祖传Python代码,备用

如何用Python爬取网页数据,Python爬取网页详细教程 阅读详情

今天分享几段工作生活中常用的代码,都是最为基础的功能和操作,而且大多还都是出现频率比较高的,很多都是可以拿来直接使用或者简单修改就可以放到自己的项目当中

日期生成

很多时候我们需要批量生成日期,方法有很多,这里分享两段代码

获取过去 N 天的日期

import datetime

def get_nday_list(n):
    before_n_days = []
    for i in range(1, n + 1)[::-1]:
        before_n_days.append(str(datetime.date.today() - datetime.timedelta(days=i)))
    return before_n_days

a = get_nday_list(30)
print(a)

Output:

['2021-12-23', '2021-12-24', '2021-12-25', '2021-12-26', '2021-12-27', '2021-12-28', '2021-12-29', '2021-12-30', '2021-12-31', '2022-01-01', '2022-01-02', '2022-01-03', '2022-01-04', '2022-01-05', '2022-01-06', '2022-01-07', '2022-01-08', '2022-01-09', '2022-01-10', '2022-01-11', '2022-01-12', '2022-01-13', '2022-01-14', '2022-01-15', '2022-01-16', '2022-01-17', '2022-01-18', '2022-01-19', '2022-01-20', '2022-01-21']

生成一段时间区间内的日期

import datetime

def create_assist_date(datestart = None,dateend = None):
    # 创建日期辅助表

    if datestart is None:
        datestart = '2016-01-01'
    if dateend is None:
        dateend = datetime.datetime.now().strftime('%Y-%m-%d')

    # 转为日期格式
    datestart=datetime.datetime.strptime(datestart,'%Y-%m-%d')
    dateend=datetime.datetime.strptime(dateend,'%Y-%m-%d')
    date_list = []
    date_list.append(datestart.strftime('%Y-%m-%d'))
    while datestart<dateend:
        # 日期叠加一天
        datestart+=datetime.timedelta(days=+1)
        # 日期转字符串存入列表
        date_list.append(datestart.strftime('%Y-%m-%d'))
    return date_list

d_list = create_assist_date(datestart='2021-12-27', dateend='2021-12-30')
d_list

Output:

['2021-12-27', '2021-12-28', '2021-12-29', '2021-12-30']

保存数据到CSV

保存数据到 CSV 是太常见的操作了,分享一段我个人比较喜欢的写法

def save_data(data, date):
    if not os.path.exists(r'2021_data_%s.csv' % date):
        with open("2021_data_%s.csv" % date, "a+", encoding='utf-8') as f:
            f.write("标题,热度,时间,url\n")
            for i in data:
                title = i["title"]
                extra = i["extra"]
                time = i['time']
                url = i["url"]
                row = '{},{},{},{}'.format(title,extra,time,url)
                f.write(row)
                f.write('\n')
    else:
        with open("2021_data_%s.csv" % date, "a+", encoding='utf-8') as f:
            for i in data:
                title = i["title"]
                extra = i["extra"]
                time = i['time']
                url = i["url"]
                row = '{},{},{},{}'.format(title,extra,time,url)
                f.write(row)
                f.write('\n')

带背景颜色的 Pyecharts

Pyecharts 作为 Echarts 的优秀 Python 实现,受到众多开发者的青睐,用 Pyecharts 作图时,使用一个舒服的背景也会给我们的图表增色不少

以饼图为例,通过添加 JavaScript 代码来改变背景颜色

def pie_rosetype(data) -> Pie:
    background_color_js = (
    "new echarts.graphic.LinearGradient(0, 0, 0, 1, "
    "[{offset: 0, color: '#c86589'}, {offset: 1, color: '#06a7ff'}], false)"
)
    c = (
        Pie(init_opts=opts.InitOpts(bg_color=JsCode(background_color_js)))
        .add(
            "",
            data,
            radius=["30%", "75%"],
            center=["45%", "50%"],
            rosetype="radius",
            label_opts=opts.LabelOpts(formatter="{b}: {c}"),
        )
        .set_global_opts(title_opts=opts.TitleOpts(title=""),
                        )
    )
    return c

requests 库调用

据统计,requests 库是 Python 家族里被引用的最多的第三方库,足见其江湖地位之高大!

发送 GET 请求

import requests


headers = {
    'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/96.0.4664.110 Safari/537.36',
  'cookie': 'some_cookie'
}
response = requests.request("GET", url, headers=headers)

发送 POST 请求

import requests


payload={}
files=[]
headers = {
    'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/96.0.4664.110 Safari/537.36',
  'cookie': 'some_cookie'
}
response = requests.request("POST", url, headers=headers, data=payload, files=files)

根据某些条件循环请求,比如根据生成的日期

def get_data(mydate):
    date_list = create_assist_date(mydate)
    url = "https://test.test"
    files=[]
    headers = {
        'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/96.0.4664.110 Safari/537.36',
        'cookie': ''
        }
    for d in date_list:
        payload={'p': '10',
        'day': d,
        'nodeid': '1',
        't': 'itemsbydate',
        'c': 'node'}
        for i in range(1, 100):
            payload['p'] = str(i)
            print("get data of %s in page %s" % (d, str(i)))
            response = requests.request("POST", url, headers=headers, data=payload, files=files)
            items = response.json()['data']['items']
            if items:
                save_data(items, d)
            else:
                break

Python 操作各种数据库

操作 Redis

连接 Redis

import redis


def redis_conn_pool():
    pool = redis.ConnectionPool(host='localhost', port=6379, decode_responses=True)
    rd = redis.Redis(connection_pool=pool)
    return rd

写入 Redis

from redis_conn import redis_conn_pool


rd = redis_conn_pool()
rd.set('test_data', 'mytest')

操作 MongoDB

连接 MongoDB

from pymongo import MongoClient


conn = MongoClient("mongodb://%s:%s@ipaddress:49974/mydb" % ('username', 'password'))
db = conn.mydb
mongo_collection = db.mydata

批量插入数据

res = requests.get(url, params=query).json()
commentList = res['data']['commentList']
mongo_collection.insert_many(commentList)

操作 MySQL

连接 MySQL

import MySQLdb

# 打开数据库连接
db = MySQLdb.connect("localhost", "testuser", "test123", "TESTDB", charset='utf8' )

# 使用cursor()方法获取操作游标 
cursor = db.cursor()

执行 SQL 语句

# 使用 execute 方法执行 SQL 语句
cursor.execute("SELECT VERSION()")

# 使用 fetchone() 方法获取一条数据
data = cursor.fetchone()

print "Database version : %s " % data

# 关闭数据库连接
db.close()

Output:

Database version : 5.0.45

本地文件整理

整理文件涉及需求的比较多,这里分享的是将本地多个 CSV 文件整合成一个文件

import pandas as pd
import os


df_list = []
for i in os.listdir():
    if "csv" in i:
        day = i.split('.')[0].split('_')[-1]
        df = pd.read_csv(i)
        df['day'] = day
        df_list.append(df)
df = pd.concat(df_list, axis=0)
df.to_csv("total.txt", index=0)

多线程代码

多线程也有很多实现方式,我们选择自己最为熟悉顺手的方式即可

import threading
import time

exitFlag = 0

class myThread (threading.Thread):
    def __init__(self, threadID, name, delay):
        threading.Thread.__init__(self)
        self.threadID = threadID
        self.name = name
        self.delay = delay
    def run(self):
        print ("开始线程:" + self.name)
        print_time(self.name, self.delay, 5)
        print ("退出线程:" + self.name)

def print_time(threadName, delay, counter):
    while counter:
        if exitFlag:
            threadName.exit()
        time.sleep(delay)
        print ("%s: %s" % (threadName, time.ctime(time.time())))
        counter -= 1

# 创建新线程
thread1 = myThread(1, "Thread-1", 1)
thread2 = myThread(2, "Thread-2", 2)

# 开启新线程
thread1.start()
thread2.start()
thread1.join()
thread2.join()
print ("退出主线程")

异步编程代码

异步爬取网站

import asyncio
import aiohttp
import aiofiles

async def get_html(session, url):
    try:
        async with session.get(url=url, timeout=8) as resp:
            if not resp.status // 100 == 2:
                print(resp.status)
                print("爬取", url, "出现错误")
            else:
                resp.encoding = 'utf-8'
                text = await resp.text()
                return text
    except Exception as e:
        print("出现错误", e)
        await get_html(session, url)

使用异步请求之后,对应的文件保存也需要使用异步,即是一处异步,处处异步

async def download(title_list, content_list):
    async with aiofiles.open('{}.txt'.format(title_list[0]), 'a',
                             encoding='utf-8') as f:
        await f.write('{}'.format(str(content_list)))

以上就是我平时用的最多的代码片段,希望对你有所帮助

关于Python技术储备

学好 Python 不论是就业还是做副业赚钱都不错,但要学会 Python 还是要有一个学习规划。最后大家分享一份全套的 Python 学习资料,给那些想学习 Python 的小伙伴们一点帮助!

一、Python所有方向的学习路线

Python所有方向路线就是把Python常用的技术点做整理,形成各个领域的知识点汇总,它的用处就在于,你可以按照上面的知识点去找对应的学习资源,保证自己学得较为全面。

二、学习软件

工欲善其事必先利其器。学习Python常用的开发软件都在这里了,给大家节省了很多时间。

三、入门学习视频

我们在看视频学习的时候,不能光动眼动脑不动手,比较科学的学习方法是在理解之后运用它们,这时候练手项目就很适合了。

四、实战案例

光学理论是没用的,要学会跟着一起敲,要动手实操,才能将自己的所学运用到实际当中去,这时候可以搞点实战案例来学习。

五、面试资料

我们学习Python必然是为了找到高薪的工作,下面这些面试题是来自阿里、腾讯、字节等一线互联网大厂最新的面试资料,并且有阿里大佬给出了权威的解答,刷完这一套面试资料相信大家都能找到满意的工作。


这份完整版的Python全套学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

Python资料、技术、课程、解答、咨询也可以直接点击下面名片,添加官方客服斯琪

python爬虫入门教程(非常详细) 爬虫指的是一种自动化程序,能够模拟人类在互联网上的浏览行为,自动从互联网上抓取、预处理并保存所需要的信息。爬虫运行的过程一般是先制定规则(如指定要抓取的网址、要抓取的信息的类型等),紧接着获取该网址的HTML源代码,根据规则对源代码进行解析和抽取,最后进行处理和保存。爬虫在实际应用中广泛使用,如搜索引擎、大数据分析、交易数据采集等领域,都需要用到爬虫技术来实现信息的定向采集和处理。 阅读详情

相关推荐

手把手教你python--爬取网站首页(学生必看)

0基础小白也能学会的用 python 爬取网站首页,方法超级简单,今天手把手教你。

qq_32139859的博客 9298

python爬取网页详细教程

可以使用Python中的Pandas库,将数据存储到Excel或CSV文件中,或者使用Python自带的sqlite3库,将数据存储到SQLite数据库中。随着互联网的高速发展,网页上的信息也越来越丰富,而Python作为一门高效的编程语言,可以帮助我们快速地获取所需的信息。requests库是Python中最常用的HTTP库,可以帮助我们向目标网站发送GET或POST请求,并获取网页上的数据。BeautifulSoup库是Python中最常用的HTML解析库,可以帮助我们快速地获取网页中的各种信息。

xiangxueerfei的博客 8941

Python TypeError: unexpected keyword argument 错误排查与解决指南

Python编程中,TypeError是一种常见的异常类型,通常表示函数或方法调用时参数类型不匹配或传递了无效参数。其核心原理在于Python解释器在调用可调用对象时,会检查传入的参数签名是否与定义相符,当出现未声明的关键字参数时便会触发此类错误。理解这一机制对于编写健壮的代码至关重要,尤其是在使用第三方库和进行面向对象设计时。从技术价值角度看,掌握参数传递的匹配规则能有效提升代码的可靠性和可维护性,避免因API变更或人为失误导致的运行时异常。在实际应用场景中,这类错误频繁出现在库版本升级、类继承调用以及

aiqixiao2017的博客 477

程序员成神之路,一年挖坑,五年扛旗,十年成神

自人类社会诞生以来,等级就一直存在,有人指点江山,称之为“大神” 有人卸瓦搬砖,称之为“小白” 在程序员的世界里,等级同样森严。特别是在1年、5年、10年时会有大不同 据说到达上面每一个级别,就会脱胎换骨一次 我们一起来看看。 每个人都做过小白,但不是人人都能成为大神 一年到十年,磨的不是时间而是汗水和经验 小白们,莫急莫燥且听我一言所谓“十年磨一剑”。听内心之声音,找前进之方向按自己之快慢! 关于Python技术储备 学好 Python 不论是就业还是做副业赚钱都不错,但要学会 P

Javachichi的博客 3278

4步解锁钥匙3D建模:从设计到打印的平民化指南

还在为丢失钥匙发愁?找 locksmith 太贵,配钥匙排队太久?现在有了 Keygen 这款开源工具,你可以像搭乐高一样轻松生成钥匙 3D 模型,在家就能打印备用钥匙!本文专为**DIY 爱好者、3D 打印玩家和锁具研究人员**打造,用最通俗的方式带你掌握从数字建模到物理打印的全流程。 ## 一、为什么要自己建模钥匙?解决3大真实痛点 当你搬进出租屋发现房东只给一把钥匙,或者祖传老锁找不到替...

gitblog_00139的博客 893

Python虚拟环境venv与Playwright:现代网页自动化开发实战指南

在现代软件开发中,网页自动化是提升效率、实现流程自动化的关键技术。其核心原理是通过程序模拟用户操作,控制浏览器执行页面导航、元素交互、数据提取等任务。传统方案如Selenium虽经典,但在处理动态加载、反爬机制和元素定位时面临挑战。Playwright作为新一代自动化框架,通过内置智能等待、多浏览器支持、网络拦截等特性,显著提升了脚本的稳定性和开发效率。结合Python虚拟环境venv,开发者可以创建隔离、可复现的运行环境,有效管理依赖版本,避免冲突。这套组合特别适用于Web应用端到端测试、数据抓取和日常操

weixin_34396902的博客 310

告别‘Requirement already satisfied’:精准定位Python环境,让pip install不再迷茫

本文针对Python开发者常见的'Requirement already satisfied'问题,提供了精准定位Python环境的实用技巧。通过which/where命令确认解释器路径、使用绝对路径安装、规范虚拟环境管理等四大法宝,有效解决pip安装混乱问题。同时分享镜像源配置、依赖冲突排查等进阶技巧,帮助开发者构建稳定的Python工作环境。

weixin_33716154的博客 426

Muse Spark 1.2:AI驱动的项目级代码理解与安全重构实战指南

在软件开发中,代码重构是提升项目可维护性的关键实践,它涉及在不改变外部行为的前提下优化代码结构。其核心原理在于通过系统性的代码变换,改善设计、消除重复并提高可读性,这依赖于对项目上下文的深度理解,包括模块依赖、符号引用和类型系统。安全重构的技术价值在于显著降低因手动修改引入错误的风险,保障软件在持续演进中的稳定性,尤其适用于大型遗留系统或多人协作项目。应用场景广泛,从重命名广泛使用的变量、提取重复逻辑为函数,到跨文件更新API接口等。本文聚焦的Muse Spark 1.2,正是一款利用AI Agent与代码

weixin_30920853的博客 422

AI结对编程实战:从代码生成到可信工程伙伴的协作指南

AI代码生成技术正深刻改变软件开发流程,其核心原理是基于大规模代码语料训练的大语言模型,通过理解自然语言指令或上下文,自动生成或补全代码片段。这项技术的价值在于显著提升开发效率,将开发者从重复性编码任务中解放出来,专注于架构设计和复杂逻辑。在实际应用场景中,AI可作为高效的“结对编程”伙伴,辅助完成从CRUD接口、复杂业务逻辑到代码重构等多种任务。然而,要将其从简单的“代码打字机”升级为“可信赖的工程伙伴”,关键在于构建有效的“人-AI协作”范式。这涉及对生成代码的严格审查、集成到现有开发与测试工作流,并警

congji3817的博客 423

如何用python爬取网页数据,python爬取网页详细教程

大家好,本文将围绕python怎么爬取网站所有网页展开说明,如何用python爬取网页数据是一个很多人都想弄明白的事情,想搞清楚python如何爬取网页数据需要先了解以下几个事情。

aifans_bert的博客 2万+

4个详细步骤讲解Python爬取网页数据操作过程!(含实例代码

今天为大家带来的内容是4个详细步骤讲解Python爬取网页数据操作过程!(含实例代码)本文具有不错的参考意义,希望在此能够帮助到大家!**提示:**由于涉及代码较多,大部分代码用图片的方式呈现出来!

WANGJUNAIJIAO的博客 1万+

30岁+,大龄青年转行程序员的切身经历

今天文章的主人公是我的一位读者,暂且称他为 A 君。不过 A 君有点特别,非科班,工作 10 年后才转行Python程序员。今年 36 岁,目前在某行业头部企业任职前端负责人,管理 40+ 人的前端团队。

h1453586413的博客 5480

python爬虫入门,轻松爬取网页上的数据(非常详细)

随着网络的普及和信息爆炸式增长,我们可以通过网络来获取各种各样的数据。而Python作为一门强大而灵活的编程语言,可以帮助我们快速地从HTML网页中提取数据。本文将介绍Python爬虫的入门知识,并详细讲解如何使用Python爬虫来爬取HTML网页上的数据。1.了解HTML和网页结构2.安装和导入相关依赖库3.发送http请求获取网页内容4.解析HTML网页内容5.定位内容和提取数据6.保存抓取的数据在开始编写爬虫之前,了解HTML和网页的结构是非常重要的。

CSDN_430422的博客 11万+

走好这六步,python爬虫爬取网页数据手到擒来~

python爬虫爬取数据真的很简单,只要掌握这六步就好,也不复杂。以前还以为爬虫很难,结果一上手,从初学到把东西爬下来,一个小时都不到就解决了。

大模型工程师老蓝的博客 1万+

Python3 注释

Python3 注释

xiqng17111342931的博客 2204
上一篇: 当机器学习遇到数据量不够时,这几个Python技巧为你化解难题
下一篇: Python理解函数调用的原理及其概念
Python妙脆角
博客等级 码龄5年 1439粉丝 346原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值