#12.1Python爬虫的进阶之路---百度贴吧漫画资源爬取

本文介绍了一个基于Python的贴吧爬虫项目,通过使用requests、BeautifulSoup等库,实现了贴吧页面的下载、解析及图片的抓取与存储。文章详细展示了如何管理URL、下载网页、解析HTML并获取图片链接,最后将图片保存到本地。

代码

#coding:utf-8
import os
import re
import requests
import urllib
import json
from bs4 import BeautifulSoup as BS

class urlmanager(object):
    def __init__(self):
        self.new_urls = set()
        self.old_urls = set()
    def add_new_urls(self, urls):
        for url in urls:
            self.add_new_url(url)
    def add_new_url(self, url):
        if url not in self.old_urls:
            self.new_urls.add(url)
    def has_new_url(self):
        if len(self.new_urls)>0:
            return True
        else:
            return False
    def get_new_url(self):
        url = self.new_urls.pop()
        self.old_urls.add(url)
        return url

class htmldownloader(object):
    def download(self,url):
        if url is None:
            return None
        User_Agent = 'Mozilla/4.0(compatible; Chrome 80.0.3987.116; Windows 10)'
        headers = {'User-Agent': User_Agent}
        r = requests.get(url,headers = headers)
        if r.status_code == 200:
            r.encoding = 'utf-8'
            return r.text
        return None
            

class htmlparser(object):
    def pre_parse(self, soup, url):
        self.soup = soup
        self.url = url
    def get_link(self):
        links = []
        urls = []
        links = self.soup.find_all('a',class_='j_th_tit',title=re.compile(r'.*\d+.*'))
        for link in links:
            url = urllib.parse.urljoin(self.url,link['href'])
            urls.append(url)
        return urls
    def get_pic(self):
        pattern = re.compile(r'\.|\s|\-|"|"|\(|\)')
        pics = []
        title = self.soup.find('h3').string
        title = pattern.sub('',title)
        links = self.soup.find_all('img',class_='BDE_Image',src=re.compile(r'http\://(?:tiebapic)|(?:imgsa)\.baidu\.com/.*\.jpg'))
        for link in links:
            pic = link['src']
            pics.append(pic)
        dic = {'title': title, 'pics':pics}
        return dic

class datastore(object):
    def __init__(self, path='./manhua/'):
        self.path = path
        if not os.path.exists(path):
            os.mkdir(path)
    def store(self, dic):
        if not os.path.exists(self.path+dic['title']):
            os.mkdir(self.path+dic['title'])
        for i in range(len(dic['pics'])):
            pics = dic['pics']
            urllib.request.urlretrieve(pics[i],self.path+dic['title']+'/'+str(i)+'.jpg',self.schedule)
        
    def schedule(self, blocknum,blocksize, totalsize):
        if totalsize<0:
            totalsize = 50*8192
        per = 100.0*blocknum*blocksize/totalsize
        if per>100:
            per = 100.0
        print('已下载:{}*{},文件大小:{};当前下载进度:{}>{:.3f}%'.format(blocknum,blocksize, totalsize,'-'*int(per/10),per), end='\r')

class highcontrol(object):
    def __init__(self):
        self.manager = urlmanager()
        self.download = htmldownloader()
        self.parse = htmlparser()
        self.store = datastore()
    def crawl(self):
        for i in range(3,5):
            if i==0:
                self.manager.add_new_url('https://tieba.baidu.com/f?kw=&ie=utf-8&tab=good&cid=1')#更改此处的初始链接为贴吧漫画资源板块
            else:
                self.manager.add_new_url('https://tieba.baidu.com/f?kw=&ie=utf-8&tab=good&cid=1&pn='+str(i*50))#更改此处的初始链接
            url = self.manager.get_new_url()
            text = self.download.download(url)
            text = text.replace('</html>','')
            text = text.replace('</body>','')
            soup = BS(text)
            code = soup.find_all('code',class_='pagelet_html',id='pagelet_html_frs-list/pagelet/thread_list')
            soup = BS(code[0].string)
            #print(soup)
            self.parse.pre_parse(soup,url)
            urls = self.parse.get_link()
            #print(urls)
            self.manager.add_new_urls(urls)
            while self.manager.has_new_url():
                url = self.manager.get_new_url()
                text = self.download.download(url)
                soup = BS(text)
                self.parse.pre_parse(soup,url)
                dic = self.parse.get_pic()
                self.store.store(dic)
                

hc = highcontrol()
hc.crawl()
一款轻量而功能强大的点云可视化和编辑软件,支持pcd, ply, las等多种格式,轻松打开海量点云数据,支持多方式多字段渲染点云,对点进行方便的查询、量测和编辑,提供了地面滤波算法,可应用于测绘、高精地图、SLAM等领域。 PCDViewer是一款专业的点云数据处理软件,特别适用于处理和编辑大规模点云数据。该软件支持多种点云文件格式,包括pcd、ply和las等,这些格式广泛应用于激光雷达扫描数据、三维建模以及其他测绘技术。PCDViewer的强大之处在于其轻量级的系统要求与丰富的功能集,使得用户可以在Windows、Ubuntu等操作系统上轻松运行软件,高效地处理海量点云数据。 这款软件的一个主要特点是其多方式多字段渲染点云的能力。这允许用户根据不同的属性,如颜色、强度、高度等,对点云进行视觉上的分类和区分,从而更直观地分析和理解点云数据。此外,PCDViewer还提供了方便的查询、量测和编辑功能,允许用户直接对点云数据进行操作,诸如添加注释、删除噪声点或进行精确测量等,极大地提高了工作效率。 软件还内置了地面滤波算法,这一功能对于测绘学、地理信息系统(GIS)以及机器人导航和定位(SLAM)等领域尤为关键。地面滤波算法能够从点云数据中分离出地面点和非地面点,这对于如道路建模、地形分析、植被测量等应用来说至关重要。通过分离地面点,可以更准确地进行地面建模和地形特征分析,为自动化系统提供清晰的环境地图。
内容概要:本文提出了一种计及并网波动约束和储能荷电状态(SOC)的混合储能功率协调控制方法,并提供了完整的Matlab代码实现。该方法针对可再生能源并网系统中存在的功率波动问题,采用锂电池与超级电容构成的混合储能系统进行功率平抑,通过低通滤波与动态时间常数调节实现高频/低频功率分量的合理分配,同时引入SOC反馈控制机制,实时调节功率分配系数,确保各储能单元的荷电状态维持在安全范围内,避免过充过放,从而在满足并网功率波动标准的同时,延长储能系统使用寿命。文中详细阐述了控制策略的设计原理、关键参数整定方法及仿真验证过程,展示了该方法在平抑功率波动和均衡储能SOC方面的优越性能。; 适合人群:具备电力系统、新能源并网或储能控制基础知识的研究生、科研人员及从事相关领域工程开发的技术人员。; 使用场景及目标:①研究混合储能系统在平抑风电/光伏并网功率波动中的应用;②掌握基于SOC反馈的储能功率协调控制策略设计方法;③学习Matlab/Simulink在电力电子与电力系统仿真中的建模与分析技巧;④为撰写学术论文或完成科研项目提供可复现的技术方案与代码参考。; 阅读建议:建议结合Matlab代码逐行理解控制逻辑,重点关注低通滤波与SOC反馈环节的实现方式,并尝试调整参数观察系统响应变化,以深入掌握控制策略的动态特性与优化思路。
标题基于SpringBoot的校园创客空间管理系统设计与实现AI更换标题第1章引言介绍校园创客空间管理系统的研究背景、意义、现状以及论文方法与创新点。1.1研究背景与意义阐述校园创客空间管理系统在提升管理效率方面的重要性。1.2国内外研究现状分析国内外校园创客空间管理系统的研究与应用现状。1.3研究方法及创新点概述论文采用的研究方法及系统设计的创新之处。第2章相关理论介绍SpringBoot框架、数据库技术及系统开发所需的相关理论。2.1SpringBoot框架介绍介绍SpringBoot框架的核心特性及其在系统开发中的应用。2.2数据库技术阐述数据库设计原理及在管理系统中的数据存储方法。2.3系统开发相关理论介绍系统开发过程中涉及的前端技术、后端技术等。第3章系统需求分析对校园创客空间管理系统的功能需求和非功能需求进行详细分析。3.1功能需求分析列举系统所需实现的具体功能,如用户管理、空间预约等。3.2非功能需求分析分析系统的性能、安全性、易用性等非功能需求。3.3用户角色与权限分析分析系统用户角色及其对应权限,确保系统安全性。第4章系统设计详细介绍校园创客空间管理系统的设计方案,包括架构、模块及数据库设计。4.1系统架构设计给出系统的整体架构,包括前端、后端及数据库的连接方式。4.2系统模块设计详细介绍各个模块的功能设计及其交互方式。4.3数据库设计阐述数据库表结构设计、字段定义及关系建立。第5章系统实现介绍校园创客空间管理系统的具体实现过程,包括环境搭建、编码实现及测试。5.1系统开发环境搭建介绍系统开发所需的软件、硬件环境及配置步骤。5.2系统编码实现阐述系统各个模块的编码实现过程及关键代码解析。5.3系统测试与优化介绍系统测试方法、测试用例及测试结果,以及针对测试结果的优化措施。第6章结论与展望总结校园创客空间管理系统的设计与实现成果,并展望未来的研究方向。6.1
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值