scrapy

本文详细介绍使用Scrapy框架进行网页爬取的流程,包括利用XPath解析网页标签、通过Request和FormRequest处理登录界面、将数据存储为JSON Lines文件等核心操作。同时,探讨了如何在settings文件中配置日志格式及内存使用监控,适用于希望深入了解Scrapy框架及网页爬虫技术的开发者。

使用 xpath 选择网页所使用的标签

 request传递数据 

html response 

 formrequest  使用  登录界面   

内容存储为json lines 文件  

   setting 文件设置实现   保存在json 文件中

LOG_FORMAT  日志的格式  

LOG_DATEDORMAT  日志日期的格式

class 

scrapy.statscollectors.MemortStatsCollector

用来获取  内存的使用情况  

可以使用文本文件

csv文件 json 文件  jsonlines文件  数据库文件 云存储

创建 scrapy  文件  命令是  scrapy startproject collectips

每一行都要进行  “#-*-coding: utf-8 -*-  进行注释

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值