使用 xpath 选择网页所使用的标签
request传递数据
html response
formrequest 使用 登录界面
内容存储为json lines 文件
setting 文件设置实现 保存在json 文件中
LOG_FORMAT 日志的格式
LOG_DATEDORMAT 日志日期的格式
class
scrapy.statscollectors.MemortStatsCollector
用来获取 内存的使用情况
可以使用文本文件
csv文件 json 文件 jsonlines文件 数据库文件 云存储
创建 scrapy 文件 命令是 scrapy startproject collectips
每一行都要进行 “#-*-coding: utf-8 -*- 进行注释
本文详细介绍使用Scrapy框架进行网页爬取的流程,包括利用XPath解析网页标签、通过Request和FormRequest处理登录界面、将数据存储为JSON Lines文件等核心操作。同时,探讨了如何在settings文件中配置日志格式及内存使用监控,适用于希望深入了解Scrapy框架及网页爬虫技术的开发者。

1049

被折叠的 条评论
为什么被折叠?



