一、所需要的库
(1)Scrapy
(2)pymysql
二、 创建数据库和表
Create database hexun;
Use hexun;
Create table myhexun(id int(10) auto_increment primary key not null,name varchar(30),url varchar(100),hits int(15),comment int(15));
三、 创建Scrapy项目
(1)创建Scrapy项目: scrapy startproject hexunpjt
(2)创建spider爬虫: scrapy genspider -t basic Myhexunspd hexun.com
(3)开始爬取: scrapy crawl myhexunspd
或者 scrapy crawl myhexunspd --nolog

本文介绍了如何利用Python的Scrapy爬虫框架抓取博客数据,并详细讲解了从创建数据库和表,到设置Scrapy项目,编写items、pipelines和spider的全过程。

1371

被折叠的 条评论
为什么被折叠?



