1. 前言
众所周知,Python 最流行的爬虫框架是 Scrapy,它主要用于爬取网站结构性数据
今天推荐一款更加简单、轻量级,且功能强大的爬虫框架:feapder
项目地址:
https://github.com/Boris-code/feapder
2. 介绍及安装
和 Scrapy 类似,feapder 支持轻量级爬虫、分布式爬虫、批次爬虫、爬虫报警机制等功能
内置的 3 种爬虫如下:
-
AirSpider
轻量级爬虫,适合简单场景、数据量少的爬虫
-
Spider
分布式爬虫,基于 Redis,适用于海量数据,并且支持断点续爬、自动数据入库等功能
-
BatchSpider
分布式批次爬虫,主要用于需要周期性采集的爬虫
在实战之前,我们在虚拟环境下安装对应的依赖库
# 安装依赖库
pip3 install feapder
3. 实战一下
我们以最简单的 AirSpider 来爬取一些简单的数据
目标网站:aHR0cHM6Ly90b3BodWIudG9kYXkvIA==
详细实现步骤如下( 5 步)
3-1 创建爬虫项目
首先,我们使用「 feapder create -p 」命令创建一个爬虫项目
# 创建一个爬虫项目
feapder create -p tophub_demo
3-2 创建爬虫 AirSpider
命令行进入到 spiders 文件夹目录下,使用「 feapder create -s 」命令创建一个爬虫
cd spiders
# 创建一个轻量级爬虫
feapder create -s tophub_spider 1
其中
-
1 为默认,表示创建一个轻量级爬虫 AirSpider
-
2 代表创建一个分布式爬虫 Spider
-
3 代表创建一个分布式批次爬虫 BatchSpider
3-3 配置数据库、创建数据表、创建映射 Item
以 Mysql 为例,首先我们在数据库中创建一张数据表
# 创建一张数据表
create table topic
(
id &n

本文介绍了Python爬虫框架feapder,与Scrapy类似,但更简单、轻量级。feapder支持轻量级、分布式和批次爬虫,内置AirSpider、Spider和BatchSpider三种爬虫。通过实战例子,展示了如何创建项目、配置数据库、创建映射Item、编写爬虫和数据解析,最后将数据入库。

4323

被折叠的 条评论
为什么被折叠?



