scrapy框架下pythom爬虫的数据库(MYSQL)

scrapy爬虫框架将数据保存Mysql数据库 scrapy爬虫框架简单Demogithub地址:https://github.com/lawlite19/PythonCrawler-Scrapy-Mysql-File-Template 使用scrapy爬虫框架将数据保存Mysql数据库和文件中settings.py 修改Mysql的配置信息 #Mysql数据库的配置信息 MYSQL_HOST = '127.0.0.1' MYSQL_DBNAM 阅读详情

本次主要讲述在scrapy框架下pythom爬虫有关mysql数据库的相关内容。

首先在MySQL数据库中创建对应的表,注意字段的设计!

数据库的信息存在setting 里,数据信息host,database,user,password,port等取出

打开管道文件pipelien.py,添加一个存储到MySQL数据库中的一个管道类(),我们可以参照管道文件初始化中,自带的管道类<项目名称>Pipeline写法,写一个Pipeline管道类。

连接数据库*执行sql语句

从setting文件中获得数据库信息,将从数据库中获得的信息定义保存到目前文件打开open_spider()开始爬虫自动连接数据库,self.db=pymysql.connect()创立连接,self.cursor=self.db.cursor()创立邮标

使用邮标self.cursor.execute(sql)执行SQL命令

在settings.py中配置: 

  process_item():该方法专门用来处理item类型对象,可以接收爬虫文件提交过来的item对象该方法每接收到一个item就会被调用一次

运行实例:

 最后上代码:

import  pymysql

class TenxunPipeline:

def process_item(self, item, spider):

return item

class TenxunPipeline(object):

def __init__(self,host,database,user,password,port):

self.host = host

self.database = database

self.user = user

self.password = password

self.port = port

@classmethod

def from_crawler(cls, crawler):

return cls(

host=crawler.settings.get("MYSQL_HOST"),

database=crawler.settings.get("MYSQL_DATABASE"),

user=crawler.settings.get("MYSQL_USER"),

password=crawler.settings.get("MYSQL_PASSWORD"),

port=crawler.settings.get("MYSQL_PORT"),

)

def open_spider(self, spider):

#开始爬虫时自动连接数据库

self.db= pymysql.connect(host=self.host, user=self.user,password=self.password,database=self.database, charset='utf8', port=self.port)

self.cursor = self.db.cursor()

def process_item(self, item, spider):

sql = "insert into enter_recruit(id,enterprise,recruit_type,source_web, position_name, occupation_type, publish_time,job_description,job_requirements,work_address,interview) values ('%s','%s','%s','%s','%s','%s','%s','%s','%s','%s','%s')"%(item['id'],item['enterprise'], item['recruit_type'], item['source_web'], item['position'], item['occupation_type'], item['publish_time'], item['job_description'], item['job_requirements'], item['work_address'], item['interview'])

#执行sql命令

self.cursor.execute(sql)

#提交sql命令

self.db.commit()

return item

def close_spider(self, spider):

self.db.close()

本文章为pythom项目“scrapy实战-爬取腾讯的招聘信息”有关数据库方面的相关内容

有关“scrapy实战--爬取腾讯的招聘信息”scrapy框架以及其他信息请前往scrapy实战--爬取腾讯的招聘信息_洛厨@锦依的博客-CSDN博客查看,谢谢。

scrapy爬虫数据存入mysql数据库 上篇博客使用scrapy框架爬取豆瓣电影top250信息将各种信息通过json存在文件中,不过对数据的进一步使用显然放在数据库中更加方便,这里将数据存入mysql数据库以便以后利用。 运行环境: 1. win7-64bit 2. python 3.5.3 3. mysql 5.7.17 安装mysql数据库模块打开命令行输入python后,通过import MySQLdb检查是否支持mysql 阅读详情

相关推荐

scrapy读取mysql数据库_python3实战scrapy获取数据保存至MySQL数据库

python3使用scrapy获取数据然后保存至MySQL数据库,我上一篇写了如何爬取数据保存为csv文件,这一篇将会写如何将数据保存至数据库。思路大都一样,我列一个思路:1:获取腾讯招聘网。2:筛选信息获取我们想要的。3:将获取的信息按照规律保存至本地的txt文件。4:读取txt文件的信息上传至MySQL数据库(友情提示:如果有朋友不怎么看得懂路径导入,可以看看我之前写的自定义模块路径导入方法...

weixin_30368405的博客 1043

网络爬虫丨基于scrapy+mysql爬取博客信息

基于scrapy+mysql爬取博客信息并保存到数据库

AIGC 2万+

非易失存储器读写

24C256、IIC_SCL、IIC_SDA

CT_1104的专栏 2907

Scrapy插入Mysql数据库()

mysql参考 保存数据到MySql数据库——我用scrapy爬虫(二) 保证安装 pip install pymysql pip install Twisted 主要是需要主子插入,子有多条数据,子是json格式数据 思路是 for page in range(0,int(pages)): #获取格中的所有行,使用find_elements...

haoyuexihuai的专栏 2643

数据采集与存储案例——基于Python爬虫框架Scrapy的网络数据爬取与MySQL数据持久化

pip命令常用的国内源,scrapy爬虫框架的安装,如何分析html爬取结构化数据,如何将爬取到的数据存储在mysql中。

weixin_52010459的博客 3096

学习python要学哪些_学习Python需要什么基础

学习Python需要什么基础?书声琅琅教育番茄老师微信pykf20介绍,python语言现在很流行,几年都霸占着IT常用语言的前三,应用非常广泛,特别是现在社会主推人工智能,大数据,而对这些需求比较好的语言就是python,对于小白来讲,想知道python学习难不难,学习Python需要什么基础,今天跟大家来聊下这个话题。学习Python分为以下几个阶段:第一阶段:1.变量及运算符2.分支及循环3...

weixin_28873283的博客 418

python爬虫进阶】你知道怎么使用Scrapy库进行数据提取和处理吗?

在我们的初级教程中,我们介绍了如何使用Scrapy创建和运行一个简单的爬虫。在这篇文章中,我们将深入了解Scrapy的强大功能,学习如何使用Scrapy提取和处理数据。

bagell的博客 1087

Scrapy 对接 mysql

数据库获取数据 import scrapy import pymysql from scrapy.conf import settings class CoscoSailingScheduleSpiderSpider(scrapy.Spider): name = 'cosco_sailing_schedule_spider' allowed_domains = ['eli...

xkx_07_10的博客 893

Scrapy爬取数据并存储到MySQL

Scrapy爬虫 爬虫框架 架构 流程 组件 功能 同步插入数据库 异步插入数据库 mysql pipeline

一个人的编程之路 8863

Scrapy链接MongoDB数据库

本文章是在的基础上改写的代码。

qq_40930841的博客 1267

中国各区域天气情况统计可视化Scrapy+MySQL+Flask(内附完整代码)

利用python scrapy框架实现天气情况统计,同时连接mysql数据库,利用Flask框架可视化处理。实高性能异步爬取并实现定时爬取。(内附完整代码)

m0_55685698的博客 1429

scrapy读取MySQL数据_如何使用scrapy中的spider从mysql中获取数据并从web中提取数据...

我有一个蜘蛛和管道并编写一段代码从web中提取数据并插入到MySQL中正在运行的class AmazonAllDepartmentSpider(scrapy.Spider):name = "amazon"allowed_domains = ["amazon.com"]start_urls = ["http://www.amazon.com/gp/site-directory/ref=nav_sad...

weixin_28943105的博客 796

scrapy连接myqsl

在pipeline中:def __init__(self): self.connect = pymysql.connect( host='localhost', port=3306, db='****', user='root', passwd='****', charset='utf8') ...

你真有意思的博客 1362

Python数据库MySQL连接池DBUtils

DBUtils 是一套允许线程化 Python 程序可以安全和有效的访问数据库的模块 一、下载安装 1.1 从pypi下载 https://pypi.python.org/pypi/DBUtils $ wget https://pypi.python.org/packages/65/65/89afee016aca7fbb5c1642e6ef3864d80af808dc5efa7367b328093eece9/DBUtils-1.1.tar.gz 1.2 安装 方法1: cd DBU...

wachoo的blog 624

数据抓取链接数据库查询

数据抓取链接数据库查询的sql语句 1》链接的是sql server库时:       public AqiSchedule LoadByCode(string code)         {             string query =                 $"select * from {SqlGenerator.TableName} where CODE = @

pyy的博客 555

利用scrapy抓取数据,批量插入mysql

具体抓取代码没什么好讲的,要注意的地方就是将抓取的数据插入数据库。 每1000条数据提交一次数据库: pipelines.py def process_item(self, item, spider): try: page_data = (item["scode"], item["name"], item["gender"], item["age"], item[...

qq_15058425的博客 1047

scrapy 操作MYSQL

scrapy piplines操作mysql数据库: class EducationPipeline: def __init__(self): self.connect = pymysql.connect(host='localhost', port=3306, user='root',

网络爬虫开发 838

2026.2.3:OpenClaw国内安装教程,国内网络使用,服务器部署,对接飞书

本文介绍了如何创建飞书应用并接入OpenClaw机器人的完整流程。主要内容包括:1)在飞书开放平台创建企业自建应用,添加机器人能力并开通相关权限;2)在Windows11系统上安装OpenClaw,完成配置文件的修改(需将bind改为"lan");3)配置MiniMax国内接口地址,重启gateway服务。整个过程涵盖了应用创建、权限设置、软件安装、服务配置等关键步骤,为开发者提供了详细的飞书机器人接入指南。

拥抱具身智能,昇腾Ascend C 3913

磁编码器原理图和PCB图

此资料是磁编码器硬件图,已经经过两个月的试用测试,已广泛应用于建筑机械上。

Q2506595744
博客等级 码龄5年 0粉丝 · 1原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值