PYTHON爬取淘宝商品附加cookies
简单的Python爬取淘宝商品路线
利用Pyhton可爬取淘宝商品,爬取技术路线为:requests-bs4-re,当所需信息可通过源代码中很轻松查找到时,直接利用正则表达式即可,本文即为直接利用正则表达式获取相关信息。
目标:获得目标商品前3页的价格、名称,本文以书包为例,参考了慕课python课程。下图为爬取结果部分图。

以下为具体步骤。
第一步确定url
通过requests.get方法可以轻松通过链接获得商品信息,但在此之前需要确定url。打开淘宝搜索‘书包’,发现url分别为:
第一页:https://s.taobao.com/search?q=书包&imgfile…48&s=0
第二页:https://s.taobao.com/search?q=书包&imgfile…48&s=44
第三页:https://s.taobao.com/search?q=书包&imgfile…48&s=88
可以从url中推测可知,’书包‘为搜索词,可以用goods来表示所提交的搜索关键词;0、44、88分别为当前页第一个商品的编号,如此可以用i*44来实现爬取第i页。
第二步获得html文档
常规爬取直接采用requests库中get方法即可,但目前淘宝需要登陆才可爬取相关内容,所以需要增加headers、cookies内容。这里可以通过chrome浏览器在登陆淘宝之后通过开发者模式中的网络中查询登陆淘宝时的cookies和user-gent,将此作为爬虫软件的模拟浏览器提交请求时的信息。
// get cookies and headers
headers={
'User-Agent':'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/76.0.3809.132 Safari/537.36'}
usercookies='thw=cn; ........'
值得注意的是,cookies要求是字典格式,所以采用split分割字符串,并利用字典赋值实现格式转换。
//的
cookies={
}
for a in usercookies.split(';'):
name,value=a.strip().split('=',1)
cookies

本文介绍了如何使用Python爬取淘宝商品,通过requests和正则表达式抓取页面上的商品价格和名称。首先确定包含搜索关键词的URL,接着添加headers和cookies以模拟登录状态。然后解析HTML文档,提取商品信息并存储,最后打印出结果。爬虫还能扩展获取销量和好评数等更多数据。

3993

被折叠的 条评论
为什么被折叠?



