我的第一个python爬虫。
根据博文Python实现简单爬虫功能
import urllib
import urllib2
import re
def getHtml(url):
page = urllib.urlopen(url)
html = page.read()
return html
def getImag(html):
reg = r'src="(.+?)"'
imgre = re.compile(reg)
imglist = re.findall(imgre, html)
x = 0
url = "/Users/userName/Desktop/python/"
for imagurl in imglist:
urllib.urlretrieve(imagurl,url+'%s' % x)
x+=1
return imglist
html = getHtml("http://www.mafengwo.cn/")
print getImag(html)
getHtml()方法也可以是这样写
def getHtml(url):
request = urllib2.Request(url)
response = urllib2.urlopen(request)
html = response.read()
return html
本文介绍了一个简单的Python爬虫程序,该程序能够抓取网页内容并下载页面中的图片到本地。通过使用urllib和正则表达式模块实现了基本的网络请求及图片链接匹配。

1484

被折叠的 条评论
为什么被折叠?



