使用Python获取网站访问的HTTP信息
在Python中,我们可以使用urllib库对网站进行访问和抓取。而本文将介绍如何使用Python的urllib库获取网站HTTP信息。
首先,我们需要导入urllib库:
import urllib.request
然后,我们可以使用urllib的urlopen函数打开特定的URL并返回一个文件对象:
url = 'http://www.example.com'
response = urllib.request.urlopen(url)
现在,我们已经成功打开了指定的URL,并得到了一个文件对象。接下来,我们可以使用该文件对象的read方法来读取HTTP响应的内容:
html = response.read()
print(html)
这段代码将输出网站的HTML源代码。当然,我们可以根据自己的需要对返回的数据进行解析和处理。例如,如果我们只想获取网页标题,可以使用以下代码:
import re
title_regex = re.compile('<title>(.*?)</title>')
match = title_regex.search(html.decode('utf-8'))
if match:
print(match.group(1))
else:
print('No title found')
这个例子使用了正则表达式来匹配HTML标题标签。首先,我们编译了一个正

本文介绍了如何使用Python的urllib库获取网站的HTTP信息。通过导入urllib库,使用urlopen函数打开URL,然后读取HTTP响应内容,可以获取到网站的HTML源代码。示例代码展示了如何解析HTML获取网页标题。
订阅专栏 解锁全文

234

被折叠的 条评论
为什么被折叠?



