有没有能够通过AI实现自动爬虫的项目

前言

刚刚看到篇帖子: https://linux.do/t/topic/2599282/31 学到了一个新的格式: Har. 它比curl记载的信息更多, 基于json结构也比较易读.

HAR 是 HTTP Archive 的缩写,后缀 .har,是 JSON 格式的文件,用来记录浏览器一次页面加载完整网络请求日志,由 Chrome、Edge、Firefox 开发者工具导出。

帖子中的需求和我类似, 也是通过对网站进行分析, 获取调用顺序对数据进行处理. 通常的步骤都是:

  • 抽取公共参数
  • 解决加密sign
  • 记录前后请求逻辑
  • 程序实现验证

之前是如何做的

说实话这是我第一次知道Har格式. 之前我收集请求都是F12看请求, 右键复制为curl保存到md文件中, 另外再把响应体粘贴进去. 大概结构如下:

## xx网站处理流程
## 页面上下文

| 字段 | 值 |
| --- | --- |
| companyId | `xxxx` |
| userId | `xxxx` |
| companyName | `xxxx` |
### 1.登录接口
curl 'https://a.domain.com/login' \
  -X POST \
  -H 'token: <PTX_TOKEN>' \
  -H 'userId: xxx' \
  -H 'Content-Type: application/x-www-form-urlencoded;charset=UTF-8' \
  -H 'DNT: 1' \
  --data-raw 'id=xxx'
响应体:
{
  "data": {
    "token": "x-x-x-x-x",
    "expireTime": "2026-06-06 11:00:00"
  },
  "code": 200,
  "success": true
}
### 2.查询接口
xxx省略

之后根据自己的操作步骤, 完善请求直接的调用顺序, 补充文档:

### 登录调用
先调用encry方法对pwd进行加密, 然后调用/login方法传参, 解析数据中的token.
判断响应体中的结果是否有token, 如果xxx就xx, 如果xx就xxx

总体来说就是多记录, 多测试. 尽可能的让程序一遍跑通. 遇到了加密也需要自行打断点调试.

之前和AI工作

在半年前或去年之前, 让ai完成爬虫处理也是我把上述文档丢给ai, 让他读取然后进行代码实现.

我有某系统的curl数据记录 @数据记录.md, 你帮我实现其中的 逻辑A的功能, 执行顺序如下:
xxx/ xxx/ xxx
要求请求工具使用 @reqUtils.ts, 入参/出差根据业务描述放到 @shared/types/业务名 中, 系统工具类方法在 @commUtils中, 代码写详细注释, 类型确保正确, 禁止unkow/any. xxx其他规则

基本就是把文档变成了提示词文档, 里面写给ai的提示词, 让ai实现代码, 最后再测试.

现在和AI工作

现在ai都支持调用浏览器, 所以现在把之前的接口文档省了, 但是操作过程还是口述给ai的:
17870369216161787036921622-2026-08-18-150841.png
现在的提示词就变成:

再继续处理 功能1->账号开具中的请求, 有搜索页面/新增页面, 新增里面有不同的账号类型/标签类型/清单类型, 还需要选择主体名称或应税劳务、服务名称中的商品搜索 然后支持暂存和保存, 这些都需要收集整理
另外账号开具的搜索列表有查看操作, 也需要整理

这时候的ai能把绝大部分的数据整理清晰, 包括基础的curl,请求/响应, 下拉框数据从哪来, 各请求间的调用嵌套.
有些网站的加密简单, ai能直接获取到相对应的密钥.

而且ai处理的时候也能看到界面, 有问题可以第一时间优化. 同时我发现, ai有时候不是点击按钮触发请求进行抓包的. 它会直接分析页面对应的js源码找到入参/出差.

因为有一次我让ai抓取保存请求, 我看着界面它并没有点按钮, 但还是输出了数据, 我就问他没点击按钮怎么来的数据. 相关截图找不到了

但还是少不了写提示词, 你要给ai说请求如何进入界面, 如何点击按钮.

以后

同时我看到有篇帖子说了一个自动化渗透系统, ai对渗透的解释是这样的:
17870372887571787037288761-2026-08-18-151448.png

我个人的理解就是对系统进行漏洞测试的, 并不适合做项目的爬虫.

所以现在或以后有没有能够对某个网站进行抓包扫描的系统? 能够让大模型理解网站是干什么的, 通过不同的身份让ai理解那些是网站重点.
或者还可以由人工规划执行路径: 先点这, 再点哪 一步步的操作

结束

现在让ai做的系统都是简单的, 无复杂加密的. 不像Boss或淘宝, 连真人操控都会弹验证码, 这种复杂网站不在讨论范围之内.
我感觉随着ai的能力提高, 爬虫简单网站会变得越来越简单. 就像之前做个页面写几个按钮要2天, 现在就要2分钟.
而且ai应该对这种网站爬虫很高效, 巨量的上下文对ai来说没有任何难度. 而同样的内容, 让人来分析/debug就要几个小时或几天.
同时咱们处理请求都是看f12, ai的好处是能够直接读混淆后的源码. 源码的变量名/函数加密但不影响接口url和请求体的生成.

所以想问下, 现在还有更好的爬虫方式吗

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值