前言
刚刚看到篇帖子: https://linux.do/t/topic/2599282/31 学到了一个新的格式: Har. 它比curl记载的信息更多, 基于json结构也比较易读.
HAR 是 HTTP Archive 的缩写,后缀 .har,是 JSON 格式的文件,用来记录浏览器一次页面加载完整网络请求日志,由 Chrome、Edge、Firefox 开发者工具导出。
帖子中的需求和我类似, 也是通过对网站进行分析, 获取调用顺序对数据进行处理. 通常的步骤都是:
- 抽取公共参数
- 解决加密sign
- 记录前后请求逻辑
- 程序实现验证
之前是如何做的
说实话这是我第一次知道Har格式. 之前我收集请求都是F12看请求, 右键复制为curl保存到md文件中, 另外再把响应体粘贴进去. 大概结构如下:
## xx网站处理流程
## 页面上下文
| 字段 | 值 |
| --- | --- |
| companyId | `xxxx` |
| userId | `xxxx` |
| companyName | `xxxx` |
### 1.登录接口
curl 'https://a.domain.com/login' \
-X POST \
-H 'token: <PTX_TOKEN>' \
-H 'userId: xxx' \
-H 'Content-Type: application/x-www-form-urlencoded;charset=UTF-8' \
-H 'DNT: 1' \
--data-raw 'id=xxx'
响应体:
{
"data": {
"token": "x-x-x-x-x",
"expireTime": "2026-06-06 11:00:00"
},
"code": 200,
"success": true
}
### 2.查询接口
xxx省略
之后根据自己的操作步骤, 完善请求直接的调用顺序, 补充文档:
### 登录调用
先调用encry方法对pwd进行加密, 然后调用/login方法传参, 解析数据中的token.
判断响应体中的结果是否有token, 如果xxx就xx, 如果xx就xxx
总体来说就是多记录, 多测试. 尽可能的让程序一遍跑通. 遇到了加密也需要自行打断点调试.
之前和AI工作
在半年前或去年之前, 让ai完成爬虫处理也是我把上述文档丢给ai, 让他读取然后进行代码实现.
我有某系统的curl数据记录 @数据记录.md, 你帮我实现其中的 逻辑A的功能, 执行顺序如下:
xxx/ xxx/ xxx
要求请求工具使用 @reqUtils.ts, 入参/出差根据业务描述放到 @shared/types/业务名 中, 系统工具类方法在 @commUtils中, 代码写详细注释, 类型确保正确, 禁止unkow/any. xxx其他规则
基本就是把文档变成了提示词文档, 里面写给ai的提示词, 让ai实现代码, 最后再测试.
现在和AI工作
现在ai都支持调用浏览器, 所以现在把之前的接口文档省了, 但是操作过程还是口述给ai的:

现在的提示词就变成:
再继续处理 功能1->账号开具中的请求, 有搜索页面/新增页面, 新增里面有不同的账号类型/标签类型/清单类型, 还需要选择主体名称或应税劳务、服务名称中的商品搜索 然后支持暂存和保存, 这些都需要收集整理
另外账号开具的搜索列表有查看操作, 也需要整理
这时候的ai能把绝大部分的数据整理清晰, 包括基础的curl,请求/响应, 下拉框数据从哪来, 各请求间的调用嵌套.
有些网站的加密简单, ai能直接获取到相对应的密钥.
而且ai处理的时候也能看到界面, 有问题可以第一时间优化. 同时我发现, ai有时候不是点击按钮触发请求进行抓包的. 它会直接分析页面对应的js源码找到入参/出差.
因为有一次我让ai抓取保存请求, 我看着界面它并没有点按钮, 但还是输出了数据, 我就问他没点击按钮怎么来的数据. 相关截图找不到了
但还是少不了写提示词, 你要给ai说请求如何进入界面, 如何点击按钮.
以后
同时我看到有篇帖子说了一个自动化渗透系统, ai对渗透的解释是这样的:

我个人的理解就是对系统进行漏洞测试的, 并不适合做项目的爬虫.
所以现在或以后有没有能够对某个网站进行抓包扫描的系统? 能够让大模型理解网站是干什么的, 通过不同的身份让ai理解那些是网站重点.
或者还可以由人工规划执行路径: 先点这, 再点哪 一步步的操作
结束
现在让ai做的系统都是简单的, 无复杂加密的. 不像Boss或淘宝, 连真人操控都会弹验证码, 这种复杂网站不在讨论范围之内.
我感觉随着ai的能力提高, 爬虫简单网站会变得越来越简单. 就像之前做个页面写几个按钮要2天, 现在就要2分钟.
而且ai应该对这种网站爬虫很高效, 巨量的上下文对ai来说没有任何难度. 而同样的内容, 让人来分析/debug就要几个小时或几天.
同时咱们处理请求都是看f12, ai的好处是能够直接读混淆后的源码. 源码的变量名/函数加密但不影响接口url和请求体的生成.
所以想问下, 现在还有更好的爬虫方式吗

2428

被折叠的 条评论
为什么被折叠?



