OpenClaw 电商评论舆情采集完整配置流程
⚠️ 前置合规说明:OpenClaw 仅作为官方 API 补充兜底采集,优先使用 1688 / 速卖通 / TikTok Shop 开放 ISV 接口获取评论;禁止高频暴力爬取、破解加密接口、批量抓取登录后隐私数据,遵循 robots 协议,采集仅用于自有运营舆情分析,不得倒卖数据openclawdo... 适用场景:增量采集商品主评、追评、问答,输出结构化数据对接 NLP 情感分析、舆情预警、代购代采中台
一、前置环境部署(第一步)
1. 安装 OpenClaw(Linux/Mac)
curl -fsSL https://openclaw.ai/install.sh | bash
openclaw onboard
- 推荐模型:通义千问 Qwen / DeepSeek(本地轻量模型可选 Qwen3-7B)
- 依赖安装:
playwright浏览器渲染(动态 JS 评论页面必备)
pip install playwright
playwright install chromium
2. 全局基础配置 ~/.openclaw/openclaw.json(防封禁核心)
{
"browser": {
"headless": true,
"slowMo": 800
},
"scraper": {
"respect_robots_txt": true,
"rate_limit": {
"requests_per_minute": 6
},
"retry_times": 2,
"delay_range": [1,3]
}
}
- slowMo:浏览器操作间隔,最低 500ms 以上,降低反爬拦截
- rate_limit:每分钟请求数,电商站点建议≤6 次
3. 必备技能安装(ClawHub)
openclaw plugins install web-fetcher
openclaw plugins install scraper
openclaw plugins install cron-task
openclaw plugins install csv-exporter
- web-fetcher:静态页面抓取
- scraper:自定义选择器结构化抽取评论
- cron-task:定时增量巡检(舆情监控核心)
- csv-exporter:导出评论结果,可入库 MySQL/MongoDB
二、采集任务整体工作流设计(舆情标准流水线)
定时触发 → 浏览器访问商品评论页 → 分页采集 → 字段抽取 → 数据清洗去重 → 增量过滤(只抓新评论) → 存储 CSV / 数据库 → NLP 情感分析 → 条件预警推送(企业微信 / 钉钉 Webhook)
三、完整任务配置实操(YAML 采集规则模板,重点)
新建任务配置 review-scraper.yaml,支持 1688、AliExpress、抖音电商商品评论,修改选择器适配不同站点
name: ecomm-review-opinion
desc: 电商商品评论舆情增量采集
target_url: "商品评论完整URL"
incremental: true # 开启增量,只采集上次之后新增评论(舆情必备)
pagination:
type: url-parameter
parameter: page
start: 1
max_pages: 3 # 舆情监控不要拉全量,限定页数,减轻压力
page_delay: 1500
selectors:
container: ".review-item" # 评论外层容器,浏览器F12自行调整
fields:
comment_time:
selector: ".review-time"
type: text
star:
selector: ".star-rating"
attribute: "data-score"
type: number
sku_info:
selector: ".review-sku"
type: text
comment_content:
selector: ".review-text"
type: text
image_list:
selector: ".review-img img"
attribute: "src"
multiple: true
transform:
filter: "comment_content.length > 5" # 过滤无意义短默认好评
dedup_by: ["comment_time","comment_content"] # 去重规则
output:
format: csv
path: "./data/review_opinion.csv"
save_raw_json: true # 保留原始报文,用于舆情审计
✅ 获取页面选择器方法:浏览器 F12 开发者工具 → 元素 → 定位评论块,复制 CSS Selector
四、两种运行模式配置
模式 A:单次手动测试(调试规则,验证能否抓到评论)
openclaw run ./review-scraper.yaml
运行完成查看 ./data/review_opinion.csv,校验字段是否完整、有无乱码、是否抓到重复历史评论
模式 B:Cron 定时增量巡检(正式舆情监控)
使用内置 cron-task 创建持久定时任务,常规商品 30~120 分钟采集一次;新品 / 直播间爆款 5~15 分钟
# 示例:每60分钟执行一次评论采集
openclaw cron create --name review-monitor --interval 3600 --task ./review-scraper.yaml
# 查看定时任务列表
openclaw cron list
增量原理:任务自动记录最后一条采集时间,下次执行自动过滤旧评论,避免全量重复抓取浪费资源
五、数据清洗 + NLP 舆情分析链路配置
采集完成后接入 NLP 做情感、痛点识别,两种实现方式:
- OpenClaw 内置 Agent 流水线(推荐一体化) 新建 VOC 舆情分析 Agent,系统提示词示例:
角色:电商 VOC 舆情分析师,接收 CSV 评论数据,完成:情感分类(正面 / 中性 / 负面)、提取痛点标签(物流破损 / 色差 / 漏发 / 售后差)、风险分级(红橙黄),输出结构化 JSON,命中高危词【假货、自燃、有毒、漏电】标记红色预警
- 外部对接自研 NLP 服务(PaddleNLP/BERT) 导出 CSV,Python 脚本读取文本做批量情感分析,结果回写数据库,接入预警工单系统

485

被折叠的 条评论
为什么被折叠?



