电商评论舆情采集完整配置流程

OpenClaw 电商评论舆情采集完整配置流程

⚠️ 前置合规说明:OpenClaw 仅作为官方 API 补充兜底采集,优先使用 1688 / 速卖通 / TikTok Shop 开放 ISV 接口获取评论;禁止高频暴力爬取、破解加密接口、批量抓取登录后隐私数据,遵循 robots 协议,采集仅用于自有运营舆情分析,不得倒卖数据openclawdo... 适用场景:增量采集商品主评、追评、问答,输出结构化数据对接 NLP 情感分析、舆情预警、代购代采中台

一、前置环境部署(第一步)

1. 安装 OpenClaw(Linux/Mac)

curl -fsSL https://openclaw.ai/install.sh | bash
openclaw onboard
  • 推荐模型:通义千问 Qwen / DeepSeek(本地轻量模型可选 Qwen3-7B)
  • 依赖安装:playwright 浏览器渲染(动态 JS 评论页面必备)
pip install playwright
playwright install chromium

2. 全局基础配置 ~/.openclaw/openclaw.json(防封禁核心)

{
  "browser": {
    "headless": true,
    "slowMo": 800
  },
  "scraper": {
    "respect_robots_txt": true,
    "rate_limit": {
      "requests_per_minute": 6
    },
    "retry_times": 2,
    "delay_range": [1,3]
  }
}
  • slowMo:浏览器操作间隔,最低 500ms 以上,降低反爬拦截
  • rate_limit:每分钟请求数,电商站点建议≤6 次

3. 必备技能安装(ClawHub)

openclaw plugins install web-fetcher
openclaw plugins install scraper
openclaw plugins install cron-task
openclaw plugins install csv-exporter
  • web-fetcher:静态页面抓取
  • scraper:自定义选择器结构化抽取评论
  • cron-task:定时增量巡检(舆情监控核心)
  • csv-exporter:导出评论结果,可入库 MySQL/MongoDB

二、采集任务整体工作流设计(舆情标准流水线)

定时触发 → 浏览器访问商品评论页 → 分页采集 → 字段抽取 → 数据清洗去重 → 增量过滤(只抓新评论) → 存储 CSV / 数据库 → NLP 情感分析 → 条件预警推送(企业微信 / 钉钉 Webhook)

三、完整任务配置实操(YAML 采集规则模板,重点)

新建任务配置 review-scraper.yaml,支持 1688、AliExpress、抖音电商商品评论,修改选择器适配不同站点

name: ecomm-review-opinion
desc: 电商商品评论舆情增量采集
target_url: "商品评论完整URL"
incremental: true  # 开启增量,只采集上次之后新增评论(舆情必备)
pagination:
  type: url-parameter
  parameter: page
  start: 1
  max_pages: 3  # 舆情监控不要拉全量,限定页数,减轻压力
  page_delay: 1500
selectors:
  container: ".review-item" # 评论外层容器,浏览器F12自行调整
  fields:
    comment_time:
      selector: ".review-time"
      type: text
    star:
      selector: ".star-rating"
      attribute: "data-score"
      type: number
    sku_info:
      selector: ".review-sku"
      type: text
    comment_content:
      selector: ".review-text"
      type: text
    image_list:
      selector: ".review-img img"
      attribute: "src"
      multiple: true
transform:
  filter: "comment_content.length > 5" # 过滤无意义短默认好评
  dedup_by: ["comment_time","comment_content"] # 去重规则
output:
  format: csv
  path: "./data/review_opinion.csv"
  save_raw_json: true # 保留原始报文,用于舆情审计

✅ 获取页面选择器方法:浏览器 F12 开发者工具 → 元素 → 定位评论块,复制 CSS Selector

四、两种运行模式配置

模式 A:单次手动测试(调试规则,验证能否抓到评论)

openclaw run ./review-scraper.yaml

运行完成查看 ./data/review_opinion.csv,校验字段是否完整、有无乱码、是否抓到重复历史评论

模式 B:Cron 定时增量巡检(正式舆情监控)

使用内置 cron-task 创建持久定时任务,常规商品 30~120 分钟采集一次;新品 / 直播间爆款 5~15 分钟

# 示例:每60分钟执行一次评论采集
openclaw cron create --name review-monitor --interval 3600 --task ./review-scraper.yaml
# 查看定时任务列表
openclaw cron list

增量原理:任务自动记录最后一条采集时间,下次执行自动过滤旧评论,避免全量重复抓取浪费资源

五、数据清洗 + NLP 舆情分析链路配置

采集完成后接入 NLP 做情感、痛点识别,两种实现方式:

  1. OpenClaw 内置 Agent 流水线(推荐一体化) 新建 VOC 舆情分析 Agent,系统提示词示例:

角色:电商 VOC 舆情分析师,接收 CSV 评论数据,完成:情感分类(正面 / 中性 / 负面)、提取痛点标签(物流破损 / 色差 / 漏发 / 售后差)、风险分级(红橙黄),输出结构化 JSON,命中高危词【假货、自燃、有毒、漏电】标记红色预警

  1. 外部对接自研 NLP 服务(PaddleNLP/BERT) 导出 CSV,Python 脚本读取文本做批量情感分析,结果回写数据库,接入预警工单系统
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值