本文整理自 AICon 上海分享「Self-GC:一种结合前缀缓存约束的多轮 Agent 上下文治理方案」(演讲者:郝栩彬),通过AI音视频总结工具 Ai好记 转录整理,以下为视频转文字精炼整理后的内容。

白领Agent的成本困境
Agent正在从演示原型走向企业级部署。但当面向白领的Agent(如处理PPT、PDF、浏览器的办公助手)在1000人规模的公司内推广时,成本会呈指数级增长——一个粗略估算,每月成本可能达到千万级别。
核心成本卡点在哪?不是推理计算的单价,而是长上下文带来的高Token消耗。
一个典型的白领Agent工作流:用户提问 → Agent理解指令 → 调用工具(浏览器/文档编辑器)→ 获取结果 → 继续交互。每轮交互都会往上下文里塞入新的内容,而白领任务的工具调用频繁、产物不可重复执行(不像代码可以git checkout),上下文长度迅速膨胀到平均80K输入Token。
北极星指标:AvgInputTokens
团队选择了一个核心指标来衡量成本——AvgInputTokens(平均每次模型请求的输入Token数)。
| 指标 | 优点 | 缺点 |
|---|---|---|
| 总Token消耗 | 直观反映总成本 | 受用户量波动大 |
| 缓存命中率 | 能看出优化效率 | 达到85%+后提升空间有限 |
| AvgInputTokens | 抹平用量波动,直接反映成本密度 | 需要精细统计 |
这个指标比总Token数或缓存命中率更能稳定地反映成本趋势,成为降本的主攻方向。
传统的上下文裁剪为什么容易「翻车」
最直接的降本思路就是给上下文「瘦身」——把不重要的内容剪掉。但白领任务和Coding任务完全不同:
| 维度 | Coding任务 | 白领任务 |
|---|---|---|
| 环境一致性 | Git仓库可复现 | 浏览器数据每次不同 |
| 产物管理 | 可版本化 | PPT/PDF不可版本化 |
| 失败恢复 | 可回溯历史 | 无法重复执行 |
| 工具鲁棒性 | 高(Git/Shell稳定) | 低(浏览器/Office不稳定) |
基于规则或固定模式的裁剪一旦错误地移除了关键上下文(比如载入的BI数据),模型无法像在Coding环境中那样通过查看Git或重跑单测来恢复,结果就是任务彻底失败,用户体验极差。
Self-GC:让模型自主管理上下文
Self-GC的核心思想是:让模型自己决定哪些上下文可以回收,而不是靠外部规则去硬裁。
第一步:上下文对象化
通过 turn_id 为用户的每次输入和每个工具的执行结果打上「户口」,使其可被索引和管理。这样上下文不再是混沌的一大段文本,而是带有标签的数据对象。
| 对象 | 标识 | 内容 |
|---|---|---|
| 用户输入 | turn_001 | 用户的问题和指令 |
| 工具结果 | turn_002 | 工具执行的返回数据 |
| Agent思考 | turn_003 | 模型的推理过程 |
第二步:旁路Fork规划机制
在对话过程中,通过一个低成本的旁路Fork,让模型自己回顾对话历史,生成一份针对性的垃圾回收计划(GC Plan):
- 哪些上下文可以折叠(压缩为摘要)
- 哪些上下文可以归档(移到外部存储)
- 哪些上下文可以删除(不再需要)
整个GC过程不由外部规则驱动,而是模型基于当前任务状态自省判断。
第三步:延迟提交 + 增量GC
为了不伤害用户体验,Self-GC有两个保护策略:
延迟提交:生成的GC计划不立即执行,而是延迟几轮再执行。避免刚刚生成的最新上下文被误伤,保护最新的用户意图。
增量GC:每次只对未被裁剪过的新增上下文尾部进行操作,保护已处理过的、处于KV Cache热缓存状态的前缀部分。这样最小化对推理性能的破坏。
效果
| 指标 | 效果 |
|---|---|
| 大盘Input Token | 下降15-20% |
| 总成本 | 下降5-10% |
| 任务成功率 | 持平或微升 |
| KV Cache命中率 | 保持 |
降成本的工程策略全景
Self-GC只是降本策略中的一环。从执行难度和副作用来看,有三种策略:
| 策略 | 方法 | 副作用 | 实施难度 |
|---|---|---|---|
| 优化工具设计 | 减少工具调用的上下文增长斜率 | 几乎无 | 低 |
| 周期裁剪/折叠 | 执行中定期剪裁 | 中等(误伤风险) | 中 |
| 激进压缩 | 大幅压缩上下文 | 大(用户体验差) | 高 |
三者应在成本与效果之间找到平衡点,逐级实施。
价值超越降本
Self-GC还有一个意想不到的价值:它产出的「干净」任务轨迹——经过GC后不带冗余噪音的交互历史——能反哺到AI系统的多个环节:
- 记忆检索:干净的历史记录更容易被检索系统命中
- 经验沉淀:成功的任务轨迹可以作为最佳实践被复用
- 数据飞轮:高质量的任务数据可以用于模型微调
这比简单的「谁便宜用谁」的策略更有长期价值。
选择模型的关键:Toplay性能
在成本优化中,有一个容易被忽视的原则:不要一味追求低价模型。
| 策略 | 效果 |
|---|---|
| 用廉价模型反复试错 | 任务失败率高,总成本反升 |
| 用一次做对能力强的模型 | 单次贵但总体成本更低 |
模型的「一次做对」能力(Toplay性能)和稳定性,往往比便宜的模型带来更低的整体成本。结合Self-GC这样的上下文管理方案,才是从架构层面真正降本的路径。
FAQ
Q:Self-GC会增加多少额外的推理成本?
A:旁路Fork规划的Token消耗很小,远小于裁剪后节省的Token量。实际验证中总成本下降5-10%。
Q:上下文折叠后信息丢失怎么办?
A:折叠不是删除,原始内容可归档存储。模型在需要时可以通过检索回溯到原始信息。
Q:Self-GC适用于Coding Agent吗?
A:可以,但对Coding Agent来说,传统规则裁剪已经效果不错。Self-GC在不可回溯的通用任务场景(白领、办公)优势更明显。
以上内容由 Ai好记 转录整理。
Ai好记 是一款音视频转图文笔记的AI音视频转录总结工具,支持解析B站、抖音、小红书、小宇宙等平台链接及本地/网盘音视频文件,转录后自动视频转文字生成精华速览、思维导图和结构化笔记等内容形式,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。

323

被折叠的 条评论
为什么被折叠?



