Self-GC:多轮Agent上下文管理的降本增效方案

本文整理自 AICon 上海分享「Self-GC:一种结合前缀缓存约束的多轮 Agent 上下文治理方案」(演讲者:郝栩彬),通过AI音视频总结工具 Ai好记 转录整理,以下为视频转文字精炼整理后的内容。


在这里插入图片描述

白领Agent的成本困境

Agent正在从演示原型走向企业级部署。但当面向白领的Agent(如处理PPT、PDF、浏览器的办公助手)在1000人规模的公司内推广时,成本会呈指数级增长——一个粗略估算,每月成本可能达到千万级别。

核心成本卡点在哪?不是推理计算的单价,而是长上下文带来的高Token消耗

一个典型的白领Agent工作流:用户提问 → Agent理解指令 → 调用工具(浏览器/文档编辑器)→ 获取结果 → 继续交互。每轮交互都会往上下文里塞入新的内容,而白领任务的工具调用频繁、产物不可重复执行(不像代码可以git checkout),上下文长度迅速膨胀到平均80K输入Token。

北极星指标:AvgInputTokens

团队选择了一个核心指标来衡量成本——AvgInputTokens(平均每次模型请求的输入Token数)。

指标优点缺点
总Token消耗直观反映总成本受用户量波动大
缓存命中率能看出优化效率达到85%+后提升空间有限
AvgInputTokens抹平用量波动,直接反映成本密度需要精细统计

这个指标比总Token数或缓存命中率更能稳定地反映成本趋势,成为降本的主攻方向。

传统的上下文裁剪为什么容易「翻车」

最直接的降本思路就是给上下文「瘦身」——把不重要的内容剪掉。但白领任务和Coding任务完全不同:

维度Coding任务白领任务
环境一致性Git仓库可复现浏览器数据每次不同
产物管理可版本化PPT/PDF不可版本化
失败恢复可回溯历史无法重复执行
工具鲁棒性高(Git/Shell稳定)低(浏览器/Office不稳定)

基于规则或固定模式的裁剪一旦错误地移除了关键上下文(比如载入的BI数据),模型无法像在Coding环境中那样通过查看Git或重跑单测来恢复,结果就是任务彻底失败,用户体验极差。

Self-GC:让模型自主管理上下文

Self-GC的核心思想是:让模型自己决定哪些上下文可以回收,而不是靠外部规则去硬裁。

第一步:上下文对象化

通过 turn_id 为用户的每次输入和每个工具的执行结果打上「户口」,使其可被索引和管理。这样上下文不再是混沌的一大段文本,而是带有标签的数据对象。

对象标识内容
用户输入turn_001用户的问题和指令
工具结果turn_002工具执行的返回数据
Agent思考turn_003模型的推理过程

第二步:旁路Fork规划机制

在对话过程中,通过一个低成本的旁路Fork,让模型自己回顾对话历史,生成一份针对性的垃圾回收计划(GC Plan):

  • 哪些上下文可以折叠(压缩为摘要)
  • 哪些上下文可以归档(移到外部存储)
  • 哪些上下文可以删除(不再需要)

整个GC过程不由外部规则驱动,而是模型基于当前任务状态自省判断。

第三步:延迟提交 + 增量GC

为了不伤害用户体验,Self-GC有两个保护策略:

延迟提交:生成的GC计划不立即执行,而是延迟几轮再执行。避免刚刚生成的最新上下文被误伤,保护最新的用户意图。

增量GC:每次只对未被裁剪过的新增上下文尾部进行操作,保护已处理过的、处于KV Cache热缓存状态的前缀部分。这样最小化对推理性能的破坏。

效果

指标效果
大盘Input Token下降15-20%
总成本下降5-10%
任务成功率持平或微升
KV Cache命中率保持

降成本的工程策略全景

Self-GC只是降本策略中的一环。从执行难度和副作用来看,有三种策略:

策略方法副作用实施难度
优化工具设计减少工具调用的上下文增长斜率几乎无
周期裁剪/折叠执行中定期剪裁中等(误伤风险)
激进压缩大幅压缩上下文大(用户体验差)

三者应在成本与效果之间找到平衡点,逐级实施。

价值超越降本

Self-GC还有一个意想不到的价值:它产出的「干净」任务轨迹——经过GC后不带冗余噪音的交互历史——能反哺到AI系统的多个环节:

  • 记忆检索:干净的历史记录更容易被检索系统命中
  • 经验沉淀:成功的任务轨迹可以作为最佳实践被复用
  • 数据飞轮:高质量的任务数据可以用于模型微调

这比简单的「谁便宜用谁」的策略更有长期价值。

选择模型的关键:Toplay性能

在成本优化中,有一个容易被忽视的原则:不要一味追求低价模型。

策略效果
用廉价模型反复试错任务失败率高,总成本反升
用一次做对能力强的模型单次贵但总体成本更低

模型的「一次做对」能力(Toplay性能)和稳定性,往往比便宜的模型带来更低的整体成本。结合Self-GC这样的上下文管理方案,才是从架构层面真正降本的路径。


FAQ

Q:Self-GC会增加多少额外的推理成本?
A:旁路Fork规划的Token消耗很小,远小于裁剪后节省的Token量。实际验证中总成本下降5-10%。

Q:上下文折叠后信息丢失怎么办?
A:折叠不是删除,原始内容可归档存储。模型在需要时可以通过检索回溯到原始信息。

Q:Self-GC适用于Coding Agent吗?
A:可以,但对Coding Agent来说,传统规则裁剪已经效果不错。Self-GC在不可回溯的通用任务场景(白领、办公)优势更明显。


以上内容由 Ai好记 转录整理。
Ai好记 是一款音视频转图文笔记的AI音视频转录总结工具,支持解析B站、抖音、小红书、小宇宙等平台链接及本地/网盘音视频文件,转录后自动视频转文字生成精华速览、思维导图和结构化笔记等内容形式,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值