投机解码(Speculative Decoding) 是一种让大模型推理变快的方法,核心思想是“小模型先猜,大模型再验”。
---
工作原理(三步走)
1. 小模型(草稿模型)快速生成:用一个很小的模型(比如7B大模型的1B版本)逐个快速生成几个Token(比如5个)。
2. 大模型(目标模型)一次性验证:把这5个Token一次性喂给大模型,大模型在单次前向传播里判断每个Token对不对。
3. 接受或拒绝:对的Token直接收下,从第一个错的地方开始重新生成。
---
关键优势
· 不改变输出质量:大模型当“裁判”,错的会纠正,最终结果和直接用大模型生成一模一样。
· 加速效果明显:如果小模型猜得准(比如对简单问题),一次能接受4-5个Token,解码速度可提升2-3倍。
· 无需重新训练:大多数方法不需要改动大模型,插拔式使用。
---
为什么跟VLA相关
VLA模型处理视频时,每一帧都会产生大量Token,解码阶段特别慢。投机解码可以在解码阶段用轻量级方法快速生成候选Token,再让VLA大模型验证,尤其适合实时机器人控制场景(需要在100ms内输出动作)。
---
常见实现方法
方法 特点
EAGLE 用小模型当草稿,是目前最主流的方法之一
Medusa 在模型头部加多个预测头,不用额外小模型
不属于但是类比:MTP(多令牌预测) DeepSeek-V3用的,训练时就把预测未来Token的能力内化到模型里
订阅专栏 解锁全文

2300

被折叠的 条评论
为什么被折叠?



