摘要
本文解读 ICML 2025(Poster)论文《Vintix: Action Model via In-Context Reinforcement Learning》。该论文提出Vintix 跨域动作模型,通过融合连续噪声蒸馏、跨域数据集与算法蒸馏,让 300M 参数的固定权重模型在推理时通过试错自纠错,其特别之处在于坚持数据为中心与"奖励足够(Reward is enough)"路线。实验表明Vintix 在 Meta-World 与 MuJoCo 上显著超越 JAT 和 REGENT(如 Humanoid 示范者归一化回报 0.97 vs 0.02),并为上下文强化学习的规模化提供了 87 任务 × 4 域的开源数据集与工具。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Vintix: Action Model via In-Context Reinforcement Learning |
| 标题(中文) | 在上下文强化学习中缩放通用智能体:Vintix 动作模型 |
| 作者 | Andrei Polubarov · Nikita Lyubaykin · Alexander Derevyagin · Ilya Zisman · Denis Tarasov · Alexander Nikulin · Vladislav Kurenkov |
| 机构 | AIRI · Innopolis University · Skoltech · MIPT · HSE · ISP RAS |
| 会议 | ICML 2025 (Poster) |
| arXiv | 2501.19400 |
| 项目网站 | dunnolab/Vintix (HuggingFace) · GitHub |
背景与动机:为什么通用动作模型需要 ICRL?
通用控制与决策智能体的长期目标,是用一个模型处理多样化任务,并具备自纠错、自改进等适应能力。传统在线强化学习(如 AlphaStar、Dota 五杀 AI)在窄域内性能极强,但依赖环境特定交互训练,难以规模化。
现有跨域动作模型大致分两条路线:
- 返回条件路线:利用全部数据,按 return-to-go 目标做条件化(upside-down RL 思想);
- 示范蒸馏路线(当前主流):只用专家示范、基本丢弃奖励信号,代表工作为 Gato、JAT、REGENT、Open X-Embodiment 等。
与之相对,"Reward is enough" 原则主张智能体应通过试错最大化任意奖励。算法蒸馏(AD, Laskin et al. ICLR 2023)把这一原则操作化:在历史 RL 轨迹上训练 next-action 预测模型,从而在推理时涌现上下文强化学习(ICRL)。然而此前的 ICRL 只在离散动作玩具任务、单域设定下成立——这正是 Vintix 要填补的空白:跨域、连续动作、87 个任务规模的数据为中心 ICRL。
研究主线:从问题到结论

图 8:研究主线——从跨域 ICRL 未缩放问题到超越 JAT/REGENT 的结论(Mermaid 流程图)
基准/方法设计:Vintix 的三阶段流水线
Vintix 是一个 300M 参数、24 层、16 头的 next-action 预测模型,基于 TinyLLaMA 骨干,编码器-Transformer-解码器结构。方法分三阶段:
- 连续噪声蒸馏(CND):在示范策略上注入逐步退火的均匀噪声,制造"策略改进轨迹",替代昂贵耗时的真实 RL 学习历史;
- 跨域数据集:把 4 个域 87 个任务的多回合序列合并为共享数据集(1.6M 回合 / 222.7M 时间步);
- 算法蒸馏训练:用 ${s, a, r}$ 三元组训练,目标仅为下一动作预测(MSE 损失)。

图 1:多回合 ICRL 自纠错——训练任务(87 个)上各域逐步接近示范者性能,柱内数字为最优 shot 数
关键设计要素:
- 维度分组编码:按观测/动作维度分组,每组独立 encoder/decoder 头映射到共享嵌入空间;模型只知道"组 ID"、不知道任务 ID,是真正的 task-agnostic;
- Token 堆叠:把"前一动作 + 前一奖励 + 当前观测"堆成一个 token,上下文窗口等效扩大 3 倍;
- 推理协议:空上下文冷启动 + 滑动窗口 + ALiBi 位置编码 + FlashAttention KV-cache(绝对位置编码与滑动窗口不兼容)。
分类全景:四域跨域数据集

图 9:跨域数据集分类全景——87 任务按四域划分(Mermaid 流程图)
方法细节:连续噪声蒸馏与训练配置
连续噪声蒸馏(CND)是本文对 $AD^\epsilon$ 的连续动作扩展。动作定义为示范动作与均匀噪声的线性混合:
$a_i = (1-\epsilon_i) \cdot \pi_D(s_i) + \epsilon_i \cdot u$,其中 $u \sim \text{Uniform}(a_{min}, a_{max})$,噪声系数 $\epsilon$ 从 1(随机策略)退火到 0(示范策略)。与 $\epsilon$-greedy 的"全随机/全专家交替"不同,线性混合产生平滑的回报曲线,更接近真实学习历史。
实际使用广义退火函数 $\epsilon(n_s)$ 控制轨迹内噪声形状:奖励前期陡增的任务用 $p > 1$ 压平起始段,后期陡增的任务用 $0 < p < 1$ 反向调节——线性退火在某些任务上会产生突变轨迹,损害收敛。
训练配置:8×H100,batch 64,梯度累积 2,序列长度 $L=8192$,学习率 $3\times10^{-4}$,bf16 精度。数据侧奖励按任务缩放、观测归一化,刻意降低任务可区分度,逼模型依赖上下文推断任务。

图 2:Vintix 三阶段流程——连续噪声蒸馏生成改进轨迹,合并为跨域数据集,再运行算法蒸馏
实验设计与结果:自纠错、对比与泛化
评测协议:冷启动推理(空上下文)逐回合展开,度量示范者归一化回报;自纠错收敛后取 100 回合平均。基线包括 JAT、REGENT(论文成绩直取)以及本文训练的专家蒸馏(ED)和无奖励消融变体。
训练数据集统计(附录 A 织入):
| 域 | 任务数 | 回合数 | 时间步 | 样本权重 |
|---|---|---|---|---|
| Bi-DexHands | 15 | 216k | 31.7M | 14.2% |
| Industrial-Benchmark | 16 | 96k | 24M | 10.8% |
| Meta-World | 45 | 670k | 67M | 30.1% |
| MuJoCo | 11 | 665k | 100M | 44.9% |
| 总体 | 87 | 1.6M | 222.7M | 100% |
MuJoCo 逐任务对比(示范者归一化回报):
| 任务 | Vintix | REGENT | JAT |
|---|---|---|---|
| Ant | 0.98 | 0.17 | 0.88 |
| HalfCheetah | 0.93 | 0.34 | 0.89 |
| Hopper | 0.86 | 0.12 | 0.76 |
| Humanoid | 0.97 | 0.02 | 0.10 |
| HumanoidStandup | 1.02 | 0.26 | 0.35 |
| Walker2d | 1.00 | 0.05 | 0.95 |

图 3:连续噪声蒸馏轨迹——四域聚合归一化回报随轨迹长度平滑上升

图 4:域级对比——Vintix 在 MuJoCo 与 Meta-World 均显著超越 JAT 与 REGENT(收敛后 100 回合)
参数变化泛化:MuJoCo 黏度(0→0.05/0.1)与重力(±10%)扰动、Industrial-Benchmark 新设定点 $p \in [80,100]$ 均接近示范者,仅收敛略慢。

图 5:参数变化冷启动推理——MuJoCo 黏度/重力扰动与 IB 新设定点下仍接近示范者
全新任务:Door-Unlock 达 47% 专家归一化分数,Door-Open-Inward 稳定 31%,其余接近随机——跨域 ICRL 仍需缩放。

图 6:全新任务推理表现——每个域各一个成功与失败案例
消融(附录 B 织入):同架构同损失,仅训练数据不同——ED 渐近归一化分数仅 0.8,AD 达 MuJoCo 0.97 / Meta-World 0.95;去掉奖励信号的 AD 变体渐近更差、收敛更慢。策略改进结构是自纠错行为的来源,奖励反馈是推理时有效自改进的必要信号。

图 7:消融实验——完整 AD 渐近最高,ED 明显偏低,无奖励变体收敛最慢
结果对比总结

图 10:结果对比总结——示范蒸馏基线、自纠错 0.97、AD 优于 ED 与新任务成绩(Mermaid 流程图)
关键发现
- 87 任务 × 4 域、1.6M 回合、222.7M 时间步的开源跨域数据集,是 ICRL 社区首个跨域训练场;
- 自纠错随回合数单调渐进:四个域一致地从次优收敛到示范者水平,是推理时隐式强化学习的标志性现象;
- 算法蒸馏显著优于专家蒸馏:AD 渐近 0.97(MuJoCo)/ 0.95(Meta-World),ED 仅 0.8——同样示范者来源,差距全来自数据里的改进结构;
- Humanoid 归一化回报 0.97 vs REGENT 0.02 / JAT 0.10:Vintix 在 MuJoCo 与 Meta-World 全面超越示范蒸馏型通用动作模型;
- 参数变化可适应:未见过的黏度、重力与设定点 $p \in [80,100]$ 下仍接近示范者,仅收敛略慢;
- 全新任务初见苗头:Door-Unlock 达 47%、Door-Open-Inward 稳定 31% 示范者分数,其余接近随机。
局限性
- 任务规模有限:仅 87 任务;原始 AD 的玩具设定任务集都更大,跨域 ICRL 仍需数据缩放;
- 仅连续向量观测:刻意隔离多模态输入,未处理视觉/语言,离真实机器人数据尚远;
- 全新任务泛化失败:未见任务的 in-context 推断任务结构尚未实现(仅个别任务部分成功);
- 无法超越示范者:性能上界受示范者约束,无超越示范者水平的自改进能力。
常见问题(FAQ)
Vintix 是什么?
Vintix 是 AIRI 团队提出的 300M 参数跨域动作模型:通过算法蒸馏(AD)把策略改进轨迹蒸馏进 Transformer,在推理时用上下文强化学习(ICRL)自纠错,覆盖 MuJoCo、Meta-World、Bi-DexHands、Industrial-Benchmark 四域 87 任务。
什么是上下文强化学习(ICRL)?
ICRL 指智能体在推理时通过试错与奖励信号学习,不更新任何权重——类似大语言模型的上下文学习,但目标是奖励最大化。Vintix 的冷启动自纠错就是 ICRL 的典型现象。
Vintix 与 JAT、REGENT 有什么区别?
JAT 和 REGENT 走专家示范蒸馏路线;Vintix 走奖励驱动的算法蒸馏路线,训练数据是噪声蒸馏出的"改进轨迹"而非纯示范。结果是 Vintix 具备推理时自纠错能力,在 MuJoCo 与 Meta-World 上显著超越二者(如 Humanoid 0.97 vs 0.02/0.10)。
为什么噪声蒸馏能替代真实 RL 学习历史?
真实学习历史昂贵且含训练不稳定噪声;连续噪声蒸馏用逐步退火的均匀噪声混合示范动作,低成本制造近似"策略改进"的轨迹。消融显示:用这种结构训练的 AD 模型渐近 0.97/0.95,而用纯示范训练的 ED 只有 0.8。
Vintix 能泛化到全新任务吗?
尚不能。在未见任务上,Door-Unlock 达到 47%、Door-Open-Inward 稳定 31% 示范者分数,其余接近随机。作者认为需要更大任务规模与更 task-agnostic 的架构。
去掉奖励信号会怎样?
奖励掩码消融显示:无奖励变体渐近性能更差、收敛更慢(Meta-World 尤甚)。奖励反馈是推理时有效自改进的必要信号,也是"Reward is enough"路线的直接证据。
参考链接
- arXiv 2501.19400:Vintix: Action Model via In-Context Reinforcement Learning
- dunnolab/Vintix 项目主页(HuggingFace)
- In-Context Reinforcement Learning with Algorithm Distillation(Laskin et al., ICLR 2023)
- Emergence of In-Context Reinforcement Learning from Noise Distillation(Zisman et al., 2024)
- Jack of All Trades, Master of Everything (JAT)(Gallouédec et al., TMLR 2024)
- REGENT: A Retrieval-Augmented Generalist Agent(Sridhar et al., NeurIPS 2024)
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)


被折叠的 条评论
为什么被折叠?



