【ICML 2025 (Poster)】在上下文强化学习中缩放通用智能体:Vintix 动作模型|从上下文强化学习规模化视角

摘要

本文解读 ICML 2025(Poster)论文《Vintix: Action Model via In-Context Reinforcement Learning》。该论文提出Vintix 跨域动作模型,通过融合连续噪声蒸馏跨域数据集算法蒸馏,让 300M 参数的固定权重模型在推理时通过试错自纠错,其特别之处在于坚持数据为中心与"奖励足够(Reward is enough)"路线。实验表明Vintix 在 Meta-World 与 MuJoCo 上显著超越 JAT 和 REGENT(如 Humanoid 示范者归一化回报 0.97 vs 0.02),并为上下文强化学习的规模化提供了 87 任务 × 4 域的开源数据集与工具。

视频讲解点击观看 B 站视频

论文基本信息

项目内容
标题(英文)Vintix: Action Model via In-Context Reinforcement Learning
标题(中文)在上下文强化学习中缩放通用智能体:Vintix 动作模型
作者Andrei Polubarov · Nikita Lyubaykin · Alexander Derevyagin · Ilya Zisman · Denis Tarasov · Alexander Nikulin · Vladislav Kurenkov
机构AIRI · Innopolis University · Skoltech · MIPT · HSE · ISP RAS
会议ICML 2025 (Poster)
arXiv2501.19400
项目网站dunnolab/Vintix (HuggingFace) · GitHub

背景与动机:为什么通用动作模型需要 ICRL?

通用控制与决策智能体的长期目标,是用一个模型处理多样化任务,并具备自纠错、自改进等适应能力。传统在线强化学习(如 AlphaStar、Dota 五杀 AI)在窄域内性能极强,但依赖环境特定交互训练,难以规模化。

现有跨域动作模型大致分两条路线:

  • 返回条件路线:利用全部数据,按 return-to-go 目标做条件化(upside-down RL 思想);
  • 示范蒸馏路线(当前主流):只用专家示范、基本丢弃奖励信号,代表工作为 GatoJATREGENT、Open X-Embodiment 等。

与之相对,"Reward is enough" 原则主张智能体应通过试错最大化任意奖励。算法蒸馏(AD, Laskin et al. ICLR 2023)把这一原则操作化:在历史 RL 轨迹上训练 next-action 预测模型,从而在推理时涌现上下文强化学习(ICRL)。然而此前的 ICRL 只在离散动作玩具任务、单域设定下成立——这正是 Vintix 要填补的空白:跨域、连续动作、87 个任务规模的数据为中心 ICRL

研究主线:从问题到结论

Vintix 跨域动作模型研究主线流程图:问题到结论(Mermaid 流程图)

图 8:研究主线——从跨域 ICRL 未缩放问题到超越 JAT/REGENT 的结论(Mermaid 流程图)

基准/方法设计:Vintix 的三阶段流水线

Vintix 是一个 300M 参数、24 层、16 头的 next-action 预测模型,基于 TinyLLaMA 骨干,编码器-Transformer-解码器结构。方法分三阶段:

  1. 连续噪声蒸馏(CND):在示范策略上注入逐步退火的均匀噪声,制造"策略改进轨迹",替代昂贵耗时的真实 RL 学习历史;
  2. 跨域数据集:把 4 个域 87 个任务的多回合序列合并为共享数据集(1.6M 回合 / 222.7M 时间步);
  3. 算法蒸馏训练:用 ${s, a, r}$ 三元组训练,目标仅为下一动作预测(MSE 损失)。

Vintix 多回合 ICRL 自纠错:训练任务上各域逐步接近示范者性能

图 1:多回合 ICRL 自纠错——训练任务(87 个)上各域逐步接近示范者性能,柱内数字为最优 shot 数

关键设计要素:

  • 维度分组编码:按观测/动作维度分组,每组独立 encoder/decoder 头映射到共享嵌入空间;模型只知道"组 ID"、不知道任务 ID,是真正的 task-agnostic;
  • Token 堆叠:把"前一动作 + 前一奖励 + 当前观测"堆成一个 token,上下文窗口等效扩大 3 倍;
  • 推理协议:空上下文冷启动 + 滑动窗口 + ALiBi 位置编码 + FlashAttention KV-cache(绝对位置编码与滑动窗口不兼容)。

分类全景:四域跨域数据集

Vintix 跨域数据集四域构成图:MuJoCo、Meta-World、Bi-DexHands 与 Industrial-Benchmark(Mermaid 流程图)

图 9:跨域数据集分类全景——87 任务按四域划分(Mermaid 流程图)

方法细节:连续噪声蒸馏与训练配置

连续噪声蒸馏(CND)是本文对 $AD^\epsilon$ 的连续动作扩展。动作定义为示范动作与均匀噪声的线性混合:

$a_i = (1-\epsilon_i) \cdot \pi_D(s_i) + \epsilon_i \cdot u$,其中 $u \sim \text{Uniform}(a_{min}, a_{max})$,噪声系数 $\epsilon$ 从 1(随机策略)退火到 0(示范策略)。与 $\epsilon$-greedy 的"全随机/全专家交替"不同,线性混合产生平滑的回报曲线,更接近真实学习历史。

实际使用广义退火函数 $\epsilon(n_s)$ 控制轨迹内噪声形状:奖励前期陡增的任务用 $p > 1$ 压平起始段,后期陡增的任务用 $0 < p < 1$ 反向调节——线性退火在某些任务上会产生突变轨迹,损害收敛。

训练配置:8×H100,batch 64,梯度累积 2,序列长度 $L=8192$,学习率 $3\times10^{-4}$,bf16 精度。数据侧奖励按任务缩放、观测归一化,刻意降低任务可区分度,逼模型依赖上下文推断任务。

Vintix 三阶段流程:噪声蒸馏 → 跨域数据集 → 算法蒸馏训练

图 2:Vintix 三阶段流程——连续噪声蒸馏生成改进轨迹,合并为跨域数据集,再运行算法蒸馏

实验设计与结果:自纠错、对比与泛化

评测协议:冷启动推理(空上下文)逐回合展开,度量示范者归一化回报;自纠错收敛后取 100 回合平均。基线包括 JAT、REGENT(论文成绩直取)以及本文训练的专家蒸馏(ED)和无奖励消融变体。

训练数据集统计(附录 A 织入):

任务数回合数时间步样本权重
Bi-DexHands15216k31.7M14.2%
Industrial-Benchmark1696k24M10.8%
Meta-World45670k67M30.1%
MuJoCo11665k100M44.9%
总体871.6M222.7M100%

MuJoCo 逐任务对比(示范者归一化回报):

任务VintixREGENTJAT
Ant0.980.170.88
HalfCheetah0.930.340.89
Hopper0.860.120.76
Humanoid0.970.020.10
HumanoidStandup1.020.260.35
Walker2d1.000.050.95

连续噪声蒸馏生成的跨域数据集轨迹:回报平滑上升,贴近真实学习历史

图 3:连续噪声蒸馏轨迹——四域聚合归一化回报随轨迹长度平滑上升

域级示范者归一化回报:Vintix vs REGENT vs JAT

图 4:域级对比——Vintix 在 MuJoCo 与 Meta-World 均显著超越 JAT 与 REGENT(收敛后 100 回合)

参数变化泛化:MuJoCo 黏度(0→0.05/0.1)与重力(±10%)扰动、Industrial-Benchmark 新设定点 $p \in [80,100]$ 均接近示范者,仅收敛略慢。

参数变化泛化:未见于训练的黏度、重力与 setpoint 下冷启动推理

图 5:参数变化冷启动推理——MuJoCo 黏度/重力扰动与 IB 新设定点下仍接近示范者

全新任务:Door-Unlock 达 47% 专家归一化分数,Door-Open-Inward 稳定 31%,其余接近随机——跨域 ICRL 仍需缩放。

全新任务推理:Meta-World 与 Bi-DexHands 各一例成功与失败 rollout

图 6:全新任务推理表现——每个域各一个成功与失败案例

消融(附录 B 织入):同架构同损失,仅训练数据不同——ED 渐近归一化分数仅 0.8,AD 达 MuJoCo 0.97 / Meta-World 0.95;去掉奖励信号的 AD 变体渐近更差、收敛更慢。策略改进结构是自纠错行为的来源,奖励反馈是推理时有效自改进的必要信号。

消融对比:AD、ED 与 AD 无奖励在 MuJoCo / Meta-World 的冷启动推理

图 7:消融实验——完整 AD 渐近最高,ED 明显偏低,无奖励变体收敛最慢

结果对比总结

Vintix 实验结果对比总结图:自纠错与消融数字(Mermaid 流程图)

图 10:结果对比总结——示范蒸馏基线、自纠错 0.97、AD 优于 ED 与新任务成绩(Mermaid 流程图)

关键发现

  1. 87 任务 × 4 域、1.6M 回合、222.7M 时间步的开源跨域数据集,是 ICRL 社区首个跨域训练场;
  2. 自纠错随回合数单调渐进:四个域一致地从次优收敛到示范者水平,是推理时隐式强化学习的标志性现象;
  3. 算法蒸馏显著优于专家蒸馏:AD 渐近 0.97(MuJoCo)/ 0.95(Meta-World),ED 仅 0.8——同样示范者来源,差距全来自数据里的改进结构;
  4. Humanoid 归一化回报 0.97 vs REGENT 0.02 / JAT 0.10:Vintix 在 MuJoCo 与 Meta-World 全面超越示范蒸馏型通用动作模型;
  5. 参数变化可适应:未见过的黏度、重力与设定点 $p \in [80,100]$ 下仍接近示范者,仅收敛略慢;
  6. 全新任务初见苗头:Door-Unlock 达 47%、Door-Open-Inward 稳定 31% 示范者分数,其余接近随机。

局限性

  • 任务规模有限:仅 87 任务;原始 AD 的玩具设定任务集都更大,跨域 ICRL 仍需数据缩放;
  • 仅连续向量观测:刻意隔离多模态输入,未处理视觉/语言,离真实机器人数据尚远;
  • 全新任务泛化失败:未见任务的 in-context 推断任务结构尚未实现(仅个别任务部分成功);
  • 无法超越示范者:性能上界受示范者约束,无超越示范者水平的自改进能力。

常见问题(FAQ)

Vintix 是什么?

Vintix 是 AIRI 团队提出的 300M 参数跨域动作模型:通过算法蒸馏(AD)把策略改进轨迹蒸馏进 Transformer,在推理时用上下文强化学习(ICRL)自纠错,覆盖 MuJoCo、Meta-World、Bi-DexHands、Industrial-Benchmark 四域 87 任务。

什么是上下文强化学习(ICRL)?

ICRL 指智能体在推理时通过试错与奖励信号学习,不更新任何权重——类似大语言模型的上下文学习,但目标是奖励最大化。Vintix 的冷启动自纠错就是 ICRL 的典型现象。

Vintix 与 JAT、REGENT 有什么区别?

JAT 和 REGENT 走专家示范蒸馏路线;Vintix 走奖励驱动的算法蒸馏路线,训练数据是噪声蒸馏出的"改进轨迹"而非纯示范。结果是 Vintix 具备推理时自纠错能力,在 MuJoCo 与 Meta-World 上显著超越二者(如 Humanoid 0.97 vs 0.02/0.10)。

为什么噪声蒸馏能替代真实 RL 学习历史?

真实学习历史昂贵且含训练不稳定噪声;连续噪声蒸馏用逐步退火的均匀噪声混合示范动作,低成本制造近似"策略改进"的轨迹。消融显示:用这种结构训练的 AD 模型渐近 0.97/0.95,而用纯示范训练的 ED 只有 0.8。

Vintix 能泛化到全新任务吗?

尚不能。在未见任务上,Door-Unlock 达到 47%、Door-Open-Inward 稳定 31% 示范者分数,其余接近随机。作者认为需要更大任务规模与更 task-agnostic 的架构。

去掉奖励信号会怎样?

奖励掩码消融显示:无奖励变体渐近性能更差、收敛更慢(Meta-World 尤甚)。奖励反馈是推理时有效自改进的必要信号,也是"Reward is enough"路线的直接证据。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

代码转载自:https://pan.quark.cn/s/133311188eb6 ### C# DllImport功能说明及路径选取问题分析 #### 一、DllImport核心原理 `DllImport`是.NET Framework内的一种技术,用于执行平台调用服务(Platform Invoke, 简称P/Invoke),该机制使得.NET应用程序能够调用非托管代码中的函数,例如Windows API或其他非托管库中的函数。这对于增强.NET应用程序的功能性非常关键,因为许多高级系统级操作(例如文件操作、进程控制等)通常由非托管库负责实现。 `DllImport`特性包含在`System.Runtime.InteropServices`命名空间中,它的主要功能是向CLR(Common Language Runtime)指示如何定位并调用非托管库中的特定函数。 #### 二、DllImport特性包含的主要元素 `DllImport`特性所包含的主要元素有: - **DllName**:必需的字符串参数,用于表明需要导入的非托管库的名称。 - **CallingConvention**:可选参数,用于设定调用协议。在默认情况下,其值为`CallingConvention.Cdecl`。 - **CharSet**:可选参数,用于定义字符集的类型。在默认情况下,其值为`CharSet.Auto`,即根据函数的签名自动决定字符集。 - **EntryPoint**:可选参数,用于指定非托管库中的函数名称。若未提供,则默认使用应用程序的方法名称作为函数名称。 - **ExactSpelling**:可选布尔值,用于确定函数名称是否必须与非托管库中的完全一致。...
代码下载链接: https://pan.quark.cn/s/8df2b016201b 555 芯片的引脚布局、功能特性、引脚示意图以及引脚说明是关键信息。555 芯片作为一种集成电路,具有多样化的功能特性,在定时器、定时延时控制、调光、调温、调压、调速等多种控制及计量检测领域有着广泛的应用。接下来将展示 555 芯片的引脚示意图和引脚说明: 1. 555 芯片引脚示意图:555 芯片包含 8 个引脚,具体如下: * 1 脚:地线端 * 2 脚:触发输入端 * 3 脚:输出端 * 4 脚:复位端 * 5 脚:控制端 * 6 脚:阈值端 * 7 脚:放电端 * 8 脚:电源端 2. 555 芯片引脚说明: * 1 脚:地线端,用于连接电路的负极部分。 * 2 脚:触发输入端,用于接收外部信号的输入,进而控制输出端的状态。 * 3 脚:输出端,输出高电平或低电平信号,其状态受触发器控制。 * 4 脚:复位端,当输入低电平时,输出端会输出低电平信号。 * 5 脚:控制端,用于调节输出端的状态,能够改变上下触发电平的数值。 * 6 脚:阈值端,作为上比较器的输入端,当输入高电平时,输出端会输出低电平信号。 * 7 脚:放电端,是内部放电管的输出端,其输出电平状态受触发器控制。 * 8 脚:电源端,用于连接电源的正极部分。 3. 555 芯片工作原理:555 芯片的工作原理是通过上比较器和下比较器来控制输出端的状态。上比较器的输入端位于 6 脚,而下比较器的输入端位于 2 脚。根据输入端的电平状态,输出端会输出高电平或低电平信号。 4. 555 芯片应用领域:555 芯片在各种电子产品中有着广泛的应用,例如在定时器、定时延时控制、调光、调温、调压、调速等领域。它还可以用于...
内容概要:本文围绕通信资源受限与恶意攻击干扰下的孤岛微电网分布式二次控制策略展开深入研究,提出了一种融合动态事件触发机制与抗拒绝服务(DoS)攻击设计的弹性控制方案。该方案旨在解决在有限通信带宽和网络攻击共存环境下,孤岛微电网面临的频率电压失稳、功率分配失效等关键问题。通过构建基于混合系统理论的协同控制模型,有效降低了通信频率以节约资源,同时增强了系统对DoS攻击的容忍能力,确保在攻击发生时仍能实现频率与电压的快速恢复及有功无功功率的精确分配。研究提供了完整的Simulink仿真模型与Matlab代码实现,通过多种复杂工况下的仿真实验,全面验证了所提策略在控制性能、通信效率、系统鲁棒性与安全弹性方面的优越性,为构建高可靠、高安全的未来微电网控制系统提供了坚实的理论依据和技术路径。; 适合人群:具备电力系统、自动控制或相关领域基础知识,从事微电网、分布式能源控制、电力电子与智能电网方向研究的研究生、科研人员及工程技术人员;熟悉Matlab/Simulink仿真工具者优先。; 使用场景及目标:①解决孤岛微电网在通信受限和网络攻击环境下频率电压失稳、功率分配失效的问题;②实现低通信开销下的高效二次控制,提升系统弹性与安全防御能力;③为相关科研项目、学位论文或工程应用提供可复现的仿真模型与算法参考。; 阅读建议:建议读者结合文中提供的Simulink仿真模型与Matlab代码进行实践操作,重点关注动态事件触发机制的设计逻辑、DoS攻击建模方法及其对系统性能的影响分析,同时按照文档目录循序渐进地学习,以全面掌握控制策略的实现细节与优化思路。
源码链接: https://pan.quark.cn/s/558fa78406c3 CASS软件作为一种在中国得到普遍应用的地形地籍绘图工具,其运行环境基于AutoCAD平台,并集成了大量的测绘专业功能。当面对海量的地形数据时,有时我们需要对地形点的高程信息进行集中式的变更操作,以便满足不同工程项目的要求。"cass软件批量移高程(lisp)"这一功能模块正是为了应对上述挑战而设计的。 LISP语言,其全称为"List Processing",是一种专门用于处理列表数据的编程语言,最初是面向人工智能研究领域的。在AutoCAD软件体系中,LISP被广泛用于开发个性化的函数和宏命令,以此来增强软件的原生能力。CASS软件同样兼容LISP编程技术,用户可以通过编写或引入现成的LISP程序来执行特定的测绘工作,其中包括批量调整高程值。 本LISP函数的主要特点在于其能够自动扫描图形中的所有点实体,识别出包含高程数据的属性信息,并依据用户设定的规则对高程数值进行重新设定。在实际作业场景中,用户可能需要设定一个基准高程值或者一个高程差值,然后将这个数值应用到全部选定的地形点或者部分指定的点对象上。这样的操作能够显著提升作业效率,从而避免了手动逐一修改的繁琐过程。 应用这个"移高程"功能的LISP程序,首要前提是确保CASS软件已经启用了LISP扩展功能,并且用户具备执行外部LISP程序的权限。文件"移高程-(gcyd).fas"应当是实现了这一功能的LISP源代码文件。在正式使用之前,需要将该文件导入到CASS软件的工作环境中。这一导入过程通常可以通过在命令行界面输入"LOAD"或"APPLOAD"指令,并指定LISP文件的存储路径来完成。 当LISP函数成功加载到C...
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

白拾ShiroX

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值