Long-VLA引入了第一个专为长程机器人操作设计的端到端视觉-语言-动作(VLA)模型,采用相位感知输入遮罩策略来调整感知焦点。该模型显著提高了在模拟和真实世界环境中多步骤任务的成功率,优于现有最先进的方法。
问题陈述与背景
视觉-语言-动作(VLA)模型已成为机器人策略学习的强大范式,它利用大规模多模态数据来开发鲁棒且可扩展的控制系统。然而,当前的VLA框架面临一个显著的局限性:它们主要擅长涉及简单、有限步骤操作的短时任务。这一限制严重阻碍了它们在需要复杂、多步骤顺序操作的真实世界场景中的应用。

图1:Long-VLA 方法论概述,展示了从大规模机器人片段到分解,再到具有阶段感知输入掩码的统一端到端模型的演变,以及在L-CALVIN基准测试和真实世界任务上的评估结果。
根本挑战在于解决“技能链问题”——在长时操作中管理子任务之间的转换和依赖关系的困难。当机器人尝试执行一系列动作时,错误可能在子任务之间传播并动态耦合,导致连锁故障。解决长时任务的传统方法通常涉及将复杂操作分解为由单独策略管理的更简单的子任务,但这与VLA模型统一的、数据驱动的训练范式产生不兼容。
核心方法论
Long-VLA引入了一种系统性方法,旨在实现长时能力,同时保留VLA模型的可扩展性和数据效率。该方法论围绕三个关键创新:阶段感知分解、通过掩码进行输入级别适应以及统一的端到端训练。


1440

被折叠的 条评论
为什么被折叠?



