GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data

图 1:GraspVLA 是⼀个基于⼗亿级合成动作数据进⾏预训练并与互联⽹语义数据协同训练的抓取基础模型。它展现出直接的模拟到现实迁移能⼒和强 ⼤的零样本泛化能⼒,涵盖多个⽅⾯,并且对特定场景和⼈类偏好具有⼩样本适应性。
摘要:具⾝基础模型因其零样本泛化能⼒、可扩展性以及通过少量后训练即可适应新任务的优势,正⽇益受到关注。然⽽,现有模型严重依赖真实世界数据,⽽这些数据的收集成本⾼昂且耗费⼈⼒。合成数据提供了⼀种经济⾼效的替代⽅案,但其潜⼒仍未被充分开发。为了弥补这⼀不⾜,我们探索了完全使⽤⼤规模合成动作数据训练“视觉-语⾔-动作”(VLA)模型的可⾏性。我们精选了 SynGrasp-1B,这是⼀个⼗亿帧的机器⼈抓取数据集,采⽤照⽚级真实感渲染和⼴泛的域随机化技术在模拟环境中⽣成。在此基础上,我们提出了 GraspVLA 模型,这是⼀个基于⼤规模合成动作 数据预训练的 VLA 模型,可作为抓取任务的基础模型。GraspVLA 将⾃回归感知任务和基于流匹配 的动作⽣成集成到⼀个统⼀的“思路链”流程中,从⽽⽀持基于合成动作数据和互联⽹语义数据的联合训练。这种设计有助于弥补模拟与现实之间的差距,并促进将学习到的动作迁移到更⼴泛的互联⽹覆盖对象,从⽽实现抓取的开放词汇泛化。在现实世界和模拟基准测试中开展的⼴泛评估证明 了 GraspVLA 先进的零样本泛化能⼒以及对特定⼈类偏好的少样本适应性。我们将发布 SynGrasp-1B 数据集和预训练权重,惠及社区。我们的项⽬⻚⾯位于GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data
1.Introduction
(NLP) 和计算机视觉 (CV) 领域经历了范式转变。在海量互联⽹数据上预训练的⼤规模模型表现出对未⻅过场景的零样本泛化能⼒[1, 2, 3] 和符 合⼈类偏好的少样本⾃适应能⼒[4]。受此成功的启发,物理世界中动作的基础模型最近被引⼊视觉-语⾔-动作 (VLA) 模型 [5, 6, 7, 8]。这些模型处理机器⼈的视觉观察和⼈类指令以直接⽣成机器⼈动作。然⽽,与视觉和语⾔模态不同,现有的互联 ⽹数据集中缺乏动作数据,因此需要⼀种新的数据收集范式。
近期研究主要依赖于通过远程操作收集现实世界数据,例如 Open-X-Embodiment (OXE) [9]和 DROID [10]数据集等社 区驱动的研究。然⽽,⼤规模收集现实世界数据既耗费⼈⼒⼜成本⾼昂,需要⼤量的机器⼈和⼈⼯操作员,以及各种物理设 置。相⽐之下,合成数据提供了⼀种更易于获取且经济⾼效的替代⽅案。
为此,我们系统地探索了合成数据在训练 VLA 模型⽅⾯的潜⼒。作为此⽅向的第⼀步,我们专注于抓取⼀项基本的机器⼈ 操控技能。我们⾸先基于先进的光线追踪渲染[11]和物理模拟[12],整理了⼀个⼗亿帧的抓取数据集 SynGrasp-1B,这是 全球⾸个此规模的数据集。该数据集包含来⾃ 240 个类别的 10,000 个独特对象,并涵盖了⼴泛的域随机化,确保⼴泛覆盖 ⼏何和视觉变化。
为了⾼效地从该数据集中学习,我们提出了 GraspVLA,这是⼀个端到端⽹络,它将⾃回归感知任务和基于流匹配的动作⽣ 成集成到⼀个统⼀的思路链 (CoT) 流程中,并命名为渐进式动作⽣成 (PAG)。PAG 将感知任务(即视觉grounding和抓取姿势预测)视为动作⽣成的中间步骤,从⽽形成⼀个能够因果推断动作的思路链流程。该设计⽀持在统⼀框架中对合成数据和互联⽹数据进⾏联合训练,其中互联⽹数据⽤于训练感知任务(部分思路链流程),合成数据⽤于训练整个思路链流程。合成 数据为对象交互提供详细的⼏何信息,⽽互联⽹数据则提供丰富的对象语义知识。通过利⽤这些互补的数据源,PAG 缩⼩了模拟与现实之间的差距,并促进了将学习到的机器⼈动作迁移到语义多样的互联⽹覆盖对象,从⽽实现开放词汇抓取。
在我们精⼼策划的⼗亿级合成抓取数据集和提出的 PAG 机制的⽀持下,GraspVLA 实现了从模拟到现实的直接泛化,并展现出令⼈印象深刻的零样本性能。据我们所知,这是⾸次揭⽰合成数据在训练 VLA 模型中的巨⼤潜⼒。在真实环境和 LIBERO [13]模拟基准测试中开展的⼤量实验证明了该模型在不同变化中的稳健性。此外,GraspVLA 对合成动作数据中 缺失的⻓尾物体类别(例如充电器、⽑⼱和泳镜)表现出出⾊的泛化能⼒。与传统抓取检测算法中最先进的 AnyGrasp [14] 相⽐, GraspVLA ⽀持⾃然语⾔指令,并提供了稳健的闭环抓取策略。它在常⻅物体上实现了相当的性能,⽽在透明物体上的表现则显著优于 AnyGrasp。此外,GraspVLA 在特定应⽤场景中表现出对⽤⼾偏好的强⼤少量适应性,这些偏好超出 了标准的抓取⾏为,例如避免接触饮⽔杯内部以保持清洁,以及在密集的环境中按顺序抓取瓶⼦。
综上所述,我们的贡献如下:a)我们引⼊了⼀种完全依赖于合成动作数据的新型预训练范式,显著减轻了数据采集负担;b)我们整理了⼀个⼗亿帧的机器⼈抓取数据集 SynGrasp-1B,这是全球⾸个该规模的数据集;c)我们提出了渐进式动作⽣成 (Progressive Action Generation) ⽅法,利⽤互联⽹数据共同训练合成动作;将 GraspVLA 的技能扩展到新的对象类别,并且 d) ⼤量实验证明了 GraspVLA 的基础能⼒,包括强⼤的零样本泛化和现 实世界中⾼效的少样本适应性。
2.Related Work
视觉-语⾔-动作 (VLA) 模型
近期,⼤量研究 [15、16、17、18、19、20、21、22、23 ]探索通过学习⼤规模演⽰数据来训练端到 端 VLA。RT-2 [5]和OpenVLA [6]提出利⽤预训练的视觉语⾔模型 (VLM) [24、25 ]来挖掘互联⽹数据集中的丰富知识。继 预训练VLM取得成功之后,⼀些研究[ 26、7、27、8、28、29 ]探索利⽤额外的动作专家来⽣成⾼保真度的多模态动作。其他研 究[30、31、32、33、34、35 ]采⽤⽣成式预训练,对互联⽹规模的视频数据进⾏学习,以从真⼈视频中学习。然⽽,受限于现实 世界机器⼈数据的规模,现有的 VLA 模型主要依赖于领域内后训练进⾏部署。同时开展的⼯作π0.5 [36]提出利⽤多模态 ⽹络数据和跨具体化数据来提升泛化能⼒,从⽽实现开箱即⽤的直接部署。虽然我们的⼯作也以零样本部署为⽬标,但我 们采⽤了不同的⽅法仅对⼤规模合成数据进⾏预训练,并展示了强大的零样本泛化能力。
合成数据
随着 GPU 加速模拟和照⽚级真实感渲染的快速发展,合成数据⽣成已成为训练机器⼈模型的⼀种流⾏⽅法。 先前的研究[37、38、39 ]率先使⽤具有域随机化的模拟数据来训练开环抓取模型。最近,⼀些研究[40、41、42 ]探索通过随 机化物体配置和利⽤运动规划来⽣成逼真的机器⼈轨迹,从⽽⾃动增强模拟中的⼈类演⽰。另⼀项研究[43、44、45、46 ]利 ⽤⽂本到图像⽣成模型和多视图⽴体渲染,从⼀些⼈类演⽰中合成数据,⽽⽆需任何物理模拟。虽然这些⽅法[47]仍然依赖 于⼈类演⽰来⽣成增强数据,但我们的研究利⽤⼤规模合成数据以及预先训练的视觉和语⾔主⼲⽹络,探索直接的模拟到现实迁移。
抓取
抓握是具⾝智能体的⼀项基本技能[48] ,在过去⼗年中得到了积极的研究。⼀些研究通过开环抓握检测[49, 14, 50] 来解决这个问题,然后使⽤运动规划器控制末端执⾏器。这种基于模块化的系统通常存在深度感知较差[51]和故障恢复⾏ 为缺乏[52, 53] 的问题。另⼀项研究则以端到端和闭环的⽅式探索基于视觉的抓握系统,具体⽅法包括强化学习[54]或模 仿学习[55]。随着视觉语⾔基础模型[1, 56, 57] 的出现,⼀些研究旨在通过构建⼀个将抓握检测模型与 VLM 相结合的模 块化系统,将抓握能⼒推⼴到开放词汇对象[58, 59, 60, 61, 62] 。虽然这些⽅法在标准抓握⽅⾯取得了令⼈印象深刻的效 果,但它们在适应特殊任务(例如具有特定约束的抓握)⽅⾯⾯临挑战。
3.SynGrasp-1B Dataset Generation

图 2:数据⽣成流程:我们⾸先从 Objaverse [63]中筛选出超过 10,680 个适合桌⾯抓取的物体⽹格,并随机选择这些物体并将其放置在桌⾯上(左图)。接下来,我们使⽤ CuRobo 规划抓取轨迹,并根据随机化的抓取姿势和指令进⾏操作 (中图)。最后,我们将域随机化应⽤于材料(桌⼦和机器⼈)、光照、摄像机视图和背景,以模拟和渲染轨迹(右图)。
训练⼀个可泛化的基础模型需要包含各种对象和环境条件的⼤规模数据集。我们建议完全使⽤合成数据进⾏训练,⽽不 是依赖昂贵、缓慢且有限的真实世界⼈⼯数据收集。这能以极低的时间和成本提供更⼤的多样性。现在,我们将详细介绍 合成数据⽣成流程的核⼼组件:布局⽣成、轨迹⽣成和渲染。(layout generation, trajectory generation, and rendering)
物体资源和布局⽣成。我们利⽤ Objaverse 数据集[63]的 LVIS ⼦集,并仔细过滤掉不合适的类别(例如武器),最终⽣ 成总共 240 个类别和 10,680 个实例。我们随机缩放这些物体,并将它们以各种姿势放置在桌⾯上,从⽽⽣成多样化且物 理上可信的场景。更多详细信息请参阅补充材料。
抓取合成与轨迹⽣成。给定初始布局,我们利⽤先进的模块化系统建⽴专家策略,⽣成⽤于抓取和提起⽬标物体的⾼质量 轨迹。对于每个物体实例,我们利⽤抓取合成算法[64机器人灵巧手抓取网络]⽣成稳定的对映抓取。然后,我们使⽤运动规划算法 CuRobo [65]规 划⽆碰撞轨迹,以达到开环抓取姿势并提起物体。我们在 MuJoCo 物理模拟器[12]中验证所有候选轨迹,以确保成功提起 物体。
视觉随机化与渲染。给定不同的布局和相应的轨迹,我们使⽤ Isaac Sim [66]渲染具有随机光照、背景和相机设置的⾼质 量 RGB 图像,该引擎可提供⾼效的照⽚级真实感光线追踪渲染。我们采⽤各种光源,并进⾏⼴泛的随机化处理,包括点光 源、定向光源和穹顶光源。图像从两个不同的视⻆渲染,以提供场景的全⾯视图,并围绕预定中⼼随机化外部参数。更多细节 请参阅补充材料。
我们进⼀步强调了数据⽣成管道设计中的两个主要考虑因素:
⾼效的数据⽣成。我们开发了三种关键策略来提升效率。⾼质量⽹格通常很⼤,导致加载时间过⻓且内存占⽤较⾼。我们实 现了缓存机制,避免了冗余加载,同时确保了数据多样性。其次,我们实现了异步数据写⼊,允许并⾏保存图像和标签,从⽽ 提⾼了数据⽣成的整体效率。最后,我们采⽤并⾏物理模拟和渲染来进⼀步提升效率。更多详情,请参阅补充材料。
为模仿学习定制数据。为了降低模仿学习的难度,我们引⼊了两项改进。⾸先,开环抓取[14]采⽤两步流程(预抓取定位,然 后执⾏抓取)来避免碰撞,⽽这种分段式⽅法会产⽣停顿。
基于此类数据训练的模仿策略常常表现出犹豫[6, 67]。因此,我们实施了单步运动规划,优先考虑轨迹的平滑度⽽⾮规划 的成功率。其次,我们引⼊了随机化的机器⼈初始姿态,以提升专家演⽰中的⼯作空间探索能⼒和观察多样性,从⽽增强模 型的鲁棒性[68]。
通过此流程,我们使⽤ 160 块 NVIDIA 4090 GPU,历时 10 天,⽣成了⼗亿帧的数据集 SynGrasp-1B。我们在附录中提供 了数据多样性分析。
4.Model
总体架构
GraspVLA将视觉-语⾔模型 (VLM) 与动作专家[7] 集成,并通过渐进式动作⽣成 (Progressive Action Generation (PAG) mechanism)机制连接,如图3 所 ⽰。VLM 采集观察图像和⽂本指令,进⾏视觉-语⾔联合感知。它包含⼀个可训练的⼤型语⾔模型 (InternLM2 1.8B [69])、 ⼀个融合了 Freeze DINO-v2 [70]和受 OpenVLA [6] 启发的SigLIP [71]特征的视觉编码器,以及⼀个从视觉空间到语 ⾔空间的可训练投影仪。我们使⽤条件流匹配动作专家[72]进⾏细粒度的末端执⾏器动作⽣成。我们进⼀步引⼊ PAG,以 便将从互联⽹基础数据集中学习到的知识⾼效地迁移到抓取技能中。

图 3: GraspVLA由⾃回归视觉语⾔主⼲⽹络和基于流匹配的动作专家组成。它利⽤互联⽹grounding数据和合成动作数据的协同作⽤,并采⽤渐进式动作⽣成机制:该模型⾸先针对合成数据和⽹络数据预测⽬标物体的⼆维边界框,然后针对合成数 据⽣成抓握姿势和分块动作。
渐进式动作⽣成
虽然 GraspVLA 能够从我们的 SynGrasp-1B 数据集中学习到通用的抓取技能,但它受到合成数据集中类别集合的限制。为了将抓取策略扩展到新的类别,一种直接的方法是将互联网grounding数据集作为单独的任务进行联合训练,并依靠模型从基础数据集中学习到的类别进行隐式泛化。
或者,我们将图像定位和抓取姿态预测作为生成动作的中间步骤。具体来说,视觉语言模型(VLM)以统一格式训练生成互联网定位数据集和合成动作数据集的二维边界框。然后,对于合成数据集,VLM 进一步预测机器人基坐标系中的目标抓取姿态。最后,动作专家根据 VLM 对输入和中间推理标记的键值缓存生成动作片段。为了实现精确的 3D 感知,在生成抓取姿态之前,将最近两个时间步长的本体感受进行标记化并插入。为了使互联网数据集与 SynGrasp-1B 的双目相机设置对齐,输入图像被复制以匹配视图数量,并独立地进行随机缩放、裁剪、水平翻转和颜色抖动增强。两个数据集共享相同的文本提示模板,首先生成边界框标记。这统一的训练策略利用了互联网基础数据集与合成数据集之间的协同作用,类似于在大型语言模型中被广泛研究并证明为处理高度复杂任务的有效措施的链式思维推理机制[73]。
VLM 与动作专家的联合训练
在每个批次中,我们从互联⽹数据集 (GRIT [74])和合成动作数据集中随机抽样。前者仅⽤于 以⾃回归⽅式监督 VLM 的边界框预测。后者监督边界框、抓握姿势和基于光流匹配的动作预测。VLM 的损失正式定义为:

其中,Nbbox 和 Ngrasp 分别是边界框和抓取姿态标记序列的长度,ybbox,n 和 ygrasp,n 分别是各自序列中位置 n 的tokens,x 是输入的图像和文本。动作专家通过分段末端执行器增量动作的流匹配损失进行监督:
![]()
其中,t ∈ [0, 1] 是流匹配的时间步长,At 是 t 时刻的噪声动作主干,vt(·) 是模型预测的流匹配向量场,ut(At | A0) 是真实向量场。我们通过实验发现,LS2 和 LS1 的简单总和作为整体损失能取得良好的性能
5.Experiments
GraspVLA 以回答以下问题:(1)在各种泛化因素下,GraspVLA 与现有⼯作相⽐如何?(2)GraspVLA 如何随着数据量⽽ 扩展?(3)我们的设计选择对 GraspVLA 的性能有多⼤贡献?(4)GraspVLA 对针对特殊偏好的少量后训练的⽀持程度 如何?
5.1现实世界中与VLA的零样本比较

表1:现实世界的零样本比较。将模型与最先进的方法进行了比较模仿学习专家和⼤型 VLA 模型。所有模型均在 SynGrasp-1B 上进⾏微调。我们的方法在使用短轨迹抓取合成类别和网络类别物品时,实现了最高的抓取成功率。关于设置的详细描述在第5.1节中提供。

任务定义
为了评估 PAG 的有效性,我们使用了两组对象:合成类别和 Web 类别。我们将合成类别定义为存在于 SynGrasp-1B 数据集中的类别,而 Web 类别是指仅存在于 Internet grounding数据集中的类别。
对于每组对象,我们设计了 5 个测试集:基本、照明、背景、干扰项和高度。每个测试集包含从每组中随机采样的不同类别的 15 个对象,每个对象有 2 次试验。换句话说,我们测试每种方法总共 15 × 2 × 5 × 2 = 300 次试验。我们使用迪斯科灯来生成不同的照明条件。为了进行背景概化,选择并交换了三种不同的桌布。对于干扰项泛化,我们在桌子上随机放置 5 个额外的对象作为干扰项。为了进行高度概化,我们将工作区表面的高度增加 10 厘米。我们使用 Franka Panda 臂,并使用两个英特尔实感摄像头作为前置和侧面摄像头。工作区被限制在机器人前面的 40 cm × 50 cm x 20 cm 区域内。初始 robot 和 object 状态在每次试验中都是固定的,以确保公平比较。
指标
成功率定义为模型在 3 次尝试内成功抓取目标对象的百分比。对于每个对象组,我们还报告了平均成功率按路径长度 (SPL) [76] 加权,这是一个广泛使用的指标,通过惩罚不必要的长路径来加权成功率和运动效率。计算公式为:
![]()
,Si是成功率的二进制指标(1是成功),li是测试中使用任何方法中的最短路径,pi是模型中采取的路径长度,N是总测试次数。
基线
我们与多个基线进行比较,包括 VLA 通才和模仿学习专家。对于通才,我们使用 π[7]、OpenVLA [6] 和 Octo [26],这三种基于 transformer 的策略在大规模真实数据集上进行了预训练。为了确保公平的比较,我们在 SynGrasp-1B 数据集上对所有三个模型进行了微调。此外,为了评估 SynGrasp-1B 预训练的有效性,我们报告了从其 VLM 权重[77]直接微调π0的结果,而没有其交叉实施体机器人预训练。对于专家,我们使用扩散政策 [75],这是视觉条件模仿学习的强扩散基线。由于它缺乏语言条件,我们只使用 elephant 类别对其进行训练和测试。补充文件中提供了其他详细信息。
比较
如表 1 所示,GraspVLA 在所有测试集上都达到了 90% 左右,并且明显优于所有基线,表现出很强的零样本泛化性。值得注意的是,GraspVLA 在合成和网络类别中都取得了相当的结果,强调了 PAG 的有效性。此外,SPL 度量显示,与经常表现出犹豫的 π0baseline 相比,GraspVLA 可以抓取路径长度较短的对象。有趣的是,没有交叉本体预训练的 π0baseline 比其预训练的 πbaseline 表现更好,这表明跨本体预训练可能不是针对特定抓取任务的最佳选择。我们在补充中提供故障分析。
5.2在libero基准测试中与VLA进行零样本测试
设置
LIBERO [13]是⼀个⼴泛使⽤的仿真基准,涵盖不同的任务和对象类别。我们评估了三个 LIBERO 套件(Long、Goal、Object),不包括 Spatial,因为它对空间推理的关注超出了我们的范围。为了专注于抓取能力,我们省略了不可抓握的任务(例如,“打开炉子”),并将任务标题重新表述为“捡起 {object}”,每个套件选择 7-10 个任务。根据标准评估协议,每项任务都经过 50 个随机初始配置的严格测试,每个套件进行 350-500 次试验。补充资料中提供了更多详细信息。

比较
如表 2 所示,在 LIBERO 上评估 zeroshot 时,GraspVLA 表现出令人满意的性能。它超越了在 LIBERO 数据集上微调的 π 和 OpenVLA,表现出很强的泛化性。我们还观察到,任务的格式会显着影响微调模型的性能,并在补充中提供详细的结果。
5.3在现实世界中与AnyGrasp的零样本比较
设置
我们将 GraspVLA 与 AnyGrasp [14] 进行了基准测试,AnyGrasp [14] 是一种专门用于抓取的最先进的抓取检测模型。对于语言条件抓取,我们将 AnyGrasp 与 Grounding DINO [78](一种流行的开放词汇对象检测器)集成,以过滤抓取候选者。我们使用相同的两个基本测试集(第 5.1 节),指标包括总体成功率(任务完成)和抓取成功率(抓取任何对象)。为了隔离抓取性能,我们设计了两个额外的测试集(每个测试集 30 次试验):一个是常见的家用物体,另一个是透明物体,机器人可以抓取场景中的任何物体。

比较
在语言条件测试集中,两个模型都实现了相似的性能,由于其全面的多视图观察,GraspVLA 在接地能力方面略优于 AnyGrasp。在任意物体抓取中,虽然 AnyGrasp 在抓取常见物体方面取得了 100% 的成功率,但由于深度感知不准确和点云数据不完整,它在处理透明物体时遇到了困难。相比之下,GraspVLA 在两个测试集上保持一致的性能,突出了它对材料变化的鲁棒性。然而,GraspVLA 的推理速度明显慢于 AnyGrasp,这一限制与其庞大的视觉语言主干有关。
5.4缩放定律

图 5 显示了现实世界中训练帧数量的缩放曲线。我们观察到,性能随着训练帧的数量而稳步提高,并且在 Web 类别上的性能比合成类别的性能缩放慢,这表明需要更多的训练帧才能在 Web 类别上进行良好的泛化。有关训练类别数量和每个类别的实例数的扩展法则,请参阅补充内容。
5.5高效的后训练
基础模型的一个决定性特征是它们适应新任务的能力。为此,我们设计了三个下游任务:i) 任务 1 – 抓取稀有的工业部件,ii) 任务 2 – 在不接触杯子内部的情况下抓取杯子以进行维护清洁度,以及 iii) 任务 3 – 在密集的环境中按顺序抓取。这些任务严格地对模型对三个关键挑战的适应性进行了基准测试:(i) 推广到新的词汇,(ii) 执行特定于任务的抓取规范,以及 (iii) 按顺序抓取。我们为任务 1-2 收集了 100 个演示,为任务 3 收集了每瓶 10 个演示。我们为每个任务进行 10 次试验,并报告整体成功率(任务完成)和抓取成功率(抓取任何对象)。如表 4 所示,GraspVLA 在任务 1 中仅用边界框注释就实现了 90% 的成功率,超过了在完整动作数据上训练的基线。这表明将 GraspVLA 扩展到新对象不需要作注释,从而大大减少了数据收集工作。如最后两行所示,从头开始训练的性能较低,这凸显了我们的合成预训练的价值。值得注意的是,在任务 3 的密集顺序抓取中,GraspVLA 学会了有效地避免与周围物体发生碰撞。


5.6设计选择的有效性
如表 5 所示,我们在第 5.1 节中描述的基本测试集上使用由路径长度 (SPL) 指标加权的成功率和成功率来评估我们关键设计选择的有效性。原版基线采用与 Internet 接地数据的联合训练,但不包括 PAG,作为我们的起点。引入 2D 边界框作为中间作步骤 (PAG-2D) 可显著改善 Web 类别。抓取姿势预测 (PAG-3D) 进一步增强,可显著减少犹豫行为并提高抓取准确性。这导致更少的尝试和更短的轨迹,这反映在更高的 SPL 分数上。总之,这些结果证明了我们的 PAG 方法的有效性。

6.Conclusion
在这项工作中,我们研究了使用大规模合成数据构建一个可推广的抓取 VLA 模型。首先,我们在模拟中策划了一个十亿级的抓取数据集,具有广泛的随机化和逼真的渲染。其次,我们精心设计了我们的模型,以有效地从合成动作数据和无动作的互联网接地数据中学习,实现了在看不见的环境中抓取新类别物体的强泛化性。广泛的消融研究和比较表明,我们的方法在桌面抓取方面实现了最先进的性能。此外,我们观察到我们的模型可以有效地与合成训练数据的数量进行扩展。最后,我们展示了 GraspVLA 可以通过小规模后后训练获得新的抓取行为,突出了其适应性和在现实世界中应用的潜力。
7.Limitations and Future Work
目前,我们的数据生成和评估仅在 Franka Panda 臂上进行,具有正面和侧视图。然而,我们的仿真管道本质上是可扩展的,可以很容易地适应其他机器人和相机配置。我们将这项工程工作留作未来的工作。
GraspVLA 与模棱两可的指令作斗争,例如“捡起食物”和“捡起最左边的物体”。应对这些挑战可能需要扩展视觉语言预训练并探索架构创新以增强语义推理。
此外,GraspVLA 将可变形物体(例如毛巾)视为刚体,而忽略了它们的物理特性。未来的工作将整合先进的仿真技术,如可变形物体和流体作[79]以及富接触装配[80],以扩大其适用性。预训练模型在密集杂乱的场景和非桌面环境中也面临挑战。我们将来会整合来自更复杂场景的数据。
虽然当前的模型侧重于抓取,但模型设计并未针对此特定任务量身定制。我们计划扩展数据生成管道以支持其他作任务,例如 pick-and-place 和 pushing。除了当前数据生成中使用的基于模块化的专家策略之外,我们还将探索强化学习用于更复杂的任务,例如非抓握作。
尽管我们的 PAG 机制支持开放词汇抓取,但它会带来额外的延迟。我们目前使用 Torch Compile 在 NVIDIA L40 上实现了大约 200 毫秒的延迟 [81]。虽然这对于静态场景来说已经足够了,但对于动态环境(例如,快速移动的物体)来说可能还不够。可以进一步探索蒸馏和量化技术。

1259

被折叠的 条评论
为什么被折叠?



