概要
https://dexgraspvla.github.io/
DexGraspVLA 是一种基于 RGB 图像感知和语言指令的分层视觉 - 语言 - 动作框架,旨在解决杂乱场景中的通用灵巧抓取问题。其核心是利用预训练的视觉语言模型(VLM)作为高层任务规划器,通过扩散策略学习低层动作控制器,在高层和低层间的衔接是通过VLM将多模态输入转换为域不变(边界框)表示。实验表明,该框架在数千个未见物体、光照和背景组合的 “零样本” 环境中实现了90% 以上的成功率,能处理对抗性物体、人类干扰和长程任务
研究背景与目标
灵巧抓取是机器人领域的基础挑战,现有方法多依赖单一物体或简化环境,难以应对真实场景中物体多样性(几何、质量、纹理)和环境干扰(光照、背景、多物体)。视觉 - 语言 - 动作(VLA)模型通过基础模型的预训练知识和模仿学习结合,成为解决泛化问题的新方向。DexGraspVLA首次将分层 VLA 框架用于通用灵巧抓取,目标是在杂乱场景中通过语言指令实现鲁棒抓取。
框架设计:分层 VLA 架构
一、高层任务规划器:
采用预训练视觉语言模型(VLM,如 Qwen-VLM),解析用户指令(如 “清理桌子”)并生成目标物体的边界框作为任务可行信号。规划器动态监控场景变化,逐步分解长时任务为单个抓取指令,例如先定位目标物体再生成边界框。
二、低层动作控制器:
基于扩散模型(DiT),输入包括:
a. 视觉特征:通过 DINOv2 提取头摄像头和腕摄像头图像的语义特征,对光照和背景变化鲁棒。
b. 目标掩码:从高层任务规划器的边界框输入,由 SAM 生成初始掩码并通过 Cutie 跟踪,确保在杂乱场景中精准定位目标。
c. 本体感受数据:机器人关节角度(13 维)。
控制器通过扩散过程预测多步动作序列,支持闭环控制和失败恢复。
实验结果
一、零样本泛化能力:
在 1287 种未见组合(360 物体、6 背景、3 光照)中,单尝试成功率90.8%,三次尝试后达96.9%。单物体基准测试成功率98.6%,远超直接从原始视觉输入学习的基线(如 ViT-small 仅 50.5%)。
场景类型 单尝试成功率 三次尝试成功率
未见物体 91.1% 96.7%
未见背景 90.5% 96.7%
未见光照 90.9% 97.4%
总计 90.8% 96.9%
二、长程任务执行:
处理 “清理桌子”“抓取所有瓶子” 等复杂指令,平均任务成功率89.6%,规划器指令生成成功率94.3%,边界框预测准确率>98%。
三、扩展至非抓握物体抓取:
针对平板物体(如盘子、书本),通过推物至桌边再抓取,在未见场景中成功率84.7%,显著优于基线(ViT-small 39.6%,DINOv2-train 66.0%)。
核心创新点
传统模仿学习直接从原始视觉输入学习,易受域偏移影响(如物体外观变化导致性能下降)。DexGraspVLA 通过基础模型(VLM+DINOv2)将多模态输入转换为域不变表示(VLM->边界框->SAM mask、DINOv2->语义特征),缓解了输入空间的多样性,使模仿学习能更高效捕捉动作分布。实验表明,其单物体抓取成功率(98.6%)远超基线(ViT-small 50.5%)。

局限
未探讨针对不同机器人本体的泛化性
未引入触觉模态

1254

被折叠的 条评论
为什么被折叠?



