点击 “AladdinEdu,同学们用得起的【H卡】算力平台”,H卡级别算力,按量计费,灵活弹性,顶级配置,学生专属优惠。
从杂乱桌面精准抓取一枚鸡蛋,到人形机器人完成复杂工具操作,DexGrasp技术正成为具身智能落地的关键突破点。
01 具身智能的核心挑战:灵巧抓取的泛化困境
在物流仓库的分拣线上,机械臂面对堆叠的包裹频繁失误;在家庭厨房场景中,服务机器人无法稳定抓取光滑的鸡蛋——这些现实问题揭示了当前机器人抓取技术的核心痛点:环境泛化能力不足。传统抓取方案面临三大瓶颈:
- 场景敏感性强:固定光照、背景下的抓取成功率骤降至40%以下(如光线变化导致视觉定位偏差超2cm)
- 依赖人工预设:工程师需预先标注物体CAD模型与抓取点,新物体部署周期长达数周
- 动态适应性差:无法实时应对物体位移、姿态变化等干扰(如抓取过程中被碰倒的水杯)
DexGrasp技术的诞生正是为了解决上述困境。其核心思想是通过多模态感知与分层决策架构,实现从“看到”到“抓到”的端到端泛化能力。2025年,灵初智能团队提出的DexGraspVLA框架在零样本场景下达到90.8%抓取成功率,而训练数据量仅为竞品Figure Helix模型的0.4%。
02 DexGrasp技术栈解析:从理论到实现
2.1 分层VLA架构:快慢脑协同决策
DexGraspVLA采用分层架构模拟人类抓取决策过程:
- 高层规划器(慢脑):基于视觉语言模型(如Qwen2.5-VL)解析指令并定位目标
# 伪代码:高层规划器工作流程
def high_level_planner(image, user_command):
# Step1:VLM理解场景语义
scene_description = vlm_predict(image, "描述场景中的物体及其关系")
# Step2:任务分解(如“清理桌子”->[抓取饼干,抓取杯子])
sub_tasks = task_decomposer(user_command, scene_description)
# Step3:生成目标检测框(域不变接口)
target_bbox = generate_bbox(image, sub_tasks


3116

被折叠的 条评论
为什么被折叠?



