具身智能领域在2026年会有什么突破性进展?当下的路径分歧谁会略胜一筹?

融合VLA + 世界模型,加速通往AGI。

这个问题就像南北粽子甜咸之争一样,已经存在好久,

但最近刷论文,隐隐有这个分久必合的趋势。

先来看看VLA与世界模型的技术路线对比

遵循辩证看待问题,优势与劣势并存,

VLA (视觉 - 语言 - 动作)优势明显,直接连接人类语言指令与机器人动作,泛化性强,学习效率高;尤其适合快速理解复杂指令的场景,参考家务保姆和导览助手;短板是长期规划不太行,新场景容易迷失自我。

参考:OpenVLA、DexVLA、ChatVLA-2

世界模型 (World Model) ,会建环境的内部表征,会预测未来状态,规划可靠;适合汽车制造、仓储物流这种长期规划的复杂制造环境类型;短板是计算消耗大,训练数据要求多且高;

参考:DreamVLA、Vision Language World Model(VLWM)

那么两者结合的融合模型,不就既能理解人类语言指令 (VLA ),又能在复杂环境中长期规划 (世界模型),嘿嘿!

接下来看下融合模型相关的论文

2025年10月,GigaBrain-0: A World Model-Powered Vision-LanguageAction Model

GigaBrai

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值