融合VLA + 世界模型,加速通往AGI。
这个问题就像南北粽子甜咸之争一样,已经存在好久,
但最近刷论文,隐隐有这个分久必合的趋势。
先来看看VLA与世界模型的技术路线对比
遵循辩证看待问题,优势与劣势并存,
VLA (视觉 - 语言 - 动作) ,优势明显,直接连接人类语言指令与机器人动作,泛化性强,学习效率高;尤其适合快速理解复杂指令的场景,参考家务保姆和导览助手;短板是长期规划不太行,新场景容易迷失自我。
参考:OpenVLA、DexVLA、ChatVLA-2
世界模型 (World Model) ,会建环境的内部表征,会预测未来状态,规划可靠;适合汽车制造、仓储物流这种长期规划的复杂制造环境类型;短板是计算消耗大,训练数据要求多且高;
参考:DreamVLA、Vision Language World Model(VLWM)
那么两者结合的融合模型,不就既能理解人类语言指令 (VLA ),又能在复杂环境中长期规划 (世界模型),嘿嘿!
接下来看下融合模型相关的论文
2025年10月,GigaBrain-0: A World Model-Powered Vision-LanguageAction Model

GigaBrai


190

被折叠的 条评论
为什么被折叠?



