在近期举行的机器人领域顶级学术会议 RSS 2026 上,佐治亚理工学院助理教授、NVIDIA 研究员徐丹飞(Danfei Xu)发表了一篇题为《组合式世界模型》的主旨演讲,直击当前具身智能领域一个被广泛忽视的核心矛盾:高保真视频生成技术虽然能预测出极其逼真的未来画面,但机器人实际执行时却频频失效。这一现象揭示了“生成”与“规划”之间的本质差异——能够“脑补”成功的结果,绝不等于拥有真正的物理规划能力。
徐丹飞指出,随着以 Sora 为代表的高保真视频生成技术走向成熟,模型已经能够为机器人构建出极其逼真的未来画面,让人感觉通用人工智能似乎触手可及。然而,回到真实的物理世界,令人困惑的现象出现了:即便模型能够预测出完美的未来画面,机械臂在实际落地执行时依然频频失效。例如,当机器人面对一个复合任务——将重物放入冰箱时,模型可能分别掌握了“双手抱重物”、“打开冰箱门”以及“高位摆放”这几个独立技能,但如果让机器人面对一个从未组合过的全新场景,完全依赖生成模型,它或许能基于数据分布合成出一段看似合理的“预测视频”,但在真实物理执行时,往往会违背最基本的物理约束——例如尝试在双手紧抱重物的同时去拉开冰箱门,甚至在冰箱门尚未开启时就试图将物体放入。这暴露出了行业内长期被忽视的一个核心矛盾:能够“生成”成功的结果,绝不等同于拥有真正的“规划能力”。
为了破解这一瓶颈,徐丹飞提出了一套名为“组合式世界模型”的解决方案。该方案利用模块化与因子图(Factor Graphs)的架构,主张让机器人像搭积木一样,在测试阶段动态拼装基础技能。具体而言,组合式世界模型通过因子图与时间注意力机制,跨越视觉与行动之间的“视频-动作跨越断层(Video-Action Gap)”。徐丹飞强调,生成(Generation)是在已有数据分布中提取高概率的预测结果,而规划(Planning)则必须在测试阶段针对新的长流程与物理限制,实时构造出数据集中从未存在过的“有效解”。这一思路的核心在于:机器人需要具备泛化能力的先验表达,以及目标导向的测试期组合机制,才能在面对未曾见过的长流程任务与复杂的物理约束时,真正实现“看得懂画面,做得出动作”。这一研究成果不仅为具身智能领域提供了新的理论框架,也为未来机器人从实验室走向真实应用场景指明了方向。
