在世界机器人大会的聚光灯下,具身智能大模型的进化路径正成为行业热议的焦点。8 月 19 日下午,一场以“具身智能大模型的进化之路:从技术分级到产业落地”为主题的分论坛在北人亦创国际会展中心举行。生数科技创始人兼首席科学家、ACM/IEEE/AAAI Fellow 朱军发表主旨演讲,首次系统披露了团队在通用世界模型领域的最新研究成果,并提出了一套五级发展路线图,试图为这一尚处混沌期的技术方向建立清晰的坐标系。
朱军在演讲中指出,当前行业对“什么样的世界模型才称得上通用”仍缺乏共识。世界模型的概念已从最初的视频生成延伸至环境模拟、机器人决策和动作控制等多个方向,但各家技术路线各自为政,缺乏统一的评估与演进框架。他强调,应从第一性原理出发,构建一个能够理解世界、预测未来并采取行动的通用基座模型,而非仅仅服务于某个特定任务或场景的专用模型。这一判断直指当前具身智能领域“重场景、轻通用”的普遍倾向,也为后续的技术分级埋下伏笔。
在朱军看来,通用世界模型并非单一的生成器、模拟器或策略模型,而是三种能力耦合在一起的闭环反馈系统。他以人类学习骑自行车或开车的过程作比:大脑在与外部世界持续互动中形成关于世界运行规律的“内部模型”,从最初的不协调逐渐趋于稳定和准确。通用世界模型同样需要生成、模拟与决策三项彼此关联的能力,且行动不仅是模型的输出,还会改变环境、产生新信息,进而进入下一轮理解、预测和决策。这种闭环设计打破了传统分模块方案中能力割裂的弊端,使模型能够在与环境的多轮交互中不断自我修正。
围绕如何构建这一通用基座模型,朱军从数据、架构与算力三个维度展开论述。数据方面,他提出一个由观察逐步走向行动的多层数据金字塔:底层是海量网络视频,向上依次扩展至特定领域视频、第一视角人类视频、带动作记录的人类示范,直至最顶层的真实机器人交互数据。越靠近底层,数据规模越大、覆盖面越广;越靠近顶层,数据越稀缺、成本越高,却更能直接建立任务、动作与物理结果之间的联系。值得注意的是,朱军特别强调“不完美数据”的价值——失败尝试、纠正动作和恢复过程都包含有效的学习信号,能够帮助机器人学会从失败中恢复,这一观点为数据采集策略提供了新的思路。
架构层面,生数科技采用 MoT(Mixture-of-Transformers)架构,为不同模态配置专属参数,并以共享注意力实现跨模态信息交互,使环境理解、世界状态预测与动作生成能够在同一模型中协同完成。基于这一架构研发的世界动作模型 Motubrain,将理解、预测与行动统一建模,提升了异构数据的利用效率和跨任务迁移能力。算力方面,朱军指出离线视频生成可以容忍一定等待时间,但实时交互和机器人控制必须在环境发生变化之前完成预测和决策,因此训练基础设施、推理加速、模型蒸馏和高效注意力机制都是通用世界模型走向实际应用的重要支撑。
基于上述技术认知,朱军提出通用世界模型的五级发展路线图。这五个层级并非彼此割裂的产品方向,而是随着对世界的理解不断加深、与世界的交互能力不断增强而逐级演进的过程。从基础的环境感知与状态预测,到复杂的多模态协同决策与实时动作控制,每一级都对模型的生成、模拟与决策能力提出更高要求。这一路线图的意义在于,它为具身智能大模型从技术分级到产业落地提供了可参照的演进路径,也为行业评估不同技术方案提供了统一标尺。随着机器人技术从实验室走向工厂、家庭等真实场景,通用世界模型有望成为连接数字世界与物理世界的关键桥梁,而五级路线图的提出,或将加速这一进程的规范化与产业化。
