在悉尼举行的 RSS 2026 机器人世界模型研讨会上,英伟达正式发布了其最新一代物理 AI 基础模型——Cosmos 3。这一产品被英伟达物理 AI 专家 Max Li 称为“全球首个在同一 Transformer 架构下打通文本、视觉、音频与动作全模态的世界基础模型”。与以往仅专注于视频生成或视觉预测的模型不同,Cosmos 3 的核心突破在于将语言理解、视觉感知与动作控制统一在一个框架内,直接面向具身智能(Embodied AI)的落地需求。这意味着,机器人不再需要依赖多个独立模型拼接来完成“看、想、动”的闭环,而是可以通过一个统一底座实现从感知到决策再到执行的全链路智能化。
长期以来,具身智能领域面临的最大瓶颈并非算法本身,而是物理世界数据的稀缺性。与互联网文本或图像数据可以近乎无限扩展不同,机器人在真实环境中采集数据受制于时间线性、空间约束和长尾场景的复杂性,难以通过简单堆算力来弥补数据缺口。Max Li 在演讲中指出,单纯依赖远程操作或合成数据无法从根本上解决这一问题,必须引入更核心的技术范式。Cosmos 3 正是基于这一判断而设计:它利用世界基础模型(World Foundation Model)对物理规律、空间关系和因果逻辑进行内化建模,使机器人能够在面对未见场景时,基于对世界运行规律的理解进行推理和行动,而非机械地匹配训练数据中的模式。
从行业演进的角度看,Cosmos 3 的发布标志着具身智能正从“组装机时代”迈向“整机一体化时代”。过去两年,开发者需要费力地将视觉模型、语言模型和控制算法像乐高积木一样拼接在一起,不仅工程复杂度高,且各模块之间的接口摩擦常常导致整体性能下降。Cosmos 3 通过统一的 Transformer 架构将多模态信息融合为一种共享的表示空间,大幅降低了系统集成的门槛。与此同时,Max Li 在演讲中释放了一个明确信号:具身智能的下半场将不再属于数据中心,而是属于边缘侧。英伟达正推动 AGI 的“大脑”向 Jetson 等边缘设备迁移,使机器人能够在本地实时运行大模型,摆脱对云端服务器的依赖,从而真正实现自主、敏捷的物理世界交互。
这一战略背后,折射出英伟达作为算力霸主的更深层野心——它不仅要继续垄断硬件层,更试图成为具身智能时代的“安卓系统”。通过定义一套标准化的“大脑与肢体”协议,英伟达希望让全球形态各异的机器人——从人形机器人到工业机械臂,从自主驾驶车辆到服务型终端——都能在 Cosmos 的逻辑底座上实现统一进化。如果这一愿景得以实现,英伟达将从芯片供应商升级为整个机器人产业的操作系统级平台,掌握定义行业规则的话语权。当然,这一路径也面临挑战:传统机器人学界对物理因果的“敬畏”与 AI 工业界对规模效应的“迷信”之间的张力,在本次研讨会上表现得尤为明显。Cosmos 3 能否真正弥合这一分歧,仍需在真实场景中接受检验。但可以确定的是,随着世界模型从概念走向产品,机器人从云端智能向物理世界落地的步伐正在显著加快。
