李飞飞等十余位顶尖学者联手,提出用像素动作接口打通视频模型与机器人壁垒
具身智能、学术研究、模型 雷峰网

李飞飞等十余位顶尖学者联手,提出用像素动作接口打通视频模型与机器人壁垒

一篇名为Masked Visual Actions for Unified World Modeling的论文引发关注,作者阵容包括李飞飞、吴佳俊、ControlNet作者张吕民等十余位顶尖学者。该研究提出用像素动作作为新接口,打通视频大模型与具身智能之间的壁垒,为机器人学习提供新思路。

近日,一篇题为《Masked Visual Actions for Unified World Modeling》的论文悄然出现在 arXiv 预印本平台上,尚未在学术圈广泛传播,却已引发业内高度关注。这份工作的署名阵容堪称近年视频生成与具身智能交叉领域最豪华的一次集结:斯坦福大学李飞飞教授、助理教授吴佳俊、ControlNet 作者张吕民、斯坦福计算成像实验室负责人 Gordon Wetzstein、机器人基础模型核心推动者黄文龙,以及哈佛大学助理教授 Yilun Du 等十余位顶尖学者赫然在列。尤其值得注意的是,李飞飞与 Yilun Du 分别代表着具身智能领域两条长期并行甚至互有分歧的技术路线——前者主张让 AI 在可理解的视觉画面中直接进行推理,后者则倾向于将一切信息先压缩为抽象表征再行处理。两人上一次合作还要追溯到五年前 Yilun Du 在 MIT 攻读博士期间,此后学术交集甚少。此次同署一篇论文,被不少研究者视为一个强烈信号:或许这两条路线之间,终于出现了某种双方都能接受的共识基础。

论文的核心贡献在于提出了一种名为 MVA(Masked Visual Actions)的新接口机制,旨在打通视频生成模型与机器人控制之间的壁垒。过去几年,视频生成模型在物理世界理解方面取得了长足进步,无论是 Sora 还是国内多家厂商推出的开源模型,都能从海量视频数据中习得“球滚到桌边会掉落”“水杯被撞会洒水”这类朴素的物理直觉。然而,这些模型始终缺乏将“理解”转化为“行动”的能力——它们知道物体会如何运动,却不知道如何主动施加动作去改变运动轨迹。论文作者指出,这一困境的根源在于缺少一个有效的“翻译接口”:视频模型以像素为语言,而机器人控制系统以关节力矩或末端位姿为语言,两者之间没有直接可通约的中间表示。MVA 的解决方案是将动作信息编码为像素空间中的遮罩轨迹,使得视频模型无需改变自身架构或重新训练,就能通过观察这些遮罩轨迹来理解并生成相应的动作序列。

实验结果表明,MVA 模型具备双向能力:既可作为正向世界模拟器,预测给定动作序列下场景的未来演变;也可作为逆向动作生成器,根据期望的视觉目标反推所需的动作指令。更令人振奋的是,在仅使用 15 小时机器人操作数据进行微调的情况下,模型便展现出了跨本体泛化能力——从训练时见过的单臂操作,成功迁移到完全未见过的双臂操作场景。这一结果对产业界具有深远意义。当前,许多工厂或物流分拣站面临一个棘手难题:每当更换机械臂型号或调整产线布局,机器人控制系统往往需要重新采集数据、重新训练模型,导致“换条机械臂就宕机”的窘境。MVA 的思路若能在实际场景中稳定落地,意味着机器人或许不再需要训练专属的大模型,甚至无需重训已有的视频生成模型,只需找到正确的接口,就能直接利用日趋成熟的视频生成能力来驱动各种不同形态的机器人本体。

当然,这篇论文的野心远不止于解决工程问题。它实际上在挑战一个当前行业中被广泛接受的前提:机器人需要自己的基础大模型。近年来,全球范围内大量科技公司和创业团队投入巨资研发“机器人大脑”,试图打造专属于具身智能的基座模型,不少创业公司甚至仅凭一个基模概念就获得了数十亿估值。而这篇论文的结论暗示,这条路或许并非唯一解,甚至可能不是最优解。如果视频生成模型本身已经蕴含了足够的物理世界知识,那么问题的关键就不在于重新训练一个更庞大的模型,而在于设计一个更聪明的接口。这一观点若被后续研究进一步验证,将可能重塑整个具身智能领域的资源分配格局,让更多研究力量从“堆参数、拼算力”转向“设计接口、优化交互”。当然,从论文到大规模产业应用仍有相当距离,MVA 目前仅在有限场景中验证了可行性,其泛化能力、鲁棒性和安全性仍需更系统的测试。但无论如何,这篇论文的出现,已经为视频生成与机器人学习的融合指明了一个极具潜力的新方向。