NUS Show Lab寿政教授打通自回归与离散扩散,打造下一代具身大模型底座

新加坡国立大学Show Lab在单个Transformer中同时实现自回归预测与离散扩散生成,打破文本离散性与视觉连续性的壁垒。Show-o系列成果将多模态能力延伸至具身机器人决策,通过闭环算法破解数据稀缺、消除连续视频帧卡顿,并实现云端大模型与端侧低延迟控制的配合,被视为多模态架构向具身大脑演进的分水岭。

在多模态大模型的发展历程中,“理解”与“生成”长期被视为两条难以交汇的技术路线。业界普遍采用的做法是将独立的视觉模型、语言模型和生成模型进行拼接,形成一种“模型拼贴”式的系统。然而,这种方案不仅带来推理效率的损耗,更在架构层面埋下了模态割裂的隐患。新加坡国立大学Show Lab负责人寿政教授在ECCV 2026现场披露的研究成果,正是对这一行业痛点的正面回应。他们选择了一条更为原生的架构路线:在单个Transformer中同时打通自回归预测与离散扩散生成,让逻辑推理与高质量内容生成在同一底座上共生。

这一突破的核心在于Show-o架构对文本离散性与视觉连续性“死结”的解开。传统自回归机制擅长处理离散的文本Token,却在生成连续视觉内容时陷入效率泥潭;而连续扩散模型虽然能生成高质量图像,却无法直接对接视觉语言模型的离散Token体系。Show-o通过将处理文本的自回归机制与处理视觉的离散掩码扩散深度缝合,既避开了自回归生成图像的效率瓶颈,又解决了连续扩散模型与VLM离散Token不兼容的难题。这意味着,同一个模型底座既能完成复杂的逻辑推理,又能输出高保真的视觉内容,为多模态能力的统一奠定了架构基础。

更具产业意义的是,这一架构正在向具身智能领域延伸。针对困扰机器人学习的“标注荒”问题,寿政教授提出了循环一致性监督方案。在缺乏人类标注的低资源领域,模型通过“观察—描述—再合成”的逻辑循环实现自监督进化,从而能够从海量无标签视频中汲取物理常识。这极大地拓宽了Scaling Law的数据边界,让AI不再依赖昂贵的人工标注,而是像人类一样从日常观察中学习世界运行的规律。与此同时,团队自研的Q1实时骨干网通过精密的特征对齐与蒸馏,实现了远超前沿闭源大模型的推理速度,为云端大模型与端侧低延迟控制的配合提供了可能。

从行业视角来看,Show-o系列成果标志着多模态架构正从“实验玩具”向“具身大脑”进化。过去,视频理解与视频生成分别训练专属模型,模型只“看懂”而不“行动”。如今,随着动作维度的融入,AI开始迈入“体验时代”——模型不仅停留在视觉与文本的关联认知上,更具备在物理或虚拟环境中采取行动的能力,并通过环境反馈实现“在做中学”。这一转变的分水岭意义在于:真正的数字生命大脑,不仅要能深思熟虑,更要在与物理世界碰撞的一瞬间给出近乎本能的实时反馈。当自回归与离散扩散在单个Transformer中完成融合,多模态大模型向具身智能底座的演进便有了可落地的技术路径。