商汤科技近日宣布,基于其自研的NEO-Unify架构,正式面向社区开源轻量级统一多模态模型的预览版本SenseNova U1.5-Lite-Preview。这一动作距离今年4月发布SenseNova U1仅过去数月,被视为商汤在统一多模态路线上的一次关键迭代。与常见的“堆参数”式升级不同,U1.5-Lite-Preview在保持8B-MoT轻量级规模的前提下,将视觉生成能力推向了原生4K分辨率,同时强化了图像编辑、文字渲染与复杂指令遵循等核心维度,试图在“统一架构”的框架内证明能力持续扩展的可行性。
从技术演进脉络来看,SenseNova U1的发布曾首次完整展示了原生统一多模态的构想:在单一模型中联合建模语言、视觉语义与像素生成,使模型能够原生完成从理解到生成的闭环任务。而U1.5-Lite-Preview并非简单的规模放大,而是针对生成质量与可控性进行了系统性打磨。据官方披露,新版本在四个方向上带来了显著提升:原生支持4K图像生成,局部纹理与真实世界质感更加精细,中英文文字生成与复杂版式组织更为准确,同时图像编辑的稳定性和视觉指令遵循能力也得到增强。这些改进并非孤立的技术指标,而是指向一个更实际的问题——统一多模态模型能否在真实创作场景中承担复杂任务。
在具体能力展示中,商汤特别强调了长上下文视觉控制的价值。以一张“背包产品解析”信息图为例,团队使用了长达1675词的提示词,包含复古博物学标本图鉴风格、五章结构、中英双语对照、拉丁文标注等多重约束。U1.5-Lite-Preview能够准确理解并执行这些结构化指令,生成结果在版式、文字和细节层面均保持较高水准。值得注意的是,官方观察指出,这种强提示词遵循能力并非主要来自对结构化模板的记忆或适配,而是源于模型对语言与视觉语义的深层联合建模。这意味着,用户既可以用简单口语快速出图,也可以为复杂创作提供详尽说明,模型会根据指令的详细程度动态调整执行精度。
从行业视角看,商汤此次开源的轻量级模型具有双重意义。一方面,8B-MoT的参数量级意味着更低的部署门槛,开发者可以在消费级硬件或边缘设备上运行,这为统一多模态模型从实验室走向实际应用铺平了道路。另一方面,原生4K图像生成与复杂视觉控制的结合,直指海报设计、信息图表、品牌视觉等专业创作场景,这些领域过去通常依赖多模型串联或人工后期调整,而统一架构有望简化工作流并提升效率。商汤方面表示,U1验证了统一架构的可行性,U1.5则进一步验证了能力的可扩展性——不仅能够同时承载理解与生成,还能向更高分辨率、更复杂信息表达和更真实视觉世界持续演进。这一判断若得到社区验证,或将推动多模态AI从“拼接式”路线向“原生统一”方向加速迁移,而开源策略也将为这一进程注入更多来自开发者的反馈与创新动力。
