商汤科技今日正式宣布,其轻量级原生统一多模态大模型 SenseNova U1.5 Lite 已面向全球开源。相较于此前发布的预览版,正式版不再仅仅展示模型在统一多模态理解与生成上的基础能力,而是将重心转向真实视觉创作流程中的稳定性与准确性。商汤方面表示,这一版本旨在推动 AI 视觉生成从“能生成”跨越到“稳定完成真实视觉交付”的新阶段,开发者与创作者现可通过 GitHub、Hugging Face、魔搭社区及 SenseNova Studio 在线平台直接部署体验。
在过往的 AI 视觉生成实践中,创作者常面临两大痛点:一是精心撰写的长指令难以被模型完整解析,二是局部修改时模型容易“好心办坏事”,连带改动无关区域。例如,用户花费 25 分钟写出的详细提示词,模型可能只能处理其中 1k 字符的内容,导致大量细节被遗漏;又或者只想替换画面中的一只杯子,模型却连背景和人物面容一并重绘。这些问题的根源在于模型对复杂指令的遵循能力不足,以及对图像编辑边界的把控不够精准。SenseNova U1.5 Lite 正式版针对这些真实生产场景进行了系统性优化。
在核心能力上,SenseNova U1.5 Lite 原生支持 3 至 4k 字符的超长上下文指令,能够同时处理主体、数量、空间关系、文字、布局、风格等多重约束,显著提升了复杂视觉任务的执行稳定性。同时,模型在视觉生成质量上进一步打磨,改善了整体构图、色彩、材质、光影与局部细节,减少了“局部正确但整体完成度不足”的常见问题。图像编辑方面,正式版增强了主体身份、空间结构、版式关系和非编辑区域的保持能力,支持局部修改、元素替换、文字精修以及多参考图编辑。此外,模型还强化了中英文文字排版、海报与信息图设计能力,并支持 Bounding Box、Visual Marker 及单图多图参考等精细视觉控制方式,最终实现原生 4K 高分辨率输出,在高清画质下兼顾整体构图与极细微的肌理和光影表现。
从行业视角来看,商汤此次开源的 SenseNova U1.5 Lite 正式版,反映出 AI 视觉生成领域正在经历从“炫技”到“实用”的关键转型。过去几年,各家模型厂商竞相追逐画面美感与写实度,但在实际生产流程中,模型能否精准执行用户完整意图才是决定其商业价值的关键。商汤选择将超长指令遵循、精细编辑控制与高分辨率输出作为核心卖点,并采用开源策略,无疑将降低开发者与中小团队应用先进多模态能力的门槛。此举不仅有助于构建更活跃的开发者生态,也可能推动整个行业重新审视视觉生成模型在真实交付场景中的评价标准,促使更多厂商将工程稳定性与任务完成度置于同等重要的位置。随着开源社区的持续反馈与迭代,AI 视觉生成工具有望在广告设计、影视制作、电商展示等专业领域发挥更大作用,真正成为创作者手中可靠的生产力工具。
