模型发布、产品 量子位

MiniMax发布H3模型:手绘即特效,多模态能力迎来新突破

MiniMax推出多模态模型H3,主打「手绘即特效」功能,用户简单绘制即可生成高质量视频后期效果,被业内视为多模态AI的「Coding时刻」。该模型在视频生成与编辑领域展现强大能力,有望大幅降低视频制作门槛,推动内容创作效率变革。

在人工智能技术加速迭代的当下,多模态模型正从“能看会听”向“理解与创造”纵深演进。3月18日,国内AI大模型独角兽MiniMax正式发布新一代多模态模型H3,其主打的“手绘即特效”功能迅速引发行业热议。用户只需在视频画面上简单勾勒几笔,模型便能自动识别意图,生成高质量的动态特效,例如为人物添加火焰光环、让背景飘落花瓣,或是将静态涂鸦转化为逼真的三维物体。这一能力被不少从业者类比为多模态AI领域的“Coding时刻”——正如自然语言编程降低了软件开发门槛,H3正在让视频后期制作从专业软件操作走向人人可用的“随手创作”。

H3模型的核心突破在于其深度融合了视觉理解与生成能力。与以往“文生视频”或“图生视频”的单向生成逻辑不同,H3能够在同一框架内完成对视频内容的语义解析、空间定位与像素级渲染。当用户绘制一条弧线,模型不仅识别出“弧线”这一图形,还能结合视频场景推断出用户可能想要“彩虹”“光轨”或“运动轨迹”等具体效果,并自动匹配光影、材质与运动规律。这种“意图推断+物理模拟”的复合能力,得益于MiniMax在自研MoE架构上的持续积累,以及大规模多模态对齐训练数据的投入。官方技术报告显示,H3在视频编辑基准测试中的多项指标已超越当前主流开源模型,尤其在指令跟随与时空一致性方面表现突出。

从产业视角看,H3的发布标志着多模态AI正从“生成素材”迈向“参与创作”的关键转折点。过去一年,视频生成模型虽已能产出惊艳片段,但用户往往需要反复调整提示词,且难以对生成结果进行精细修改。H3的“手绘即特效”模式则提供了一种更直觉、更可控的交互范式,让创作者能够像在纸上涂鸦一样直接“告诉”模型自己的修改意图。这不仅大幅降低了视频剪辑与特效制作的学习成本,也为短视频平台、广告营销、在线教育乃至影视预演等场景带来了效率革命。有分析人士指出,当AI能够理解“画一笔”背后的创作语义时,人机协作的边界将被重新定义,内容生产的民主化进程也将进一步加速。

当然,H3目前仍处于早期版本,其在复杂场景下的稳定性、多笔触叠加的语义冲突处理,以及生成特效的物理真实性等方面仍有优化空间。同时,随着“手绘即特效”等强交互功能普及,如何界定AI辅助创作中的版权归属、如何防止深度伪造技术被滥用,也是行业必须直面的课题。MiniMax方面表示,H3将率先在其旗下海螺AI等产品中开放体验,并计划逐步向企业开发者提供API接口。可以预见,当更多创作者拿起“画笔”与AI协作,视频创作的黄金时代或许才刚刚拉开序幕。而这场由多模态模型驱动的创作范式变革,正以超乎想象的速度向我们走来。