2026年世界人工智能大会(WAIC)现场,智象未来正式发布了全球首个无限时长内容创作多模态智能体vivago R1,并同步官宣完成C轮融资,近三个月累计融资金额超过20亿元人民币。这一动作将AI视频生成赛道从“模型比拼”推向“编排体验”的新阶段,也让这家成立仅三年多的北京初创公司正式跻身独角兽行列。
智象未来成立于2023年3月,创始人兼CEO梅涛是计算机视觉领域的资深学者,曾任微软亚洲研究院高级研究员、京东高级副总裁,并于2025年当选ACM Fellow。公司定位为“全球唯一同时支持文本、图像、视频统一生成与编辑的多模态大模型企业”。此次发布的vivago R1,核心卖点被概括为“长、长、稳”——无限时长视频生成、长任务思考能力、高稳定生成输出。与市面上多数仅支持数秒至数十秒片段的视频生成工具不同,vivago R1试图以智能体方式接管完整创作流程,从脚本构思、分镜设计到长片段连续生成与编辑,实现端到端的“内容工厂”体验。
围绕AI视频生成,行业长期存在“模型聚合是否等于套壳”的争议。伯克利哈斯商学院今年6月发表的一篇评论文章指出,模型与编排框架都在快速商品化,纯软件的Agent编排层护城河最弱,真正的壁垒正从“大脑”(模型)迁移至“物理体验”。然而,智象未来在资本市场的表现却给出了另一重信号:近三个月内连续完成两轮融资,总额超20亿元,投资方涵盖多家头部机构。此前Cursor被SpaceX以600亿美元收购、Manus曾接近20亿美元出售、OpenRouter也在洽谈并购,这些案例共同指向一个趋势——聚合只是手段,编排出的产品体验才是用户真正愿意付费的东西。
实测显示,vivago R1在模型聚合之上,以长视频编排能力构建了新的护城河。它不满足于调用多个开源或自研模型生成单段视频,而是通过智能体调度,让模型在长时间任务中保持角色一致性、场景连贯性和叙事逻辑完整性。这种能力在广告片、短剧、纪录片预告等需要长叙事结构的场景中尤为关键。对创作者而言,过去需要数周完成的视频项目,现在可能压缩到数小时;对行业而言,AI视频生成从“单点工具”进化为“创作伙伴”,意味着内容生产的边际成本将大幅下降。
当然,质疑声依然存在:无限时长是否意味着无限可用?编排层能否真正抵御“几周被克隆”的模仿风险?智象未来用融资和产品发布给出了阶段性回答,但真正的验证仍要看用户是否愿意把核心创作流程托付给这个智能体。在人人皆可聚合开源模型的时代,vivago R1的尝试为行业提供了一个值得观察的样本——当模型不再是稀缺品,谁能把编排体验做到极致,谁就能定义下一代AI创作平台。而20亿元融资的注入,无疑为这场长跑增添了重要筹码。
