2026年上半年,中国AI领域的资金与人才正以前所未有的速度涌向同一个方向——世界模型。据行业统计,仅前六个月,国内世界模型赛道披露的融资总额便达到约300亿元人民币,若将“具身智能+世界模型”融合赛道纳入统计,这一数字更是膨胀至900亿元以上,同比增速超过5倍。百亿资金、海量人才如潮水般涌入,然而一个绕不开的问题也随之浮出水面:在如此狂热追逐之下,究竟有多少人真正想清楚了这个概念的本质?从业者在寻找技术方向,投资人在筛选潜力团队,猎头在摸排组织架构,大厂战略部门则忙于研判谁能在这场竞赛中存活下来。所有人都在追问同一个问题:有没有人能真正把世界模型这件事讲清楚?
IDEA研究院讲席科学家、视启未来创始人张磊,正是极少数能给出清晰、可操作且不随主流妥协答案的人。张磊是IEEE Fellow,Google Scholar引用量超过77000次,H-Index高达107,拥有60多项美国授权专利。他的DINO系列模型曾在COCO数据集上霸榜长达五个月,Grounding DINO与后续的DINO-X力压谷歌和Meta,被李飞飞团队、英伟达、银河通用等全球顶尖机构视为“标配”引用。2025年,他带着团队从IDEA研究院孵化创立视启未来,天使轮融资一个月内便到账近亿元,身后还站着两位AI巨擘——学术导师张钹院士(中国人工智能奠基人之一)与产业导师沈向洋院士(前微软全球执行副总裁、前微软亚洲研究院院长)。从微软研究院首席研究员,到IDEA研究院讲席科学家,再到创业者,张磊的职业道路几经换轨,但研究命题始终如一:“让AI理解物体”。在他看来,世界模型正是这个做了二十多年的命题在物理世界中的关键答案。
张磊对世界模型的定义提出了一个极具冲击力的核心观点:不以动作为输入条件,就不叫世界模型。这一论断直指当前行业概念的混乱边界。他认为,许多团队所宣称的“世界模型”实际上只是视频生成模型或预测模型的变体,它们虽然能够生成逼真的画面或预测下一帧,却缺乏与物理世界交互的关键能力——动作输入。真正的世界模型应当以动作作为核心条件,模型需要理解“如果我执行某个动作,世界将如何响应”,而非仅仅被动地观察和预测视觉信号。这一区分至关重要,因为它决定了模型能否真正用于具身智能的决策与控制,而非停留在视觉生成的表层。张磊强调,具身智能当前最大的瓶颈并非机器人本体硬件,而是“大脑”——即能够理解物理规律、支持动作规划与执行的世界模型。运动控制上的惊艳表现固然引人注目,但若缺乏对世界因果关系的深层理解,机器人仍无法在开放环境中实现真正的自主智能。
这一观点为行业厘清了概念边界,也为投资人与从业者提供了判断标准。当大量团队以“世界模型”之名行“视频生成”之实时,张磊的定义无疑是一面照妖镜。他进一步指出,世界模型的路线之争最终将回归到“理解”与“生成”的本质差异:生成追求视觉逼真,理解追求因果正确。对于具身智能而言,后者才是通往通用机器人的必经之路。张磊的DINO系列之所以被全球顶尖机构广泛引用,正是因为其在物体理解上的深度突破了传统视觉模型的局限,为世界模型奠定了感知基础。随着视启未来的成立,张磊正将这一理念从学术研究推向产业落地,其背后张钹与沈向洋两位导师的加持,更让这家初创公司备受瞩目。在百亿资金涌入的喧嚣中,张磊的清醒与坚持,或许正是这个赛道最稀缺的资产——一个真正想清楚了“世界模型是什么”的人,正在用行动定义这个时代的答案。
