张一鸣罕见发声拒绝蒸馏捷径,字节Seed模型瞄准世界第一梯队
行业、模型发布 雷峰网

张一鸣罕见发声拒绝蒸馏捷径,字节Seed模型瞄准世界第一梯队

在字节跳动Seed全员会上,张一鸣明确拒绝以蒸馏手段追赶前沿大模型,强调愿为长远目标牺牲短期利益。当前全球LLM排行榜中,Kimi K3 Max、Qwen 3.8 Max等中国模型已占据前十近半席位,而字节Seed 2.1 Pro仅排第21位。张一鸣的长期主义战略引发行业关注。

字节跳动创始人张一鸣近日在旗下AI实验室Seed的全员会议上罕见发声,明确拒绝以“蒸馏”手段追赶前沿大语言模型,并强调“字节跳动应该愿意为了长远目标牺牲一些短期利益”。这一表态迅速引发行业热议,被视为中国AI头部玩家在技术路线选择上的重要分水岭。据The Information报道,这场内部会议发生在两周前,张一鸣的立场异常坚决,直接否定了内部多次提出的“走捷径”方案,为Seed团队定下了长期主义的基调。

所谓蒸馏(Distillation),通俗而言就是利用其他更强模型的输出结果作为训练数据,让自家模型快速逼近对方能力。这种做法的确见效极快:几百万条高质量指令数据灌入后,模型在基准测试上的分数能在数周内大幅提升。然而,张一鸣对此并不买账。据接近Seed的人士透露,字节内部早在2023年4月就已明令禁止将GPT生成数据混入训练集,并通过API检测等技术手段硬性执行。张一鸣希望Seed像人类一样“学习如何思考”,而非模仿其他模型的“碎碎念”。这一路线之争在字节内部至少爆发过三次:2025年1月DeepSeek-R1横空出世时、英伟达Blackwell芯片部署后算力差距拉大时,以及Kimi K3跻身全球顶尖榜单时,均有研究员提议跟进蒸馏,但每一次都被张一鸣否决。

从最新一期Artificial Analysis全球LLM排行榜来看,中国模型已占据前十近半席位:月之暗面Kimi K3 Max位列第二,阿里Qwen 3.8 Max位居第四,智谱GLM 5.2 Max和DeepSeek V4 Flash分列第七、第八。反观字节Seed 2.1 Pro仅排在第21位,远低于其他中国模型。这一差距令人困惑——论资金,字节年利润规模位居互联网头部;论人才,Seed团队汇聚了搜广推体系成长起来的顶尖算法工程师;论算力,数万张GPU集群的智算中心正在全国铺开;论数据,抖音与TikTok坐拥全球最大的原生内容池。样样不缺的字节,为何在大模型榜单上追不上?有字节员工透露,公司内部普遍认为,不愿蒸馏正是其大语言模型落后于其他中国AI实验室的关键原因之一。

张一鸣的长期主义战略并非盲目自信。面对算力瓶颈,字节选择增资2000亿元,在乌兰察布和怀来等地加盖智算中心;面对榜单压力,他坚持“榜单是虚的,商业主权是实的”。国内某大厂高管曾对媒体表示:“阿里、腾讯、字节这个量级的公司,不能总靠蒸馏别人过日子。”张一鸣要的是在下一轮竞争中,Seed模型能力跻身世界第一梯队。这种选择意味着短期内字节的模型排名可能继续承压,但从长远看,自研能力的积累才是AI竞赛的终极壁垒。行业观察人士指出,随着赛道进入深水区,依赖蒸馏的玩家将面临技术同质化和创新能力枯竭的风险,而字节的“慢功夫”或许能在下一代模型架构或推理范式中爆发出真正的竞争力。这场关于速度与深度的博弈,正在重塑中国AI产业的竞争格局。