国产大模型的竞争已经不再停留在参数规模和榜单分数上,而是深入到了算子层面的底层优化。8月14日晚间,智谱AI正式认领了近期在OpenRouter盲测榜上表现抢眼的“牛来”模型,并将其命名为GLM-5.3-Flash。这款模型上线首日便登顶OpenRouter调用量榜单,以极具竞争力的长文本性价比迅速引发行业关注。而真正让技术圈沸腾的,并非仅仅是性能数据,而是其底层架构所展现出的“集百家之长”的混合设计思路。
根据智谱AI公开的技术信息,GLM-5.3-Flash采用了一种混合架构,将DeepSeek的稀疏注意力机制(NSA)与月之暗面Kimi赖以成名的线性注意力机制进行了融合,并叠加了DeepSeek的流形约束超连接(mHC)技术。这一组合的核心目标十分明确:在保持长文本处理能力的同时,大幅降低推理成本。传统Transformer架构依赖Softmax注意力机制,每个Token都需要存入KV缓存,计算量随上下文长度呈平方级增长,显存占用则线性攀升。当上下文达到百万级时,仅KV缓存就可能消耗数十GB显存,推理成本高企,难以实现商业化落地。而线性注意力路线通过固定大小的状态矩阵压缩历史信息,配合“遗忘门”控制旧信息衰减,使显存占用基本恒定,这正是近期百万级长文本API价格大幅下降的底层逻辑。
然而,线性注意力并非没有代价。其循环乘法更新机制在长上下文场景下容易遭遇数值溢出问题——每处理一个新Token,旧状态都要乘以遗忘门系数,随着乘法次数增加,数值要么逐渐归零导致信息丢失,要么膨胀溢出破坏训练稳定性。因此,遗忘门下界的设定成为平衡“长记忆”与“数值稳定”的关键。8月15日上午,月之暗面核心研究员、“注意力残差”论文作者陈广宇在仔细研究GLM-5.3-Flash的模型配置文件后,贴出了一张Kimi K3与GLM-5.3-Flash的底层代码对比图。结果显示,两者不仅都采用了KDA线性注意力,排布逻辑高度重合,连核心参数“遗忘门下界”(gate_lower_bound)都同为-5。这一发现迅速引发热议,因为从Kimi K3公开技术报告到智谱上新,间隔还不到一个月。
这一现象背后,折射出的是中国顶尖大模型团队在技术路线上的深度趋同。有分析指出,线性注意力发展到当前阶段,数值稳定的最优区间本就极度狭窄,即便是不同团队各自独立试错,最终也往往会收敛到相近的数值。-5这个数字,既是Kimi K3在开源领域巨大辐射力的体现,也揭示了一个更深层的趋势:中国最顶尖的大模型团队,正不约而同地迈入同一个底层算子优化的技术深水区。对于行业而言,这种趋同并非坏事——它意味着长文本推理成本仍有进一步下降的空间,也预示着大模型商业化落地将迎来更多可能性。但与此同时,如何在趋同的技术路径上建立差异化优势,将成为下一阶段各家团队需要思考的核心命题。
