智谱近期在递归式自我优化(RSI)方向上的布局浮出水面。据雷峰网报道,智谱已将 RSI 能力下沉至基础设施层,构建出一套由 GLM-5.3 驱动的推理系统。这套系统的直接成果,是支撑 GLM-5.3-Flash 在发布一周内迅速成为全网使用最广泛的模型之一,短短六天内处理超过 62 万亿个 Token。更值得关注的是,这一切全部运行在十万张国产芯片组成的集群之上,而非依赖英伟达的算力方案。
在十万张国产芯片上把一个大模型真正跑通并部署好,难度远超常规工程实践。国产芯片的内存带宽与数据传输速度存在先天限制,无法直接照搬英伟达生态的成熟经验;底层软件栈不成熟,关键算子缺乏现成实现,大量文档甚至只能靠推测与验证;而 GLM-5.3-Flash 作为全新架构,需同时处理文字与图像,并支持 100 万 token 的超长上下文,KV 缓存容量压力呈几何级暴涨。此外,在十万张芯片这个量级,集群中每天都可能有数百张卡发生硬件故障、网络掉线或数据丢包。智谱的应对方式,是用 GLM-5.3 驱动的 Infra Agent 融合多项关键技术,以软件工程能力补硬件短板,例如采用节点内张量并行与层分割,用通信换内存,最终使端到端吞吐量提升 3.2 倍。
从第一次全量跑通到把全部真实生产流量切换过去,智谱只用了两周,而以往这类迁移往往需要经验丰富的基础设施团队耗费数周甚至数月。这背后是智谱的一个核心判断:在算力受到外部严格限制的情况下,中国 AGI 能否取得突破,关键不只在于拥有多少芯片,更在于能否通过软件更高效地调动和利用算力。智谱试图借助 RSI 建立一种底层解耦能力,让 AI 自主适配不同硬件生态,把“国产算力不好用”的行业难题,转变为“由 AI 自动挖掘硬件极限”的技术主动权。唐杰也坦言,距离 RSI 的终局仍相差甚远,但“模型优化系统、系统反哺模型”的最小循环,已经真实地转动了起来。
