大模型竞争的主线在过去几年一直清晰而直接:更大的模型、更多的数据和更强的GPU集群。然而,随着预训练阶段边际收益的递减,行业正经历一场深刻的范式转移——模型能力的Scaling不再单纯依赖预训练的堆叠,而是越来越多地转向后训练阶段的强化学习(RL)。数学推理、代码生成、复杂决策以及长时序Agent等高阶能力,正愈发依赖RL来激发。RL通过“生成—执行—反馈—奖励”的闭环机制,让模型在持续交互中学习推理、规划与自我纠错,从而将大模型的发展从“一次性训练”推向“持续训练”的新阶段。这一转变意味着,模型能力的增长不再局限于预训练阶段,而是延伸至生成、反馈与迭代的全过程。
智谱近期的模型迭代为观察这一趋势提供了绝佳窗口。根据官方公告,GLM-5.3与GLM-5.2在相同基座上推进强化学习,通过后训练Scaling持续提升模型智能上界。以GLM-5.2为例,其在SWE-bench Pro基准上取得62.1分,在Terminal-Bench 3.0上达到81.0分,核心驱动力正是面向长时序、多步骤、工具联动场景的RL训练。这些成绩表明,复杂推理和Agent能力的提升正越来越依赖强化学习,而非单纯的参数规模扩张。与此同时,SemiAnalysis的分析指出,当RL成为模型能力持续Scaling的关键时,竞争的核心就不再只是算法本身,还包括支撑模型持续生成、训练和更新的AI基础设施系统。问题随之而来:当模型越依赖RL获得能力,谁来支撑这种能力持续且低成本地生产?
这一变化正在重塑AI产业链的分工方式。模型厂商不再只是单独推进算法,而是需要与AI基础设施共同服务于“智能持续生产”。目前,GLM-5系列、DeepSeek R系列等主流推理模型均已部署于九章智算云,实现规模化Token生产。不同于传统“模型+算力”的简单叠加关系,九章智算云与模型厂商形成了算法与工程系统双向RL Scaling的协作模式:模型厂商持续挑战RL算法和策略边界,九章智算云则持续打磨适配的算力调度、推理服务和状态管理,实现工业级应用。这种协同让大规模应用的模型算法得以再进化,进而提出更高的基础设施要求,而基础设施的持续迭代又为更大规模RL实现打开空间。由此,模型厂商与AI基础设施成为RL的一体两面,RL从模型训练中的单一算法环节,升级为AI云必须具备的核心能力。
强化学习与传统预训练的核心差异,不在于增加一种训练算法,而在于改变了训练系统的结构。一个完整的RL系统通常由三部分组成:Generator、Environment和Trainer。Generator接收Prompt并通过推理生成Rollout;Environment执行代码、工具调用或任务模拟并返回Reward;Trainer依据Rollout进行梯度更新。这种结构使得训练与推理不再是割裂的两个阶段,而是同一条生产线上紧密咬合的环节。九章智算云正是基于“训推一致”的架构理念,将模型、算力、数据、状态和推理融为一体,构成一条持续运行的智能生产线。真正的问题也由此从“模型+算力”转向如何让算法与基础设施协同Scaling,以更低成本持续生产有效Token和模型能力。在这场从“一次性训练”到“持续训练”的演进中,AI基础设施不再只是算力提供者,而是智能生产体系中不可或缺的引擎,其价值与挑战都将被重新定义。
