过去几年,大模型竞争的主线一直清晰而直接:更大的模型、更多的数据、更强的GPU集群。然而,随着预训练边际收益的递减,单纯堆叠参数和算力已难以带来等比例的智能跃升。行业共识正在转向——模型能力的持续扩展,正从预训练阶段向后训练强化学习(RL)转移。数学推理、代码生成、复杂决策、长时序Agent等高阶能力,越来越依赖RL来激发。RL通过生成、执行、反馈和奖励的闭环机制,让模型在持续交互中学习推理、规划与自我纠错,从而推动大模型从“一次性训练”进入“持续训练”的新阶段。这一转变意味着,模型能力的增长不再局限于训练时的静态权重更新,而是延伸至生成、反馈和迭代的全过程。
在这一背景下,AI基础设施的角色被重新定义。SemiAnalysis的观察指出,当RL成为模型能力持续扩展的关键,竞争的焦点就不再只是算法本身,还包括支撑模型持续生成、训练和更新的AI基础设施系统。问题随之而来:当模型越来越依赖RL获得能力,谁来支撑这种能力以低成本、可持续的方式生产?智谱近期的模型迭代为观察这一趋势提供了窗口。智谱公告显示,GLM-5.3与GLM-5.2在相同基座上推进强化学习,通过后训练Scaling持续提升模型智能上界。以GLM-5.2为例,其在SWE-bench Pro取得62.1分、Terminal-Bench 3.0达到81.0分,核心驱动力正是面向长时序、多步骤、工具联动场景的RL训练。这些成绩表明,复杂推理和Agent能力的提升,正越来越依赖强化学习,而非单纯的预训练扩展。
这一变化正在重塑AI产业链的分工方式。模型厂商不再只是单独推进算法,而是需要与AI基础设施共同服务于“智能持续生产”。目前,GLM-5系列、DeepSeek R系列等主流推理模型均已部署于九章智算云,实现规模化Token生产。不同于“模型+算力”的传统产业关系,九章智算云与模型厂商形成了算法与工程系统双向RL Scaling的协作模式:模型厂商持续挑战RL算法和策略边界,九章智算云则持续打磨适配的算力调度、推理服务和状态管理,实现工业级应用。这种协作并非单向依赖,而是相互促进的飞轮——大规模应用的模型算法再进化,进而提出更高的基础设施要求,而基础设施的持续迭代又为更大规模RL实现打开空间。由此,模型厂商与AI基础设施成为RL的一体两面,RL从模型训练中的单一算法环节,升级为AI云必须具备的核心能力。
强化学习与传统预训练的核心差异,不在于增加一种训练算法,而在于改变了训练系统的结构。一个完整的RL系统通常由三部分组成:Generator、Environment和Trainer。Generator接收Prompt并通过推理生成Rollout;Environment执行代码、工具调用或任务模拟并返回Reward;Trainer依据Rollout和Reward进行策略更新。这一结构意味着,训练与推理不再是分离的两个阶段,而是同一条生产线上紧密耦合的环节。九章智算云推出的训推一致强化学习系统,正是针对这一结构性变化而设计。该系统以GLM-5为例,解决了模型持续生成、训练和更新的基础设施问题,确保在RL训练过程中,推理服务的高吞吐、低延迟与训练调度的稳定性能够协同工作。模型、算力、数据、状态和推理不再彼此割裂,而是共同构成一条持续运行的智能生产线。真正的问题也由“模型+算力”转向如何让算法与基础设施协同Scaling,以“一条智能生产线”更低成本持续生产有效Token和模型能力。九章智算云的落地实践表明,RL的工业化应用不再遥不可及,而是正在成为AI云的核心竞争力,为下一阶段大模型能力的持续扩展奠定基础。
