小米正式发布并开源了新一代大模型 MiMo-V2.6,此次共推出 Pro 与 Flash 两个版本。其中 Pro 版总参数达到 1.02 万亿,激活参数为 420 亿;Flash 版总参数为 3090 亿,激活参数为 150 亿。两款模型均支持 100 万 token 的超长上下文,并覆盖文本、图像、视频与音频等多种输入形式。从参数规模看,这似乎是一次常规的模型升级,但小米此次投入更多篇幅讨论的,是模型在完成预训练之后,能力如何继续向上突破,后训练因此成为 MiMo-V2.6 的核心环节。
与普通问答任务不同,Agent 类任务并非生成一段文本就宣告结束,而是需要不断读取环境、搜索信息、调用工具、执行操作,再根据返回结果调整下一步行动。这意味着训练对象不再只是最终答案,而是一整条包含状态、决策与反馈的行为轨迹。小米将代码、通用 Agent、视觉与网络安全任务纳入同一套强化学习系统,单次 RL 更新使用 1568 个 prompt,每个 prompt 生成 16 条 rollout。当强化学习围绕这种长轨迹展开时,模型既要承担更长上下文和持续生成带来的计算开销,还要同时处理大量执行时间差异极大的任务。
为应对这些挑战,MiMo-V2.6-Pro 在注意力结构上做了针对性设计。其 70 层 Transformer 中,有 60 层采用滑动窗口注意力,窗口仅为 128 token,另外 10 层使用全局注意力。绝大多数层只处理附近信息,长距离通信则由少量全局层完成。这样一来,100 万 token 上下文并不意味着每一层、每个 token 都要与完整上下文重新交互,局部信息高频流动,远处信息通过全局层重新汇合,更贴合长时间运行 Agent 的实际工作负载。参数侧采用类似思路,Pro 版每个 token 实际只激活约 420 亿参数,每个 MoE 层有 384 个路由专家,其中仅调用 8 个,从而在维持较大专家容量的同时避免每个 token 穿过全部参数。
在奖励机制上,小米也进行了重新设计。当轨迹数量真正上来后,单纯依靠成功或失败这样的二元奖励,很难判断两条都完成任务的路径哪一条更值得模型学习。因此 MiMo-V2.6 的架构、异步训练与奖励设计,基本都是从这些实际问题中一步步推导出来的。此次开源意味着开发者可以直接基于 MiMo-V2.6 构建长上下文 Agent 应用,而小米将代码、视觉、安全统一到一套强化学习框架中的做法,也为后训练阶段的能力挖掘提供了一条可参考的工程路径。在模型规模竞赛之外,如何让模型在预训练之后继续变强,正成为大模型竞争的新焦点。
