大模型能力的提升,是否一定要靠堆参数、换架构?DeepSeek 刚刚给出了一种新的答案。今日,DeepSeek 正式更新了 DeepSeek-V4-Flash,并将其命名为“正式版”。不过,这一版本目前仅在 API 端上线公测,V4-Pro API 以及 App 和网页端正在使用的模型均未同步更新。相比“正式版”这一称谓,更值得行业关注的是官方披露的关键信息:DeepSeek-V4-Flash-0731 与此前的 Preview 版本采用完全相同的模型结构和参数规模,唯一的变化在于重新进行了后训练。
要理解这次更新的意义,需要先厘清大模型训练的两个核心阶段。第一阶段是预训练,模型通过海量文本和代码学习知识,形成基础能力,这一阶段决定了模型的大致智力水平和知识储备。第二阶段是后训练,它更像是针对具体工作场景的专项训练,让模型学会如何回答问题、如何调用工具、如何按照指令完成任务。此次 DeepSeek 并未重新设计模型架构,也未扩大参数规模,而是在原有模型基础上重新进行后训练。模型结构没有变化,但内部权重和行为方式发生了调整。这好比同一辆车没有更换发动机,却重新调校了变速箱、控制系统和驾驶策略——车本身没有变大,但在特定道路上的表现可能明显改善。不过,DeepSeek 并未公布此次后训练具体使用了哪些数据、奖励方法和训练流程,因此目前只能确认它重新做了后训练,尚不能断言性能提升究竟来自哪一种具体技术。
从官方公布的结果来看,新版 V4-Flash 的能力提升主要指向 Agent 方向。在 Terminal Bench 2.1 上,该模型获得 82.7 分;在 DeepSWE 上获得 54.4 分;在 DSBench-FullStack 上获得 68.7 分。这些测试与传统代码补全任务有本质区别:传统代码测试通常只要求模型写出一段代码,而 Agent 测试要求模型真正进入一个工作环境,需要读取文件、理解代码仓库、调用终端、修改程序、运行测试,再根据报错信息继续处理。也就是说,模型不仅要“知道答案”,还要连续完成多个步骤。但需要注意的是,这些成绩不能完全等同于模型自身的独立能力。DeepSeek 明确说明,部分代码 Agent 测试使用了尚未公开的 DeepSeek Harness,并采用了较高的推理档位;DSBench-FullStack 和 DSBench-Hard 则是 DeepSeek 自己的内部测试集。因此,更准确的说法是:V4-Flash-0731 在 DeepSeek 公布的 Agent 运行环境中取得了明显提升,但它在第三方框架中的实际表现,还需要更多独立测试来验证。
此次更新还带来一个重要变化:V4-Flash 开始原生支持 Responses API,并针对 Codex 进行了适配。Responses API 解决的是模型接入问题,它让开发者能够更便捷地将模型集成到现有工作流中,尤其是面向 Agent 场景的复杂调用。这一举措表明,DeepSeek 不仅关注模型本身的性能,也在着力降低开发者使用 Agent 能力的门槛。从行业视角看,这次更新传递出一个清晰信号:后训练正成为大模型能力增强的新变量。过去,业界普遍认为模型能力的上限主要由预训练阶段决定,架构和参数规模是核心竞争力。但 DeepSeek 用实际动作证明,在架构和参数不变的前提下,通过精细化的后训练,同样可以显著提升模型在特定任务上的表现。这对于算力资源有限、难以持续扩大模型规模的团队而言,提供了一条更具性价比的优化路径。当然,后训练的效果高度依赖数据质量、奖励设计和训练策略,其可复制性仍有待观察。随着更多厂商跟进这一思路,大模型竞争的重点或许将从“拼参数”逐步转向“拼训练工艺”。
