DeepSeek 正式上线了 V4.1-Flash 版本,这次更新的核心并非简单的参数堆叠,而是一次面向长上下文场景的彻底架构重写。长期以来,大模型领域存在一个近乎铁律的规律:更强的智力往往意味着更庞大的算力消耗,而超长上下文背后更是极高的硬件门槛。无论是智能体频繁的工具调用结果返回,还是多轮对话的持续推进,模型都必须把全部上下文从头到尾重新计算一遍,生成所谓的 KV 缓存记忆,这个过程被称为预填充。在百万级 Token 的上下文场景中,单是预填充这一步就能吃满整张 GPU,成为制约长文本应用落地的最大成本瓶颈。DeepSeek 此次用因果编码器-解码器架构、第二代压缩稀疏注意力以及三档可调推理力度旋钮,试图打破这一潜规则。
从技术细节来看,新架构的降本逻辑相当清晰。DeepSeek V4.1-Flash 的神经网络共 40 层,CED 架构将其一分为二:前 20 层用因果编码器把全部上下文通读一遍,在隐状态中输出一个高度浓缩的摘要;后 20 层不再重复通读,而是直接通过投影矩阵从摘要中生成所需的全局 KV 缓存。这一先读薄、只捞重点的设计,直接把预填充计算量砍掉一半。与此同时,为了兼顾就近内容的绝对精准,模型引入了滑动窗口注意力来盯住局部细节,并配合有限回放机制,在算力可控的前提下保证关键信息的完整性。最终结果是,运行时显存占用直接减少约四分之三,写入硬盘的长期记忆存储仅为上一代的八分之一,KV 缓存更是暴降 437 倍。
这一变化的行业意义不容小觑。过去调用 API 跑一次深度复杂任务,企业可能需要支付约 10 元的算力账单,而新架构下这一成本被压缩到 1 至 2 元的平民价级别。成本的量级下降,意味着百万 Token 级别的超长上下文真正具备了进入工业级生产力阶段的条件,智能体应用的规模化部署不再被显存和存储成本死死卡住脖子。更值得关注的是,DeepSeek V4.1-Flash 在不少评测中智力表现已超越上一代 V4-Pro,说明这次架构重写并非以牺牲能力换取效率,而是在效率与智力之间找到了新的平衡点。对于整个行业而言,这或许标志着长上下文竞争从单纯拼算力,转向拼架构效率的新阶段。
