DeepSeek 新论文公开自动化沙箱系统 DSec,日运行三百万环境

DeepSeek 在 arXiv 更新 31 页论文,首次展示面向大规模智能体训练的生产级沙箱基础设施 DSec。该系统每日可自动运行 300 万个沙箱环境,单生产单元横跨 160 个 CPU 节点,通过严格权限隔离防止 AI 作弊,并精准复现每一步环境反馈,为智能体强化学习与评测提供底座。

DeepSeek 近日在 arXiv 更新了一篇长达 31 页的新论文,首次对外完整展示其面向大规模智能体训练的生产级沙箱基础设施 DSec(DeepSeek Elastic Compute)。论文聚焦一个此前较少被公开讨论、却对智能体能力上限影响巨大的环节:如何为成千上万次强化学习与评测任务,秒级创建彼此隔离、可精准复现的虚拟运行环境。根据论文披露的数据,DSec 每日可自动运行 300 万个沙箱环境,单个生产单元横跨 160 个 CPU 节点,工程规模与调度密度都指向“生产级”而非实验室原型。

从技术定位看,DSec 是 DeepSeek 内部超大规模智能体强化学习与评测体系的底座。它为每一次训练任务创建独立的虚拟“新考场”,让智能体在受控环境中反复试错、接受反馈并更新策略。沙箱的关键难点不只是“跑起来”,而是权限隔离与反馈复现:一方面要通过严格的权限边界防止智能体绕过规则、读取不该读取的信息或利用环境漏洞“作弊”;另一方面要保证智能体在沙箱内每一步操作所获得的环境反馈都能被精准复现,从而让训练信号稳定、评测结果可比。这两点直接决定了强化学习能否规模化,也决定了评测是否可信。

这一基础设施的意义,放在当前智能体能力快速提升的背景下更为突出。当智能体开始具备长程规划、工具调用乃至隐藏推理过程的能力时,沙箱不再只是附庸式的安全配件,而同时扮演两个角色:既是 AI 进化的训练场,也是约束其破坏力的关键防线。大规模、可复现、强隔离的沙箱,意味着训练与评测可以在更接近真实生产环境的条件下进行,同时把潜在风险限制在可控范围内。对行业而言,DSec 公开的工程细节,也为其他团队构建智能体训练底座提供了可参照的样本。

值得注意的是,该论文的通讯作者栏出现了梁文锋的名字。过去三年,他极少以第一作者或通讯作者身份出现在动辄上百人署名的旗舰模型整体报告中,却持续把名字签在 MLA 注意力、MoE 路由机制、mHC 拓扑流形、DSpark 推理算子以及此次 DSec 智能体沙盒等底层原子技术论文上。这种署名选择本身传递出一种技术路线信号:在模型规模竞赛之外,DeepSeek 正把相当一部分精力投向决定智能体能否安全、稳定、大规模进化的基础设施层。随着智能体强化学习成为下一代模型能力提升的核心路径,沙箱这类“看不见的底座”很可能成为拉开差距的关键变量。