DeepSeek 开源算子工具链并原生支持昇腾,国产算力首次对标英伟达生态

DeepSeek 将面向英伟达 GPU 的算子开发工具链整体迁移至华为昇腾 950 NPU,核心产品 TileLang 官宣原生支持昇腾,DeepGEMM、DeepEP、FlashMLA 等五大计算与通信库同步推出昇腾版本。这意味着国产算力首次在核心算子工具层面具备与英伟达生态对标的能力,为国产 AI 芯片软件生态补上关键一环。

长期以来,全球 AI 算力生态被英伟达的 CUDA 体系深度绑定,开发者若想充分释放芯片性能,几乎只能围绕英伟达 GPU 编写底层算子。这一格局正在被打破。DeepSeek 近日完成了一项开源壮举:将原本面向英伟达 GPU 的全套算子开发工具链整体迁移至华为昇腾 950 NPU,其中最核心的算子开发产品 TileLang 正式官宣原生支持昇腾。与此同时,DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect 五大核心计算与通信库也同步推出昇腾版本,直接对标英伟达平台的全套工具链。这意味着国产算力第一次在核心算子工具层面,具备了与英伟达生态正面竞争的能力。

要理解这一动作的分量,需要先看清“写算子”为何长期是 AI 底层开发中门槛最高、耗时最久的环节。一张 AI 芯片的理论算力上限很高,但如果底层算子写得不够好,芯片内部的计算单元就会大量时间空等数据流转,导致价值数万元的芯片可能只能发挥出两成性能。写算子的目标,正是把硬件利用率从两成提升到九成以上。以最常见的矩阵乘法为例,开发者要手动管理三级缓存、调度线程块、搭建数据预取流水线,甚至深入到寄存器分块和指令重排层面,资深工程师为优化上千行底层代码打磨数周是常态。由此形成一个核心矛盾:模型算法迭代飞快,而芯片厂商的官方算子库永远跟不上节奏。

过去行业有三条路可选,却各有局限。第一条是手写 CUDA,性能天花板最高,但开发效率极低,且深度绑定英伟达生态,无法跨平台移植。第二条是使用厂商预制算子库,如英伟达 cuBLAS,标准算子开箱即用、性能拉满,但灵活性极差,开发者无法修改内部逻辑,也难以做算子融合,新算法很容易卡在算力层。第三条是使用高层 DSL 编译器,如 OpenAI 的 Triton,大幅降低了开发门槛,但性能上限受限于编译器自身的优化策略,对昇腾、AMD 等非英伟达硬件原生支持度低,异构适配成本很高。

TileLang 开辟了第四条路,试图终结算子开发的“手工作坊”模式,同时兼顾开发灵活性、运行性能与跨平台能力。其核心是多级分块技术,将庞大计算任务切分成标准化的数据块,开发者只需声明“每块数据在哪里计算”,编译器便自动完成数据搬运、线程同步等底层工作,性能直逼手写 CUDA 的硬件上限。这本质上是把资深工程师手工调优的成熟思路,抽象为标准化编程原语。TileLang 主攻大模型核心算子,包括通用矩阵乘法、反量化 GEMM、FlashAttention、线性注意力、稀疏 MLA 等,这些算子承载了大模型训练和推理九成以上的计算量,直接决定 AI 芯片的算力利用率。

此次迁移的产业意义在于,国产算力首次在核心算子工具层面补齐了关键一环。算子速度每提升一倍,都意味着大模型训练成本下降、推理效率提升。当一套代码能够跑遍不同芯片,开发者不再被单一生态锁死,国产 AI 芯片的软件生态也就有了与英伟达生态对标的基础。DeepSeek 用一行行开源代码,为国产算力自主生态蹚出了一条可行路径,也为全球 AI 行业摆脱 CUDA 垄断提供了新的选择。