DeepSeek 于 9 月 30 日在微信公告中一次性开源 6 套面向华为升腾平台的基础设施组件,对应其此前发布的英伟达版工具。此举的重点不只在于升腾芯片本身的性能表现,更在于其中的 TileLang 升腾版:这是一套功能上直接对标英伟达 CUDA 的软件层工具。
在 AI 开发中,CUDA 长期被视为全球主流标准平台,难点不只来自硬件,还包括多年积累的软件生态和开发者使用习惯。DeepSeek 这次开源的做法,是把面向升腾平台的一系列底层能力逐步补齐。
6 套组件分别对应不同训练环节
这次开源的 6 套组件分别是 FlashMLA、DeepEP、DeepGEMM、TileKernels、DeepSelect 和 TileLang 升腾版。
- FlashMLA:负责稀疏注意力计算。
- DeepEP:负责多卡之间的分布式通信。
- DeepGEMM:用于加速矩阵运算。
- TileKernels:提供向量计算与混合专家路由算子。
- DeepSelect:负责 TopK 筛选,用于从大量候选中快速选出分数最高的项目,稀疏注意力与采样都会用到。
- TileLang 升腾版:将底层 Ascend C 指令封装起来,让开发者以高阶语言编程,功能定位对标 CUDA。
在这套体系中,TileLang 升腾版起到串联作用。DeepSeek 表示,TileLang 这一路线最早已在英伟达平台完成验证,目前已经承载 DeepSeek V4 系列模型训练中的大部分算子实现。此次发布的升腾版本,目标也是把底层指令封装起来,在提供高阶写法的同时,不牺牲硬件性能。
DeepSeek 还强调,目前其训练中用到的每一个 TileLang 算子,在升腾平台上都已有对应的高性能实现,不是只展示少数样例,而是训练流程中会用到的算子,升腾版基本都已补齐。
与华为合作推进 128 卡超节点
DeepSeek 表示,在升腾平台研发过程中,华为团队给予了「毫无保留的大力支援」。双方围绕基于升腾 950 的 128 卡超节点方案展开紧密合作,并对计算和通信进行了深度优化。所谓 128 卡超节点,是将 128 颗芯片通过高速网络连接成一台逻辑上的超大型计算机器。
除 TileLang 外,另外几项组件也同步更新。DeepGEMM 新增升腾支持,并兼容既有英伟达版 API,同时支持 BF16、FP8、FP4 三种精度的矩阵运算。DeepEP 的对外接口则刻意与英伟达版保持一致,方便开发者沿用熟悉的调用方式,处理混合专家模型中的数据分发与汇总。TileKernels 支持同一组 Python 接口同时运行在英伟达 GPU 与华为 NPU 上,由程序在运行时自动选择后端。
性能数字附带多项前提
不过,DeepSeek 也在 GitHub README 中明确写出了限制条件。
首先,相关性能数字是在华为提供给 DeepSeek 的概念验证版硬件开发套件 PoC HDK 上跑出的结果,所使用的还是一套未公开的手动配置。README 提到,若要获得完整带宽,需要等待华为 Atlas 850E 商用版硬件开发套件上市。官方规划时间为 2026 年 10 月中旬、约 10 月 15 日前后,但这仍属于厂商发布计划,实际时间可能变化。
在分布式通信方面,README 的表述也相当直接。DeepEP 在专家并行规模 EP 不超过 32 时,数据分发带宽约可达到物理上限的 90% 至 95%。但在规模继续扩大后,以及结果汇总 combine 的性能上,文档写明仍在优化中。部分集合通信操作目前仍在开发,部分接口也还处于实验阶段。
即便是被视为对标 CUDA 的那一层,现阶段也并非完全补齐。FlashMLA 中那颗融合 Q-norm、RoPE、注意力计算与类型转换、可一次调用完成多个步骤的融合算子,目前只支持英伟达平台,升腾版尚未提供。DeepSelect 的升腾版也仅支持 bf16 格式,不支持 fp32。
若团队希望接入这套工具链,还需要配齐对应芯片,以及 CANN 9.2.0 以上版本的软件栈与固件环境,接入门槛并不低。
谁在补足升腾生态
这次开源的一个关键观察点是,面向华为升腾平台补足生态的动作,执行者并非华为自身,而是 DeepSeek。把真正用于前沿模型训练的各类算子迁移并公开,原本外界可能认为应由芯片厂商完成的工作,现在由一家 AI 实验室推进。
据彭博社报道,DeepSeek 很少对外谈及内部开发细节,这次主动公开升腾工具链较为少见。彭博社还提到,DeepSeek 计划在内蒙古建设大型数据中心,至少部署 16 万颗华为最强芯片;公司也在敲定新一轮融资,估值接近 5,000 亿元人民币,约合 740 亿美元,且最早可能在今年上市。
目前,全球模型训练仍高度依赖英伟达芯片。升腾的相关生态建设仍处在推进阶段。

