DeepSeek 于 9 月 30 日在 GitHub 开源一批专为华为升腾平台打造的基础设施组件,覆盖计算函数库与分布式通信函数库,并称这些组件与此前面向英伟达 GPU 平台开源的版本一一对应。
DeepGEMM Ascend 首个版本已发布
DeepGEMM Ascend 的说明文件写明,首个版本已于 9 月 30 日发布,支持升腾 950 系列。文件称,这套矩阵乘法函数库与原本 DeepGEMM 的 API 完全兼容,支持 BF16、FP8、FP4 等格式,安装后可沿用其他平台上的 API 与开发流程,无需重写。
说明文件还提到,这套实现对升腾的矩阵乘加原语做了一层轻量抽象,将分形矩阵布局、对齐限制、地址计算等细节封装起来。
DeepEP-Ascend 对齐英伟达版 buffer API
另一套组件 DeepEP-Ascend 是面向训练与推理的通信函数库,提供混合专家模型(MoE)所需的专家并行通信操作。其说明文件写明,对外提供的 buffer API 与英伟达版 DeepEP 对齐。
根据量子位报道,这次开源的组件还包括 TileLang 编译工具、FlashMLA、TileKernel、DeepSelect 等。
带宽测试披露小规模与大规模表现
DeepEP-Ascend 的说明文件附上了实测数据,测试环境为升腾 950DT 与 CANN 9.2.0。在 8 个专家并行单元配置下,dispatch 带宽为 373 至 375 GB/s,combine 为 345 至 347 GB/s。规模扩大到 128 个单元后,dispatch 降至 313 至 320 GB/s,combine 降至 272 至 278 GB/s。
文件称,在 32 个单元以内,持续 dispatch 的带宽约达到实体负载带宽上限的 90% 至 95%。更大规模场景以及 combine 仍在优化中,combine 还存在本地归约带来的额外开销。
文件同时注明,这些数据是在人工设定的概念验证固件环境下取得,其他升腾代际或 CANN 版本的支持情况,并未通过这批测试得到证实。
量子位:华为提供 SuperPoD Flex 与 UBL128 组网方案
据量子位报道,华为方面的说明称,华为提供了与 DeepSeek 共同定义的升腾超节点 SuperPoD Flex 与 UBL128 组网方案,可实现 128 张卡、单层交换每秒 3.2 Tb 的网络规模。
量子位还称,华为已将这次合作成果放到 CANN 社区开源,内容包括低延迟推理部署、单卡与单机部署,以及大规模训练等做法。
离线推理吞吐与固件发布时间表
量子位援引的数据还显示,在 32 个专家并行单元的离线推理模式下,DeepSeek-V4.1-Flash 纯模型在每个输出 token 延迟 5 毫秒时,每张卡的输出吞吐量为 2,469 token/s。该数据注明采集于离线推理模式,不包含服务调度与框架负载均衡的影响。
DeepEP-Ascend 的说明文件则提到,如需达到完整带宽,需要华为面向 Atlas 850E 的第三季度商用固件版本。文件称,该版本预计将在 2026 年 10 月中旬、约 10 月 15 日前后公开,实际时间仍以华为发布安排为准。
相关背景
中国实验室的算力选择近期仍在变化。链新闻此前曾报道,The Information 称中国拟放行字节跳动、阿里巴巴采购英伟达新芯片。

