DeepSeek开源升腾基础组件,API与英伟达平台版本对齐

DeepSeek开源升腾基础组件,API与英伟达平台版本对齐

N
News Editor
2026-10-01 08:42:13
DeepSeek 于 9 月 30 日在 GitHub 开源一批面向华为升腾平台的基础设施组件,包括 DeepGEMM Ascend 与 DeepEP-Ascend,并称其接口与此前面向英伟达 GPU 平台的版本一一对应。公开资料显示,DeepGEMM Ascend 支持升腾 950 系列,兼容原有 API 与开发流程;DeepEP-Ascend 则披露了在升腾 950DT 与 CANN 9.2.0 环境下的带宽测试数据。量子位还提到,双方合作成果已在 CANN 社区开源,部分完整带宽能力仍需等待华为后续商用固件版本。

DeepSeek 于 9 月 30 日在 GitHub 开源一批专为华为升腾平台打造的基础设施组件,覆盖计算函数库与分布式通信函数库,并称这些组件与此前面向英伟达 GPU 平台开源的版本一一对应。

DeepGEMM Ascend 首个版本已发布

DeepGEMM Ascend 的说明文件写明,首个版本已于 9 月 30 日发布,支持升腾 950 系列。文件称,这套矩阵乘法函数库与原本 DeepGEMM 的 API 完全兼容,支持 BF16、FP8、FP4 等格式,安装后可沿用其他平台上的 API 与开发流程,无需重写。

说明文件还提到,这套实现对升腾的矩阵乘加原语做了一层轻量抽象,将分形矩阵布局、对齐限制、地址计算等细节封装起来。

DeepEP-Ascend 对齐英伟达版 buffer API

另一套组件 DeepEP-Ascend 是面向训练与推理的通信函数库,提供混合专家模型(MoE)所需的专家并行通信操作。其说明文件写明,对外提供的 buffer API 与英伟达版 DeepEP 对齐。

根据量子位报道,这次开源的组件还包括 TileLang 编译工具、FlashMLA、TileKernel、DeepSelect 等。

带宽测试披露小规模与大规模表现

DeepEP-Ascend 的说明文件附上了实测数据,测试环境为升腾 950DT 与 CANN 9.2.0。在 8 个专家并行单元配置下,dispatch 带宽为 373 至 375 GB/s,combine 为 345 至 347 GB/s。规模扩大到 128 个单元后,dispatch 降至 313 至 320 GB/s,combine 降至 272 至 278 GB/s。

文件称,在 32 个单元以内,持续 dispatch 的带宽约达到实体负载带宽上限的 90% 至 95%。更大规模场景以及 combine 仍在优化中,combine 还存在本地归约带来的额外开销。

文件同时注明,这些数据是在人工设定的概念验证固件环境下取得,其他升腾代际或 CANN 版本的支持情况,并未通过这批测试得到证实。

量子位:华为提供 SuperPoD Flex 与 UBL128 组网方案

据量子位报道,华为方面的说明称,华为提供了与 DeepSeek 共同定义的升腾超节点 SuperPoD Flex 与 UBL128 组网方案,可实现 128 张卡、单层交换每秒 3.2 Tb 的网络规模。

量子位还称,华为已将这次合作成果放到 CANN 社区开源,内容包括低延迟推理部署、单卡与单机部署,以及大规模训练等做法。

离线推理吞吐与固件发布时间表

量子位援引的数据还显示,在 32 个专家并行单元的离线推理模式下,DeepSeek-V4.1-Flash 纯模型在每个输出 token 延迟 5 毫秒时,每张卡的输出吞吐量为 2,469 token/s。该数据注明采集于离线推理模式,不包含服务调度与框架负载均衡的影响。

DeepEP-Ascend 的说明文件则提到,如需达到完整带宽,需要华为面向 Atlas 850E 的第三季度商用固件版本。文件称,该版本预计将在 2026 年 10 月中旬、约 10 月 15 日前后公开,实际时间仍以华为发布安排为准。

相关背景

中国实验室的算力选择近期仍在变化。链新闻此前曾报道,The Information 称中国拟放行字节跳动、阿里巴巴采购英伟达新芯片。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。