DeepSeek 正与华为推进 AI 训练和推理底层组件向升腾平台迁移。根据 BlockBeats 发布的快讯,这次新开源的工具覆盖算子开发、矩阵计算、跨卡通信、Attention 和数据筛选,基本对应 DeepSeek 此前围绕英伟达 GPU 打造的一套底层工具。
路透社将这一进展称为中国科技公司寻找英伟达生态替代方案的最新动向。报道提到,其中最关键的组件是 TileLang。DeepSeek V4 训练中的大量算子已经用 TileLang 实现,它处理的是一个更底层的问题:开发者如何把模型中的计算高效运行在芯片上。
TileLang 对应 CUDA 体系中的关键能力
BlockBeats 援引的内容显示,过去这类能力高度围绕 CUDA 建立,现在 DeepSeek 和华为正为升腾补上对应版本。报道认为,这正好对应了英伟达 CEO 黄仁勋数月前公开表达的担忧。
今年 4 月,黄仁勋在 Dwarkesh Patel 的播客中表示,如果有一天 DeepSeek 率先在华为芯片上发布,对美国会是一个「糟糕的结果」。按该报道的说法,他担心的不只是华为芯片本身,而是模型开始围绕华为架构优化。一旦全球开发者拿到同一个模型时,默认在非美国硬件上运行得更好,美国芯片原有的优势就会被逐步削弱。
从模型适配到训练芯片,软件层现在也在补齐
报道称,DeepSeek 后续动作基本沿着这一路径展开。V4 已开始适配升腾 950,华为还表示,自家芯片参与了部分 V4 训练。
《The Information》上周披露,梁文锋已将增加国产芯片训练列为 DeepSeek 的重点押注,并预计最早会在第四季度拿到新的华为训练芯片。眼下补上的则是软件层。按照原文梳理,从模型适配,到训练芯片,再到矩阵计算、MoE 通信、Attention 和算子开发,DeepSeek 正把过去高度依赖英伟达和 CUDA 的部分底层能力,逐步迁移到华为升腾上。
竞争焦点转向整套技术栈
这则快讯还提到,中美 AI 竞争过去更多集中在模型能力和 GPU 数量,如今开始转向另一层面:谁能建立一整套从芯片、算子、通信到训练框架的技术栈。
按原文表述,CUDA 最难被替代的部分,从来不只是一张显卡,而是围绕它形成的一整套软件体系。DeepSeek 与华为当前补齐的,正是这一层。

