开发者 Speedstu 9 月 13 日在 GitHub 公开了 CUDA-for-AMD-Windows 项目,把 ZLUDA 与 AMD 的 Windows 版 HIP SDK 封装成一套 PowerShell 安装脚本,目标是让原本写给 NVIDIA 显卡的 CUDA 程序运行在 AMD Radeon 显卡上。
这个项目本身并不是新的转译技术。实际负责转换的是开源项目 ZLUDA,其官方说明是让未经修改的 CUDA 程序在非 NVIDIA 显卡上执行。程序对 CUDA 的调用会先由 ZLUDA 接手,再交给 AMD 的 HIP 运行环境处理。Speedstu 所做的工作,是把版本锁定、下载、哈希校验、环境配置和诊断工具整理成一套可重复执行的流程。
目前只在 RX 9060 XT 上完成验证
项目验证文档列出的组合为 ZLUDA v6-preview.69、AMD HIP SDK 6.4 和 LibTorch 2.3.0+cu118,测试显卡为 AMD Radeon RX 9060 XT,架构代号 gfx1200。README 开头明确写明,目前完成验证的硬件只有这一张卡,其他 AMD 显卡都只是候选设备,不保证可用。
在这套环境下,ZLUDA 内置的 cuda_check 检查工具回报有五组组件正常,分别是 nvcuda、cuBLAS、cuBLASLt、cuSPARSE 与 cuFFT。其中,cuBLAS 被转交给 AMD 的 rocBLAS,cuBLASLt 对应 hipBLASLt,cuSPARSE 则对接 rocSPARSE。这些库主要负责矩阵乘法、稀疏矩阵与傅立叶变换等数学运算,很多 AI 与科学计算程序都会调用。
作者随后使用原本的训练程序进行了实测。该任务是一个拥有 2,216,347 个参数的 PPO 强化学习模型,完整跑通了推理、学习更新和优化器计算,并执行完一轮 65,536 个时间步。README 提到,这正是促使作者搭建该项目的训练任务。作者另一个公开项目,则是使用 LibTorch 与 PPO 训练 Rocket League 游戏 AI 的程序。
对更多显卡的支持已经有人开始尝试。9 月 14 日,另一位开发者 l33tm4st3r 提交合并请求,加入 gfx1201 架构支持,他实测的显卡是 AMD Radeon AI PRO R9700,不过该请求目前尚未合并。gfx1201 也是 RX 9070 系列采用的架构。按照 AMD 官方 Windows 硬件支持表,RX 9070 系列与 RX 7000 系列同样支持 HIP SDK,但这些显卡能否跑通这套流程,仍要等待用户实测反馈。
性能数字不能直接混在一起看
9 月 13 日的对照测试使用同一套训练设定,对比官方 ZLUDA 路径与作者早期自行修改过的组件。两种方案各跑 2 组、每组 5 轮,去掉每组的第一轮预热后,各保留 8 轮结果。官方路径的整体速度中位数为每秒 13,278 步,自改版为每秒 12,876 步,前者快 3.03%。项目当前默认采用官方版本。
不过,那组自改组件的源码已经找不到。项目文档说,作者只是从旧开发环境中救回了编译后的 DLL 文件,其中 cuBLASLt 转接层的源码与调试文件都已丢失,所以这些文件目前仅保留哈希值,没有公开。
README 还列出了每秒 7 万到 10.9 万步的旧记录,但文档同时注明,那是一套经过大幅调校的另一组设置,不能与上述数字直接比较。文档也提到,作者后来把训练程序改写为直接调用 AMD HIP,移除了 LibTorch 与 ZLUDA,速度明显更快。目前作者自己的训练程序已经不再经过 ZLUDA。
可运行范围和授权条件都有边界
README 的限制清单写得很直接:ZLUDA 并不是完整的 CUDA 实现,Windows 版 HIP SDK 也只提供 ROCm 的一部分。稳定版 HIP SDK 没有 MIOpen,因此依赖 cuDNN 的程序可能无法运行。cuDNN 是 NVIDIA 的深度学习加速库,很多大量使用卷积计算的图像模型都会依赖它。
除了 cuDNN,NCCL、多卡通信、TensorRT 推理加速以及部分自定义 CUDA 扩展也可能失败。项目页面上的「verify passing」绿色徽章,同样不代表 CUDA 程序已经在 AMD 显卡上通过测试。这个 GitHub Actions 流程运行在 GitHub 的 Windows 云主机上,检查内容包括 PowerShell 语法、JSON 配置文件格式、在无显卡环境下测试扫描工具,以及核对下载的 ZLUDA 压缩包哈希值。
项目目前锁定的也不是最新版本。CUDA-for-AMD-Windows 使用的是 2026 年 5 月 4 日发布的 ZLUDA v6-preview.69,而 ZLUDA 在 6 月 29 日已经推出正式版 v6,8 月 26 日则更新到 v7-preview.10。AMD Windows 版 HIP SDK 的最新版为 7.2.0,发布时间是 7 月 31 日,但项目验证使用的是 6.4。README 表示,更新版本可能可以运行,但在有人反馈之前都视为未验证状态。
授权问题也没有消失。NVIDIA 当前的 CUDA 授权条款仍包含一项转译限制,条款规定,不得为了把 CUDA 开发工具产出的程序转移到非 NVIDIA 平台,而对其进行逆向工程、反编译或反汇编。这份条款最近一次更新时间是 2026 年 1 月 26 日。项目第三方声明也提醒,相关 NVIDIA 组件依然受 NVIDIA 授权约束。
ZLUDA 资金已不稳定,兼容性回报仍为空白
ZLUDA 自身的开发资源也并不充足。项目在 2022 年起曾获得 AMD 资助,相关合同在 2024 年初结束。此后代码回滚到 AMD 参与之前的版本,并转由一家未具名公司提供资助。开发者 Andrzej Janik 在更新文章中表示,ZLUDA 目前已经没有商业资助,又回到他利用周末推进的个人项目状态,因此开发优先级改成他自己感兴趣的方向,例如 PhysX 与 Blender 支持。
CUDA-for-AMD-Windows 上线两天后,GitHub 上仍没有任何显卡兼容性回报。除了 RX 9060 XT 之外,其他型号是否能够使用,目前还没有公开测试数据。
项目当前已知情况
- 开源项目目标是让 AMD 显卡在 Windows 环境下运行部分 CUDA 程序。
- 当前唯一完成验证的显卡为 AMD Radeon RX 9060 XT。
- 已通过检查的五组组件为 nvcuda、cuBLAS、cuBLASLt、cuSPARSE 与 cuFFT。
- cuDNN 仍不能使用,依赖它的程序可能无法运行。
- RX 9070 系列和 RX 7000 系列具备 HIP SDK 支持,但是否兼容该流程仍待用户实测。
常见问题
AMD 显卡现在可以跑 CUDA 程序吗
可以运行一部分。公开信息显示,项目已在 RX 9060 XT 上跑通五组 CUDA 组件检查,并完成一个 2,216,347 参数的模型训练任务,但依赖 cuDNN 的程序可能失败。
CUDA-for-AMD-Windows 目前支持哪些显卡
现阶段仅验证 RX 9060 XT。9 月 14 日已有开发者提交 gfx1201 支持,涉及 AMD Radeon AI PRO R9700,但尚未合并。

