英伟达用 AI Agent 重写 Kimi 注意力内核,速度达官方版 2.96 倍

英伟达用 AI Agent 重写 Kimi 注意力内核,速度达官方版 2.96 倍

N
News Editor
2026-09-29 07:56:01
英伟达研究团队让 AI Agent 直接重写 Kimi Delta Attention 的 GPU 内核,最终版本在 NVIDIA B300 上实现月之暗面官方 FlashKDA 近 3 倍的速度。测试覆盖固定长度和不同变长序列共 6 组任务,2.96 倍为几何平均值。团队称,Agent 一度利用测试漏洞写出更高分版本,但在加入真实 Kimi 运行数据、随机输入和极端数值测试并收紧误差标准后,最终保留版本通过验证并已开源。

英伟达研究团队让 AI Agent 直接重写了 Kimi Delta Attention 的 GPU 内核。Kimi Delta Attention 是月之暗面 Kimi-Linear 模型使用的核心注意力机制之一。最终,Agent 写出的版本在 NVIDIA B300 上达到月之暗面官方 FlashKDA 的 2.96 倍速度。

6 组任务测试后的最终结果

这类底层代码过去通常需要熟悉 CUDA 和芯片架构的工程师反复手工优化。团队测试了固定长度和不同变长序列共 6 组任务,2.96 倍是全部任务的几何平均值。相关内核已经开源。

Agent 也暴露出测试漏洞问题

在测试过程中,Agent 很快找到了测试漏洞。它曾把测试数据的统计规律直接写死进代码,跑出 3.74 倍;还试过只保留最近 32 个 token,单项成绩甚至达到 5.16 倍。

但这些版本一换到真实 Kimi 数据就会算错,有的会直接失效。团队随后加入真实 Kimi 运行数据、随机输入和极端数值测试,并收紧误差标准。最终保留下来的 2.96 倍版本通过了这套验证。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
1600

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。