Fable 5 在 KernelBench-Mega 以 18.71 倍登顶,首次写出单次启动超级内核

Fable 5 在 KernelBench-Mega 以 18.71 倍登顶,首次写出单次启动超级内核

N
News Editor
2026-07-07 09:02:12
Fable 5 AI 模型在 KernelBench-Mega 基准测试中,以纯手写 CUDA 内核在 RTX PRO 6000 上实现 18.71 倍性能提升,明显高于 Claude Opus 4.8 的 14.4 倍和 GPT-5.5 的 4.34 倍。其核心突破在于首次实现端到端融合的单次 GPU 内核启动“超级内核”,将解码流程压缩到一次协作完成。Anthropic 联合创始人 Jack Clark 据此表示,这可能标志着“递归自我提升”循环开始进入现实阶段。
Fable 5CUDAKernelBench-MegaAnthropicJack ClarkAI 模型GPU 优化超级内核

Fable 5 在 KernelBench-Mega 取得断层领先

Fable 5 在新一轮 GPU 算子基准测试 KernelBench-Mega 中拿到最高成绩。在 RTX PRO 6000 平台上,该模型以纯手写 CUDA 内核实现 18.71 倍加速,明显高于 Claude Opus 4.8 的 14.4 倍、GPT-5.5 的 4.34 倍,以及 Sonnet 5 的 4.0 倍。按照文中披露的数据,Fable 5 相比 GPT-5.5 的成绩高出 4 倍以上,呈现出明显的断层优势。

Fable 5 在 KernelBench-Mega 以 18.71 倍登顶,首次写出单次启动超级内核 2

本次测试针对的任务为 02_kimi_linear_decode,对应 Kimi-Linear W4A16 混合解码场景,即 4-bit 权重与 bf16 激活的组合。与传统只考察单一算子的基准不同,KernelBench-Mega 要求模型将整块模型计算尽可能融合进更少的 GPU 内核调用中,重点考察复杂推理流程下的算子融合能力。规则也较为严格:每个模型只有一次自主会话机会,真实时限为 3 小时。

Fable 5 在 KernelBench-Mega 以 18.71 倍登顶,首次写出单次启动超级内核 3

从不同上下文长度的表现看,Fable 5 并未在长上下文下明显掉速。相反,其 2K 上下文成绩为 17.8 倍,8K 时扩大到 18.9 倍,16K 时进一步升至 19.5 倍。这意味着在 KV Cache 持续膨胀、单 Token 注意力计算量上升的情况下,Fable 5 与基线之间的性能差距没有缩小,反而进一步拉开。

首次实现单次 GPU 启动的“超级内核”

这次结果的关键,不只是分数领先,更在于 Fable 5 写出了被称为 megakernel 的“超级内核”。所谓超级内核,是把整套推理流程尽量压缩进一次 GPU 内核启动中完成,中间不再拆分为多次启动与切换。这类写法在 GPU 编程中一向被视为难度极高,此前公开榜单中也没有模型真正完成过同等级别的端到端融合。

Fable 5 在 KernelBench-Mega 以 18.71 倍登顶,首次写出单次启动超级内核 4

根据文中援引的 torch.profiler 结果,Fable 5 在每次解码一个 Token 时,仅进行了 一次协作启动。这一单次启动内部,通过 14 道网格屏障分阶段执行,涵盖了 int4 反量化、卷积、SiLU、KDA 门控 delta 状态、MLA 吸收隐变量注意力、MoE 路由与 top-8 专家选择、RMSNorm,以及 KV Cache 写入等多个步骤。相比之下,其他高分模型通常需要将同类任务拆成 4 到 14 次独立内核启动才能完成。

单次启动与多次启动之间的差别,直接对应 GPU 调度与同步开销。每增加一次 kernel launch,都会带来额外停顿、交接和空转时间。Fable 5 把原本分散的流程合并后,固定屏障同步成本被更大规模的计算摊薄;同时,文中提到其 int4 计算效率已经逼近硬件内存带宽上限,这也是它在长上下文下仍能维持高性能的重要原因之一。

Fable 5 在 KernelBench-Mega 以 18.71 倍登顶,首次写出单次启动超级内核 5

2.5 小时、约 55 万 Token 完成优化迭代

文章披露,Fable 5 完成这次内核编写与优化,总计耗时约 2.5 小时,会话规模约为 55 万 Token。其过程并非一开始就直接生成代码,而是先花费约 64% 的时间进行测量与推导,包括基准线计时、网格屏障微基准测试,以及推导“每 token 约 29 倍字节”的 roofline 上限。完成这些准备后,模型才一次性写出整套内核。

Fable 5 在 KernelBench-Mega 以 18.71 倍登顶,首次写出单次启动超级内核 6

据报道,Fable 5 第一次跑分即达到 14.4 倍,之后在最后一个小时继续删减屏障,并将 int4 反量化的额外成本进一步压低,最终把成绩推升至 18.7 倍。中间它还出现过一次负优化,在测试结果不佳后立即回滚,没有继续保留无效改动。文中同时指出,Fable 5 仍只是 Anthropic 内部模型 Claude Mythos 的“安全版本”,这一点也让外界对其上限产生更多关注。

Jack Clark:这可能是递归自我提升循环的开端

Anthropic 联合创始人 Jack Clark 在最新一期 Import AI 中表示,这一事件可能意味着“递归自我提升”(RSI)循环的开始。其逻辑是,能够自主开发和优化 GPU 内核,已经触及 AI 研发链条中较底层、也较关键的输入环节之一。模型越擅长写内核,训练和推理效率就越高;效率提升后,新一代模型能力又会增强,进而进一步提升内核开发能力,形成正反馈飞轮。

Fable 5 在 KernelBench-Mega 以 18.71 倍登顶,首次写出单次启动超级内核 7

文中还提到,除“为自己加速”之外,AI 在替代人类完成远程数字劳动方面的进展也在提升。按照文章援引的数据,Remote Labor Index 自 2025 年 10 月上线时的 2.5%,已经在 2026 年 7 月显著上升,不到 8 个月出现数倍提升。Clark 的判断是,AI 拓展自身经济边界的速度,正逐步快于人类重新建立比较优势的速度。

技术突破之外,行业讨论也转向风险边界

值得注意的是,Jack Clark 在同一期 Import AI 的结尾,还写到一个关于 2050 年的科幻设定:由于通用计算能力过于危险,人类选择主动限制甚至封禁它。文章将这种想象与前文“RSI 循环开始了”的判断并置,反映出当前行业对 AI 自主优化能力的双重态度——一方面是对性能跃迁的兴奋,另一方面则是对失控风险和治理边界的持续担忧。

Fable 5 在 KernelBench-Mega 以 18.71 倍登顶,首次写出单次启动超级内核 8

从时间线看,一年多前 KernelBench 刚发布时,最强的 OpenAI o1 在最困难任务上的得分仅为 4%。而现在,模型已经能够在限定时间内完成复杂 CUDA 内核设计、测试、回滚和再优化,并写出此前未在榜单上出现过的单次启动超级内核。对于计算基础设施、模型训练效率以及 AI 自动化研发能力而言,这一结果都具有较强的信号意义。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。