英伟达 AVO 在 ARC-AGI-3 拿下满分,183 关全部通关

英伟达 AVO 在 ARC-AGI-3 拿下满分,183 关全部通关

N
News Editor
2026-08-24 07:20:18
英伟达通用编码智能体 AVO 在 ARC-AGI-3 的 25 个游戏环境中通关全部 183 个关卡,以 6624 步拿到 100.00 的 RHAE。报道显示,AVO 未改动底层模型 Claude Opus 5,而是在模型外加入持久记忆和监督器机制。该系统原本用于 GPU 算子优化,曾在 B200 上自主运行 7 天,探索超过 500 个优化方向,并提交 40 个有效内核版本。

英伟达的通用编码智能体 AVO 在 ARC-AGI-3 上拿到满分,在 25 个游戏环境里通关全部 183 个关卡,总共用了 6624 步,RHAE 为 100.00。

英伟达 AVO 在 ARC-AGI-3 拿下满分,183 关全部通关 2

ARC-AGI-3 的设定是把智能体直接放进陌生游戏,不提供规则和目标,只能靠自己操作、观察和猜测。有的环境支持上下左右移动,在走廊中绕行时,碰到蓝黑色方块后,整幅画面会旋转 90 度;有的环境则不能移动,只能点击,通过点击把格子的颜色循环成目标图案。

每个环境至少有 6 关,难度会逐步提升。报道举例称,第一关可能 5 步就能通过,第六关则需要走 50 步。智能体可用的信息只有一块 64×64 的网格和几个按键。

同一模型,分数从 30.16% 到 100 分

AVO 这次使用的模型是 Claude Opus 5。报道称,如果让模型单独参加 ARC-AGI-3 测试,成绩只有 30.16%,但这已经是官方认证榜上的第一名。

ARC Prize 拆解上一代对局录像后,将典型错误归纳为三类:一是局部看懂了,但没有理解全局;二是把陌生机制套进熟悉游戏的经验里;三是过了关,但没有真正学会机制。

第三类问题被认为最棘手。以 ka59 为例,Opus 曾只用 37 步打通第一关,但它对点击机制的理解一开始就是错的。进入第二关后,它仍沿用这套错误理论,最后卡在关内。

英伟达 AVO 在 ARC-AGI-3 拿下满分,183 关全部通关 3

英伟达这次没有改动模型本身,而是在外层加了一套系统。结果是,同一个 Claude Opus 5,成绩从 30 分直接提升到满分。

AVO 外层系统的两个关键部件

报道将 AVO 与近期受到关注的 DeepSeek Harness、Codex Harness 相提并论,称它们处理的都是模型之外的一圈事务,包括提供哪些上下文、接入哪些工具、如何保存状态、怎样接收反馈、卡住时如何处理,以及上下文用满后如何继续工作。

具体机制上,真正起作用的有两部分。

持久记忆

长时程任务面临的一个核心问题是上下文会被耗尽。一旦上下文满了,模型此前试过什么、哪些路径走不通、profiler 输出过什么结果,都可能丢失。新一轮开始后,系统可能再次踩进同样的坑。

AVO 会把这些状态保存下来,包括过往实现版本、每次评测结果、编译器和分析器输出,以及累积的推理过程。这样即使上下文重置,智能体也能从当前状态继续推进,而不是从零开始重建整个搜索。

监督器

主智能体负责执行具体工作,决定看什么、改什么、测什么和提交什么。监督器本身不直接完成任务,而是监控整条搜索轨迹。一旦发现进展停滞,或者主智能体开始原地打转、重复无效操作,监督器就会介入,把主智能体拉向别的策略。

英伟达 AVO 在 ARC-AGI-3 拿下满分,183 关全部通关 4

还有一个细节。AVO 在 ARC-AGI-3 全程使用纯文本模态。每一帧观察输入给模型的都是精确的 64×64 文本网格,没有图片,也没有图像 token。也就是说,在这个满屏像素的游戏环境里,模型从头到尾没有直接看见画面。

最终,这套机制交出了 6624 步跑完 183 关、RHAE 满分的成绩。英伟达据此给出的结论是,长时程能力并不是模型单独具备的属性,而是由整个系统共同构成。记忆决定哪些信息能留到下一轮,工具决定智能体能执行哪些动作,反馈让它知道有没有走错;当假设被推翻时,系统能否退回来继续推进,也决定任务是否能持续完成。

这套系统原本用于 GPU 算子优化

报道提到,AVO 并不是为了打游戏而设计,它的主场是 GPU 算子优化。

2026 年 3 月 25 日,英伟达向 arXiv 上传论文《AVO: Agentic Mutation Operators for Autonomous Evolutionary Search》,链接为 https://arxiv.org/abs/2603.24517 。题目中的两个关键词是「进化搜索」和「变异算子」。

按照文中解释,进化搜索的基本过程是:持有一批候选代码,修改、运行,再保留最快的版本,继续迭代。负责「修改」这一步的,在进化算法中被称为变异算子。过去这部分通常由人预先写死;后来即使换成 LLM,也往往只是调用一次模型生成一段代码。

AVO 的做法,是把整个变异算子换成一个自主智能体。这样一来,它不仅可以阅读 CUDA 编程指南和 PTX 架构文档,也能运行测试、读取 profiler 结果、诊断正确性故障,然后自己决定下一版该改哪里。

英伟达 AVO 在 ARC-AGI-3 拿下满分,183 关全部通关 5

团队把 AVO 放到 B200 上,任务是优化注意力内核。报道称,这个算子是 Transformer 中被高度压榨的一类核心算子。之后系统连续自主运行 7 天,探索了超过 500 个优化方向,最终提交 40 个有效内核版本。

结果显示,跑出来的多头注意力内核,相比英伟达自家闭源的 cuDNN,最高快 3.5%;相比开源实现 FlashAttention-4,最高快 10.5%。

随后,这套优化方法又被迁移到 GQA。报道称,这次只自主运行了大约 30 分钟,新内核就比 cuDNN 快 7.0%,比 FlashAttention-4 快 9.3%。

手写 CUDA 内核一直被视为这个生态中门槛最高的工作之一,而 AVO 首先超过的正是这类任务。ARC-AGI-3 的 25 个游戏环境,用的也是同一套系统。

同一核心循环被搬到像素游戏里

调优内核和打游戏看起来并不属于同一类问题,但按照英伟达的说法,它们底层运行的是同一个循环:智能体先从不完整证据中建立假设,动手尝试,观察结果,保存有用状态,再修正自己对问题的理解;如果假设错误,就退回去重想,然后一轮轮推进。

英伟达的表述是,可迁移的不是领域知识,而是维持长时程自主推进的那套机制。

英伟达 AVO 在 ARC-AGI-3 拿下满分,183 关全部通关 6

作者名单中有多位华人研究者

AVO 论文共有 23 位署名作者。报道提到,这份名单中出现了多位过去十年开源深度学习基础设施领域的关键人物。

共同第一作者之一许冰是英伟达 Distinguished Engineer,也是 MXNet 作者。更早之前,他还是 2014 年 GAN 原始论文的第四作者,与末位作者 Yoshua Bengio 同署蒙特利尔大学。

作者名单中还有 TVM 和 XGBoost 作者陈天奇。围绕 TVM 这条线,报道也提到 Luis Ceze;两人共同创办的 OctoAI 已在 2024 年 9 月被英伟达收购,Ceze 随后加入英伟达继续从事机器学习编译器工作。

其他被点名的作者还包括 FlashInfer 作者叶子豪,以及 CUDA 编译器元老 Vinod Grover。

团队负责人是 Humphrey Shi,他是英伟达高性能 AI 副总裁,同时也是佐治亚理工学院教授。另一位共同第一作者 Zhifan Ye,则是佐治亚理工学院在读博士生。

这次博客署名共有 5 人,其中 4 位为华人。除 Humphrey Shi 外,还包括 Terry Chen、Zhifan Ye 和 Yeyin Zhu,另一位 Jean-Francois Puget 则是英伟达的两冠 Kaggle 特级大师。

英伟达 AVO 在 ARC-AGI-3 拿下满分,183 关全部通关 7

报道还提到许冰此前在 X 上的一段自述:一年半前,他和 Terry Chen 刚在英伟达做智能体编程时,两人都不懂 GPU 编程。也正因为不懂,他们从第一天起就朝着完全自动、无需人工干预的系统去做,并将这条路径称为「盲编程」。一年半后,这套无需人工指挥的系统,超过了人类专家优化数月的内核结果。

英伟达想占据的是模型外层这一层

报道认为,英伟达之所以花一年半时间做一套无需人工插手的智能体系统,是因为这层外壳可以与不同模型配合使用。

AVO 已经做过跨模型运行。面对同样的关卡,配 GPT-5.6 Sol 时耗时更短,换成 Opus 5 时则更省步数。

在模型侧,英伟达并不依赖卖模型盈利。报道称,英伟达今年 8 月推进的 Nemotron 4 瞄准万亿参数规模,预计秋季完成训练,模型将免费开放,收入落点仍在后续 GPU 和软件栈。

在算力侧,长时程智能体也正是英伟达希望看到的负载类型。报道引用黄仁勋今年在 GTC 上的判断称,推理拐点已经到来。过去两年算力需求增长了约 10000 倍,而使用量只增长了约 100 倍,中间差值被推理消化。

按照这一逻辑,使用哪家模型并不是关键;只要智能体任务越做越长、越做越重,最终结算都会落到 GPU 上。

英伟达 AVO 在 ARC-AGI-3 拿下满分,183 关全部通关 8

满分正在变多,但 AVO 的迁移能力仍是重点

报道提到,ARC-AGI-3 的 100 分正在快速增多。3 月时还没有系统能拿到 1 分;7 月底 Tycho 首次拿下满分,8 月 5 日 VISTA 又获得一次,而 AVO 这次已是 6 周里的第三个满分系统,且三家都由 Claude Opus 5 驱动。

即便如此,AVO 的结果仍被认为有独特意义。一个原本为了在 B200 上继续压榨 FlashAttention 最后几个百分点而设计出来的架构,被几乎原封不动搬进像素游戏环境,并成功跑通。中间变化的只有任务接口和评测方式,核心循环没有改动。

正如英伟达在博客最后写的那样,模型很重要,但模型不是智能体的全部。

参考资料: https://developer.nvidia.com/blog/nvidia-avo-reaches-100-on-arc-agi-3-demonstrating-a-frontier-level-general-purpose-architecture-for-long-horizon-autonomous-agents/

本文来自微信公众号「新智元」,作者:ASI启示录,编辑:摩西。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
40

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。