ARC Prize官方给Opus 5的ARC-AGI-3成绩是30.2%。在排行榜上,这一成绩排在第一,领先第二名GPT-5.6 Sol的7.8%。
但开发者Jeremy Berman随后在X上公布了另一组测试结果:在25个公开关卡中,Opus 5单次通过24关,正确率从30.2%升至96.2%;如果每关给两次机会,正确率达到99.3%,25关几乎全部通过。
按Berman的说法,模型本身没有变化,权重也没有改动,差别在于运行环境中多了一台电脑。
给模型一台电脑后,Opus 5自己写工具通关
Berman采用的配置很简单:一个Claude Code环境、一个动作命令,以及一份文件系统日志,用来记录到目前为止发生了什么。测试中没有专门设计提示词,也没有针对ARC编写的专用代码。

在这套环境里,剩下的工作交给Opus 5自行完成。它需要自己探索规则、自己判断要用什么工具、自己编写代码,再从零开始通关每一关,打完后再丢弃这套工具。
ARC-AGI-3要求模型进入一个从未见过的小游戏,在交互过程中理解规则并完成任务。Jeremy Berman提到,这类题目对人类并不难,但AI系统过去在这里的表现一直较弱。每一关的规则都是预先新造出来的,模型无法直接查找现成答案,只能现场推理。
今年3月发布时,最强AI在这项测试中的成绩只有0.37%,而人类通关率是100%。

25个游戏写出269个程序,总代码接近1.27万行
Berman称,他并没有在提示词里要求Opus 5去写解析器、模拟器、世界模型或搜索程序。需要什么工具,由模型在运行时自行判断并现场生成。
一轮测试下来,Opus 5总共写出269个程序,代码量接近1.27万行。25个游戏全部配了解析器,23个游戏配了搜索函数,9个游戏则被模型直接写出了可运行的游戏模拟器。
这些工具不是通用模板,而是一关一套、用完即弃。也就是说,Opus 5每进入一个全新的游戏,会先花几步摸清规则,再决定是否需要解析器、搜索函数或模拟器,然后临时把这些组件写出来。通关后,这一套工具不会沿用到下一关。

Berman还提到一个与直觉不太一致的结果:虽然模型会先停下来写一批程序,但总账单反而比让Opus 5直接逐关硬解更低。原因在于代码可以复用,模型把推理逻辑压进函数后,函数可以执行上千次,并连续跑完整段动作序列。
这次Opus 5打通25关,全程都在断网沙箱中进行,总成本为540美元。Berman表示,整套代码已经开源到GitHub,仓库名为arc-code。
同一套程序换到Codex和GPT-5.6 Sol,成绩降至73.7%
Berman还把同一套程序直接换到Codex和GPT-5.6 Sol(xhigh)上再次测试,得到的成绩是73.7%。
他披露,这一结果对应的动作数大约是Opus 5的三倍。25次会话中,Sol有7次尝试逃出沙箱并上网找答案,而Opus 5在同样条件下为0次。

由于沙箱本身处于断网状态,这7次尝试并没有真正连上网络,但Berman将其视为在测试过程中试图向外部寻求答案。
Jeremy Berman:模型越强,Harness就该越简单
Berman把同一模型从30.2%提升到96.2%的原因归结为环境变化。官方测试里,模型面对的是逐题作答的形式;而在他的测试中,模型被允许使用电脑、编写代码、保存文件,并通过反复尝试推进解题。
在这种设置下,模型虽然没换,但能力边界发生了变化:它不再只是回答问题,而是可以自己动手构造解题所需的解析器、搜索器和模拟器。按Berman的说法,30分和96分之间的差距,来自是否允许模型动手。

他在帖子最后写道:「模型越强,harness就该越简单。」
文中对Harness的解释是,人类为模型搭建的脚手架,包括提示词模板、工具链、流程规则和防错机制。Berman认为,过去两三年里,很多研究都在尝试把这套脚手架做得更复杂,斯坦福也发布过《Meta-Harness》论文,研究如何优化这类系统。
但按照他这次测试展示出的结果,当模型能力足够强时,最有效的配置可能不是更复杂的外部约束,而是更简单的环境:一台电脑、一个动作接口、一份日志。

他给出的理由是,预先设计的工具链和流程规则,本质上仍然是人类在替模型做决策。人类可能预设它需要解析器,但模型实际需要的是模拟器;人类给它安排搜索接口,但模型也许会选择完全不同的策略。
在这种前提下,原本用于帮助模型的架构,可能反而限制了模型自己生成解题路径的能力。本文据此提出,随着模型能力增强,「简单环境+强模型」相对「复杂架子+同一个模型」的优势可能会越来越明显,Prompt Engineering、工具编排和Agent框架的有效期也可能被重新评估。
关于这组测试,Jeremy Berman在X上公开了相关说明,MarsBit转载文章援引的原始参考链接为:https://x.com/jeremyberman/status/2087633198822117446 。

