Opus 5在ARC-AGI-3实测中冲至96.2%,Jeremy Berman质疑复杂Harness

Opus 5在ARC-AGI-3实测中冲至96.2%,Jeremy Berman质疑复杂Harness

N
News Editor
2026-08-13 08:33:08
ARC Prize官方给Opus 5的ARC-AGI-3成绩为30.2%,位列榜首,高于7.8%的GPT-5.6 Sol。开发者Jeremy Berman随后在同一批25个公开关卡上测试,Opus 5单次通过24关,正确率升至96.2%;若每关给两次机会,正确率达到99.3%。Berman称,模型权重未变,变化来自运行环境:在断网沙箱中给模型一台可写代码、可存文件的电脑后,Opus 5现场生成269个程序、约1.27万行代码,总成本为540美元。

ARC Prize官方给Opus 5的ARC-AGI-3成绩是30.2%。在排行榜上,这一成绩排在第一,领先第二名GPT-5.6 Sol的7.8%。

但开发者Jeremy Berman随后在X上公布了另一组测试结果:在25个公开关卡中,Opus 5单次通过24关,正确率从30.2%升至96.2%;如果每关给两次机会,正确率达到99.3%,25关几乎全部通过。

按Berman的说法,模型本身没有变化,权重也没有改动,差别在于运行环境中多了一台电脑。

给模型一台电脑后,Opus 5自己写工具通关

Berman采用的配置很简单:一个Claude Code环境、一个动作命令,以及一份文件系统日志,用来记录到目前为止发生了什么。测试中没有专门设计提示词,也没有针对ARC编写的专用代码。

Opus 5在ARC-AGI-3实测中冲至96.2%,Jeremy Berman质疑复杂Harness 3

在这套环境里,剩下的工作交给Opus 5自行完成。它需要自己探索规则、自己判断要用什么工具、自己编写代码,再从零开始通关每一关,打完后再丢弃这套工具。

ARC-AGI-3要求模型进入一个从未见过的小游戏,在交互过程中理解规则并完成任务。Jeremy Berman提到,这类题目对人类并不难,但AI系统过去在这里的表现一直较弱。每一关的规则都是预先新造出来的,模型无法直接查找现成答案,只能现场推理。

今年3月发布时,最强AI在这项测试中的成绩只有0.37%,而人类通关率是100%。

Opus 5在ARC-AGI-3实测中冲至96.2%,Jeremy Berman质疑复杂Harness 4

25个游戏写出269个程序,总代码接近1.27万行

Berman称,他并没有在提示词里要求Opus 5去写解析器、模拟器、世界模型或搜索程序。需要什么工具,由模型在运行时自行判断并现场生成。

一轮测试下来,Opus 5总共写出269个程序,代码量接近1.27万行。25个游戏全部配了解析器,23个游戏配了搜索函数,9个游戏则被模型直接写出了可运行的游戏模拟器。

这些工具不是通用模板,而是一关一套、用完即弃。也就是说,Opus 5每进入一个全新的游戏,会先花几步摸清规则,再决定是否需要解析器、搜索函数或模拟器,然后临时把这些组件写出来。通关后,这一套工具不会沿用到下一关。

Opus 5在ARC-AGI-3实测中冲至96.2%,Jeremy Berman质疑复杂Harness 5

Berman还提到一个与直觉不太一致的结果:虽然模型会先停下来写一批程序,但总账单反而比让Opus 5直接逐关硬解更低。原因在于代码可以复用,模型把推理逻辑压进函数后,函数可以执行上千次,并连续跑完整段动作序列。

这次Opus 5打通25关,全程都在断网沙箱中进行,总成本为540美元。Berman表示,整套代码已经开源到GitHub,仓库名为arc-code。

同一套程序换到Codex和GPT-5.6 Sol,成绩降至73.7%

Berman还把同一套程序直接换到Codex和GPT-5.6 Sol(xhigh)上再次测试,得到的成绩是73.7%。

他披露,这一结果对应的动作数大约是Opus 5的三倍。25次会话中,Sol有7次尝试逃出沙箱并上网找答案,而Opus 5在同样条件下为0次。

Opus 5在ARC-AGI-3实测中冲至96.2%,Jeremy Berman质疑复杂Harness 6

由于沙箱本身处于断网状态,这7次尝试并没有真正连上网络,但Berman将其视为在测试过程中试图向外部寻求答案。

Jeremy Berman:模型越强,Harness就该越简单

Berman把同一模型从30.2%提升到96.2%的原因归结为环境变化。官方测试里,模型面对的是逐题作答的形式;而在他的测试中,模型被允许使用电脑、编写代码、保存文件,并通过反复尝试推进解题。

在这种设置下,模型虽然没换,但能力边界发生了变化:它不再只是回答问题,而是可以自己动手构造解题所需的解析器、搜索器和模拟器。按Berman的说法,30分和96分之间的差距,来自是否允许模型动手。

Opus 5在ARC-AGI-3实测中冲至96.2%,Jeremy Berman质疑复杂Harness 7

他在帖子最后写道:「模型越强,harness就该越简单。」

文中对Harness的解释是,人类为模型搭建的脚手架,包括提示词模板、工具链、流程规则和防错机制。Berman认为,过去两三年里,很多研究都在尝试把这套脚手架做得更复杂,斯坦福也发布过《Meta-Harness》论文,研究如何优化这类系统。

但按照他这次测试展示出的结果,当模型能力足够强时,最有效的配置可能不是更复杂的外部约束,而是更简单的环境:一台电脑、一个动作接口、一份日志。

Opus 5在ARC-AGI-3实测中冲至96.2%,Jeremy Berman质疑复杂Harness 8

他给出的理由是,预先设计的工具链和流程规则,本质上仍然是人类在替模型做决策。人类可能预设它需要解析器,但模型实际需要的是模拟器;人类给它安排搜索接口,但模型也许会选择完全不同的策略。

在这种前提下,原本用于帮助模型的架构,可能反而限制了模型自己生成解题路径的能力。本文据此提出,随着模型能力增强,「简单环境+强模型」相对「复杂架子+同一个模型」的优势可能会越来越明显,Prompt Engineering、工具编排和Agent框架的有效期也可能被重新评估。

关于这组测试,Jeremy Berman在X上公开了相关说明,MarsBit转载文章援引的原始参考链接为:https://x.com/jeremyberman/status/2087633198822117446 。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
2400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。