Opus 5在ARC-AGI-3实测中冲至96.2%,Jeremy Berman质疑复杂Harness
ARC Prize官方给Opus 5的ARC-AGI-3成绩为30.2%,位列榜首,高于7.8%的GPT-5.6 Sol。开发者Jeremy Berman随后在同一批25个公开关卡上测试,Opus 5单次通过24关,正确率升至96.2%;若每关给两次机会,正确率达到99.3%。Berman称,模型权重未变,变化来自运行环境:在断网沙箱中给模型一台可写代码、可存文件的电脑后,Opus 5现场生成269个程序、约1.27万行代码,总成本为540美元。








