ARC-AGI-3 Human Test Shows All Levels Cleared by Humans While AI Still Trails

ARC-AGI-3 Human Test Shows All Levels Cleared by Humans While AI Still Trails

N
News Editor 01
2026-07-07 20:43:38
ARC Prize Foundation released the largest human performance dataset for ARC-AGI-3, with 458 participants completing all abstract reasoning environments under first-attempt conditions. The foundation also updated scoring rules, lifting both human and AI scores by about 0.5 percentage points.

4月15日,ARC Prize Foundation公布了ARC-AGI-3的人类表现数据集。这是ARC-AGI系列迄今规模最大的人类测试研究,共有458名参与者参与,数据集中包含342份完整的人类游戏录屏,覆盖25个公开环境,并已全部开源。此次发布再次将外界的注意力拉回到一个核心问题:在面对全新、没有说明书的抽象推理任务时,人类与AI之间究竟还有多大差距。

无提示测试设计,重点考察“首次适应能力”

根据基金会披露,ARC-AGI-3共包含135个抽象推理环境。测试参与者在进入任务前不会收到任何玩法说明,必须自行探索界面、推断规则,并形成解决策略。测试在旧金山的一处线下测试中心进行,每场时长为90分钟。参与者可获得约130美元基础报酬,并对每个成功完成的环境额外获得5美元奖励

更关键的是,本次测试采用了严格的“首次完成”条件:每位参与者对每个环境都只会看到一次,也只允许尝试一次。这种设计意在测量个体在面对完全陌生问题时的学习、适应与泛化能力,而这也正是AGI讨论中最核心的能力维度之一。基金会强调,在测试中,人类与AI获得的是相同的信息,不存在信息优势差异。

所有关卡均被人类完成,AI能力边界再被凸显

此次数据集最受关注的发现,是ARC-AGI-3中的全部环境均被人类完成。基金会表示,每一个环境至少都有2名独立参与者成功通关,而大多数环境则有超过5名参与者完成。这意味着,即便这些任务没有任何提前说明,人类依然可以凭借抽象推理、模式识别和策略调整能力实现有效破解。

ARC Prize Foundation还直言:“我们尚未实现AGI,这个数据集就是证据。”这一表述反映出该机构的基本判断:尽管当前AI系统在特定基准、代码、数学和多模态任务中持续进步,但在真正陌生、强调规则发现和泛化迁移的抽象推理场景下,AI距离人类仍存在明显差距。

值得注意的是,自ARC-AGI-3预览版发布以来,公开环境已累计收到近100万次AI评测提交。这一数字说明,相关基准正在快速成为AI研究者和开发者的重要测试场,也意味着该数据集未来可能持续影响模型评估方法与竞赛生态。

评分规则更新:人类与AI分数同步小幅上调

伴随数据集发布,ARC Prize Foundation还宣布了两项评分更新。第一,单关人类基准由此前的“第二好玩家”调整为“中位数玩家”。基金会认为,这样可以降低运气因素对最终分数的扰动,使基准更稳定,也更能代表普通人类表现。

第二,单关最高得分上限由100%提高至115%。这一调整旨在避免某一关中的单次低表现对整体成绩产生过度拖累。基金会称,两项调整的综合结果是,人类与AI的总评分均小幅提升约0.5个百分点

从评估方法角度看,这种调整并不意味着AI突然取得突破,而更像是基准体系在统计层面的一次校准。对研究者而言,评分规则更稳健,有助于减少偶然因素带来的误判;对市场观察者而言,也应避免将这类小幅分数变动误解为模型能力的根本跃迁。

对AI与加密市场意味着什么

虽然这则消息本质上属于AI基准测试更新,但其在加密行业同样具有传播价值。过去一年,“AI+Crypto”叙事不断升温,去中心化算力、链上数据市场、AI代理、模型验证和训练激励等概念持续吸引资金关注。在这种背景下,任何能够揭示AI真实能力边界的研究,都可能影响市场对相关赛道估值的预期。

从短期看,ARC-AGI-3人类测试结果释放的信号较为明确:当前AI系统距离通用智能仍有显著距离,因此市场对“AI即将全面替代人类复杂认知工作”的激进预期,可能需要重新审视。这对部分依赖高增长叙事支撑估值的AI代币项目而言,未必是利多。

但从中长期看,这反而可能利好真正提供基础设施的项目。原因在于,当行业确认AI在抽象推理与泛化能力上仍有不足时,市场往往会更重视数据、算力、评估、对齐和验证机制的长期建设价值。尤其是在链上场景中,公开透明、可审计的数据集与评测流程,与加密行业强调的开放性和可验证性天然契合。

总体来看,ARC-AGI-3最新人类数据集不仅是一份研究成果,也是一面镜子:它提醒行业,AI能力进步值得肯定,但距离真正的AGI仍有现实鸿沟。对于加密市场参与者而言,理解这种技术进展与能力边界,或许比单纯追逐热点概念更重要。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
200

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.