4月15日,ARC Prize Foundation公布了ARC-AGI-3人类表现数据集,这是该系列迄今规模最大的一次人类测试,共有458名参与者加入。此次公开的数据包含342份完整的人类游戏过程录屏,覆盖25个公开环境,并已全部开源。对于持续关注人工智能能力边界以及AI与加密叙事结合的市场参与者而言,这一数据集不仅是技术研究的重要样本,也为“AGI是否已经接近实现”提供了新的实证参考。
135个抽象推理环境全部被人类完成
ARC-AGI-3包含135个抽象推理环境。测试的关键特点在于,参与者在进入测试前不会获得任何玩法说明,必须在陌生环境中自行探索、总结规则并形成解题策略。这种设计旨在评估面对全新问题时的学习、适应与抽象推理能力,而非单纯考察记忆或已有知识调用。
根据基金会披露的信息,测试在旧金山的线下测试中心进行,每场时长90分钟。参与者获得130美元基础报酬,并对每完成一个环境额外获得5美元奖励。所有测试均在“首次完成”条件下进行,即每位参与者对每个环境只看一次、只尝试一次,以尽可能排除重复练习带来的影响。更重要的是,基金会强调,人类与AI在测试中获得的是相同信息,不存在额外的信息优势。
结果显示,ARC-AGI-3中的全部环境都被人类完成,且每个环境至少有两名独立参与者完成,大多数环境则有超过五名参与者成功通关。这意味着在人类样本中,ARC-AGI-3所代表的抽象推理挑战虽然困难,但尚未构成无法跨越的能力门槛。相比之下,基金会明确表示:“我们尚未实现AGI,这份数据集就是证据。”
近百万次AI评测后,基金会更新评分规则
自ARC-AGI-3预览版推出以来,公开环境已累计收到近100万次AI评测提交。在大量测试数据基础上,ARC Prize Foundation同步宣布了两项评分机制调整。
第一,单关卡的人类基准由原先的“第二好玩家”改为“中位数玩家”。这一改动的核心目的是降低个别高分样本或运气因素对整体基准的扰动,使评分更加稳定,更能反映人类群体的典型表现。
第二,单关卡最高得分上限由100%提高至115%。基金会认为,这样可以避免某一关的单次失误对总成绩造成过度拖累,让整体评估更贴近真实能力表现。
从结果看,这两项调整带来的净影响相对有限:人类与AI的总体得分均小幅上升约0.5个百分点。也就是说,评分修正更多是在统计口径上优化比较方式,而不是改变“人类显著强于现阶段AI”的整体结论。
对AI与加密市场叙事意味着什么
尽管这则消息本身并非传统意义上的链上代币事件,但在当前“AI+Crypto”叙事持续升温的背景下,其市场意义不容忽视。过去一段时间,部分加密项目借助AI概念推动估值扩张,市场也普遍将“更强大的通用智能”视为链上自治、智能代理和去中心化算力网络的重要催化剂。然而,ARC-AGI-3的人类测试结果再次提醒市场:当前AI在面对陌生抽象推理任务时,距离稳定达到人类水平仍有明显差距。
这对加密投资者的启示主要体现在两个层面。其一,围绕AGI、自治代理和链上智能体的项目估值,短期内可能需要更加审慎地回归技术现实。若底层模型在泛化、适应和推理方面仍未跨越关键门槛,那么相关商业化叙事的兑现速度或许不会像市场预期那样迅速。其二,从基础设施角度看,AI能力仍在快速迭代,数据、算力验证、模型评测和开放研究框架的重要性反而进一步提升,这可能继续为部分与AI基础设施、数据协作和去中心化算力相关的加密赛道提供长期讨论空间。
此外,ARC Prize Foundation选择将大量测试数据与录屏开源,也体现出评测透明化趋势正在增强。对于加密行业而言,开放、可验证、可复现的机制天然契合链上世界强调的透明原则。未来若类似评测框架与链上激励、去中心化竞赛或模型验证市场结合,或将催生新的交叉应用场景。
结语
总体来看,ARC-AGI-3此次公布的人类表现数据集,为评估AI真实能力提供了更扎实的对照样本。数据显示,458名参与者构成的最大规模人类测试中,人类成功完成了全部抽象推理关卡,而AI尚未展现出同等稳定性。尽管评分规则更新使双方成绩均略有抬升,但并未改变核心判断:AGI仍未到来。对于加密市场而言,这既是一次对AI叙事的降温提醒,也是一次重新审视AI基础设施长期价值的契机。

