Codex 在 12 道 Solidity 挑战中率先跑完全程
10 个 AI 编码代理在周四接受了同一组 12 道 Solidity 挑战,最终只有一个模型完成全部任务。比赛使用的题目最初是为 Ethereum Devcon 大会上的人类开发者设计的。
这场竞赛由 Austin Griffith 组织。他负责 Ethereum Foundation 的开发者入门与工具工作,同时还是开发者组织 BuidlGuidl 的创始人。比赛在美国东部时间上午 11 点进行,时间上比他在 Unchained 的 Uneasy Money 播客中提前预告这场比赛晚了一天。
每个代理都在隔离实例中运行,并配有自己的钱包;只有当 mint 真正上链时,才会计入一次捕获。
OpenAI 的 Codex 拿下前三名
OpenAI 的 Codex,在 GPT-5.5 上运行,包揽了全部三个完赛名次。三种推理设置里,中等推理模式最快完成全部 12 面旗帜,用时 40 分 7 秒;额外高推理设置在三者中最慢,用时 50 分 26 秒,而且为了完成任务消耗了近三分之一更多 token。
从单次结果看,最值得外界关注的可能是第四名。DeepSeek V4 Pro 是一款开源权重的中国模型,拿下 12 面旗帜中的 11 面,计算成本为 1.45 美元。Anthropic 的 Claude Opus 4.8 完成了 10 面,成本为 7.61 美元,比 DeepSeek 多花了 5 倍多,却少拿 1 面旗帜。
其他开源权重的中国模型差距更大:GLM 5.3 完成 6 面,Kimi K3 和 Qwen 各完成 2 面。
BuidlGuidl 只把它当作一次公开单轮评估
BuidlGuidl 将每个参赛者的 harness、模型和推理强度一并标注,并公开了系统提示词以及所有人工介入,连同最终排名一起发布。组织方明确表示,这次测试是一次透明的单轮评估,不是通用的模型排行榜。
Griffith 在节目里的核心观点,是没人能在新模型发布后立刻回答最简单的问题。我们需要好的评估。他在播客中说,人们应该一直做评估,你应该有自己的评估套件,而且你应该能够运行它。
他还说,这套关卡并不是为机器写的。这套评估就是我们在曼谷和布宜诺斯艾利斯的 Devcon 上为人类做的 capture the flag,Griffith 说,这些挑战足够冷门,答案不太可能出现在任何模型的训练数据里。
但最强的代理仍然完成了它们。页面上的说明也保留了一个限制:只有一轮、一个赛道、一天。

