Codex 完成奥斯汀·格里菲思的 AI 安全赛,DeepSeek 只差一步

Codex 完成奥斯汀·格里菲思的 AI 安全赛,DeepSeek 只差一步

N
News Editor
2026-09-04 01:33:42
在 Ethereum Foundation 开发者入门与工具负责人 Austin Griffith 设计的一场 Solidity 挑战赛中,10 个 AI 编码代理只跑完一轮测试,只有 OpenAI 的 Codex 完成全部 12 题。DeepSeek V4 Pro 以 11 题紧随其后,计算成本为 1.45 美元;Anthropic 的 Claude Opus 4.8 完成 10 题,成本为 7.61 美元。BuidlGuidl 表示,这只是单次、单赛道、单日评估,不是模型总排名。

Codex 在 12 道 Solidity 挑战中率先跑完全程

10 个 AI 编码代理在周四接受了同一组 12 道 Solidity 挑战,最终只有一个模型完成全部任务。比赛使用的题目最初是为 Ethereum Devcon 大会上的人类开发者设计的。

这场竞赛由 Austin Griffith 组织。他负责 Ethereum Foundation 的开发者入门与工具工作,同时还是开发者组织 BuidlGuidl 的创始人。比赛在美国东部时间上午 11 点进行,时间上比他在 Unchained 的 Uneasy Money 播客中提前预告这场比赛晚了一天。

每个代理都在隔离实例中运行,并配有自己的钱包;只有当 mint 真正上链时,才会计入一次捕获。

OpenAI 的 Codex 拿下前三名

OpenAI 的 Codex,在 GPT-5.5 上运行,包揽了全部三个完赛名次。三种推理设置里,中等推理模式最快完成全部 12 面旗帜,用时 40 分 7 秒;额外高推理设置在三者中最慢,用时 50 分 26 秒,而且为了完成任务消耗了近三分之一更多 token。

从单次结果看,最值得外界关注的可能是第四名。DeepSeek V4 Pro 是一款开源权重的中国模型,拿下 12 面旗帜中的 11 面,计算成本为 1.45 美元。Anthropic 的 Claude Opus 4.8 完成了 10 面,成本为 7.61 美元,比 DeepSeek 多花了 5 倍多,却少拿 1 面旗帜。

其他开源权重的中国模型差距更大:GLM 5.3 完成 6 面,Kimi K3 和 Qwen 各完成 2 面。

BuidlGuidl 只把它当作一次公开单轮评估

BuidlGuidl 将每个参赛者的 harness、模型和推理强度一并标注,并公开了系统提示词以及所有人工介入,连同最终排名一起发布。组织方明确表示,这次测试是一次透明的单轮评估,不是通用的模型排行榜。

Griffith 在节目里的核心观点,是没人能在新模型发布后立刻回答最简单的问题。我们需要好的评估。他在播客中说,人们应该一直做评估,你应该有自己的评估套件,而且你应该能够运行它。

他还说,这套关卡并不是为机器写的。这套评估就是我们在曼谷和布宜诺斯艾利斯的 Devcon 上为人类做的 capture the flag,Griffith 说,这些挑战足够冷门,答案不太可能出现在任何模型的训练数据里。

但最强的代理仍然完成了它们。页面上的说明也保留了一个限制:只有一轮、一个赛道、一天。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
900

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。