OpenAI联手Paradigm推出EVMbench,直测以太坊合约安全

OpenAI联手Paradigm推出EVMbench,直测以太坊合约安全

N
News Editor 01
2026-07-23 09:05:14
OpenAI与Paradigm发布EVMbench,基于120个真实高危漏洞测试AI对以太坊合约的发现、修复与利用能力。GPT-5.3-Codex在利用模式中得分72.2%。
OpenAIParadigm以太坊安全智能合约AI审计

OpenAI与Paradigm发布了面向以太坊智能合约安全的基准测试EVMbench,核心是用真实漏洞评估AI代理在发现、修复和利用合约缺陷时的表现。OpenAI称,这套测试覆盖120个高严重性漏洞,来源于40份专业智能合约审计。这些合约所处的EVM网络承载着超过1000亿美元的加密资产,安全风险直接关联链上资金。

120个真实审计漏洞构成测试集

EVMbench没有采用合成样例,而是直接建立在历史真实漏洞之上。OpenAI披露,数据集中的大量问题来自公开审计竞赛,包括Code4rena。素材还提到,测试场景纳入了Tempo链相关的安全案例。Tempo是一条面向支付、主打稳定币转账的Layer 1网络,这也让基准测试加入了支付逻辑层面的风险类型。

为了让测试更接近真实攻击环境,工程团队在有条件时复用了已有的漏洞利用PoC脚本;文档不完整的部分,则由团队手动补齐缺失组件。OpenAI表示,处理目标是在保留漏洞可利用性的同时,确保补丁方案能够正确编译。

三种模式分别考察发现、修复与提币攻击

EVMbench把AI代理测试拆分为detect、patch和exploit三种模式。detect模式下,代理需要扫描代码仓库,评分依据是已确认漏洞的召回情况。patch模式要求模型修复漏洞,同时不能破坏合约原有行为。这一点很关键,单纯改掉报错并不算通过。

exploit模式更直接。测试会在沙盒区块链里模拟完整的资金提取攻击,评测器通过交易回放和链上状态检查确认结果。为保持部署结果一致,OpenAI还构建了一套基于Rust的测试框架,用于确定性部署。

利用测试在本地Anvil环境运行

这套利用测试并不运行在真实网络,而是在本地Anvil环境中完成。OpenAI强调,所有漏洞都属于历史上已经公开披露的问题。测试框架同时限制了不安全的RPC调用,以降低被滥用的风险。

已公布的结果显示,GPT-5.3-Codex在exploit模式中得分72.2%,明显高于数月前发布的GPT-5,后者得分为31.9%。不过,OpenAI也提到,当前在漏洞检测和补丁覆盖上的表现仍不完整,说明这类模型在合约安全审计中的能力还没有覆盖全部环节。

OpenAI同步确认一项人事变动

伴随EVMbench发布,OpenAI还确认了新成员加入。OpenClaw创始人Peter Steinberger已加入OpenAI,参与代理开发工作。Sam Altman随后在X上确认这一消息,并称Steinberger将负责下一代个人代理项目。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。