OpenAI与投资机构Paradigm发布了EVMbench,这是一个面向以太坊智能合约安全的基准测试框架,专门评估AI代理在真实链上安全场景中的表现。该系统聚焦三类任务:识别漏洞、修复漏洞,以及在隔离环境中对漏洞进行受控利用,用来衡量AI是否能处理高价值加密系统里的实际风险。
120个真实漏洞构成测试集
EVMbench并没有使用理论化样例,而是整理了120个漏洞,来源于40份安全审计,其中包含公开审计竞赛中的知名案例。测试集建立在真实智能合约缺陷之上,目标是更接近开发者和审计团队平时会遇到的问题,而不是只考察模型在标准化题目上的代码能力。
素材提到,如今智能合约保护的数字资产规模已超过1000亿美元。在自动化工具越来越擅长阅读和编写代码的情况下,如何量化它们在高价值环境中的安全能力,已经成了区块链行业无法回避的问题。EVMbench的发布,正是把这类能力评估从概念讨论推进到可重复测试。
检测、修补、利用三项任务分开评估
在具体设计上,EVMbench把AI表现拆成三个模式。detect模式要求模型审计合约并找出已知漏洞;patch模式要求模型在不破坏合约正常运行的前提下完成修补;exploit模式则是在安全测试环境内复现攻击路径,展示漏洞可��造成的风险。三项能力并不等价。会找漏洞,不代表能稳定修好;能写出利用脚本,也不意味着能完成完整安全审计。
整套系统运行在一个基于Rust的安全测试框架上,可部署合约并以可复现方式回放交易。所有利用行为都只发生在隔离环境中,不接触真实资金,也不会影响线上网络。这一点很关键,尤其是在安全研究与攻击模拟边界越来越敏感的情况下。
早期结果显示利用能力提升更快
早期测试结果显示,OpenAI最新代码模型在漏洞利用任务中的成功率已超过70%,与6个月前相比有明显提升。不过,漏洞检测和修补仍然更难,尤其是在缺陷较隐蔽时,模型表现没有利用任务那样稳定。
研究人员的观察是,目标越明确,AI完成得越好。比如在模拟攻击中,以“转走资金”为清晰目标时,模型更容易收敛出有效路径;而面对需要通盘理解合约逻辑、权限关系和边界条件的完整安全审计时,能力短板就会更明显。这也说明,AI在加密安全领域已经具备实用潜力,但离独立承担全面审计还有距离��
审计流程可能出现新标准,也带来双重用途风险
EVMbench的出现,可能影响区块链项目处理安全问题的方式。审计机构、开发者和DeFi团队,后续可能把AI辅助审查作为部署前的常规环节。若漏洞发现速度提高,项目遭遇黑客攻击的成本有机会下降,用户对协议安全性的判断也会更依赖这类工具的实际表现。
但同一套能力也存在双重用途风险。能够帮助防守方的工具,同样可能帮助攻击者学习新的利用方法。素材显示,相关技术公司正在投入保护措施、监控系统和安全研究计划,以推动负责任使用。EVMbench还纳入了面向支付场景的智能合约案例,这也反映出稳定币基础设施和现实应用合约正在成为安全评测的重要对象。
从Web3开发流程看,EVMbench更像是一套可量化坐标。它不直接替代人工审计,却给AI在合约安全中的强项和短板提供了统一的测试方法。

