
EVMbench是OpenAI与Paradigm合作开发的基准测试,评估AI代理在检测、修补和利用智能合约漏洞方面的能力。包含117个精选漏洞,覆盖检测、修补和利用三种模式,最终推动AI在区块链安全中的防御性应用。
2026年2月18日,OpenAI Research发布了一项重要研究成果——EVMbench。这是一个全新的基准测试,旨在评估AI代理在检测、修补和利用智能合约漏洞方面的能力。随着AI代理在代码读写和执行上的进步,衡量其在经济意义重大的环境中的表现变得至关重要。EVMbench的推出,旨在鼓励AI系统在防御性审计和强化已部署合约中的使用,从而提升区块链生态的安全性。
EVMbench是与Paradigm合作开发的,专注于评估AI代理处理高严重性智能合约漏洞的能力。该基准测试包含来自40次审计的117个精选漏洞,其中大部分源自公开的代码审计竞赛。此外,EVMbench还纳入了来自Tempo区块链安全审计过程的多个漏洞场景。Tempo是一个专为通过稳定币实现高吞吐量、低成本支付而设计的L1区块链。这些场景将基准测试扩展到支付导向的智能合约代码,预计代理稳定币支付将在此领域增长,并为EVMbench提供了新兴实际应用领域的坚实基础。
为了创建任务环境,研究团队改编了现有的概念验证漏洞利用测试和部署脚本(如果存在),否则手动编写。在修补模式下,他们确保漏洞是可利用的,并且可以在不引入编译破坏性更改的情况下进行缓解。在利用模式下,他们编写了自定义评分器,并对环境进行了红队测试,以发现和修补代理可能欺骗评分器的方法。除了通过Paradigm提供的领域专业知识进行任务质量控制外,还使用了自动化任务审计代理来提高环境的健全性。
EVMbench评估三种能力模式:
为了支持客观和可重复的评估,研究团队开发了一个基于Rust的框架,该框架部署合约,确定性地重放代理交易,并限制不安全的RPC方法。利用任务在隔离的本地Anvil环境中运行,而不是在实时网络上,漏洞是历史性的且公开记录。这种设计确保了评估的安全性和一致性。
评估涵盖了所有三种模式下的前沿AI代理。在“利用”模式下,通过Codex CLI运行的GPT-5.3-Codex获得了71.0%的分数。这比仅六个月前发布的GPT-5(得分33.3%)有显著提升。然而,检测召回率和修补成功率仍低于完全覆盖,因为很大一部分漏洞对代理来说仍然难以发现和修复。这表明AI代理在复杂安全任务上仍有改进空间。
EVMbench还揭示了不同任务中模型行为的有趣差异。代理在利用设置中表现最佳,因为目标明确:继续迭代直到资金耗尽。相比之下,在检测和修补任务中性能较弱。在“检测”模式中,代理有时在识别单个问题后停止,而不是全面审计代码库。在“修补”模式中,在移除细微漏洞的同时保持完整功能仍然具有挑战性。这反映了AI代理在系统性任务中的局限性。
EVMbench并不代表现实世界智能合约安全的全部难度。包含的漏洞来自Code4rena审计竞赛。虽然这些漏洞是真实且高严重性的,但许多大量部署和广泛使用的加密合约经历了更严格的审查,可能更难利用。
评分系统虽然稳健但并非完美。在“检测”模式中,检查代理是否找到与人类审计员相同的漏洞。如果代理识别出额外问题,目前没有可靠的方法确定它们是否代表人类遗漏的真实漏洞或误报。
在“利用”设置中也存在结构限制。交易在评分容器中顺序重放,因此依赖于精确时序机制的行为不在范围内。链状态是干净的本地Anvil实例,而不是主网的分叉,目前仅支持单链环境。在某些情况下,这需要使用模拟合约而不是主网部署。
智能合约保护着数十亿美元的资产,AI代理可能对攻击者和防御者都具有变革性。衡量模型在这一领域的能力有助于跟踪新兴的网络风险,并强调使用AI系统进行防御性审计和强化已部署合约的重要性。
EVMbench既是一个测量工具,也是一个行动号召。随着代理能力的提升,开发者和安全研究人员将AI辅助审计纳入工作流程变得越来越重要。
在最近几个月中,模型在网络安全任务上的性能有了显著提升,这使开发者和安全专业人员都受益。与此同时,研究团队一直在准备加强的网络保障措施,以支持防御性使用和更广泛的生态系统韧性。
由于网络安全本质上是双用途的,他们正在采取基于证据的迭代方法,加速防御者发现和修复漏洞的能力,同时减缓滥用。缓解措施包括安全训练、自动监控、对高级功能的可信访问,以及包括威胁情报在内的执行管道。
OpenAI正在投资生态系统,以促进AI在区块链安全中的负责任使用。通过EVMbench,他们希望激发更多研究,推动AI代理在防御性审计中的实际应用。随着技术的演进,EVMbench将定期更新以反映新的漏洞类型和攻击向量,确保其持续相关性。
总之,EVMbench代表了AI与区块链安全交叉领域的重要一步。它不仅提供了一个评估AI代理能力的标准化框架,还强调了AI在保护数字资产中的关键作用。随着AI代理继续进化,EVMbench将成为开发者和安全研究人员不可或缺的工具,帮助他们构建更安全、更可靠的区块链应用。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

开放知识格式 v0.2 增加了信任层,但尚无 AI 代理读取。其真正价值在于迫使网站所有者以机器视角审视内容,通过诚实回答“来源、时效、背书”三问,揭示网站的结构与信任缺口。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。