Bingdada 技术博客Bingdada 技术博客
首页博客SEOGEOAI工具关于
登录注册
Logo

Bingdada 技术博客

专注于SEO搜索引擎优化和GEO生成式引擎优化以及未来人工智能发展趋势的技术博客

快速链接

  • 首页
  • 博客文章
  • 关于我们

联系方式

  • 398848662@qq.com

订阅我们的 Newsletter,获取最新的 SEO 和 GEO 技术资讯。

© 2024 Bingdada 技术博客. All rights reserved.

首页博客AI人工智能EVMbench:评估AI代理在区块链安全中的能力,推动智能合约防御升级
EVMbench:评估AI代理在区块链安全中的能力,推动智能合约防御升级
AI人工智能

EVMbench:评估AI代理在区块链安全中的能力,推动智能合约防御升级

bingdadabingdada
八月 2, 20266 次阅读约 7 分钟阅读
快速回答

EVMbench是OpenAI与Paradigm合作开发的基准测试,评估AI代理在检测、修补和利用智能合约漏洞方面的能力。包含117个精选漏洞,覆盖检测、修补和利用三种模式,最终推动AI在区块链安全中的防御性应用。

核心要点
  • 什么是EVMbench?
  • 任务环境的构建
  • 三种能力模式
  • 评估框架
  • 前沿代理的性能
目录

目录

  • 引言
  • 什么是EVMbench?
  • 任务环境的构建
  • 三种能力模式
  • 评估框架
  • 前沿代理的性能
  • 模型行为差异
  • 局限性
  • 为什么这很重要
  • 网络安全与双用途挑战
  • 生态投资与未来展望

EVMbench:评估AI代理在区块链安全中的能力,推动智能合约防御升级

引言

2026年2月18日,OpenAI Research发布了一项重要研究成果——EVMbench。这是一个全新的基准测试,旨在评估AI代理在检测、修补和利用智能合约漏洞方面的能力。随着AI代理在代码读写和执行上的进步,衡量其在经济意义重大的环境中的表现变得至关重要。EVMbench的推出,旨在鼓励AI系统在防御性审计和强化已部署合约中的使用,从而提升区块链生态的安全性。

什么是EVMbench?

EVMbench是与Paradigm合作开发的,专注于评估AI代理处理高严重性智能合约漏洞的能力。该基准测试包含来自40次审计的117个精选漏洞,其中大部分源自公开的代码审计竞赛。此外,EVMbench还纳入了来自Tempo区块链安全审计过程的多个漏洞场景。Tempo是一个专为通过稳定币实现高吞吐量、低成本支付而设计的L1区块链。这些场景将基准测试扩展到支付导向的智能合约代码,预计代理稳定币支付将在此领域增长,并为EVMbench提供了新兴实际应用领域的坚实基础。

任务环境的构建

为了创建任务环境,研究团队改编了现有的概念验证漏洞利用测试和部署脚本(如果存在),否则手动编写。在修补模式下,他们确保漏洞是可利用的,并且可以在不引入编译破坏性更改的情况下进行缓解。在利用模式下,他们编写了自定义评分器,并对环境进行了红队测试,以发现和修补代理可能欺骗评分器的方法。除了通过Paradigm提供的领域专业知识进行任务质量控制外,还使用了自动化任务审计代理来提高环境的健全性。

三种能力模式

EVMbench评估三种能力模式:

  • 检测模式:代理审计智能合约代码库,并根据真实漏洞的召回率和相关审计奖励进行评分。这衡量了AI代理发现潜在安全问题的能力。
  • 修补模式:代理修改易受攻击的合约,必须保留预期功能同时消除可利用性,通过自动化测试和漏洞利用检查进行验证。这评估了AI代理在修复漏洞时不破坏合约正常功能的能力。
  • 利用模式:代理在沙盒区块链环境中对已部署合约执行端到端的资金耗尽攻击,通过交易重放和链上验证进行编程评分。这测试了AI代理在实际攻击场景中的表现。

评估框架

为了支持客观和可重复的评估,研究团队开发了一个基于Rust的框架,该框架部署合约,确定性地重放代理交易,并限制不安全的RPC方法。利用任务在隔离的本地Anvil环境中运行,而不是在实时网络上,漏洞是历史性的且公开记录。这种设计确保了评估的安全性和一致性。

前沿代理的性能

评估涵盖了所有三种模式下的前沿AI代理。在“利用”模式下,通过Codex CLI运行的GPT-5.3-Codex获得了71.0%的分数。这比仅六个月前发布的GPT-5(得分33.3%)有显著提升。然而,检测召回率和修补成功率仍低于完全覆盖,因为很大一部分漏洞对代理来说仍然难以发现和修复。这表明AI代理在复杂安全任务上仍有改进空间。

模型行为差异

EVMbench还揭示了不同任务中模型行为的有趣差异。代理在利用设置中表现最佳,因为目标明确:继续迭代直到资金耗尽。相比之下,在检测和修补任务中性能较弱。在“检测”模式中,代理有时在识别单个问题后停止,而不是全面审计代码库。在“修补”模式中,在移除细微漏洞的同时保持完整功能仍然具有挑战性。这反映了AI代理在系统性任务中的局限性。

局限性

EVMbench并不代表现实世界智能合约安全的全部难度。包含的漏洞来自Code4rena审计竞赛。虽然这些漏洞是真实且高严重性的,但许多大量部署和广泛使用的加密合约经历了更严格的审查,可能更难利用。

评分系统虽然稳健但并非完美。在“检测”模式中,检查代理是否找到与人类审计员相同的漏洞。如果代理识别出额外问题,目前没有可靠的方法确定它们是否代表人类遗漏的真实漏洞或误报。

在“利用”设置中也存在结构限制。交易在评分容器中顺序重放,因此依赖于精确时序机制的行为不在范围内。链状态是干净的本地Anvil实例,而不是主网的分叉,目前仅支持单链环境。在某些情况下,这需要使用模拟合约而不是主网部署。

为什么这很重要

智能合约保护着数十亿美元的资产,AI代理可能对攻击者和防御者都具有变革性。衡量模型在这一领域的能力有助于跟踪新兴的网络风险,并强调使用AI系统进行防御性审计和强化已部署合约的重要性。

EVMbench既是一个测量工具,也是一个行动号召。随着代理能力的提升,开发者和安全研究人员将AI辅助审计纳入工作流程变得越来越重要。

网络安全与双用途挑战

在最近几个月中,模型在网络安全任务上的性能有了显著提升,这使开发者和安全专业人员都受益。与此同时,研究团队一直在准备加强的网络保障措施,以支持防御性使用和更广泛的生态系统韧性。

由于网络安全本质上是双用途的,他们正在采取基于证据的迭代方法,加速防御者发现和修复漏洞的能力,同时减缓滥用。缓解措施包括安全训练、自动监控、对高级功能的可信访问,以及包括威胁情报在内的执行管道。

生态投资与未来展望

OpenAI正在投资生态系统,以促进AI在区块链安全中的负责任使用。通过EVMbench,他们希望激发更多研究,推动AI代理在防御性审计中的实际应用。随着技术的演进,EVMbench将定期更新以反映新的漏洞类型和攻击向量,确保其持续相关性。

总之,EVMbench代表了AI与区块链安全交叉领域的重要一步。它不仅提供了一个评估AI代理能力的标准化框架,还强调了AI在保护数字资产中的关键作用。随着AI代理继续进化,EVMbench将成为开发者和安全研究人员不可或缺的工具,帮助他们构建更安全、更可靠的区块链应用。

目录

  • 引言
  • 什么是EVMbench?
  • 任务环境的构建
  • 三种能力模式
  • 评估框架
  • 前沿代理的性能
  • 模型行为差异
  • 局限性
  • 为什么这很重要
  • 网络安全与双用途挑战
  • 生态投资与未来展望
黄金广告位 · 限时招商
广告位招商中

把品牌放进读者的阅读流

文章内广告位,高注意力场景,适合新品发布与活动招募。

商务合作

标签

#OpenAI News#AI代理#EVMbench#智能合约安全#区块链漏洞
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

相关文章

开放知识格式 v0.2 增加信任层:尚无 AI 代理读取,但价值远不止于此
SEO基础

开放知识格式 v0.2 增加信任层:尚无 AI 代理读取,但价值远不止于此

开放知识格式 v0.2 增加了信任层,但尚无 AI 代理读取。其真正价值在于迫使网站所有者以机器视角审视内容,通过诚实回答“来源、时效、背书”三问,揭示网站的结构与信任缺口。

8月 4约 7 分钟阅读
OpenAI如何用AI提升销售效率与客户成功
AI人工智能

OpenAI如何用AI提升销售效率与客户成功

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

8月 4约 5 分钟阅读
OpenAI 正式发布 Sora:负责任地开启 AI 视频生成新时代
AI人工智能

OpenAI 正式发布 Sora:负责任地开启 AI 视频生成新时代

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

8月 4约 6 分钟阅读

订阅我们的 Newsletter

获取最新的 SEO 与 GEO 技术资讯。

我们尊重您的隐私,随时可以取消订阅。

评论 ({count}) (0)

登录后即可参与讨论

登录注册
还没有评论,来抢沙发吧