Bingdada 技術部落格Bingdada 技術部落格
首頁部落格SEOGEOAEOAI工具關於
登入註冊
Logo

Bingdada 技術部落格

專注於 SEO 搜尋引擎優化、GEO 生成式引擎優化以及未來人工智慧發展趨勢的技術部落格。

快速連結

  • 首頁
  • 部落格文章
  • 關於我們

聯絡方式

  • 398848662@qq.com

訂閱我們的 Newsletter,獲取最新的 SEO 與 GEO 技術資訊。

© 2024 Bingdada 技术博客. All rights reserved.

本文為簡體中文,可一鍵翻譯為 繁體中文
首頁部落格AI人工智能OpenAI News:代码评估中信号与噪声的分离——SWE-Bench Pro审计揭示约30%任务存在缺陷
OpenAI News:代码评估中信号与噪声的分离——SWE-Bench Pro审计揭示约30%任务存在缺陷
AI人工智能

OpenAI News:代码评估中信号与噪声的分离——SWE-Bench Pro审计揭示约30%任务存在缺陷

bingdadabingdada
八月 2, 2026141 次閱讀約 6 分鐘閱讀
post.quickAnswer

OpenAI 对 SWE-Bench Pro 的详细审计发现约 30% 的任务存在缺陷,主要源于过于严格的测试、提示不明确、低覆盖率测试和误导性提示。这强调了评估基准持续审计的重要性。

post.keyTakeaways
  • 引言:评估准确性的重要性
  • SWE-Bench Pro 的设计初衷
  • 审计发现:约30%的任务存在问题
  • 方法论:确保评估质量
  • 结果与建议
目錄

目錄

  • 引言:评估准确性的重要性
  • SWE-Bench Pro
  • 审计发现:约30%的任务存在问题
  • 方法论:确保评估质量
  • 结果与建议
  • 结论与未来方向
  • 相关阅读
  • 关于 Bingdada

引言:评估准确性的重要性

在人工智能模型开发中,准确衡量模型能力对于安全部署和决策至关重要。OpenAI 在其准备框架(Preparedness Framework)下,每次发布模型时都会报告多种外部和内部基准测试结果,以跟踪模型进展。然而,当评估本身存在缺陷时,结果可能误导对能力的理解,错误呈现安全案例,并影响研究优先级。 此前,OpenAI 发现广泛使用的代码基准 SWE-bench Verified 存在根本性设计和污染问题,该评估不再能提供有意义的软件开发能力信号。当时,OpenAI 鼓励社区转向 SWE-Bench Pro。

SWE-Bench Pro

的设计初衷 SWE-Bench Pro 旨在改进 SWE-bench Verified,通过测试模型在更长周期和更真实编码任务上的表现,更好地追踪智能体编码能力。与 SWE-bench Verified 类似,任务从一组公共和私有仓库的功能变更历史中程序化生成。模型需要实现一个解决方案,通过新功能的测试,同时不破坏现有功能。在 731 个任务的公开分割中,前沿模型在八个月内通过率从 23.3% 提升至 80.3%。

审计发现:约30%的任务存在问题

OpenAI 对 SWE-Bench Pro 进行了类似审计,使用数据点分析管道审查数据集。该管道检查模型尝试、任务元数据和失败痕迹,以标记可能的评估缺陷。每个被标记的任务随后通过多个调查智能体通道评估,并由五位经验丰富的软件工程师独立审查,分歧升级以进一步调查。 审计发现,数据集中相当大比例的任务存在破坏性问题。数据点分析管道标记了 200 个(27.4%)有缺陷的任务,而人工标注活动识别出 249 个(34.1%)。问题主要分为四类: 1. 过于严格的测试:强制要求提示中未指定的实现细节,导致许多功能正确的提交被判定为失败。

  1. 提示不明确:省略了隐藏测试强制要求且无法合理推断的需求。
  2. 低覆盖率测试:未充分检查请求的功能,因此不完整的修复可能通过。
  3. 误导性提示:引导模型走向错误行为或与测试要求矛盾。 OpenAI 估计 SWE-Bench Pro 中约 30% 的任务存在缺陷,并建议模型开发者仔细检查结果。

方法论:确保评估质量

OpenAI 的目标是确保任务失败反映模型真正局限,任务成功反映对提示要求的完整有效解决方案。为检查评估数据质量,创建了质量保证管道,评估每个数据点是否准确反映模型能力。 初始数据质量管道标记问题以供审查。通过更深入的智能体辅助审计和与经验丰富的工程师合作的人工标注活动进行验证。初始自动过滤器检查模型指令、模型尝试和用于评分的测试,标记可能有问题或错误的示例。该过滤器标记了 286 个潜在有缺陷的任务。然后通过两种方式对该子集进行深入审查:

  • 人工监督的智能体审查:使用基于 Codex 的调查智能体进行审计,这些智能体可访问任务仓库和环境,帮助区分合理任务歧义与真正的不明确性。智能体可以运行测试、检查仓库文件,并调查模型尝试及其常见失败模式。经过多次独立重复审计后,研究人员审查摘要、做出最终判断并标记可能的问题。

  • 人工标注活动:与经验丰富的软件工程师合作,对标记子集进行审查。每位工程师独立审查任务,从可见问题陈述、测试用例和真实参考解决方案开始,然后使用管道分析或转录作为支持上下文。工程师分配标签和严重性评级,并升级分歧或低信心案例。

结果与建议

人类审查员比调查智能体更可能将任务标记为有缺陷。两种审查路径在类别上存在一些分歧,但在任何标记任务中,“未缺陷”都不是最常见的人类标签。在智能体管道标记的类别中,审查员的判断在 74% 的案例中重叠。 与智能体管道相比,人类审查员更可能为任务选择多个标签,表明他们发现任务以多种方式存在缺陷或不能整齐地归入单一类别。这表明智能体加审查员管道导致保守标记:它捕获了人类识别的相同广泛失败模式,同时低估了审查员看到额外或重叠问题的案例。

结论与未来方向

OpenAI 的审计揭示了 SWE-Bench Pro 中约 30% 的任务存在缺陷,主要源于过于严格的测试、提示不明确、低覆盖率测试和误导性提示。这些发现强调了策划困难但公平的基准的难度,以及智能体用于可扩展数据质量检查的日益增长的效用。OpenAI 建议模型开发者仔细检查结果,并考虑使用类似管道进行质量保证。 对于 AI 社区而言,这提醒我们评估基准本身需要持续审计和更新。随着模型能力提升,旧基准可能失去区分度或引入噪声。OpenAI 将继续发布评估结果,并鼓励社区采用更严格的质量控制措施。 关键词:OpenAI News, SWE-Bench Pro, 代码评估, 基准测试, AI 模型能力


相关阅读

  • OpenAI 如何将合同转化为可搜索数据:内部 AI 代理架构解析

  • GPT-5.2-Codex 系统卡附录:OpenAI 最新编程模型的安全与能力解析

  • GPT-Red:解锁自我改进,提升AI模型鲁棒性

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。 编辑团队:内容策划 · 技术编辑 · AI 研究组 网站:bingdada.com © 2026 Bingdada. 保留所有权利。

目錄

  • 引言:评估准确性的重要性
  • SWE-Bench Pro
  • 审计发现:约30%的任务存在问题
  • 方法论:确保评估质量
  • 结果与建议
  • 结论与未来方向
  • 相关阅读
  • 关于 Bingdada
黃金廣告位 · 限時招商
廣告位招商中

把品牌放進讀者的閱讀流

文章內廣告位,高注意力場景,適合新品發布與活動招募。

商務合作

標籤

#OpenAI News#SWE-Bench Pro#代码评估#基准测试#AI 模型能力
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

相關文章

当IPO遇上AI代理:律所如何把上市准备从数月压缩到数周
AI人工智能

当IPO遇上AI代理:律所如何把上市准备从数月压缩到数周

国际律所 Cooley 基于 ChatGPT Work 打造 GO Public,用代理编排层重构 IPO 准备流程:AI 负责信息梳理,律师专注判断与决策。本文解析其运作逻辑,并对比国内法律 AI 的落地路径。

9月 18約 5 分鐘閱讀
银发族也能玩转AI:OpenAI联手OATS把ChatGPT课堂开进美国十城
AI人工智能

银发族也能玩转AI:OpenAI联手OATS把ChatGPT课堂开进美国十城

OpenAI 与 AARP 旗下 OATS 合作,在美国10座城市为老年人开设免费 ChatGPT 线下工作坊,课程兼顾日常应用与防诈骗教育,为AI普惠提供了可复制的社区样本。

9月 17約 6 分鐘閱讀
OpenAI 让全员用自然语言查数据,企业分析的门槛正在消失
AI人工智能

OpenAI 让全员用自然语言查数据,企业分析的门槛正在消失

OpenAI 在 ChatGPT Work 中推出 Data agent,让员工用自然语言连接企业数据、生成看板并直接行动。本文解析其数据源、语义层与权限设计,并对比国内同类进展。

9月 16約 5 分鐘閱讀

訂閱我們的 Newsletter

獲取最新的 SEO 與 GEO 技術資訊。

我們尊重您的隱私,隨時可以取消訂閱。

留言 ({count}) (0)

登入後即可參與討論

登入註冊
還沒有留言,來搶沙發吧