Bingdada 技术博客Bingdada 技术博客
首页博客SEOGEOAI工具关于
登录注册
Logo

Bingdada 技术博客

专注于SEO搜索引擎优化和GEO生成式引擎优化以及未来人工智能发展趋势的技术博客

快速链接

  • 首页
  • 博客文章
  • 关于我们

联系方式

  • 398848662@qq.com

订阅我们的 Newsletter,获取最新的 SEO 和 GEO 技术资讯。

© 2024 Bingdada 技术博客. All rights reserved.

首页博客AI人工智能OpenAI News:代码评估中信号与噪声的分离——SWE-Bench Pro审计揭示约30%任务存在缺陷
OpenAI News:代码评估中信号与噪声的分离——SWE-Bench Pro审计揭示约30%任务存在缺陷
AI人工智能

OpenAI News:代码评估中信号与噪声的分离——SWE-Bench Pro审计揭示约30%任务存在缺陷

bingdadabingdada
八月 2, 20267 次阅读约 6 分钟阅读
快速回答

OpenAI 对 SWE-Bench Pro 的详细审计发现约 30% 的任务存在缺陷,主要源于过于严格的测试、提示不明确、低覆盖率测试和误导性提示。这强调了评估基准持续审计的重要性。

核心要点
  • 引言:评估准确性的重要性
  • SWE-Bench Pro 的设计初衷
  • 审计发现:约30%的任务存在问题
  • 方法论:确保评估质量
  • 结果与建议
目录

目录

  • 引言:评估准确性的重要性
  • SWE-Bench Pro 的设计初衷
  • 审计发现:约30%的任务存在问题
  • 方法论:确保评估质量
  • 结果与建议
  • 结论与未来方向

引言:评估准确性的重要性

在人工智能模型开发中,准确衡量模型能力对于安全部署和决策至关重要。OpenAI 在其准备框架(Preparedness Framework)下,每次发布模型时都会报告多种外部和内部基准测试结果,以跟踪模型进展。然而,当评估本身存在缺陷时,结果可能误导对能力的理解,错误呈现安全案例,并影响研究优先级。

此前,OpenAI 发现广泛使用的代码基准 SWE-bench Verified 存在根本性设计和污染问题,该评估不再能提供有意义的软件开发能力信号。当时,OpenAI 鼓励社区转向 SWE-Bench Pro。

SWE-Bench Pro 的设计初衷

SWE-Bench Pro 旨在改进 SWE-bench Verified,通过测试模型在更长周期和更真实编码任务上的表现,更好地追踪智能体编码能力。与 SWE-bench Verified 类似,任务从一组公共和私有仓库的功能变更历史中程序化生成。模型需要实现一个解决方案,通过新功能的测试,同时不破坏现有功能。在 731 个任务的公开分割中,前沿模型在八个月内通过率从 23.3% 提升至 80.3%。

审计发现:约30%的任务存在问题

OpenAI 对 SWE-Bench Pro 进行了类似审计,使用数据点分析管道审查数据集。该管道检查模型尝试、任务元数据和失败痕迹,以标记可能的评估缺陷。每个被标记的任务随后通过多个调查智能体通道评估,并由五位经验丰富的软件工程师独立审查,分歧升级以进一步调查。

审计发现,数据集中相当大比例的任务存在破坏性问题。数据点分析管道标记了 200 个(27.4%)有缺陷的任务,而人工标注活动识别出 249 个(34.1%)。问题主要分为四类:

  1. 过于严格的测试:强制要求提示中未指定的实现细节,导致许多功能正确的提交被判定为失败。
  2. 提示不明确:省略了隐藏测试强制要求且无法合理推断的需求。
  3. 低覆盖率测试:未充分检查请求的功能,因此不完整的修复可能通过。
  4. 误导性提示:引导模型走向错误行为或与测试要求矛盾。

OpenAI 估计 SWE-Bench Pro 中约 30% 的任务存在缺陷,并建议模型开发者仔细检查结果。

方法论:确保评估质量

OpenAI 的目标是确保任务失败反映模型真正局限,任务成功反映对提示要求的完整有效解决方案。为检查评估数据质量,创建了质量保证管道,评估每个数据点是否准确反映模型能力。

初始数据质量管道标记问题以供审查。通过更深入的智能体辅助审计和与经验丰富的工程师合作的人工标注活动进行验证。初始自动过滤器检查模型指令、模型尝试和用于评分的测试,标记可能有问题或错误的示例。该过滤器标记了 286 个潜在有缺陷的任务。然后通过两种方式对该子集进行深入审查:

  • 人工监督的智能体审查:使用基于 Codex 的调查智能体进行审计,这些智能体可访问任务仓库和环境,帮助区分合理任务歧义与真正的不明确性。智能体可以运行测试、检查仓库文件,并调查模型尝试及其常见失败模式。经过多次独立重复审计后,研究人员审查摘要、做出最终判断并标记可能的问题。
  • 人工标注活动:与经验丰富的软件工程师合作,对标记子集进行审查。每位工程师独立审查任务,从可见问题陈述、测试用例和真实参考解决方案开始,然后使用管道分析或转录作为支持上下文。工程师分配标签和严重性评级,并升级分歧或低信心案例。

结果与建议

人类审查员比调查智能体更可能将任务标记为有缺陷。两种审查路径在类别上存在一些分歧,但在任何标记任务中,“未缺陷”都不是最常见的人类标签。在智能体管道标记的类别中,审查员的判断在 74% 的案例中重叠。

与智能体管道相比,人类审查员更可能为任务选择多个标签,表明他们发现任务以多种方式存在缺陷或不能整齐地归入单一类别。这表明智能体加审查员管道导致保守标记:它捕获了人类识别的相同广泛失败模式,同时低估了审查员看到额外或重叠问题的案例。

结论与未来方向

OpenAI 的审计揭示了 SWE-Bench Pro 中约 30% 的任务存在缺陷,主要源于过于严格的测试、提示不明确、低覆盖率测试和误导性提示。这些发现强调了策划困难但公平的基准的难度,以及智能体用于可扩展数据质量检查的日益增长的效用。OpenAI 建议模型开发者仔细检查结果,并考虑使用类似管道进行质量保证。

对于 AI 社区而言,这提醒我们评估基准本身需要持续审计和更新。随着模型能力提升,旧基准可能失去区分度或引入噪声。OpenAI 将继续发布评估结果,并鼓励社区采用更严格的质量控制措施。

关键词:OpenAI News, SWE-Bench Pro, 代码评估, 基准测试, AI 模型能力

目录

  • 引言:评估准确性的重要性
  • SWE-Bench Pro 的设计初衷
  • 审计发现:约30%的任务存在问题
  • 方法论:确保评估质量
  • 结果与建议
  • 结论与未来方向
黄金广告位 · 限时招商
广告位招商中

把品牌放进读者的阅读流

文章内广告位,高注意力场景,适合新品发布与活动招募。

商务合作

标签

#OpenAI News#SWE-Bench Pro#代码评估#基准测试#AI 模型能力
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

相关文章

OpenAI如何用AI提升销售效率与客户成功
AI人工智能

OpenAI如何用AI提升销售效率与客户成功

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

8月 4约 5 分钟阅读
OpenAI 正式发布 Sora:负责任地开启 AI 视频生成新时代
AI人工智能

OpenAI 正式发布 Sora:负责任地开启 AI 视频生成新时代

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

8月 4约 6 分钟阅读
Sora 2 正式发布:AI视频生成迎来GPT-3.5时刻
AI人工智能

Sora 2 正式发布:AI视频生成迎来GPT-3.5时刻

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。

8月 4约 5 分钟阅读

订阅我们的 Newsletter

获取最新的 SEO 与 GEO 技术资讯。

我们尊重您的隐私,随时可以取消订阅。

评论 ({count}) (0)

登录后即可参与讨论

登录注册
还没有评论,来抢沙发吧