
OpenAI 对 SWE-Bench Pro 的详细审计发现约 30% 的任务存在缺陷,主要源于过于严格的测试、提示不明确、低覆盖率测试和误导性提示。这强调了评估基准持续审计的重要性。
在人工智能模型开发中,准确衡量模型能力对于安全部署和决策至关重要。OpenAI 在其准备框架(Preparedness Framework)下,每次发布模型时都会报告多种外部和内部基准测试结果,以跟踪模型进展。然而,当评估本身存在缺陷时,结果可能误导对能力的理解,错误呈现安全案例,并影响研究优先级。
此前,OpenAI 发现广泛使用的代码基准 SWE-bench Verified 存在根本性设计和污染问题,该评估不再能提供有意义的软件开发能力信号。当时,OpenAI 鼓励社区转向 SWE-Bench Pro。
SWE-Bench Pro 旨在改进 SWE-bench Verified,通过测试模型在更长周期和更真实编码任务上的表现,更好地追踪智能体编码能力。与 SWE-bench Verified 类似,任务从一组公共和私有仓库的功能变更历史中程序化生成。模型需要实现一个解决方案,通过新功能的测试,同时不破坏现有功能。在 731 个任务的公开分割中,前沿模型在八个月内通过率从 23.3% 提升至 80.3%。
OpenAI 对 SWE-Bench Pro 进行了类似审计,使用数据点分析管道审查数据集。该管道检查模型尝试、任务元数据和失败痕迹,以标记可能的评估缺陷。每个被标记的任务随后通过多个调查智能体通道评估,并由五位经验丰富的软件工程师独立审查,分歧升级以进一步调查。
审计发现,数据集中相当大比例的任务存在破坏性问题。数据点分析管道标记了 200 个(27.4%)有缺陷的任务,而人工标注活动识别出 249 个(34.1%)。问题主要分为四类:
OpenAI 估计 SWE-Bench Pro 中约 30% 的任务存在缺陷,并建议模型开发者仔细检查结果。
OpenAI 的目标是确保任务失败反映模型真正局限,任务成功反映对提示要求的完整有效解决方案。为检查评估数据质量,创建了质量保证管道,评估每个数据点是否准确反映模型能力。
初始数据质量管道标记问题以供审查。通过更深入的智能体辅助审计和与经验丰富的工程师合作的人工标注活动进行验证。初始自动过滤器检查模型指令、模型尝试和用于评分的测试,标记可能有问题或错误的示例。该过滤器标记了 286 个潜在有缺陷的任务。然后通过两种方式对该子集进行深入审查:
人类审查员比调查智能体更可能将任务标记为有缺陷。两种审查路径在类别上存在一些分歧,但在任何标记任务中,“未缺陷”都不是最常见的人类标签。在智能体管道标记的类别中,审查员的判断在 74% 的案例中重叠。
与智能体管道相比,人类审查员更可能为任务选择多个标签,表明他们发现任务以多种方式存在缺陷或不能整齐地归入单一类别。这表明智能体加审查员管道导致保守标记:它捕获了人类识别的相同广泛失败模式,同时低估了审查员看到额外或重叠问题的案例。
OpenAI 的审计揭示了 SWE-Bench Pro 中约 30% 的任务存在缺陷,主要源于过于严格的测试、提示不明确、低覆盖率测试和误导性提示。这些发现强调了策划困难但公平的基准的难度,以及智能体用于可扩展数据质量检查的日益增长的效用。OpenAI 建议模型开发者仔细检查结果,并考虑使用类似管道进行质量保证。
对于 AI 社区而言,这提醒我们评估基准本身需要持续审计和更新。随着模型能力提升,旧基准可能失去区分度或引入噪声。OpenAI 将继续发布评估结果,并鼓励社区采用更严格的质量控制措施。
关键词:OpenAI News, SWE-Bench Pro, 代码评估, 基准测试, AI 模型能力
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。