
为什么我们不再使用SWE-bench Verified评估模型?OpenAI最新分析揭示关键缺陷
OpenAI发布研究宣布停止使用SWE-bench Verified评估模型编程能力,发现测试用例缺陷导致正确解决方案被拒绝,以及训练数据污染问题。该基准得分不再反映真实能力提升,OpenAI建议转向SWE-bench Pro。
- 为什么我们不再使用SWE-bench Verified评估模型?OpenAI最新分析揭示关键缺陷
目录
为什么我们不再使用SWE-bench Verified评估模型?OpenAI最新分析揭示关键缺陷
2026年2月23日,OpenAI发布了一项重要研究,宣布停止使用SWE-bench Verified作为前沿模型编程能力的评估基准。这一决定源于对基准测试本身存在严重缺陷的发现,这些缺陷使得测试结果无法真实反映模型的自主软件工程能力。本文将深入分析OpenAI的研究发现,探讨其对行业评估标准的影响,并展望未来的评估方向。
SWE-bench Verified的诞生与初衷
自2024年8月OpenAI首次发布SWE-bench Verified以来,它迅速成为业界衡量模型在自主软件工程任务上进展的标准指标。这一基准测试旨在解决原始SWE-bench评估中存在的问题,如某些任务因测试用例缺陷而无法完成等。原始SWE-bench评估于2023年发布,每个问题源自12个开源Python仓库中的已解决GitHub问题,并配以相应的拉取请求。模型需要根据问题描述生成代码更改,并通过两组测试:一组是失败测试(修复后应通过),另一组是回归测试(确保无关功能不受影响)。
然而,原始评估存在多个问题:某些单元测试过于具体或与任务不匹配,导致正确修复被拒绝;许多任务描述不明确,允许多种有效解释,但测试仅覆盖其中一种;环境配置差异(如Linux与Windows、Python版本不同)可能导致测试意外失败。为此,OpenAI与专家软件工程师合作,审查了1,699个SWE-bench问题,筛选出500个高质量问题,形成了SWE-bench Verified。
进展放缓引发质疑
在最初的飞跃之后,SWE-bench Verified上的最新技术进展明显放缓——在过去6个月内,得分仅从74.9%提升至80.9%。这一现象引发了一个关键问题:剩余的失败是反映了模型能力的局限,还是数据集本身的特性?OpenAI的分析给出了令人震惊的答案。
两大核心缺陷
OpenAI的研究发现了SWE-bench Verified的两个主要问题,表明该基准已不再适合衡量前沿模型的自主软件工程能力:
1. 测试用例拒绝正确解决方案
OpenAI审计了模型经常失败的数据集子集(占27.6%),发现其中至少59.4%的问题存在有缺陷的测试用例,这些测试用例错误地拒绝了功能正确的提交。尽管在创建SWE-bench Verified时已尽力改进,但问题依然存在。
具体表现为两种模式:
- 过窄的测试用例:占审计问题的35.5%,这些测试用例强制执行特定的实现细节,导致许多功能正确的提交被无效化。例如,测试可能要求使用特定函数名或实现方式,而模型生成的等效解决方案却被拒绝。
- 过宽的测试用例:占审计问题的18.8%,这些测试检查了问题描述中未指定的额外功能。模型可能正确解决了原始问题,但因未处理未要求的额外功能而失败。
- 其他杂项问题:占5.1%,包括测试环境依赖、不明确的错误信息等。
一个典型例子是pylint-dev__pylint-4551问题,其中拉取请求引入了新函数get_annotation,但测试用例却要求模型必须使用特定命名,导致功能正确的解决方案被拒绝。
2. 训练数据污染
更严重的问题是,所有前沿模型在训练过程中都可能接触过SWE-bench问题及其解决方案。SWE-bench的问题来自开源仓库,许多模型提供商将这些仓库用于训练目的。OpenAI的分析发现,所有测试的前沿模型都能复现原始的人工编写的错误修复(即黄金补丁),或逐字复现某些任务的问题描述细节,这表明它们至少在训练中见过部分问题和解决方案。
研究发现,在训练中见过问题的模型更有可能成功,因为它们拥有通过测试所需的额外信息,而这些信息在问题描述中并未明确给出。这意味着SWE-bench Verified得分的提升不再反映模型真实软件开发能力的进步,而是越来越多地反映模型在训练时接触基准测试的程度。
对行业的影响与建议
基于这些发现,OpenAI已停止报告SWE-bench Verified得分,并建议其他模型开发者采取同样做法。这一决定对AI行业具有深远影响:
- 评估标准需要更新:许多前沿模型发布时都引用SWE-bench Verified得分作为能力证明,但这些得分可能已被污染,不再具有参考价值。
- 推动新基准开发:OpenAI正在构建新的、未受污染的评估体系,以更好地跟踪编程能力。直到这些新基准就绪,OpenAI建议报告SWE-bench Pro的结果。
- 行业协作至关重要:整个研究社区需要聚焦于开发更可靠的评估方法,避免类似的数据污染问题。
未来展望:更可靠的评估体系
OpenAI的研究强调了评估基准设计的重要性。理想的基准应具备以下特征:
- 测试用例与任务描述严格对齐:避免过窄或过宽的测试,确保功能正确的解决方案不被错误拒绝。
- 防止数据污染:使用私有或动态生成的问题集,确保模型在训练中无法接触。
- 环境无关性:测试结果不应依赖于特定的操作系统、库版本或配置。
- 多维度评估:不仅关注代码正确性,还应考虑代码质量、效率、可维护性等。
结论
SWE-bench Verified的退场标志着AI评估领域的一个重要转折点。它提醒我们,基准测试本身需要不断演进和验证,才能继续作为能力进步的可靠指标。OpenAI的坦诚分析为行业树立了榜样,即当评估工具不再有效时,应主动承认并推动改进。对于开发者、研究人员和用户而言,这意味着在参考任何模型得分时,都需要保持批判性思维,理解其背后的局限性和潜在偏差。
随着新评估体系的建立,我们有望获得更准确、更可靠的模型能力衡量标准,从而推动AI编程技术的健康发展。
bingdada
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。
相关文章

OpenAI如何用AI提升销售效率与客户成功
OpenAI销售团队规模一年增长三倍,通过构建GTM Assistant智能助手,将顶尖销售经验系统化,实现销售生产力提升20%,让销售代表每周多出一天时间专注于客户关系。

OpenAI 正式发布 Sora:负责任地开启 AI 视频生成新时代
OpenAI 正式发布 AI 视频生成模型 Sora,通过水印溯源、肖像权控制、青少年保护、内容过滤等多维安全策略,在推动视频创作创新的同时,构建了负责任的 AI 应用框架。

Sora 2 正式发布:AI视频生成迎来GPT-3.5时刻
OpenAI 发布 Sora 2,视频生成模型迎来 GPT-3.5 时刻。新模型在物理准确性、可控性上大幅提升,支持同步音效和对话,并推出基于‘角色’功能的社交 iOS 应用。
订阅我们的 Newsletter
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。
