
AI人工智能
bingdada
为什么我们不再使用SWE-bench Verified评估模型?OpenAI最新分析揭示关键缺陷
OpenAI发布研究宣布停止使用SWE-bench Verified评估模型编程能力,发现测试用例缺陷导致正确解决方案被拒绝,以及训练数据污染问题。该基准得分不再反映真实能力提升,OpenAI建议转向SWE-bench Pro。
2026-08-026约 6 分钟阅读
浏览所有关于 SEO、GEO 和搜索优化的技术文章

OpenAI发布研究宣布停止使用SWE-bench Verified评估模型编程能力,发现测试用例缺陷导致正确解决方案被拒绝,以及训练数据污染问题。该基准得分不再反映真实能力提升,OpenAI建议转向SWE-bench Pro。