OpenAI 自废 SWE-bench Verified:基准污染后, AI 编程分数还能信吗?

2 月 25 日
 Zane3

先说结论:跑分看个参考就行,别太当真。

OpenAI 最近发了篇博文,宣布停止使用自家的 SWE-bench Verified 基准。查出了两个致命问题:

问题一:数据污染

SWE-bench 的题目来自开源 GitHub 仓库,而这些仓库也是模型训练数据的来源。OpenAI 做了污染检测,发现所有前沿模型( GPT-5.2 、Claude Opus 4.5 、Gemini 3 Flash )都能复现标准答案:

这不是能力强,是背过答案。

问题二:测试设计缺陷

审计了 138 道题(约 28%),每题至少 6 名工程师独立审查:

SWE-bench Verified vs Pro

维度 Verified Pro
题量 500 1865
语言 Python Python/Go/TS/JS
平均改动量 11 行 107 行
仓库数 12 41

同一批模型:Verified ~80%,Pro ~43-50%。分数腰斩。

原文: https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/

1461 次点击
所在节点    分享发现
0 条回复

这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。

https://v2ex.ih06.com/t/1193932

V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。

V2EX is a community of developers, designers and creative people.

© 2021 V2EX