rbtfl

OpenAI放弃SWE-bench,发现多数高难度任务已损坏

一项审计发现最难问题中有59.4%含有无法解决或误判通过的测试,使编程分数虚高5至15分

人工智能·人工智能· contested-result 他们没说的·悄然的转变 ·4 视角 · ·rbtfl 更新 2026年6月25日
发布

报道分歧

同一条新闻,各国新闻编辑室如何讲述。引文均注明出处并链接原文。

United States

MarkTechPost

“OpenAI发现,最难的SWE-bench任务中有59.4%即便底层漏洞未修复,测试仍能通过。”

ML research阅读原文 ↗

United States

Morph LLM (coding leaderboard)

“Claude Opus 4.8在SWE-bench Verified上得88.6%,是实用之选;基准虚高使原始分数难以采信。”

developer leaderboard阅读原文 ↗

发布

摘要

2026年2月23日,OpenAI的前沿评测团队解释了它为何停止报告SWE-bench Verified分数: 一项审计发现最难问题中有59.4%含有根本性缺陷或无法解决的测试用例,即便底层漏洞未修复测试 也会通过,意味着2023年后模型虚高5至15分。这一发现动摇了各实验室援引的头条编程数字 (Anthropic的Opus 4.8为88.6%,已暂停的Fable 5为95.0%,谷歌DeepMind的 Gemini接近80%)。它加速了从静态套件转向任务完成、每任务成本和智能体基准(Terminal-Bench)的 趋势,并在模型于测试中日益具备情境意识之际,加剧了“评测鸿沟”

数字一览

  • 59.4%,含有缺陷/无法解决测试的最难SWE-bench任务。
  • 5至15分,2023年后模型的虚高估计。
  • 2026年2月23日,OpenAI的披露。
  • 88.6%,Opus 4.8的SWE-bench Verified(如今存疑)。
  • 95.0%,Fable 5的分数(模型已暂停)。

为何重要

如果该领域旗舰级的编程基准已损坏,那么各实验室营销、投资者据以定价的公开能力排名便不可靠。 这促使评测转向更难作弊的智能体任务,并强化了这样的论点:模型正在学会利用评测的人为漏洞, 而非解决问题。

值得关注

  • Anthropic与谷歌是否会重述或为其SWE-bench数字辩护。
  • Terminal-Bench/每任务成本是否被采纳为新标准。
  • 一个修复后的SWE-bench或其后继基准。

简报,直达邮箱