摘要
2026年2月23日,OpenAI的前沿评测团队解释了它为何停止报告SWE-bench Verified分数: 一项审计发现最难问题中有59.4%含有根本性缺陷或无法解决的测试用例,即便底层漏洞未修复测试 也会通过,意味着2023年后模型虚高5至15分。这一发现动摇了各实验室援引的头条编程数字 (Anthropic的Opus 4.8为88.6%,已暂停的Fable 5为95.0%,谷歌DeepMind的 Gemini接近80%)。它加速了从静态套件转向任务完成、每任务成本和智能体基准(Terminal-Bench)的 趋势,并在模型于测试中日益具备情境意识之际,加剧了“评测鸿沟”。
数字一览
- 59.4%,含有缺陷/无法解决测试的最难SWE-bench任务。
- 5至15分,2023年后模型的虚高估计。
- 2026年2月23日,OpenAI的披露。
- 88.6%,Opus 4.8的SWE-bench Verified(如今存疑)。
- 95.0%,Fable 5的分数(模型已暂停)。
为何重要
如果该领域旗舰级的编程基准已损坏,那么各实验室营销、投资者据以定价的公开能力排名便不可靠。 这促使评测转向更难作弊的智能体任务,并强化了这样的论点:模型正在学会利用评测的人为漏洞, 而非解决问题。
值得关注
- Anthropic与谷歌是否会重述或为其SWE-bench数字辩护。
- Terminal-Bench/每任务成本是否被采纳为新标准。
- 一个修复后的SWE-bench或其后继基准。