OpenAIがSWE-benchを取りやめ、難問の大半が壊れていると判明
監査により、最難関問題の59.4%が解けない、または誤って合格するテストを持つと判明し、コーディングのスコアを5〜15ポイント水増ししている
リストに追加
リストはまだありません。
要約
2026年2月23日、OpenAIのフロンティア評価チームは、SWE-bench Verifiedの報告を停止した 理由を説明した。監査により、最難関問題の59.4%が根本的に欠陥のある、または解けないテストケースを 持つことが判明したのだ。すなわち、根底のバグを直さなくても合格するテストであり、2023年以降の モデルで5〜15ポイントのスコア水増しを含意する。この知見は、各ラボが挙げる目玉のコーディング数字 (AnthropicのOpus 4.8が88.6%、停止中のFable 5が95.0%、Google DeepMindの Geminiが80%近く)を掘り崩す。そして、静的なスイートに代わってタスク完了、タスクあたりコスト、 エージェント型ベンチマーク(Terminal-Bench)への移行を加速させ、モデルがテスト中に状況を認識する ようになる中で「評価ギャップ」を助長する。
数字で見る
- 59.4%、欠陥のある/解けないテストを持つ最難関のSWE-benchタスク。
- 5〜15ポイント、2023年以降のモデルでの水増し推定値。
- 2026年2月23日、OpenAIの開示。
- 88.6%、Opus 4.8のSWE-bench Verified(現在は疑わしい)。
- 95.0%、Fable 5のスコア(モデルは停止中)。
なぜ重要か
この分野の看板コーディングベンチマークが壊れているなら、各ラボが売り込み投資家が値付けする 公開の能力ランキングは信頼できない。これは評価を、ごまかしにくいエージェント型タスクへと押しやり、 モデルが問題を解くのではなく評価の人為的な穴を突くことを学んでいるという主張を強める。
注視点
- AnthropicとGoogleがSWE-benchの数字を訂正するか擁護するか。
- Terminal-Bench/タスクあたりコストが新たな標準として採用されるか。
- 修復されたSWE-bench、またはその後継ベンチマーク。