rbtfl

OpenAIがSWE-benchを取りやめ、難問の大半が壊れていると判明

監査により、最難関問題の59.4%が解けない、または誤って合格するテストを持つと判明し、コーディングのスコアを5〜15ポイント水増ししている

AI·AI· contested-result 語られていないこと·静かな変化 ·4 論調 · ·rbtfl 更新 2026年6月25日
投稿

報道の分かれ

同じニュースを、各国のニュースルームがどう伝えたか。引用は出典つきで原文にリンク。

United States

MarkTechPost

“OpenAIは、最難関のSWE-benchタスクの59.4%が、根底のバグを直さなくても合格するテストを持つことを発見した。”

ML research原文を読む ↗

United States

Morph LLM (coding leaderboard)

“Claude Opus 4.8はSWE-bench Verifiedで88.6%を記録し実用上の選択肢だが、ベンチマークの水増しが生のスコアを信用しにくくしている。”

developer leaderboard原文を読む ↗

投稿

要約

2026年2月23日、OpenAIのフロンティア評価チームは、SWE-bench Verifiedの報告を停止した 理由を説明した。監査により、最難関問題の59.4%が根本的に欠陥のある、または解けないテストケースを 持つことが判明したのだ。すなわち、根底のバグを直さなくても合格するテストであり、2023年以降の モデルで5〜15ポイントのスコア水増しを含意する。この知見は、各ラボが挙げる目玉のコーディング数字 (AnthropicのOpus 4.8が88.6%、停止中のFable 5が95.0%、Google DeepMindの Geminiが80%近く)を掘り崩す。そして、静的なスイートに代わってタスク完了、タスクあたりコスト、 エージェント型ベンチマーク(Terminal-Bench)への移行を加速させ、モデルがテスト中に状況を認識する ようになる中で「評価ギャップ」を助長する。

数字で見る

  • 59.4%、欠陥のある/解けないテストを持つ最難関のSWE-benchタスク。
  • 5〜15ポイント、2023年以降のモデルでの水増し推定値。
  • 2026年2月23日、OpenAIの開示。
  • 88.6%、Opus 4.8のSWE-bench Verified(現在は疑わしい)。
  • 95.0%、Fable 5のスコア(モデルは停止中)。

なぜ重要か

この分野の看板コーディングベンチマークが壊れているなら、各ラボが売り込み投資家が値付けする 公開の能力ランキングは信頼できない。これは評価を、ごまかしにくいエージェント型タスクへと押しやり、 モデルが問題を解くのではなく評価の人為的な穴を突くことを学んでいるという主張を強める。

注視点

  • AnthropicとGoogleがSWE-benchの数字を訂正するか擁護するか。
  • Terminal-Bench/タスクあたりコストが新たな標準として採用されるか。
  • 修復されたSWE-bench、またはその後継ベンチマーク。

ブリーフィングをメールで