rbtfl

コーディングエージェントがフロンティアAIの主要な実証の場に

Codex+GPT-5.5とClaudeコード+Opus 4.8がエージェントリーダーボードを席巻、静的ベンチマークは信頼性を失う

AI·AI· active 暮らしはどう変わるか·長期戦 ·4 論調 · ·rbtfl 更新 2026年6月25日
投稿

報道の分かれ

同じニュースを、各国のニュースルームがどう伝えたか。引用は出典つきで原文にリンク。

United States

MarkTechPost

“Codex+GPT-5.5がTerminal-Benchで83.4%を記録しトップ、Claude Code+Fable 5は83.1%で2位。”

ML research原文を読む ↗

Global

decodethefuture

“エージェントに今重要なのは6つのテスト、長期的視野、ツール活用、コストであり、一問一答の精度ではない。”

developer原文を読む ↗

投稿

概要

2026年半ばまでに、コーディングエージェントはフロンティアAIの主要な実証の場となった。GPT-5.5を搭載したCodexがTerminal-Benchで約83.4%の首位、AnthropicのClaudeコードはOpus 4.8と組み合わせて約83.1%で続く。GoogleのAntigravityエージェントも参入した。このシフトはオープンAIのSWE-benchの監査に続くもので、静的ベンチマークの信頼性が失われるなか、評価は長期的視野、ツール活用、タスクあたりコストへと移行した。Codex単体ですでに週間ユーザー数は200万人超に上る。

対立の構図

モデル側はベースモデルが依然として核心だと主張し、製品側はハーネス、サンドボックス、統合の深さに差別化の源泉があると見る。企業顧客は実世界タスクの信頼できる計測の限界を問うている。

数字で見る

  • 約83.4%: Terminal-BenchでのCodex+GPT-5.5のスコア
  • 約83.1%: Claude Code+Opus/Fable 5のスコア
  • 200万人超: Codexの週間ユーザー数

なぜ重要か

競争優位の源泉がモデルの重みから、その周囲のハーネス、サンドボックス、統合へと移行している。企業の購買行動もベンチマークの見出しではなく、タスク完了率とコストに基づくよう変わっている。

注目点

ゲームに強いエージェントベンチマーク、本番システム上でのエージェントの安全性・エラー対応体制、オープンウェイトエージェントがエージェントのギャップを縮められるかどうか。

ブリーフィングをメールで