コーディングエージェントがフロンティアAIの主要な実証の場に
Codex+GPT-5.5とClaudeコード+Opus 4.8がエージェントリーダーボードを席巻、静的ベンチマークは信頼性を失う
リストに追加
リストはまだありません。
概要
2026年半ばまでに、コーディングエージェントはフロンティアAIの主要な実証の場となった。GPT-5.5を搭載したCodexがTerminal-Benchで約83.4%の首位、AnthropicのClaudeコードはOpus 4.8と組み合わせて約83.1%で続く。GoogleのAntigravityエージェントも参入した。このシフトはオープンAIのSWE-benchの監査に続くもので、静的ベンチマークの信頼性が失われるなか、評価は長期的視野、ツール活用、タスクあたりコストへと移行した。Codex単体ですでに週間ユーザー数は200万人超に上る。
対立の構図
モデル側はベースモデルが依然として核心だと主張し、製品側はハーネス、サンドボックス、統合の深さに差別化の源泉があると見る。企業顧客は実世界タスクの信頼できる計測の限界を問うている。
数字で見る
- 約83.4%: Terminal-BenchでのCodex+GPT-5.5のスコア
- 約83.1%: Claude Code+Opus/Fable 5のスコア
- 200万人超: Codexの週間ユーザー数
なぜ重要か
競争優位の源泉がモデルの重みから、その周囲のハーネス、サンドボックス、統合へと移行している。企業の購買行動もベンチマークの見出しではなく、タスク完了率とコストに基づくよう変わっている。
注目点
ゲームに強いエージェントベンチマーク、本番システム上でのエージェントの安全性・エラー対応体制、オープンウェイトエージェントがエージェントのギャップを縮められるかどうか。