rbtfl

编程智能体成为AI前沿的主要验证场

Codex+GPT-5.5与Claude Code+Opus 4.8领跑智能体排行榜,静态基准测试公信力下降

人工智能·人工智能· active 生活如何改变·长远之局 ·4 视角 · ·rbtfl 更新 2026年6月25日
发布

报道分歧

同一条新闻,各国新闻编辑室如何讲述。引文均注明出处并链接原文。

United States

MarkTechPost

“Codex+GPT-5.5以83.4%领跑Terminal-Bench,Claude Code+Fable 5以83.1%位居第二。”

ML research阅读原文 ↗

Global

decodethefuture

“六项测试如今对智能体至关重要,分别是长周期任务、工具使用和成本,而非单次准确率。”

developer阅读原文 ↗

发布

摘要

2026年中期,编程智能体已成为AI前沿的主要验证场。搭载GPT-5.5的Codex以约83.4%领跑Terminal-Bench,Anthropic的Claude Code搭载Opus 4.8以约83.1%紧随,Google的Antigravity智能体也加入竞争。这一转变发生在OpenAI SWE-bench审计之后,随着静态基准公信力下滑,评估重心转向长周期任务、工具使用和每任务成本指标。仅Codex一款,周活跃用户已超200万。

分歧

模型阵营认为基础模型仍是核心;产品阵营认为差异化来自围绕模型的运行框架、沙箱和集成深度。企业客户则对如何可靠衡量真实场景任务提出质疑。

数据

  • 约83.4%:Codex+GPT-5.5在Terminal-Bench的得分
  • 约83.1%:Claude Code+Opus/Fable 5的得分
  • 超200万:Codex周活跃用户数

为何重要

竞争护城河正从模型权重转向围绕它的运行框架、沙箱和集成能力。这改变了企业的采购逻辑,评判标准变成任务完成率和成本,而非基准测试标题数字。

关注焦点

不易被刷分的智能体基准,智能体在生产系统上运行的安全性与错误处理机制,开源权重智能体能否缩小差距。

简报,直达邮箱