摘要
2026年中期,编程智能体已成为AI前沿的主要验证场。搭载GPT-5.5的Codex以约83.4%领跑Terminal-Bench,Anthropic的Claude Code搭载Opus 4.8以约83.1%紧随,Google的Antigravity智能体也加入竞争。这一转变发生在OpenAI SWE-bench审计之后,随着静态基准公信力下滑,评估重心转向长周期任务、工具使用和每任务成本指标。仅Codex一款,周活跃用户已超200万。
分歧
模型阵营认为基础模型仍是核心;产品阵营认为差异化来自围绕模型的运行框架、沙箱和集成深度。企业客户则对如何可靠衡量真实场景任务提出质疑。
数据
- 约83.4%:Codex+GPT-5.5在Terminal-Bench的得分
- 约83.1%:Claude Code+Opus/Fable 5的得分
- 超200万:Codex周活跃用户数
为何重要
竞争护城河正从模型权重转向围绕它的运行框架、沙箱和集成能力。这改变了企业的采购逻辑,评判标准变成任务完成率和成本,而非基准测试标题数字。
关注焦点
不易被刷分的智能体基准,智能体在生产系统上运行的安全性与错误处理机制,开源权重智能体能否缩小差距。