코딩 에이전트가 AI 최전선의 주요 검증 무대로 부상
Codex+GPT-5.5와 Claude Code+Opus 4.8이 에이전트 리더보드를 선도하며 정적 벤치마크는 신뢰성을 잃어
리스트에 추가
아직 리스트가 없습니다.
요약
2026년 중반까지 코딩 에이전트는 AI 최전선의 주요 검증 무대가 됐다. GPT-5.5를 탑재한 Codex가 Terminal-Bench에서 약 83.4%로 선두, Anthropic의 Claude Code는 Opus 4.8과 결합해 약 83.1%로 근접하며, Google의 Antigravity 에이전트가 새로 진입했다. 이 변화는 OpenAI의 SWE-bench 감사 이후 이어진 것으로, 정적 벤치마크의 신뢰성이 떨어지면서 평가가 장기 과제 수행, 도구 사용, 태스크당 비용 지표로 이동했다. Codex 단독으로도 주간 사용자가 200만 명을 넘어섰다.
분열의 구도
모델 진영은 기반 모델이 여전히 핵심이라고 주장하고, 제품 진영은 하네스, 샌드박스, 통합 깊이에서 차별화가 이뤄진다고 본다. 기업 고객들은 실제 업무 태스크를 신뢰성 있게 측정하는 것의 한계를 묻고 있다.
수치로 보기
- 약 83.4%: Terminal-Bench에서 Codex+GPT-5.5 점수
- 약 83.1%: Claude Code+Opus/Fable 5 점수
- 200만 명 이상: Codex 주간 사용자 수
왜 중요한가
경쟁 우위의 원천이 모델 가중치에서 이를 둘러싼 하네스, 샌드박스, 통합으로 이동하고 있다. 기업의 구매 방식도 벤치마크 헤드라인이 아닌 태스크 완료율과 비용 기준으로 바뀌고 있다.
주목 사항
조작에 강한 에이전트 벤치마크, 실제 시스템에서 에이전트의 안전성과 오류 체계, 오픈웨이트 에이전트가 에이전트 격차를 좁힐 수 있는지 여부.