rbtfl

코딩 에이전트가 AI 최전선의 주요 검증 무대로 부상

Codex+GPT-5.5와 Claude Code+Opus 4.8이 에이전트 리더보드를 선도하며 정적 벤치마크는 신뢰성을 잃어

AI·AI· active 삶은 어떻게 바뀌는가·장기전 ·4 시각 · ·rbtfl 업데이트 2026년 6월 25일
게시

보도의 갈림

같은 뉴스를 각국 뉴스룸이 어떻게 전했는지. 인용문은 출처와 원문 링크를 밝힙니다.

United States

MarkTechPost

“Codex+GPT-5.5가 Terminal-Bench에서 83.4%로 선두, Claude Code+Fable 5는 83.1%로 2위.”

ML research원문 보기 ↗

Global

decodethefuture

“에이전트에게 이제 중요한 것은 6개 테스트, 장기 과제 수행, 도구 사용, 비용이며 단발성 정확도가 아니다.”

developer원문 보기 ↗

게시

요약

2026년 중반까지 코딩 에이전트는 AI 최전선의 주요 검증 무대가 됐다. GPT-5.5를 탑재한 Codex가 Terminal-Bench에서 약 83.4%로 선두, Anthropic의 Claude Code는 Opus 4.8과 결합해 약 83.1%로 근접하며, Google의 Antigravity 에이전트가 새로 진입했다. 이 변화는 OpenAI의 SWE-bench 감사 이후 이어진 것으로, 정적 벤치마크의 신뢰성이 떨어지면서 평가가 장기 과제 수행, 도구 사용, 태스크당 비용 지표로 이동했다. Codex 단독으로도 주간 사용자가 200만 명을 넘어섰다.

분열의 구도

모델 진영은 기반 모델이 여전히 핵심이라고 주장하고, 제품 진영은 하네스, 샌드박스, 통합 깊이에서 차별화가 이뤄진다고 본다. 기업 고객들은 실제 업무 태스크를 신뢰성 있게 측정하는 것의 한계를 묻고 있다.

수치로 보기

  • 약 83.4%: Terminal-Bench에서 Codex+GPT-5.5 점수
  • 약 83.1%: Claude Code+Opus/Fable 5 점수
  • 200만 명 이상: Codex 주간 사용자 수

왜 중요한가

경쟁 우위의 원천이 모델 가중치에서 이를 둘러싼 하네스, 샌드박스, 통합으로 이동하고 있다. 기업의 구매 방식도 벤치마크 헤드라인이 아닌 태스크 완료율과 비용 기준으로 바뀌고 있다.

주목 사항

조작에 강한 에이전트 벤치마크, 실제 시스템에서 에이전트의 안전성과 오류 체계, 오픈웨이트 에이전트가 에이전트 격차를 좁힐 수 있는지 여부.

브리핑을 이메일로