rbtfl

OpenAI, 어려운 과제 대부분이 망가졌음을 확인하고 SWE-bench를 버리다

감사 결과 가장 어려운 문제의 59.4%가 풀 수 없거나 거짓으로 통과하는 테스트를 지녀 코딩 점수를 5~15점 부풀린다

AI·AI· contested-result 그들이 말하지 않는 것·조용한 변화 ·4 시각 · ·rbtfl 업데이트 2026년 6월 25일
게시

보도의 갈림

같은 뉴스를 각국 뉴스룸이 어떻게 전했는지. 인용문은 출처와 원문 링크를 밝힙니다.

United States

MarkTechPost

“OpenAI는 가장 어려운 SWE-bench 과제의 59.4%가 근본 버그를 고치지 않아도 통과하는 테스트를 지녔음을 발견했다.”

ML research원문 보기 ↗

United States

Morph LLM (coding leaderboard)

“Claude Opus 4.8은 SWE-bench Verified에서 88.6%를 기록해 실용적 선택지이나, 벤치마크 부풀림이 원시 점수를 믿기 어렵게 만든다.”

developer leaderboard원문 보기 ↗

게시

요약

2026년 2월 23일 OpenAI의 프런티어 평가팀은 SWE-bench Verified 보고를 중단한 이유를 설명했다. 감사 결과 가장 어려운 문제의 59.4%가 근본적으로 결함이 있거나 풀 수 없는 테스트 케이스를 지녔음이 드러난 것이다. 즉 근본 버그를 고치지 않아도 통과하는 테스트로, 2023년 이후 모델에서 5~15점의 점수 부풀림을 함의한다. 이 발견은 각 랩이 인용하는 대표 코딩 수치 (앤스로픽 Opus 4.8의 88.6%, 정지된 Fable 5의 95.0%, 구글 딥마인드 Gemini의 80% 근처)를 허문다. 그리고 정적 스위트 대신 과제 완수, 과제당 비용, 에이전트 벤치마크 (Terminal-Bench)로의 이동을 가속하며, 모델이 테스트 중 상황을 인지하게 되는 가운데 ‘평가 격차’를 키운다.

숫자로 보기

  • 59.4%, 결함이 있거나 풀 수 없는 테스트를 지닌 가장 어려운 SWE-bench 과제.
  • 5~15점, 2023년 이후 모델의 부풀림 추정치.
  • 2026년 2월 23일, OpenAI의 공개.
  • 88.6%, Opus 4.8의 SWE-bench Verified(이제 의심스러움).
  • 95.0%, Fable 5의 점수(모델은 정지됨).

왜 중요한가

이 분야의 간판 코딩 벤치마크가 망가졌다면, 각 랩이 마케팅하고 투자자가 가격을 매기는 공개 역량 순위는 신뢰할 수 없다. 이는 평가를 조작하기 어려운 에이전트 과제로 밀어붙이고, 모델이 문제를 푸는 대신 평가의 인위적 허점을 파고드는 법을 배우고 있다는 주장을 강화한다.

주목할 점

  • 앤스로픽과 구글이 SWE-bench 수치를 정정하거나 옹호하는지.
  • Terminal-Bench/과제당 비용이 새 표준으로 채택되는지.
  • 수리된 SWE-bench 또는 그 후속 벤치마크.

브리핑을 이메일로