MiniMax, M3 출시, 주의 비용 20분의 1로 프론티어급 코딩 능력 주장하는 중국산 오픈웨이트 모델
100만 토큰 희소 주의 모델이 자체 코딩 벤치마크에서 GPT-5.5를 앞섰지만 Claude Opus 4.8에는 못 미쳐, 가중치는 여전히 미공개
리스트에 추가
아직 리스트가 없습니다.
요약
중국 AI 연구소 MiniMax가 M3를 공개했다. 100만 토큰 컨텍스트 윈도우, 네이티브 멀티모달 입력, 에이전트 컴퓨터 사용을 갖춘 오픈웨이트 모델로, 자체 SWE-Bench Pro 코딩 벤치마크에서 59.0%를 기록해 OpenAI의 GPT-5.5(58.6%)와 Google Gemini 3.1 Pro(54.2%)를 앞섰다. 다만 일주일 앞서 출시된 Anthropic의 Claude Opus 4.8에는 69.2%로 뒤처진다. 핵심 기술 주장은 MiniMax Sparse Attention(MSA)으로, 관련 키-밸류 블록만 선택해 전체 컨텍스트에서 토큰당 연산량을 20분의 1로 줄이며, 아키텍처는 6월 18일경 독립 검증됐다. 문제는 약속된 오픈 가중치가 출시 시점에 공개되지 않았고, 학습 코드와 추론 연산자도 비공개로 유지됐다는 점이다.
시각의 분열
미국 ML 언론은 능력 측면과 주의 사항 사이에서 의견이 갈렸다. MarkTechPost는 MSA의 효율성을 전면에 내세웠고, Tech Times는 벤치마크가 벤더 자체 측정이며 M3가 Opus 4.8에 못 미친다는 점을 강조했다. 미국 밖에서는 프레임이 달랐다. 이탈리아 개발자 커뮤니티와 인도의 Open Source For You는 미국 기사들이 축소한 두 가지 사항을 중심에 놓았다. '오픈웨이트'는 코드가 비공개인 채로 오픈소스가 아니라는 점, 그리고 중국의 2017년 국가정보법이 API를 통해 전달되는 모든 프롬프트에 대해 MiniMax에 국가정보 지원을 의무화한다는 점이다. SWE-Bench 숫자가 아니라 이 거버넌스 문제가 출시 홍보에서 빠진 핵심이다.
숫자로 보기
- 59.0%, 벤더 측정 M3의 SWE-Bench Pro 점수 (GPT-5.5: 58.6%, Gemini 3.1 Pro: 54.2%).
- 69.2%, Claude Opus 4.8의 보고된 SWE-Bench Pro 점수, M3 앞서.
- 100만 토큰, M3 컨텍스트 윈도우.
- 1/20, MSA 적용 시 전체 컨텍스트에서의 토큰당 연산량 (이전 세대 대비).
- 9배 / 15배, MSA 하에서 주장된 프리필 및 디코딩 속도 향상.
왜 중요한가
중국산 오픈웨이트 모델의 저비용 장문맥 코딩은 가격 면에서 서방 AI 연구소를 압박하고 더 많은 추론 작업을 중국 인프라로 몰아간다. 하지만 코드가 비공개인 '오픈웨이트', 벤더 자체 벤치마크, 베이징을 지원해야 할 법적 의무의 조합은 도입 문제를 능력에서 신뢰의 문제로 바꾼다. API를 통해 소스 코드를 전달하는 팀에는 특히 중대한 문제다.