rbtfl

MiniMax, M3 출시, 주의 비용 20분의 1로 프론티어급 코딩 능력 주장하는 중국산 오픈웨이트 모델

100만 토큰 희소 주의 모델이 자체 코딩 벤치마크에서 GPT-5.5를 앞섰지만 Claude Opus 4.8에는 못 미쳐, 가중치는 여전히 미공개

AI· active 장기전·그들이 말하지 않는 것 ·5 시각 · ·rbtfl 업데이트 2026년 6월 29일
게시

보도의 갈림

같은 뉴스를 각국 뉴스룸이 어떻게 전했는지. 인용문은 출처와 원문 링크를 밝힙니다.

United States

MarkTechPost

“MSA는 100만 토큰 컨텍스트에서 토큰당 연산량을 20분의 1로 줄이며, 이전 세대 대비 프리필 9배 이상, 디코딩 15배 이상 빠르다.”

ML engineering press원문 보기 ↗

United States

Tech Times

“M3의 SWE-Bench Pro 59.0%는 GPT-5.5를 앞서지만 Claude Opus 4.8의 69.2%에는 못 미친다. 점수는 회사 자체 측정이며 가중치는 여전히 미공개.”

skeptical benchmark scrutiny원문 보기 ↗

Italy

Pasquale Pillitteri

“중국의 2017년 국가정보법은 MiniMax에 국가정보 활동 지원을 의무화하며, 이 의무는 사용자 위치와 무관하게 API에 전송되는 모든 프롬프트에 적용된다.”

European developer view원문 보기 ↗

게시

요약

중국 AI 연구소 MiniMax가 M3를 공개했다. 100만 토큰 컨텍스트 윈도우, 네이티브 멀티모달 입력, 에이전트 컴퓨터 사용을 갖춘 오픈웨이트 모델로, 자체 SWE-Bench Pro 코딩 벤치마크에서 59.0%를 기록해 OpenAI의 GPT-5.5(58.6%)와 Google Gemini 3.1 Pro(54.2%)를 앞섰다. 다만 일주일 앞서 출시된 Anthropic의 Claude Opus 4.8에는 69.2%로 뒤처진다. 핵심 기술 주장은 MiniMax Sparse Attention(MSA)으로, 관련 키-밸류 블록만 선택해 전체 컨텍스트에서 토큰당 연산량을 20분의 1로 줄이며, 아키텍처는 6월 18일경 독립 검증됐다. 문제는 약속된 오픈 가중치가 출시 시점에 공개되지 않았고, 학습 코드와 추론 연산자도 비공개로 유지됐다는 점이다.

시각의 분열

미국 ML 언론은 능력 측면과 주의 사항 사이에서 의견이 갈렸다. MarkTechPost는 MSA의 효율성을 전면에 내세웠고, Tech Times는 벤치마크가 벤더 자체 측정이며 M3가 Opus 4.8에 못 미친다는 점을 강조했다. 미국 밖에서는 프레임이 달랐다. 이탈리아 개발자 커뮤니티와 인도의 Open Source For You는 미국 기사들이 축소한 두 가지 사항을 중심에 놓았다. '오픈웨이트'는 코드가 비공개인 채로 오픈소스가 아니라는 점, 그리고 중국의 2017년 국가정보법이 API를 통해 전달되는 모든 프롬프트에 대해 MiniMax에 국가정보 지원을 의무화한다는 점이다. SWE-Bench 숫자가 아니라 이 거버넌스 문제가 출시 홍보에서 빠진 핵심이다.

숫자로 보기

  • 59.0%, 벤더 측정 M3의 SWE-Bench Pro 점수 (GPT-5.5: 58.6%, Gemini 3.1 Pro: 54.2%).
  • 69.2%, Claude Opus 4.8의 보고된 SWE-Bench Pro 점수, M3 앞서.
  • 100만 토큰, M3 컨텍스트 윈도우.
  • 1/20, MSA 적용 시 전체 컨텍스트에서의 토큰당 연산량 (이전 세대 대비).
  • 9배 / 15배, MSA 하에서 주장된 프리필 및 디코딩 속도 향상.

왜 중요한가

중국산 오픈웨이트 모델의 저비용 장문맥 코딩은 가격 면에서 서방 AI 연구소를 압박하고 더 많은 추론 작업을 중국 인프라로 몰아간다. 하지만 코드가 비공개인 '오픈웨이트', 벤더 자체 벤치마크, 베이징을 지원해야 할 법적 의무의 조합은 도입 문제를 능력에서 신뢰의 문제로 바꾼다. API를 통해 소스 코드를 전달하는 팀에는 특히 중대한 문제다.

관전 포인트

  • MiniMax가 실제로 M3 가중치와 기술 보고서를 공개할지 여부.
  • 벤더 숫자 대비 독립적인 벤치마크 재측정 결과.
  • API 데이터 노출에 관한 기업 및 정부 차원의 금지 또는 예외 조치.
  • DeepSeek, Qwen 등이 희소 주의 효율성을 따라잡을지 여부.

브리핑을 이메일로