rbtfl

MiniMax发布M3,号称以二十分之一注意力成本实现前沿编码能力的中国开放权重模型

百万token稀疏注意力模型在自家编码基准上超越GPT-5.5,但不及Claude Opus 4.8,权重仍未公开

人工智能· active 长远之局·他们没说的 ·5 视角 · ·rbtfl 更新 2026年6月29日
发布

报道分歧

同一条新闻,各国新闻编辑室如何讲述。引文均注明出处并链接原文。

United States

MarkTechPost

“MSA在百万token上下文下将每token计算量降至二十分之一,预填充速度比上一代快9倍以上,解码速度快15倍以上。”

ML engineering press阅读原文 ↗

United States

Tech Times

“M3的SWE-Bench Pro 59.0%超越GPT-5.5,但落后于Claude Opus 4.8的69.2%;评分由厂商自行测试,权重仍未公开。”

skeptical benchmark scrutiny阅读原文 ↗

Italy

Pasquale Pillitteri

“中国2017年《国家情报法》要求MiniMax协助国家情报工作,无论用户身处何地,该义务适用于发送至其API的每一条提示。”

European developer view阅读原文 ↗

发布

摘要

中国AI实验室MiniMax发布了M3,这是一款开放权重模型,结合百万token上下文窗口、原生多模态输入和智能体计算机使用能力,在实验室自测的SWE-Bench Pro编码基准上取得59.0%,超越OpenAI的GPT-5.5(58.6%)和Google Gemini 3.1 Pro(54.2%)。但其仍落后于一周前发布的Anthropic Claude Opus 4.8的69.2%。核心工程主张是MiniMax Sparse Attention(MSA),仅选取相关键值块,在全上下文下将每token计算量降至二十分之一,该架构已于6月18日前后得到独立验证。问题在于:承诺的开放权重在发布时未予公开,训练代码和推理算子也仍为封闭。

分歧

美国机器学习媒体在能力报道与注意事项之间产生分歧。MarkTechPost突出MSA的效率优势,Tech Times则着重指出基准测试由厂商自行运行且M3不及Opus 4.8。美国以外的报道框架有所不同:意大利开发者报道与印度Open Source For You聚焦于美国报道轻描淡写的两点,"开放权重"在代码封闭的情况下并非开源,以及中国2017年《国家情报法》要求MiniMax协助国家情报机构处理经由其API传输的任何提示。这一治理层面的问题,而非SWE-Bench数字,才是发布宣传所省略的内容。

数字解读

  • 59.0%,M3厂商自测SWE-Bench Pro得分(GPT-5.5: 58.6%,Gemini 3.1 Pro: 54.2%)。
  • 69.2%,Claude Opus 4.8报告的SWE-Bench Pro得分,领先M3。
  • 百万token,M3上下文窗口。
  • 1/20,MSA架构下全上下文每token计算量(相较上一代)。
  • 9倍 / 15倍,MSA下宣称的预填充和解码速度提升。

重要性

来自中国开放权重模型的廉价长上下文编码在价格上向西方实验室施压,并推动更多推理工作流向中国基础设施。但"开放权重"加封闭代码、厂商基准测试,以及协助北京的法律义务,将采用决策从能力问题转变为信任问题,对任何通过API传输源代码的团队尤为如此。

关注点

  • MiniMax是否真正公开M3权重及技术报告。
  • 针对厂商数字的独立基准测试复测结果。
  • 企业和政府层面针对API数据暴露问题的禁令或豁免。
  • DeepSeekQwen等能否匹敌稀疏注意力的效率优势。

简报,直达邮箱