MiniMax发布M3,号称以二十分之一注意力成本实现前沿编码能力的中国开放权重模型
百万token稀疏注意力模型在自家编码基准上超越GPT-5.5,但不及Claude Opus 4.8,权重仍未公开
加入列表
还没有列表。
摘要
中国AI实验室MiniMax发布了M3,这是一款开放权重模型,结合百万token上下文窗口、原生多模态输入和智能体计算机使用能力,在实验室自测的SWE-Bench Pro编码基准上取得59.0%,超越OpenAI的GPT-5.5(58.6%)和Google Gemini 3.1 Pro(54.2%)。但其仍落后于一周前发布的Anthropic Claude Opus 4.8的69.2%。核心工程主张是MiniMax Sparse Attention(MSA),仅选取相关键值块,在全上下文下将每token计算量降至二十分之一,该架构已于6月18日前后得到独立验证。问题在于:承诺的开放权重在发布时未予公开,训练代码和推理算子也仍为封闭。
分歧
美国机器学习媒体在能力报道与注意事项之间产生分歧。MarkTechPost突出MSA的效率优势,Tech Times则着重指出基准测试由厂商自行运行且M3不及Opus 4.8。美国以外的报道框架有所不同:意大利开发者报道与印度Open Source For You聚焦于美国报道轻描淡写的两点,"开放权重"在代码封闭的情况下并非开源,以及中国2017年《国家情报法》要求MiniMax协助国家情报机构处理经由其API传输的任何提示。这一治理层面的问题,而非SWE-Bench数字,才是发布宣传所省略的内容。
数字解读
- 59.0%,M3厂商自测SWE-Bench Pro得分(GPT-5.5: 58.6%,Gemini 3.1 Pro: 54.2%)。
- 69.2%,Claude Opus 4.8报告的SWE-Bench Pro得分,领先M3。
- 百万token,M3上下文窗口。
- 1/20,MSA架构下全上下文每token计算量(相较上一代)。
- 9倍 / 15倍,MSA下宣称的预填充和解码速度提升。
重要性
来自中国开放权重模型的廉价长上下文编码在价格上向西方实验室施压,并推动更多推理工作流向中国基础设施。但"开放权重"加封闭代码、厂商基准测试,以及协助北京的法律义务,将采用决策从能力问题转变为信任问题,对任何通过API传输源代码的团队尤为如此。