DeepSeek V4 预览版缩小与开源权重 MoE 模型的差距
1.6T 参数(激活 49B)的 V4-Pro 与 284B 的 V4-Flash,均为 1M 上下文,已在 Hugging Face 开源权重发布
加入列表
还没有列表。
摘要
Deepseek 于 2026 年 4 月 24 日发布 V4 预览版,将 deepseek-v4-pro 与 deepseek-v4-flash 列为 API 模型 ID,并在 Hugging Face 公布开源权重。V4-Pro 是一款 1.6 万亿参数的混合专家模型,激活 49B;V4-Flash 为 284B,激活 13B;二者均为 1M 令牌上下文。DeepSeek 称 V4 缩小了与前沿模型的差距,在推理上超过部分 GPT-5.2 与 Gemini 3.0 Pro 的结果。它仍是无最终定版日期的预览版。这次每令牌成本低得多的开源权重发布,加剧了 开源与闭源之争,也与 DeepSeek 所受的美国 芯片出口 限制相抵触。
数据一览
- 1.6T,V4-Pro 参数(激活 49B)。
- 284B,V4-Flash 参数(激活 13B)。
- 1M 令牌,两款模型的上下文窗口。
- 2026 年 4 月 24 日,预览版发布。
- 开源权重,已在 Hugging Face 公布。
为何重要
一家中国实验室推出的逼近前沿的开源权重模型,在价格上压过闭源实验室,并移除了美国在其顶级模型周围筑起的访问门槛,正是 Anthropic 出口管制令 所暴露的不对称。它使中国在芯片管制之下仍能在前沿保持竞争力。
值得关注
- 对比 GPT-5.5、Gemini 3.5 与 Opus 4.8 的独立基准测试。
- 定版(非预览)的 V4 及其定价。
- 美国出口政策是否会针对中国的开源权重模型。