MiniMax M3正式开源:428B参数MoE架构,1M上下文解码提速15倍

MiniMax M3正式开源:428B参数MoE架构,1M上下文解码提速15倍

N
News Editor 01
2026-07-22 08:39:14
MiniMax今日开源旗舰模型M3,采用428B总参数MoE架构,单Token仅激活23B参数,支持1M超长上下文,独创MSA机制使解码提速15倍,原生多模态,编码和Agent能力顶尖。
MiniMaxM3开源模型MoE多模态

大模型独角兽MiniMax于今日(7月12日)在Hugging Face正式开源其旗舰模型MiniMax M3的权重。该模型采用原生多模态MoE架构,总参数428B,128个专家网络,单Token仅激活4个专家(约23B参数),兼顾知识储备与推理速度。MiniMax同步提供了基于MXFP8的量化版本,大幅降低显存门槛,方便不同硬件配置的开发者部署。

428B总参数MoE架构,单Token仅23B激活

模型总计60层。通过精细的专家分工,M3实现了“大容量、低消耗”的效果。相比于同等总参数的稠密模型,推理时计算量大幅缩减。量化版进一步压缩模型体积,让更多开发者能在消费级显卡上运行。

独创MSA技术:1M上下文解码提速15倍

M3支持高达1M Token(约百万字)的超长上下文。这得益��官方独创的MSA(MiniMax Sparse Attention,区块稀疏注意力)机制。根据技术论文,MSA通过“lightning indexer”实现高效区块稀疏计算,在1M上下文极端场景下,预填充阶段加速约9倍,解码阶段加速达15倍,显著拉低了长上下文AI的算力成本。

从Step Zero原生多模态,编码与Agent能力登顶

M3并非在后期训练中拼接多模态能力,而是从预训练第一步就融合文本、图像与视频数据。这种原生设计使其在长视频理解和复杂桌面操作上表现突出。在编码方面,M3在SWE-Bench Pro上达到59.0%的正确率,在Terminal Bench 2.1上获得66.0%,适合多步推理、工具调用等Agent工作流。模型支持“思考模式”与“非思考模式”,用户可在深度推理低延迟场景间自由切换。

部署建议:优先SGLang、vLLM,针对NVIDIA Blackwell优化

目前M3已上线Hugging Face和Unsloth平台。官方推荐使用SGLangvLLMTransformers(需设置trust_remote_code=True)进行部署。模型针对NVIDIA Blackwell平台深度优化,配合MXFP8量化版,开发者能以更低成本构建多模态Agent应用。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。