BlockBeats 消息,7 月 25 日,AMD 宣布推出全开源混合专家模型 Instella-MoE。该模型拥有 160 亿总参数,每个 Token 激活 28 亿参数。AMD称,Instella-MoE 在同规模开源语言模型中具备领先性能。
AMD表示,Instella-MoE 完全基于自家 AMD Instinct MI300X 和 MI325X GPU,以及 ROCm 软件栈从零训练完成,并采用 Gated Multi-head Latent Attention(Gated MLA)和 FarSkip-Collective 等架构创新,用于提升训练和推理效率。
测试成绩与模型能力
根据 AMD 披露的性能测试,Instella-MoE-16B-A3B 基础模型平均得分达到 76.7 分,在全开源模型中排名领先,超过 SmolLM3-3B、OLMo-3-7B 等模型。AMD称,该模型在仅激活 28 亿参数的情况下,也能够与更大规模模型竞争。
Instella-MoE 还支持 64K Token 长上下文处理,并已完成预训练、中期训练、长上下文扩展、监督微调(SFT)、直接偏好优化(DPO)以及强化学习(RL)等完整训练流程。
同步开放训练资料
AMD 此次同步公开了 Instella-MoE 的全部模型权重、训练配置、数据配比、中间检查点及推理代码。该公司表示,此举旨在推动开放 AI 模型研究与复现。
AMD还表示,Instella-MoE 展示了基于 AMD 硬件和开放软件生态进行大规模 MoE 模型训练的能力,后续将继续推进更大规模、更强推理能力和更高效率的开源语言模型研发。

