AMD发布全开源Instella-MoE,16B参数瞄准同规模开源模型前列

AMD发布全开源Instella-MoE,16B参数瞄准同规模开源模型前列

N
News Editor
2026-07-25 03:18:25
AMD于7月25日发布全开源混合专家模型Instella-MoE,总参数量160亿、每个Token激活28亿参数。AMD称,该模型完全基于MI300X、MI325X GPU及ROCm软件栈从零训练,并引入Gated MLA与FarSkip-Collective等架构设计。测试数据显示,Instella-MoE-16B-A3B基础模型平均得分为76.7,在全开源模型中处于领先位置,同时支持64K Token长上下文及完整训练流程开放。
AMDInstella-MoE开源大模型MoEROCmMI300XMI325XAI技术

BlockBeats 消息,7 月 25 日,AMD 宣布推出全开源混合专家模型 Instella-MoE。该模型拥有 160 亿总参数,每个 Token 激活 28 亿参数。AMD称,Instella-MoE 在同规模开源语言模型中具备领先性能。

AMD表示,Instella-MoE 完全基于自家 AMD Instinct MI300X 和 MI325X GPU,以及 ROCm 软件栈从零训练完成,并采用 Gated Multi-head Latent Attention(Gated MLA)和 FarSkip-Collective 等架构创新,用于提升训练和推理效率。

测试成绩与模型能力

根据 AMD 披露的性能测试,Instella-MoE-16B-A3B 基础模型平均得分达到 76.7 分,在全开源模型中排名领先,超过 SmolLM3-3B、OLMo-3-7B 等模型。AMD称,该模型在仅激活 28 亿参数的情况下,也能够与更大规模模型竞争。

Instella-MoE 还支持 64K Token 长上下文处理,并已完成预训练、中期训练、长上下文扩展、监督微调(SFT)、直接偏好优化(DPO)以及强化学习(RL)等完整训练流程。

同步开放训练资料

AMD 此次同步公开了 Instella-MoE 的全部模型权重、训练配置、数据配比、中间检查点及推理代码。该公司表示,此举旨在推动开放 AI 模型研究与复现。

AMD还表示,Instella-MoE 展示了基于 AMD 硬件和开放软件生态进行大规模 MoE 模型训练的能力,后续将继续推进更大规模、更强推理能力和更高效率的开源语言模型研发。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。