英伟达正式推出Nemotron 3 Super,这是一款面向智能体(Agentic)工作负载打造的开源混合模型,总参数规模达到1200亿,但在每次前向计算中仅激活127亿参数。这一设计基于Mixture-of-Experts(MoE)架构,目标是压缩大规模推理成本,尤其针对多阶段AI智能体在长链路推理和高token消耗下的部署难题。
以更低激活成本应对复杂推理
根据英伟达披露,Nemotron 3 Super采用88层混合Mamba-Transformer骨干网络。其中,Mamba-2模块负责以线性时间效率处理长序列,Transformer注意力层则用于保留精确召回能力。借助这一组合,模型可原生支持最高100万个token的上下文窗口,尽量避免纯注意力架构常见的内存压力。
在MoE设计上,英伟达加入了LatentMoE路由系统,先将token嵌入压缩至低秩空间,再分发给每层512个专家中的22个激活专家。公司称,这一方案可在与标准MoE相近的推理成本下实现约4倍更多专家,从而支持更细粒度的任务专门化,例如将Python逻辑与SQL处理分配给不同专家。
吞吐量与长上下文能力成为重点卖点
Nemotron 3 Super还引入了多token预测层,通过两个共享权重的头部加速链式思维生成,并支持原生投机解码。英伟达表示,在结构化任务中,模型生成速度最高可提升至3倍。
基准测试方面,该模型在MMLU-Pro获得83.73、AIME25获得90.21、SWE-Bench获得60.47,在PinchBench上达到85.6%,被称为同级别开源模型中的最高成绩之一;在长上下文评测RULER 1M中得分91.64。性能对比上,英伟达称其在8k输入、64k输出设置下,相比GPT-OSS-120B吞吐量提升2.2倍,相比Qwen3.5-122B-A10B最高提升7.5倍。
训练规模庞大,并已全面开放
训练方面,Nemotron 3 Super预训练共使用25万亿token,分两阶段完成:先使用20万亿token通用数据,再以5万亿token高质量数据进行优化。之后,模型又通过510亿token的上下文扩展训练,将原生上下文窗口延伸至100万token。后训练部分则包括约700万条监督微调样本,以及在21个环境中完成、超过120万次rollout的强化学习。
英伟达表示,该模型已在自家的NVFP4四位浮点格式上完成端到端训练,并针对Blackwell GPU进行了优化。在B200硬件上,其推理速度据称较H100上的FP8最高快4倍,且未报告精度损失。当前,Nemotron 3 Super已通过Nvidia Nemotron Open Model License开源,BF16、FP8和NVFP4检查点,以及预训练数据、后训练样本和强化学习环境均已上线Hugging Face,并可通过Nvidia NIM、Google Cloud、AWS、Azure、Coreweave等平台部署使用。

