英伟达(Nvidia)正式发布Nemotron 3 Super,一款拥有1200亿总参数的开放混合模型,旨在大幅降低大规模运行人工智能代理(AI Agent)的计算成本。
核心要点
- Nemotron 3 Super采用MoE架构,每次前向传播仅激活127亿参数,显著降低推理成本。
- 在Agent工作负载下,其吞吐量相比Qwen3.5-122B-A10B最高提升7.5倍。
- 模型完全开放,权重、训练数据及微调工具已上线Hugging Face。
专为Agent场景设计的架构创新
Nemotron 3 Super是Nemotron 3系列的第二款模型,继2025年12月发布的Nemotron 3 Nano之后推出,于2026年3月10日左右官宣。其核心设计直接针对多步AI Agent部署中的两大痛点:扩展推理链带来的额外成本,以及多Agent管线中令牌消耗可能膨胀15倍的问题。
模型采用混合Mamba-Transformer骨干,共88层。Mamba-2模块以线性时间效率处理长序列,Transformer注意力层则保留精确召回能力。这种组合使模型原生支持高达100万令牌的上下文窗口,同时避免纯注意力设计的内存惩罚。
英伟达还内置了LatentMoE路由系统:在将令牌嵌入发送至每层512个专家之前,先压缩至低秩空间,每次激活22个专家。公司声称,与标准MoE方法相比,这可以在相同推理成本下启用约4倍数量的专家,从而实现更细粒度的任务专业化——比如在专家级别将Python逻辑与SQL处理分离。
多令牌预测层使用两个共享权重头,加速思维链生成并支持原生推测解码。在结构化任务上,英伟达报告生成速度最高提升3倍。
训练规模与基准表现
模型分两阶段预训练,共25万亿令牌。第一阶段使用20万亿令牌的广泛数据,第二阶段使用5万亿高质量令牌以优化基准性能。最终扩展阶段在510亿令牌上训练,将原生上下文扩展至100万令牌。后训练包括约700万样本的监督微调,以及在21个环境中超过120万次采样的强化学习。
在基准测试中,Nemotron 3 Super在MMLU-Pro上取得83.73分,AIME25上90.21分,SWE-Bench(OpenHands)上60.47分。在PinchBench上达到85.6%,为同类开放模型最高。长上下文评估中,RULER 1M得分91.64。
与GPT-OSS-120B相比,Nemotron 3 Super在8k输入/64k输出设置下吞吐量提升2.2倍;相比Qwen3.5-122B-A10B,这一数字达到7.5倍。英伟达还表示,相比前代Nemotron Super,吞吐量提升超过5倍,准确率最高提升2倍。
硬件优化与开放生态
模型端到端训练采用NVFP4四比特浮点格式,针对Blackwell GPU优化。在B200硬件上,推理速度相比H100上的FP8格式提升4倍,且无准确率损失。量化后的FP8和NVFP4检查点保留了全精度准确率的99.8%以上。
Nemotron 3 Super完全开放,基于英伟达Nemotron开放模型许可。检查点(BF16、FP8、NVFP4格式)以及预训练数据、后训练样本和强化学习环境均已上架Hugging Face。推理支持通过Nvidia NIM、build.nvidia.com、Perplexity、Openrouter、Together AI、Google Cloud、AWS、Azure、Coreweave等平台,也可通过Dell Enterprise Hub和HPE进行本地部署。
开发者可通过NeMo平台访问训练配方、微调指南和推理食谱,支持vLLM、SGLang和TensorRT-LLM等框架。

