英伟达发布Nemotron 3 Super:120B参数开源AI模型,推理吞吐量提升7.5倍

英伟达发布Nemotron 3 Super:120B参数开源AI模型,推理吞吐量提升7.5倍

N
News Editor 01
2026-07-08 17:42:13
英伟达正式推出Nemotron 3 Super,一款1200亿参数的开源混合模型(MoE),每次前向推理仅激活12.7B参数,在智能体任务中吞吐量较Qwen3.5-122B提升7.5倍,支持百万级Token上下文,完全开源。
英伟达NvidiaNemotron 3 Super开源AI模型MoE架构

英伟达正式发布Nemotron 3 Super,这是一款拥有1200亿总参数的开源混合模型,采用专家混合(MoE)架构,每次前向推理仅激活约127亿参数,旨在大幅降低大规模运行AI智能体的计算成本。该模型面向多步骤推理和智能体工作负载优化,是英伟达Nemotron 3家族的第二款产品,继2025年12月的Nemotron 3 Nano之后推出。

模型架构创新:Mamba-Transformer混合与LatentMoE

Nemotron 3 Super采用88层混合Mamba-Transformer骨干网络。其中Mamba-2模块以线性时间复杂度高效处理长序列,而Transformer注意力层保留精确召回能力。这种组合使模型原生支持高达100万个Token的上下文窗口,且不会像纯注意力设计那样产生内存惩罚。

在MoE方面,英伟达引入了LatentMoE路由系统:先将Token嵌入压缩到低秩空间,再分配到每层512个专家中的22个(激活比例约4.3%)。公司表示,与标准MoE方法相比,这能在相同推理成本下启用约4倍的专家数量,实现更精细的任务专业化——例如在专家级别将Python逻辑与SQL处理分离开来。

此外,模型还配备多Token预测层,使用两个共享权重的头部加速思维链生成,并支持原生推测解码。在结构化任务上,英伟达报告生成速度提升高达3倍。

训练数据与基准性能

Nemotron 3 Super分两阶段预训练:第一阶段使用20万亿Token的广泛数据,第二阶段使用5万亿高质量Token微调性能。随后通过51亿Token的扩展阶段将原生上下文窗口延长至100万Token。后训练阶段包括约700万样本的监督微调,以及21个环境中超过120万次滚动的强化学习。

在多项基准测试中表现亮眼:MMLU-Pro得分83.73,AIME25得分90.21,SWE-Bench(OpenHands)得分60.47。在PinchBench上达到85.6%,是同类别开源模型中的最高分。长上下文评测方面,RULER 1M得分91.64。

核心性能对比:在8k输入/64k输出设置下,Nemotron 3 Super的吞吐量是GPT-OSS-120B的2.2倍,是Qwen3.5-122B-A10B的7.5倍。与上一代Nemotron Super相比,吞吐量提升超过5倍,精度提升最高2倍。

端到端训练与硬件优化

英伟达全程使用其NVFP4 4位浮点格式训练该模型,专为Blackwell GPU优化。在B200硬件上,推理速度较H100上的FP8提升最高4倍,且无精度损失报告。量化后的FP8和NVFP4检查点保留全精度准确率的99.8%以上。

Nemotron 3 Super还驱动了英伟达AI-Q研究智能体,该智能体在Deepresearch Bench排行榜上位居首位。

开源与部署

该模型在英伟达Nemotron开放模型许可证下完全开源。BF16、FP8和NVFP4格式的检查点、预训练数据、后训练样本和强化学习环境均已在Hugging Face上发布。开发者可通过Nvidia NIM、build.nvidia.com、Perplexity、OpenRouter、Together AI、Google Cloud、AWS、Azure及CoreWeave等平台进行推理,也可通过Dell Enterprise Hub和HPE进行本地部署。NeMo平台还提供训练配方、微调指南和推理手册,支持vLLM、SGLang和TensorRT-LLM。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。