英伟达发布120B开源模型Nemotron 3 Super,主打AI代理低成本推理

英伟达发布120B开源模型Nemotron 3 Super,主打AI代理低成本推理

N
News Editor 01
2026-07-23 03:15:14
英伟达推出Nemotron 3 Super,这是一款1200亿总参数开源混合模型,单次前向仅激活127亿参数,瞄准AI代理场景下的推理吞吐与成本问题。
英伟达AI代理开源模型大模型Nemotron 3 Super

英伟达发布了 Nemotron 3 Super,这是一款面向 AI 代理工作负载的 1200 亿总参数开源混合模型。按官方披露,该模型采用 MoE(混合专家)架构,单次前向传播仅激活 127 亿参数,目标是压低大规模部署 AI 代理时的算力成本,尤其针对多步推理链条和多代理流程中 token 消耗快速放大的问题。

英伟达称,在多代理流水线里,token 使用量最高可放大至 15 倍。Nemotron 3 Super 试图直接处理这个瓶颈。它是 Nemotron 3 系列中的第二款模型,前一款 Nemotron 3 Nano 发布于 2025 年 12 月,而这次新品发布信息则由英伟达在 2026 年 3 月 10 日左右公布。

88 层混合骨干支持 100 万 token 上下文

Nemotron 3 Super 使用 Mamba-Transformer 混合骨干网络,共 88 层。其中,Mamba-2 模块负责以线性时间效率处理长序列,Transformer 注意力层则用于保留更精确的召回能力。英伟达表示,这种组合让模型原生支持最高 100 万 token上下文窗口,同时避免纯注意力架构常见的内存负担。

模型还加入了 LatentMoE 路由系统:先将 token 嵌入压缩到低秩空间,再分发给每层 512 个专家,每次激活其中 22 个。按英伟达说法,这种方案在相同推理成本下可容纳约 4 倍专家数量,也让任务分工更细,例如把 Python 逻辑处理与 SQL 处理分配给不同专家。

预训练 25 万亿 token,结构化任务生成提速最高 3 倍

Nemotron 3 Super 配置了 Multi-Token Prediction 层,使用两个共享权重头来加快思维链生成,并支持原生 speculative decoding(投机解码)。在结构化任务上,英伟达报告其生成速度最高可提升至 3 倍

训练方面,该模型分两个阶段完成预训练,总规模达到 25 万亿 token。第一阶段使用 20 万亿 token通用数据,第二阶段使用 5 万亿高质量 token,以优化基准测试表现。随后又通过 510 亿 token扩展训练,将原生上下文长度拉升到 100 万 token。后训练部分包括约 700 万条监督微调样本,以及覆盖 21 个环境、超过 120 万次 rollout的强化学习训练。

与 Qwen3.5-122B-A10B 相比吞吐最高提升 7.5 倍

基准成绩方面,Nemotron 3 Super 在 MMLU-Pro 上得分 83.73,AIME25 为 90.21,使用 OpenHands 的 SWE-Bench 为 60.47。在 PinchBench 上,该模型达到 85.6%,英伟达称这是同等级开源模型中已报告的最高分;在长上下文评测 RULER 1M 中,得分为 91.64

吞吐方面,英伟达表示,在 8k 输入、64k 输出设置下,Nemotron 3 Super 相比 GPT-OSS-120B 可实现 2.2 倍吞吐,相比 Qwen3.5-122B-A10B 可达到 7.5 倍。与上一代 Nemotron Super 相比,其吞吐超过 5 倍,准确率最高提升至 2 倍

开放权重与训练数据,已接入多家云与推理平台

硬件与部署层面,英伟达称该模型全流程使用 NVFP4 四位浮点格式训练,并针对 Blackwell GPU 做了优化。在 B200 硬���上,推理速度最高可比 H100 上的 FP8 提升 4 倍,且未报告精度损失。量化后的 FP8 和 NVFP4 checkpoint 可保留不少于 99.8%的全精度准确率。

Nemotron 3 Super 采用 Nvidia Nemotron Open Model License 完全开放,Hugging Face 已提供 BF16、FP8、NVFP4 格式 checkpoint,以及预训练数据、后训练样本和强化学习环境。推理可通过 Nvidia NIM、build.nvidia.com、Perplexity、Openrouter、Together AI、Google Cloud、AWS、Azure 和 Coreweave 使用,本地部署则支持 Dell Enterprise Hub 和 HPE。开发者还可通过 NeMo 平台获取训练配方、微调指南和推理手册,兼容 vLLM、SGLang 与 TensorRT-LLM。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。