英伟达于 2026 年 6 月 4 日发布开源旗舰模型 Nemotron 3 Ultra,将目标直接指向长时间运行的 AI 代理和复杂多代理工作流。该模型总参数规模达到 5500 亿,采用混合专家(MoE)架构,每次推理仅激活 550 亿 参数,重点解决���代理系统在长上下文、重复规划、工具调用和子代理委派中的成本与效率问题。
5500 亿总参数,面向多代理编排场景
按英伟达的定位,Nemotron 3 Ultra 主要承担“编排者”或前沿推理引擎角色,负责深度规划、复杂综合分析与逻辑验证,把例行执行和工具调用交给更轻量的模型处理。原始素材提到,在传统多代理工作流里,持续维护冗长上下文会推高 Token 消耗,也会增加成本和目标偏离风险,这正是该模型试图压缩的环节。
基准测试数据也集中围绕 AI 代理能力展开。Nemotron 3 Ultra 在 PinchBench 中取得 91%,在 EnterpriseOps-Gym 和 Terminal-Bench 2.0 中分别达到 40% 和 67%。素材称,尽管活跃参数规模低于总参数规模,但其整体推理能力已超越或接近 GLM 5.1、Kimi K2.6 与 Qwen3.5 等主流开源大模型。
五项技术组合,瞄准速度与成本
为了提升吞吐和压低代理任务成本,英伟达在 Nemotron 3 Ultra 中整合了五项核心技术,包括混合 Mamba-Transformer 层、NVFP4 量化、LatentMoE、多代币预测(MTP)以及多教师在线蒸馏(MOPD)。其中,混合 Mamba-Transformer 层强调长序列处理效率与事实召回能力的结合;NVFP4 量化则支持模型权重部署在 Hopper、Blackwell 与 Ampere 架构 GPU 上。
按素材披露的数据,与传统 BF16 格式相比,Nemotron 3 Ultra 在 Blackwell 平台上可实现最高 5 倍 吞吐量提升。与此同时,这套技术路线还能减少任务处理时的总 Token 消耗,使企业代理任务成本最高下降 30%。短句来说,英伟达这次卖点很明确:更快,也更省。
开放模型权重与训练配方
训练数据方面,Nemotron 3 Ultra 建立在超过 10 万亿 Token 的预训练基础上,并加入了超过 2120 亿 个领域特定 Token,覆盖法律文件、维基百科风格文本和最新 GitHub 代码。英伟达表示,该模型采用 OpenMDW-1.1 许可,向社区开放完整模型权重、训练配方和数据管道。
目前,开发者已经可以在 Hugging Face、NVIDIA Build 和 NIM 上获取并部署 Nemotron 3 Ultra。素材���提到,该模型在 Ruler @1M 测试中达到 95%,长文本处理能力是其一项重点指标。英伟达将其应用方向指向客户服务自动化、供应链管理、IT 安全防护和芯片设计验证等企业场景。

