英伟达开源Nemotron 3 Ultra:AI代理吞吐量最高增5倍

英伟达开源Nemotron 3 Ultra:AI代理吞吐量最高增5倍

N
News Editor 01
2026-07-23 07:50:15
英伟达发布开源旗舰模型 Nemotron 3 Ultra,面向长时间运行的 AI 代理与多代理工作流,主打 5500 亿总参数、最高 5 倍吞吐量提升及最高 30% 成本下降。
英伟达AI代理开源模型Nemotron 3 Ultra大模型

英伟达于 2026 年 6 月 4 日发布开源旗舰模型 Nemotron 3 Ultra,将目标直接指向长时间运行的 AI 代理和复杂多代理工作流。该模型总参数规模达到 5500 亿,采用混合专家(MoE)架构,每次推理仅激活 550 亿 参数,重点解决���代理系统在长上下文、重复规划、工具调用和子代理委派中的成本与效率问题。

5500 亿总参数,面向多代理编排场景

按英伟达的定位,Nemotron 3 Ultra 主要承担“编排者”或前沿推理引擎角色,负责深度规划、复杂综合分析与逻辑验证,把例行执行和工具调用交给更轻量的模型处理。原始素材提到,在传统多代理工作流里,持续维护冗长上下文会推高 Token 消耗,也会增加成本和目标偏离风险,这正是该模型试图压缩的环节。

基准测试数据也集中围绕 AI 代理能力展开。Nemotron 3 Ultra 在 PinchBench 中取得 91%,在 EnterpriseOps-Gym 和 Terminal-Bench 2.0 中分别达到 40%67%。素材称,尽管活跃参数规模低于总参数规模,但其整体推理能力已超越或接近 GLM 5.1、Kimi K2.6 与 Qwen3.5 等主流开源大模型。

五项技术组合,瞄准速度与成本

为了提升吞吐和压低代理任务成本,英伟达在 Nemotron 3 Ultra 中整合了五项核心技术,包括混合 Mamba-Transformer 层、NVFP4 量化、LatentMoE、多代币预测(MTP)以及多教师在线蒸馏(MOPD)。其中,混合 Mamba-Transformer 层强调长序列处理效率与事实召回能力的结合;NVFP4 量化则支持模型权重部署在 Hopper、Blackwell 与 Ampere 架构 GPU 上。

按素材披露的数据,与传统 BF16 格式相比,Nemotron 3 Ultra 在 Blackwell 平台上可实现最高 5 倍 吞吐量提升。与此同时,这套技术路线还能减少任务处理时的总 Token 消耗,使企业代理任务成本最高下降 30%。短句来说,英伟达这次卖点很明确:更快,也更省。

开放模型权重与训练配方

训练数据方面,Nemotron 3 Ultra 建立在超过 10 万亿 Token 的预训练基础上,并加入了超过 2120 亿 个领域特定 Token,覆盖法律文件、维基百科风格文本和最新 GitHub 代码。英伟达表示,该模型采用 OpenMDW-1.1 许可,向社区开放完整模型权重、训练配方和数据管道。

目前,开发者已经可以在 Hugging Face、NVIDIA Build 和 NIM 上获取并部署 Nemotron 3 Ultra。素材���提到,该模型在 Ruler @1M 测试中达到 95%,长文本处理能力是其一项重点指标。英伟达将其应用方向指向客户服务自动化、供应链管理、IT 安全防护和芯片设计验证等企业场景。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。