英伟达首测 Vera Rubin NVL72:DeepSeek Agent 任务吞吐最高增 30 倍

英伟达首测 Vera Rubin NVL72:DeepSeek Agent 任务吞吐最高增 30 倍

N
News Editor
2026-08-25 02:02:15
英伟达首次公布 Vera Rubin NVL72 片上实测数据,并以 DeepSeek-V4-Pro 运行 AgentX 智能体编码负载。官方数据显示,相比 GB300 NVL72,该系统每兆瓦吞吐量最高提升 30 倍、每百万 Token 成本最高下降 35 倍。英伟达同日还披露 Groq 3 LPX 已全面量产,Gemma 4 31B 在 10 万 Token 上下文窗口下输出速度达 3400 Token/秒,Vera CPU 也已进入部署阶段。

英伟达首次公布下一代旗舰级机柜 Vera Rubin NVL72 的片上实测数据,并以 DeepSeek-V4-Pro 运行真实智能体编码任务。按英伟达披露的数据,在 AgentX 工作负载下,Vera Rubin NVL72 相比 GB300 NVL72 的每兆瓦吞吐量最高提升 30 倍,每百万 Token 成本最高下降 35 倍。

英伟达首测 Vera Rubin NVL72:DeepSeek Agent 任务吞吐最高增 30 倍 2

这次测试没有使用传统固定长度推理基准,而是采用 SemiAnalysis 旗下的 AgentX 基准。该测试回放真实代码编写会话,覆盖上下文增长、工具调用和子智能体生成等环节,用来衡量完整的 Agent 工作流。

报道援引 OpenRouter 最新数据称,真实世界中一个 Agent AI 任务消耗的 Token 数量,是普通聊天对话的 15 倍。原文给出的例子是,若让一个 Agent 为投资决策研究一家公司,智能体与子智能体会持续推理,累积的 Token 又会成为下一步输入,长上下文处理因此成为限制智能体 AI 的关键因素。

在这一前提下,英伟达认为,传统基于固定长度序列的 AI 基准测试已不足以衡量 Agent 场景下的系统性能,性能测量需要从单次推理请求转向完整工作流。

Vera Rubin NVL72 对比 GB300 NVL72

英伟达此次直接使用 DeepSeek-V4-Pro(1.6T)进行片上实测。结果显示,在 AgentX 工作负载下,Vera Rubin NVL72 的每兆瓦吞吐量较 GB300 NVL72 最高提升 30 倍。

英伟达首测 Vera Rubin NVL72:DeepSeek Agent 任务吞吐最高增 30 倍 3

作为对照,GB300 NVL72 在同样的 DeepSeek-V4-Pro 测试中,每兆瓦吞吐量已较 H200 提升 15 倍。报道据此描述,从 H200 到 GB300,真实 Agent 工作负载的吞吐量最高提升 30 倍、成本大致翻倍;从 GB300 到 Vera Rubin,吞吐量再次最高提升 30 倍,整机架价格大致再翻倍。

报道还提到,对受电力供应限制的 AI 工厂而言,在相同电力预算下,Vera Rubin 可完成更多智能体推理任务。对兆瓦级乃至吉瓦级数据中心来说,更高的每兆瓦吞吐量意味着更高的算力利用效率。

英伟达同时披露,NVIDIA DSX MaxLPS 可在 GPU、机架和工作负载层面进行电源管理,在相同兆瓦预算内多配置高达 40% 的 GPU,以继续提升 AI 工厂的每兆瓦吞吐量。

Token 成本最高下降 35 倍

随着每兆瓦吞吐量上升,推理成本同步下降。英伟达称,Vera Rubin NVL72 生产每百万 Token 的成本,相比 GB300 NVL72 最高可降低 35 倍。

英伟达首测 Vera Rubin NVL72:DeepSeek Agent 任务吞吐最高增 30 倍 4

原文将这一变化直接与智能体应用的商业模型联系起来,认为当推理成本大幅下降后,24 小时运行的数字员工和面向消费者的超级应用会获得更现实的成本基础。不过,报道没有给出更多量化商业数据。

性能提升来自系统协同设计

报道称,Vera Rubin NVL72 的性能跃升并非单靠单颗芯片工艺,而是来自系统级协同设计。文中列出的关键技术包括分离式服务、分布式 KV 缓存、KV 感知路由和 MegaMoE。

在模型侧,NVFP4 量化将模型权重压缩到 4 位精度,以减少内存占用并提升吞吐。互联侧,第六代 NVLink 与大模型 MoE 结合后,提供了比现成以太网快 10 倍、延迟低 3 倍的互联能力,使 DeepSeek 这类基于 MoE 架构的大模型可以在 72 个 GPU 之间调用不同的专家子网络。

按照原文表述,英伟达当前出售的已不只是单张 GPU,而是一整套面向 AI 工厂的系统。

英伟达首测 Vera Rubin NVL72:DeepSeek Agent 任务吞吐最高增 30 倍 5

Groq 3 LPX 开始全面量产

除 Vera Rubin NVL72 外,英伟达在 Hot Chips 2026 大会上还披露,Groq 3 LPX 已开始全面量产。报道称,Groq 3 LPX 是 Vera Rubin NVL72 数据中心平台的专属扩展,定位是低延迟推理加速。

原文称,这项技术来自英伟达去年 12 月以 200 亿美元从初创公司 Groq 手中收购的资产。其设计思路是将大规模上下文处理与 Token 生成拆分:Rubin GPU 负责处理大规模上下文,Groq 3 LPX 负责高速生成 Token。

在完整机架级部署中,最多可有 256 个 LP30 加速器通过超高带宽互连与 GPU 协同工作,构建企业级推理引擎。

按照 Artificial Analysis 的基准测试结果,Groq 3 LPX 在 10 万 Token 超长上下文窗口下运行 Gemma 4 31B,输出速度达到 3400 Token/秒。在延迟敏感负载中,其响应速度比竞品快 4 倍。

英伟达首测 Vera Rubin NVL72:DeepSeek Agent 任务吞吐最高增 30 倍 6

报道还给出一个具体对比:Groq 3 LPX 生成 5000 Token 所需时间,从 50 秒降至 1.5 秒,差距为 34 倍。在编码任务中,Groq 3 LPX 的最大输出速度达到 6981 token/s。

黄仁勋在原文中表示,通过 LPX 推进超高速 Token 生成,在 AI 吞吐量和响应能力上实现了「又一次巨大飞跃」。

报道还提到,Nebius 已在 Nebius Token Factory 中部署该芯片,用于提升智能体循环各步骤的响应速度。

Vera CPU 进入部署阶段

这次发布中,英伟达还公布了面向 Agent 负载设计的 Vera CPU。该 CPU 配备 88 个自研 Olympus 核心,并采用高带宽 LPDDR5X 内存,带宽达到 1.2TB/s。

英伟达首测 Vera Rubin NVL72:DeepSeek Agent 任务吞吐最高增 30 倍 7

根据原文,在 Hot Chips 现场,英伟达 Vera CPU 高管表示,「Agentic AI 是史上最复杂的计算任务」。报道解释称,一次 Agent 任务背后往往涉及上百步调度,包括工具调用、执行 Python 代码、检索上下文和处理大量数据,这些任务都对 CPU 形成负载。

报道称,SpaceXAI 已宣布正式规模化部署英伟达 Vera CPU。原文还提到,早在今年 5 月,英伟达已将首批 Vera 样片提供给 A 社、OpenAI 和 SpaceXAI 试用。3 个月后,SpaceXAI 已将其转入全面部署。

按报道说法,SpaceXAI 正基于 Vera Rubin 平台建设吉瓦级算力工厂,用于驱动 Grok。马斯克表示,「两家强强联手,设计了一款优化版的 Vera Rubin NVL72,将在 2028 年大规模部署」。

此外,SpaceXAI 的第一代「Starmind」AI 卫星,计划采用 Vera Rubin NVL72 机架级系统。

从 GPU 延伸到整套 Agent 基础设施

同一天,Vera CPU 和 Groq 3 LPX 均被描述为进入全面量产阶段。按原文的归纳,在大模型阶段,英伟达主要依靠 GPU 覆盖训练与推理;而在 Agent 场景下,其产品线已延伸到 CPU、推理加速器和 NVLink 等多个层面。

文章最后将这一变化概括为:英伟达试图出售的不只是单一 GPU,而是一座持续生产 Token 的 AI 工厂。

参考资料

  • https://x.com/MinLiBuilds/status/2091915873661686204
  • https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
  • https://developer.nvidia.com/blog/inside-nvidia-groq-3-lpx-the-low-latency-inference-accelerator-for-the-nvidia-vera-rubin-platform/
  • https://developer.nvidia.com/blog/maximizing-ai-factory-performance-per-watt-with-nvidia-dsx-maxlps/

本文来自微信公众号「新智元」,作者为 ASI启示录。MarsBit 收录并发布了该文。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
60

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。