英伟达公布的最新测试结果显示,在独立评测机构 Artificial Analysis 推出的 AA-AgentPerf 基准中,GB300 NVL72 可在 1 兆瓦 电力预算下同时承载 61400 个并发 AI 智能体。作为对照,上一代 H200 的对应成绩约为 2600 个,差距接近 20 倍。这也是该基准首次把“每兆瓦并发智能体数”作为核心衡量指标,而不是传统的每秒 token 吞吐。

英伟达称,在每秒 20 个 token 和 60 个 token 两档服务标准下,GB300 NVL72 的每兆瓦并发智能体数都大约是 H200 的 20 倍。相比单纯展示芯片峰值性能,这组数据更突出的是评测口径的变化:行业开始用智能体负载、长上下文和工具交互,来衡量真实推理系统的承载能力与能效。
AA-AgentPerf 为何改用“每兆瓦并发智能体数”
Artificial Analysis 将 AA-AgentPerf 定义为首个专门面向 AI 智能体推理场景的基准。其出发点是,现有多数推理测试仍围绕固定长度的合成请求展开,主要衡量单次调用延迟和并发请求量,但这类方法难以覆盖智能体任务的真实负载特征。
与普通对话不同,智能体执行任务往往是链式流程。一个目标会被拆成数十步甚至上百步,包括读取文件、写代码、执行命令、调用搜索或数据库工具,再根据中间结果决定下一步操作。整个过程中,大模型调用和工具调用交替进行,历史上下文持续累积,复杂度并不是简单叠加,而是随链路拉长而放大。

这也解释了旧基准的局限。传统测试通常只测单轮请求,难以反映长会话中的前缀复用、KV cache 缓存、工具输出导致的上下文膨胀,以及调度器和显存层级在长短请求混杂时的稳定性。对于采购 GPU、部署数据中心的买方来说,他们更关注的是同样的电力和硬件,究竟能支撑多少真正运行中的智能体服务。
基准方法:真实轨迹回放与 SLO 约束
AA-AgentPerf 并不使用固定长度提示词,而是回放真实编程智能体的执行轨迹。这些轨迹来自智能体处理真实代码仓库问题的过程,覆盖 12 种以上编程语言,单次会话最长可达 200 轮,上下文规模可超过 10 万 token。其输入长度区间为 5000 到 13 万 token,平均约 2.7 万 token,主要由工具输出和历史对话累积形成。
在评分方式上,这套基准没有一味追求极限并发,而是先设定服务等级目标,即 SLO。只有当系统同时满足每个智能体的输出速度和首字延迟 TTFT 要求时,并发数才被计入成绩。AA-AgentPerf 设置了从每秒 20 个 token 到每秒 180 个 token 的多档服务标准,并分别测量每档标准下系统可维持的最大并发。

另一个变化是,AA-AgentPerf 允许厂商启用生产环境中真实使用的优化,包括 KV cache 复用、推测解码,以及将预填充与解码拆分部署等。Artificial Analysis 的逻辑是,如果测试关闭这些实际会被开启的优化,那么得出的结果对真实采购和系统设计参考价值有限。与此同时,基准也会跟踪输出质量,避免系统以牺牲回答质量换取更高并发。
GB300 与 H200 的差距落在能效和单卡密度两端
在一个代表当前前沿水平的混合专家模型测试中,GB300 NVL72 的成绩为每兆瓦 61400 个 并发智能体,平均每块 GPU 可承载 57.5 个 智能体。H200 的对应成绩约为每兆瓦 2600 个、每块 GPU 1.4 个。按这一口径计算,GB300 在每兆瓦指标上领先约 20 倍,在每 GPU 服务密度上领先约 40 倍。
这两组数据反映的含义并不相同。每兆瓦指标对应的是电力预算下的智能体产能,本质上是一笔能效账;每 GPU 指标反映的则是单卡服务密度,更接近硬件投资回报。对于需要估算机房功耗、机架规模和服务容量的企业用户,这两项指标都比单纯的 token 吞吐更接近实际决策需求。
英伟达同时提到,首批榜单不仅包含 GB300,也纳入了 AMD MI355X 等产品,并覆盖单卡、整机到机架级系统。按照目前披露的结果,机架级系统在推理拆分和资源摊销上天然更有优势,无论算力利用率还是每兆瓦效率,整体表现都优于单节点方案;而从 Hopper 到 Blackwell 的代际跨越,也显示出并非小幅迭代,而是系统承载能力的明显跃升。

72 卡 NVLink 机架成为成绩背后的关键变量
从架构层面看,GB300 NVL72 的核心并不只是单卡性能提升,更重要的是 72 块 GPU 通过 NVLink 连接成一个高带宽机架级整体。对于混合专家模型而言,这使模型可以在更大范围内分布,多个专家模块并行运行,而不必受限于单卡资源边界。
英伟达表示,CUDA 栈进一步优化了专家间通信与计算重叠,尽量把协调开销隐藏在计算过程中;TensorRT-LLM 则在高并发场景下负责维持吞吐与时延平衡,例如分别优化输入预处理和输出生成路径。换句话说,这一成绩并不是单一芯片参数的结果,而是硬件、互联与软件栈联合作用后的系统级表现。
在这种架构下,各块 GPU 能更快共享参数、KV cache 和中间结果,这也是 GB300 NVL72 能在基准中支撑超过 6 万个智能体并发会话的基础。相比之下,若缺少机架级互联和系统软件优化,即便单卡能力提升,也难以把智能体推理的链式负载平滑地扩展到大规模并发。

基准成绩不等于生产环境可直接兑现的服务能力
不过,这组数据也有明确边界。首先,61400 个并发智能体并不意味着一台设备同时运行 61400 个完全独立的大模型实例。按照 AA-AgentPerf 的定义,这是一种并发会话模拟:每个智能体沿着预先录制的轨迹运行,工具调用也不是实际执行,而是以固定 CPU 耗时模拟,以便尽量把测试结果聚焦在算力系统本身。
其次,Artificial Analysis 也指出,这项基准仍属于快速变化中的前沿快照,并非固定不变的生产服务协议。随着软件栈持续优化,各家系统成绩仍可能继续抬升。因此,目前结果更适合用于横向比较系统设计和能效趋势,而不是直接映射到企业对外承诺的 SLA。
最后,AA-AgentPerf 目前仍是单一机构提出的测试标准。它能否像 MLPerf 那样成为全行业广泛接受的通用标尺,还有待观察。但从指标设计看,AI 推理评测从“tokens per second”转向“agents per megawatt”,已经释放出明确信号:当智能体成为主要负载后,衡量标准也在从模型层性能转向系统级承载力与能效。

