英伟达近日在一篇关于推理硬件选择的博客中,详细披露了新一代Blackwell架构在AI推理场景下的成本表现。核心结论非常明确:衡量推理基础设施时,市场不应只看“每张GPU每小时多少钱”,而应更关注“每个Token的生成成本”。这一口径变化,可能对AI算力采购、云服务定价,乃至与算力相关的加密市场叙事带来持续影响。
Blackwell单卡更贵,但推理性价比显著提升
根据英伟达引用的云市场租用价格,Blackwell平台中的GB300 NVL72,折算后每GPU每小时成本约为2.65美元;相比之下,上一代Hopper平台中的HGX H200约为1.41美元。从单卡租金看,Blackwell几乎达到前代的两倍,表面上似乎并不“划算”。
但如果切换到Token产出效率维度,结论则完全不同。以DeepSeek-R1这一MoE推理模型作为测试样本,Blackwell单GPU每秒可输出约6,000个Token,而Hopper仅约90个Token。这意味着吞吐量提升约65倍。在这一基础上,每百万Token的成本从4.20美元大幅下降至0.12美元,降幅达到35倍。
除了单位Token成本大幅下降外,英伟达还提到,Blackwell在每兆瓦对应的Token产出方面提升约50倍。这表明其优势不仅体现在直接租赁成本上,也体现在数据中心电力利用效率层面。对于大规模部署AI推理服务的云厂商、模型服务商以及企业客户而言,这类指标的重要性正在持续上升。
软件优化是成本骤降的关键变量
需要注意的是,英伟达给出的0.12美元/百万Token这一极具吸引力的数据,并非单纯由硬件升级带来,而是建立在多项软件优化同时启用的前提下。其中,最关键的包括FP4低精度推理以及MTP(Multi-Token Prediction,多Token预测)。
按照报道援引的SemiAnalysis InferenceX v2原始测试数据,在同样的GB300 NVL72平台上运行DeepSeek-R1时,如果不启用MTP,每百万Token成本约为2.35美元;而在启用MTP后,这一数字可进一步降至约0.11美元。也就是说,仅MTP这一项优化,就带来了大约21倍的成本差异。
这组对比说明,AI推理竞争已不再只是芯片制程、显存带宽或集群规模的比拼,软件栈、推理框架和模型推理策略正在成为决定商业效率的核心因素。对于市场参与者而言,未来判断一家算力供应商的竞争力,不能只看硬件采购价格,还必须综合观察其软件协同能力。
测试结果具有模型依赖性,不能简单外推
不过,这些数据也存在明确前提。英伟达此次分析主要基于DeepSeek-R1单一模型展开,而不同模型架构、参数规模、推理任务以及上下文长度,都可能导致截然不同的结果。尤其是MoE模型与稠密模型在推理效率上的差异较大,因此不能将上述结论简单套用到所有生成式AI场景。
换言之,Blackwell在某些模型上的成本优势可能极为突出,但在其他工作负载下,实际表现仍需结合具体部署环境评估。对于企业采购方来说,这意味着算力选型将更加依赖实测,而不是单纯参考芯片名义参数或宣传口径。
对市场与加密叙事的潜在影响
从市场角度看,Blackwell所体现出的趋势,可能进一步强化“AI推理降本”这一长期逻辑。如果高端GPU虽然单价上升,但能显著降低Token成本,那么模型服务商更有动力加速更新硬件,云厂商也可能围绕更低的推理单价展开新一轮价格竞争。
这一变化对加密市场也并非毫无关联。近年来,围绕AI算力、去中心化GPU网络、AI代理以及数据基础设施的加密项目,往往高度依赖“算力稀缺”和“推理成本”叙事。如果主流中心化硬件平台不断把单位推理成本压低,那么部分加密AI项目的商业故事可能面临重估:一方面,整体AI应用普及可能受益,带动相关赛道情绪升温;另一方面,若中心化云服务在效率与价格上持续领先,去中心化算力网络则需要证明自身在成本、弹性或抗审查等方面的独特价值。
总体来看,英伟达此次披露的信息再次说明,AI基础设施竞争的衡量标准正在发生转变。未来市场讨论的重点,或将从“GPU贵不贵”转向“生成一个Token到底要花多少钱”。而在这一新标准下,Blackwell展示出的优势,已经为下一阶段的AI推理市场定下了更高门槛。

