英伟达近日公布了关于推理硬件选型的一组关键数据,核心结论是:在AI推理时代,衡量基础设施性价比的关键指标,不应只看“每小时每张GPU的成本”,而应转向“每单位Token的成本”。从这一角度看,尽管新一代Blackwell平台的单卡价格明显高于上一代Hopper,但其推理效率的大幅提升,正在显著压低生成式AI服务的边际成本。
根据英伟达披露的对比,在云端租赁口径下,Blackwell的每GPU每小时成本约为2.65美元,相比之下,Hopper约为1.41美元。单从硬件租用价格来看,Blackwell几乎贵了近一倍。然而在相同测试条件下,Blackwell的单GPU吞吐量可达到每秒6000个Token,而Hopper仅为每秒90个Token。这意味着前者在Token输出能力上实现了约65倍的提升。
更值得关注的是成本侧变化。按照英伟达给出的测算,Hopper的推理成本约为每百万Token 4.20美元,而Blackwell则可降至每百万Token 0.12美元,降幅达到35倍。此外,单位兆瓦的Token产出能力提升约50倍,这说明Blackwell不仅提升了算力密度,也在能效层面带来了更强竞争力。
软件优化决定最终成本表现
不过,这组看似“压倒性领先”的数字并非单纯由硬件升级带来。英伟达特别指出,每百万Token 0.12美元这一结果建立在多项软件优化全部开启的前提之上,其中包括FP4低精度推理以及MTP(Multi-Token Prediction,多Token预测)。后者允许模型在单次推理过程中生成多个Token,从而显著提高吞吐效率。
从SemiAnalysis InferenceX v2的原始数据来看,在同样基于GB300 NVL72、并运行DeepSeek-R1模型的情况下,如果不启用MTP,Blackwell的成本大约为每百万Token 2.35美元;而启用MTP后,成本可进一步降至约0.11美元。也就是说,仅MTP这一项优化,就可能带来接近21倍的成本差异。
这也提示市场,评估新一代AI芯片价值时,不能简单理解为“更贵的GPU一定更划算”或“硬件升级自然带来成本下降”。实际部署效果高度依赖软件栈成熟度、推理框架适配情况,以及模型本身的结构特征。英伟达此次采用的测试对象是DeepSeek-R1这一MoE(混合专家)推理模型,因此结果并不能机械套用于所有模型架构和参数规模。
为何“每Token成本”比“每小时GPU价格”更重要
过去市场讨论AI基础设施,常聚焦于GPU售价、租赁价格和供需关系。但随着大模型商业化进入深水区,企业真正关注的是模型上线后的运营成本,也就是每次调用、每次问答、每次内容生成背后的实际支出。对云厂商、AI应用开发者乃至提供链上AI服务的Web3项目而言,单位Token成本的变化,直接决定毛利率、定价空间以及用户增长能力。
换言之,即便Blackwell在采购或租用层面更昂贵,只要其吞吐提升足够大,最终仍可能带来更低的服务成本。这一逻辑与传统数据中心扩容思路不同,更接近互联网业务中的“单位产出效率优先”。因此,英伟达此次披露的数据,实际上是在试图重塑市场对AI芯片价值的衡量框架。
对加密市场与AI赛道的潜在影响
虽然这则消息主要聚焦AI推理基础设施,但其外溢影响同样值得加密市场关注。当前,越来越多加密项目正在将AI叙事与去中心化算力、链上代理、数据市场等概念结合。如果高端GPU的单位Token成本持续下降,那么AI应用的部署门槛可能进一步降低,这对AI Agent、去中心化推理网络以及相关基础设施代币的估值逻辑都可能形成支撑。
另一方面,硬件效率提升也可能加剧行业分化。具备先进软件优化能力和大规模算力调度能力的厂商,将更容易吃到成本下降红利;而仅依赖“囤GPU”叙事、缺乏实际推理优化能力的项目,则可能面临竞争压力。尤其是在加密市场中,部分AI概念代币此前更多依赖情绪驱动,未来投资者或将更关注底层算力利用率、模型适配能力以及真实收入转化。
整体来看,Blackwell与Hopper的对比再次说明,AI基础设施竞争已从单纯比拼芯片参数,转向“硬件+软件+模型适配”的系统级竞争。对于市场而言,最值得追踪的不只是Blackwell有多贵,而是它能否在更多真实业务场景中,持续兑现更低每Token成本这一承诺。如果这一趋势被验证,AI服务商业化速度有望进一步提升,也可能为加密AI板块带来新的基本面想象空间。

