Google在Cloud Next 2026大会上推出第八代TPU,做了一项史无前例的决定:将训练与推理任务拆开,交给两颗专用芯片处理。TPU 8t专攻训练,TPU 8i专攻推理。Google宣称,后者每美元的推论效能比上一代Ironwood提升80%。
为何分拆训练与推理
AI计算分为两个截然不同的阶段。训练需要极高算力密度,让模型从大量数据中学习。推理则是模型部署后响应每一次查询,追求低延迟和低成本。过去一块TPU兼顾两者,但从第八代起正式分家。
TPU 8t:训练专用,具备12.6 petaFLOPS的4位元浮点运算能力,216 GB高频宽内存,6.5 TB/s内存频宽。Google称其训练速度比上一代快3倍,并可让超过100万颗TPU同时协作于单一丛集。
TPU 8i:推理专用,具备10.1 petaFLOPS的FP4运算能力,288 GB高频宽内存,384 MB片上内存——后者用于减少资料搬移延迟。Google表示,在低延迟目标下,TPU 8i每美元效能较前代提升80%。两芯片预计2026年内正式对外开放。
Nvidia的护城河面临挑战
Nvidia目前一条GPU产品线同时服务训练与推理。即将推出的Vera Rubin规格为35 petaFLOPS FP4、288 GB HBM4内存、22 TB/s频宽。纯算力数字仍远超TPU 8t的12.6 petaFLOPS。但推理市场的竞争核心是每次模型回答的费用。TPU 8i的设计目标正是压低单位推理成本,这正是Anthropic、OpenAI等大型模型厂商最在意的数字。
值得注意的是,Anthropic已宣布将Claude的训练与服务扩展至“多gigawatt级别”的TPU容量,成为目前公开最大的TPU客户。OpenAI也开始取用Google的TPU容量。
不过Google并未否定Nvidia。它同步宣布自家云端将在2026年底提供Nvidia Vera Rubin芯片。两家公司还在合作强化“Falcon”网络协议——这是Google 2023年开源的数据中心网络技术,目的是让Nvidia系统在Google云跑得更有效率。
生态壁垒与云厂商博弈
Google TPU的真正挑战从来不只是规格。Nvidia拥有CUDA,一个开发者深度依赖了二十年的AI计算软体框架。从训练脚本、优化工具到学术论文复现,几乎都建立在CUDA上。Google TPU有自己的编译工具,但每次移植工作负载都代表一个摩擦点。
Amazon和Microsoft面对同样的结构性困难:自研芯片试图减少对Nvidia的依赖,同时继续采购Nvidia。超大云端服务商的逻辑不是消灭Nvidia,而是在自有芯片能有效覆盖的工作负载上,把更多利润留在自己手里。Google将训练与推理一拆为二,是一个清晰的工程信号:它决定在推理成本战场认真打一仗,不是取代Nvidia,而是让客户在特定场景下没有理由继续付Nvidia的溢价。

