Google推第八代TPU:训练推理分拆两芯片,每美元性能提升80%直击Nvidia痛点

Google推第八代TPU:训练推理分拆两芯片,每美元性能提升80%直击Nvidia痛点

N
News Editor 01
2026-07-22 12:08:13
Google在Cloud Next 2026发布第八代TPU,首次将训练与推理分拆至TPU 8t和TPU 8i两款专用芯片。TPU 8i每美元推理性能较前代提升80%,直接压低保推理成本。Anthropic、OpenAI已开始采用TPU集群。
Google TPU第八代TPU训练推理分拆AI芯片Nvidia竞争

Google在Cloud Next 2026大会上推出第八代TPU,做了一项史无前例的决定:将训练与推理任务拆开,交给两颗专用芯片处理。TPU 8t专攻训练,TPU 8i专攻推理。Google宣称,后者每美元的推论效能比上一代Ironwood提升80%。

为何分拆训练与推理

AI计算分为两个截然不同的阶段。训练需要极高算力密度,让模型从大量数据中学习。推理则是模型部署后响应每一次查询,追求低延迟和低成本。过去一块TPU兼顾两者,但从第八代起正式分家。

TPU 8t:训练专用,具备12.6 petaFLOPS的4位元浮点运算能力,216 GB高频宽内存,6.5 TB/s内存频宽。Google称其训练速度比上一代快3倍,并可让超过100万颗TPU同时协作于单一丛集。

TPU 8i:推理专用,具备10.1 petaFLOPS的FP4运算能力,288 GB高频宽内存,384 MB片上内存——后者用于减少资料搬移延迟。Google表示,在低延迟目标下,TPU 8i每美元效能较前代提升80%。两芯片预计2026年内正式对外开放。

Nvidia的护城河面临挑战

Nvidia目前一条GPU产品线同时服务训练与推理。即将推出的Vera Rubin规格为35 petaFLOPS FP4、288 GB HBM4内存、22 TB/s频宽。纯算力数字仍远超TPU 8t的12.6 petaFLOPS。但推理市场的竞争核心是每次模型回答的费用。TPU 8i的设计目标正是压低单位推理成本,这正是Anthropic、OpenAI等大型模型厂商最在意的数字。

值得注意的是,Anthropic已宣布将Claude的训练与服务扩展至“多gigawatt级别”的TPU容量,成为目前公开最大的TPU客户。OpenAI也开始取用Google的TPU容量。

不过Google并未否定Nvidia。它同步宣布自家云端将在2026年底提供Nvidia Vera Rubin芯片。两家公司还在合作强化“Falcon”网络协议——这是Google 2023年开源的数据中心网络技术,目的是让Nvidia系统在Google云跑得更有效率。

生态壁垒与云厂商博弈

Google TPU的真正挑战从来不只是规格。Nvidia拥有CUDA,一个开发者深度依赖了二十年的AI计算软体框架。从训练脚本、优化工具到学术论文复现,几乎都建立在CUDA上。Google TPU有自己的编译工具,但每次移植工作负载都代表一个摩擦点。

Amazon和Microsoft面对同样的结构性困难:自研芯片试图减少对Nvidia的依赖,同时继续采购Nvidia。超大云端服务商的逻辑不是消灭Nvidia,而是在自有芯片能有效覆盖的工作负载上,把更多利润留在自己手里。Google将训练与推理一拆为二,是一个清晰的工程信号:它决定在推理成本战场认真打一仗,不是取代Nvidia,而是让客户在特定场景下没有理由继续付Nvidia的溢价。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
400

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。