谷歌云高管:AI运算转向内存受限,高性能内存占硬件成本75%

谷歌云高管:AI运算转向内存受限,高性能内存占硬件成本75%

N
News Editor
2026-09-02 02:17:35
SEMICON Taiwan 2026存储器高峰论坛9月1日登场,谷歌云高级总监Nikhil Cherian指出,AI运算已转向内存受限,高性能内存占AI服务器硬件成本超75%。谷歌推出软硬双轨策略:TPU 8i/8t分流推理与训练,TurboQuant算法将键值缓存压缩至3位,内存占用缩小6倍,注意力运算加速8倍。

ChainCatcher消息,SEMICON Taiwan 2026存储器高峰论坛于9月1日登场。Alphabet旗下谷歌云(Google Cloud)供应链基础架构高级总监Nikhil Cherian指出,随着多模态与混合专家架构普及,AI运算已从算力受限转向内存受限,高性能内存已占AI服务器硬件物料清单成本的75%以上。

面对容量、带宽与功耗瓶颈,谷歌通过推理与训练硬件分流、无损量化软件算法等软硬件双轨策略,突破AI内存瓶颈。

硬件分流:TPU 8i与TPU 8t

谷歌在硬件架构上采取分流策略,推出针对低延迟推理的TPU 8i以及专攻超大规模训练的TPU 8t。TPU 8i配备288GB高带宽内存,芯片上SRAM容量扩增3倍至384MiB,将动态对话状态与键值缓存置于芯片内部,实现零片外延迟。TPU 8t通过9600颗芯片组成超大型计算集群,HBM共享池化达到2PB规模,消除芯片外数据传输瓶颈,并搭配TPU Direct Storage技术。

TurboQuant:3位无损量化

谷歌开发出免训练的TurboQuant无损量化算法,将大模型的键值缓存从32位压缩至3位,在精确度零损失的前提下将内存占用缩小6倍,带来8倍注意力运算加速。该算法还导入旧世代DRAM整合技术,延长零部件生命周期。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。