Google Research于25日发布TurboQuant压缩算法,称这套无需训练的方案可把大型语言模型的KV缓存量化至仅3 位元,在不损失模型准确度的情况下,将内存使用量压缩至少 6 倍。消息公布后,存储板块迅速承压,美光当日盘中一度下跌6.1%,收于382.09 美元,创三周来收盘新低。
美股其他相关个股同样走弱,Sandisk下跌3.5%,希捷跌2.59%,威腾电子跌1.63%。亚洲市场也未能独善其身,三星电子开盘重挫3.6%,SK海力士下跌4.5%。市场的直接反应很明确:如果AI模型对内存的需求下降,近期因元件紧缺形成的定价能力可能受到冲击。
KV缓存成为大模型推理中的内存瓶颈
KV缓存(Key-Value Cache)是LLM在生成过程中保存已处理注意力数据的核心机制,作用是避免模型在输出每个token时重复计算。上下文窗口持续扩张后,这部分开销越来越大,也让KV缓存成为AI推理环节最突出的内存压力来源之一。
Google给出的方案分为两个阶段。第一阶段使用PolarQuant对数据向量进行旋转,以获得更高质量的压缩;第二阶段再通过Quantized Johnson-Lindenstrauss算法消除残余误差。Google指出,传统向量量化方法通常会带来每个数值约1 到 2 位元的额外开销,而TurboQuant试图把这部分负担降到更低。
H100基准测试显示4位元版本提速8倍
按Google披露的数据,在英伟达H100 GPU的基准测试中,4 位元TurboQuant在计算注意力度量值时,相较未量化的32 位元键,性能提升8 倍,同时KV缓存内存占用压缩至少6 倍。Google还表示,该算法无需额外训练或微调,运行时开销很低,可直接部署到正式推理环境以及大规模向量搜索系统。
官方称,相关论文将于4 月在ICLR 2026大会正式发表。
分析师对存储需求前景并未形成一致判断
市场抛售出现后,并不是所有观点都认同“内存需求将被削弱”的判断。部分分析师援引杰文斯悖论,认为当资源使用成本下降,整体需求未必同步减少,���而可能因为门槛降低而扩大。按这一逻辑,若TurboQuant显著降低AI推理成本,AI模型部署范围扩大,最终对内存和闪存的总需求仍可能上升。
Lynx Equity Strategies分析师在报告中表示,Google描述的方法在未来3 到 5 年内“几乎不会减少对内存和快闪内存的需求”,原因是供给仍然极度受限。基于这一判断,该机构维持美光700 美元目标价。

