
KV缓存

SemiAnalysis
2026-09-22 04:50:22SemiAnalysis:AI 推理更看重内存带宽,调度层成基础设施关键
SemiAnalysis 发布报告,拆解大模型推理服务底层架构。报告称,MoE 模型普及后,推理已演变为由 Prefill、Midfill、Decode Attention 和 Decode Experts 组成的复杂流水线,不同阶段对算力、内存带宽和网络需求并不相同。其判断是,在多数推理场景中,内存带宽比容量更具经济价值,调度层、缓冲机制和 KV 缓存分级管理将直接影响集群吞吐效率。
400

2910

Google
2026-07-24 09:25:16Google推TurboQuant压缩算法,AI内存需求称降6倍拖累存储股
Google Research发布无需训练的TurboQuant,称可将LLM的KV缓存压缩至3位元、内存占用至少降6倍。消息公布后,美光、三星电子、SK海力士等存储股走弱。
290

SemiAnalysis
2026-07-19 02:20:13SemiAnalysis:Kimi K3降KV带宽,但AI网络需求未必收缩
SemiAnalysis表示,Kimi K3约四分之三网络层采用KDA,可把KV缓存传输带宽较完整全局注意力模型最多降低10倍,但这不代表AI网络交换机市场会明显缩小。该机构指出,Kimi K3拥有2.8万亿参数,即便采用MXFP4,单次前向计算仍需约1.5TB HBM带宽;若要在保证交互速度并实现盈利部署的前提下运行,仍要依赖GB300 NVL72等高带宽网络连接大量芯片,以及WideEP扩展服务。
1550

AI基础设施
2026-07-10 20:52:13MatX创始人:批量大小可将AI推理效率提升千倍
MatX创始人Reiner Pope表示,批量大小是影响AI训练与推理成本效率的关键变量,合理批处理、KV缓存优化和GPU利用率提升可显著降低单token成本。
530

