SemiAnalysis:Kimi K3降KV带宽,但AI网络需求未必收缩

SemiAnalysis:Kimi K3降KV带宽,但AI网络需求未必收缩

N
News Editor
2026-07-19 02:20:13
SemiAnalysis表示,Kimi K3约四分之三网络层采用KDA,可把KV缓存传输带宽较完整全局注意力模型最多降低10倍,但这不代表AI网络交换机市场会明显缩小。该机构指出,Kimi K3拥有2.8万亿参数,即便采用MXFP4,单次前向计算仍需约1.5TB HBM带宽;若要在保证交互速度并实现盈利部署的前提下运行,仍要依赖GB300 NVL72等高带宽网络连接大量芯片,以及WideEP扩展服务。
SemiAnalysisKimi K3AI网络KV缓存KDAGB300 NVL72WideEP

BlockBeats 消息,7 月 19 日,半导体与 AI 独立研究机构 SemiAnalysis 发文称,尽管 Kimi K3 约四分之三的网络层采用 KDA,相比完整全局注意力模型可将 KV 缓存传输带宽最多降低 10 倍,但这并不意味着 AI 网络交换机市场规模会大幅收缩。

SemiAnalysis 表示,Kimi K3 拥有 2.8 万亿参数,即使采用 MXFP4,每次前向计算仍需约 1.5TB HBM 带宽。若要在保持合理交互速度的同时实现盈利部署,仍需要通过 GB300 NVL72 等高带宽网络连接大量芯片,并依赖 WideEP 扩展服务。

据介绍,WideEP 会将 896 个专家模型分散到多个 GPU,并在每层、每次前向计算中两次执行 Token 分发与结果合并,单次前向计算需要执行 120 次以上。相比之下,预填充与解码之间的 KV 缓存传输在每轮对话中只发生一次,因此 KDA 节省的传输带宽,可能小于大规模专家模型带来的扩展网络需求。

SemiAnalysis 还认为,更高效的注意力机制可能推动上下文长度从 100 万 Token 提升至 500 万 Token 以上。按照 Jevons 悖论,效率提升也可能扩大 AI 的使用规模,从而带来更多网络需求。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。