BlockBeats 消息,7 月 19 日,半导体与 AI 独立研究机构 SemiAnalysis 发文称,尽管 Kimi K3 约四分之三的网络层采用 KDA,相比完整全局注意力模型可将 KV 缓存传输带宽最多降低 10 倍,但这并不意味着 AI 网络交换机市场规模会大幅收缩。
SemiAnalysis 表示,Kimi K3 拥有 2.8 万亿参数,即使采用 MXFP4,每次前向计算仍需约 1.5TB HBM 带宽。若要在保持合理交互速度的同时实现盈利部署,仍需要通过 GB300 NVL72 等高带宽网络连接大量芯片,并依赖 WideEP 扩展服务。
据介绍,WideEP 会将 896 个专家模型分散到多个 GPU,并在每层、每次前向计算中两次执行 Token 分发与结果合并,单次前向计算需要执行 120 次以上。相比之下,预填充与解码之间的 KV 缓存传输在每轮对话中只发生一次,因此 KDA 节省的传输带宽,可能小于大规模专家模型带来的扩展网络需求。
SemiAnalysis 还认为,更高效的注意力机制可能推动上下文长度从 100 万 Token 提升至 500 万 Token 以上。按照 Jevons 悖论,效率提升也可能扩大 AI 的使用规模,从而带来更多网络需求。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

