SemiAnalysis:AI 推理更看重内存带宽,调度层成基础设施关键

SemiAnalysis:AI 推理更看重内存带宽,调度层成基础设施关键

N
News Editor
2026-09-22 04:50:22
SemiAnalysis 发布报告,拆解大模型推理服务底层架构。报告称,MoE 模型普及后,推理已演变为由 Prefill、Midfill、Decode Attention 和 Decode Experts 组成的复杂流水线,不同阶段对算力、内存带宽和网络需求并不相同。其判断是,在多数推理场景中,内存带宽比容量更具经济价值,调度层、缓冲机制和 KV 缓存分级管理将直接影响集群吞吐效率。

研究机构 SemiAnalysis 发布报告,对大模型推理服务的底层架构进行了系统拆解。报告指出,随着 MoE 模型成为主流,AI 推理已经不再是单一计算任务,而是由预填充(Prefill)、中间填充(Midfill)、解码注意力(Decode Attention)和解码专家(Decode Experts)组成的复杂流水线。

不同阶段资源需求并不相同

报告称,上述不同阶段对算力、内存带宽和网络的需求存在明显差异。在多数推理场景下,内存带宽比容量更具经济价值。SemiAnalysis 认为,高带宽内存可以提升 Token 生成效率,而闲置的 HBM 只会增加成本。

2027 年单阶段本地快速内存需求或达 400 至 500GB

SemiAnalysis 预计,到 2027 年,单个流水线阶段可能需要约 400 至 500GB 本地快速内存。不过,已经完成处理的 KV 缓存应及时迁移至 CPU DRAM 及更低成本的网络存储,以避免继续占用稀缺的 HBM 资源。

调度层被视为关键环节

报告认为,调度层将成为 AI 推理基础设施的关键部分。预填充和中间填充的处理时间相对可预测,解码时长则存在较大波动,容易造成任务积压和「延迟反馈震荡」。在这一背景下,稳定的缓冲机制、跨时间尺度的调度,以及 KV 缓存分级管理,将直接影响推理集群的吞吐效率。

聚合式与分离式架构各有取舍

在架构选择上,报告比较了聚合式和分离式两种方案。聚合式方案将 Prefill 和 Decode 集中在同一设备上,可以减少 KV 缓存跨节点传输,但要求硬件同时具备高计算密度和高内存带宽。分离式方案则针对不同阶段配置专用节点,能够实现硬件优化,但会增加数据搬运和网络开销。

SemiAnalysis 认为,这两种架构如何取舍,最终取决于未来是否会出现兼具高算力和高内存带宽的「全能型」加速器。

模拟结果涉及 Kimi K3 与英伟达多套系统

报告还通过模拟器预测了 Kimi K3 在英伟达 B200、B300 和 GB200 系统上的表现。结果显示,GB200 在部分低延迟场景具备优势,而多数前沿配置的单 GPU HBM 峰值驻留量低于 80GB,这也进一步凸显了内存带宽和存储编排的重要性。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。