Jefferies 与美国银行(BofA)两份研究报告指出,随着 AI 机架规模持续扩大,算力芯片在整体建置成本中的占比已经回落,内存占比大致持平,而光学互连网络正成为 AI 基础设施支出的新重心。两家机构都认为,这一环节的市场地位仍未被投资人充分定价。
机架成本结构重组
根据 Jefferies 针对 NVIDIA AI 机架平台物料清单(BOM)的分析,GPU 在整体机架成本中的占比,已从早期 GB300 NVL72 世代的 62.5%,逐步降至 Rubin 世代 NVL576 Pod 的 46%。
但与此同时,单一机架的总采购成本却从 416 万美元升至 5,525 万美元,增幅超过 13 倍。报告指出,这并不意味着 GPU 变便宜,而是其他部件的成本扩张速度更快。
其中,网络设备与光纤互连的成本占比,从 GB300 时代的 8.6% 升至 NVL576 Pod 的 22.4%。按绝对金额计算,超过 1,200 万美元的机架建置费用流向了光学互连与交换网络。
推理场景把内存推到瓶颈位置
美国银行几天前与前微软工程副总裁 Fran Cardells 的访谈,则从系统架构角度解释了这轮成本变化。Cardells 表示,AI 推理基础设施与模型训练存在本质差异:推理要求接近实时的响应、极低延迟、更本地化的内存配置,以及具备经济效益的 GPU 利用率。
在 agentic AI 工作负载下,KV 缓存需要保存此前的 token 序列、企业场景上下文、护栏规则以及 agent 决策日志。在部分场景中,这部分规模可达到模型权重本身的 10 倍。随着上下文窗口从约 128K token 向 1M token 扩展,再叠加多 agent 同步运行的需求,内存需求仍在快速上升。
报告提到,HBM4 的加入、系统内存需求扩大,以及 3D NAND 作为 KV 缓存卸载存储介质进入机架配置,共同推高了内存在 BOM 中的占比。尽管后续随着 HBM4 量产成熟,这一占比回落至约 19%,但 Cardells 认为,HBM 需求预计仍将维持高位,短期内供给紧张的格局不会解除。
光子学与高速互连被点名低估
当 GPU 集群从单一机架演进到跨机架 Pod,再扩展到更大规模的数据中心 fabric,机架之间的光学互连以及对外的 scale-out 网络,开始成为无法回避的大额支出。
Cardells 直接表示:「高速网络、光子学、内存池化(memory pooling)、芯片内内存创新,以及超以太网(Ultra Ethernet),是目前市场最被低估的 AI 基础设施投资主题。」
他解释称,推理效率的关键在于让 GPU 尽可能保持满载运算。要做到这一点,需要依靠高带宽网络快速搬运 KV 缓存,把非活跃数据卸载到 DRAM、NVMe 或 Flash 等成本更低的内存层级,并在任务恢复时即时重新载入压缩信息。
这也意味着,推理流程的核心瓶颈,已经从「拥有多少 GPU」转向「数据能以多快的速度在 GPU、内存与存储之间流动」。
受益标的从 GPU 供应链转向光学生态
综合两份报告,美国银行明确点名 SanDisk(SNDK)是 3D NAND 的直接受益者,并看好 DigitalOcean Holdings(DOCN)、Apple(AAPL)、DELL、Hewlett Packard Enterprise(HPE)在 agentic AI 推理基础设施普及过程中的长期布局机会。
Jefferies 的 BOM 数据则纳入了 Coherent(COHR)、中际旭创(InnoLight)等光收发模块厂商、Fabrinet(FN)等代工企业,以及博通(AVGO)、Marvell(MRVL)等高速网络交换芯片设计商,并看好这些公司的订单能见度逐步提升。

