摩根士丹利在最新研报中表示,AI 内存短缺可能贯穿整个周期,而英伟达不会只等供应扩产。按照该行判断,Rubin 平台可能推出更低内存配置版本,HBM4 容量或从 288GB 下调至 192GB,机架级 LPDDR5 则可能从 54TB 降至 28TB。报告强调,这并不代表需求消退,而是供给受限后,数据开始转向 NAND、DRAM 与高速互连。
这份报告由摩根士丹利半导体分析师 Joseph Moore 发布。其核心判断是,AI 竞赛的主要瓶颈正在从 GPU 数量转向内存供给,而厂商应对方式不是暂停部署,而是改写系统架构,让现有硬件继续支撑增长。
英伟达 Rubin 或推出更低内存版本
摩根士丹利称,DRAM 与 NAND 供应紧张、价格上行,正在迫使 AI 产业链重新考虑产品配置。对芯片厂商来说,如果坚持原规格导致系统无法按计划交付,不如提供不同内存容量的版本,让客户按需求选择。
在机架级内存方面,报告称 Rubin 原先规划的 LPDDR5 容量约为 54TB,部分新配置可能降至 28TB,对应 SOCAMM2 内存模组容量从 192GB 降至 96GB。
在 HBM 方面,Rubin 单 GPU 原先预计搭载 288GB HBM4,采用 8 组 12 层堆叠设计。摩根士丹利预计,英伟达可能增加配备 192GB HBM4 的产品版本,将堆叠层数降至 8 层。
对于 Rubin Ultra,报告认为,在调整为双计算芯粒方案后,512GB 是更合适的比较基准,后续可能出现约 192GB 至 384GB 的不同容量选项。
报告同时说明,这些都属于摩根士丹利在研报发布时对产品配置的判断,并非所有规格都已得到英伟达正式确认。
从成本角度看,这一策略具备合理性。报告指出,降低 HBM 堆叠层数可以减少容量,而在接口数量和引脚速率等条件不变时,理论带宽不一定同步下降。
不过,容量与带宽解决的是不同问题。对于模型较小、上下文较短的应用,容量下降的影响可能有限;但随着模型规模扩大、推理任务更复杂,内存容量不足仍可能让更多数据在不同存储层之间来回移动,增加延迟,或提高 GPU 使用量。
需求没有消失,而是转向 NAND、DRAM 和互连
摩根士丹利认为,减少 HBM 并不会让 AI 原本要处理的数据消失,只会让这些数据寻找新的存放位置。
如果 GPU 的 HBM 容量不足,部分数据可能转入主内存;如果机架级 LPDDR5 容量降低,一部分 KV Cache(键值缓存)需求则可能转向 NAND 闪存。
报告指出,KV Cache 用于大模型推理过程中的历史计算信息缓存。随着上下文变长、并发请求增加,其容量需求也会随之上升。
这意味着,英伟达的减配策略可能在短期内缓解 DRAM 供应约束,但同时会推高对 NAND、互连芯片以及更大规模 GPU 集群的需求。
摩根士丹利引用 Epoch AI 的历史数据称,大语言模型时代的前沿模型参数规模曾呈现约每 6 个月翻倍的增长趋势,上下文窗口也快速扩张。与此同时,更多 AI 应用正从简单问答转向编程、复杂推理和长时间运行的 Agent 任务,这些变化都在继续推高内存使用量。
基于这一判断,摩根士丹利认为,模型规模、上下文长度和推理并发量仍会继续推动存储需求增长。因此,下调部分产品配置更像是供给紧张阶段的过渡方案,而不是 AI 内存需求长期下行的信号。
Prefill 与 Decode 分离,推理架构开始重组
摩根士丹利关注的第二条路径,是 Disaggregated Inference,即解耦式推理。它的核心思路,是把原本集中在同一套计算系统中的不同推理任务拆开,分别交给更适合的硬件执行。
传统大模型推理主要包括两个阶段。第一阶段是 Prefill,即处理用户输入的提示词、文件或历史上下文,并进行大量并行计算,这一阶段通常更依赖计算性能。第二阶段是 Decode,即模型逐个生成输出 Token。这个过程需要反复访问模型权重和 KV Cache,因此更依赖内存带宽、容量以及数据访问延迟。
过去,同一套 GPU 往往同时承担这两类任务。摩根士丹利认为,随着推理需求扩大,这种方式未必始终是效率最高的选择。更合理的方向可能是,让更偏计算密集型的硬件负责 Prefill,再由针对低延迟和高带宽优化的架构承担 Decode。
报告称,这不仅可能提升硬件利用率,也让数据中心可以分别扩充两类算力资源,而不必为所有任务都配置相同的 GPU 和 HBM。
Cerebras 与 AMD、AWS 的组合方案
摩根士丹利认为,Cerebras 是这一变化中的潜在受益者之一。Cerebras 采用晶圆级处理器架构,将大量计算单元和 SRAM 集成在同一块芯片上。SRAM 的容量密度通常低于 DRAM,但具备低延迟、高带宽特性,适合部分需要频繁读取数据的推理任务。
报告指出,Cerebras 已与 AMD、AWS 展开合作,探索将不同处理器组合为统一的推理系统。
在 AMD 与 Cerebras 的联合方案中,AMD Helios 负责更偏计算密集型的 Prefill 和大上下文处理,Cerebras 晶圆级引擎则负责 Decode。摩根士丹利预计,该方案将在 2026 年第四季度进入生产阶段。
AWS 也采用类似思路,由 Trainium 处理 Prefill,再由 Cerebras 处理 Decode,相关组合方案预计将在 2027 年第一季度进入 Amazon Bedrock。
根据 Cerebras 和 AMD 披露的特定方案性能数据,两者结合后有望在保持 Cerebras 推理速度的同时,实现最高约 5 倍的吞吐量提升。报告同时说明,这并不意味着所有推理任务都能获得同等增幅,但说明按任务拆分硬件,可能显著改善系统经济性。
对于 Cerebras 而言,这种变化不仅可能带来更多芯片销售机会。由于该公司还运营自有推理云服务,如果相同硬件可以生成更多 Token,单位 Token 成本就可能下降,从而改善毛利率,或给下调客户价格留下空间。
英伟达也在推进类似方向
报告称,英伟达也在探索相近路线。通过整合 Groq 相关技术,英伟达正将基于 HBM 的 GPU 与采用高速 SRAM 的 LPU 架构结合使用。
在摩根士丹利描述的方案中,Rubin GPU 负责 Prefill 以及部分需要大容量缓存的解码计算,而 Groq 架构承担更适合其低延迟特性的运算,由 NVIDIA Dynamo 软件协调不同处理器之间的任务。
报告特别区分,英伟达与 Groq 在 2025 年达成的是技术授权及人才引进安排,并非对 Groq 公司的完整收购。
摩根士丹利认为,随着推理支出增速超过训练,面向不同推理环节优化的异构计算架构可能获得更大市场空间。按照该行的基础设施支出预测,到 2030 年,推理预计将占 AI 基础设施支出的约 56%,训练占比约为 44%。
这也意味着,未来评估一套 AI 系统竞争力的标准,可能不只是峰值算力,还包括每秒能生成多少 Token,以及生成每个 Token 的成本。
CXL 被视为新的内存连接增长点
除了改变推理任务的分配方式,摩根士丹利还把重点放在如何提升现有内存资源利用率上,CXL 因此被列为关键观察方向。
CXL,即 Compute Express Link,是一种高速互连协议,可让处理器更灵活地访问外部内存,而不必始终依赖本地直连 DRAM。
在传统服务器中,内存资源通常与特定 CPU 绑定。即便一台服务器存在大量闲置内存,也难以直接供另一台服务器使用。CXL 通过内存扩展、共享和池化,提高数据中心对 DRAM 的整体利用率。其内存扩展模式可为单个处理器提供额外容量;内存共享允许多个处理器访问同一份内存资源;内存池化则把分散的内存整合成统一资源池,并按工作负载动态分配。
报告指出,这项技术过去更多用于传统 CPU 计算环境,因为 CPU 工作负载更容易接受外部内存带来的额外访问延迟。相比之下,AI GPU 长期依赖 HBM 提供极高数据带宽,CXL 连接的外部 DRAM 很难直接替代 HBM。
但随着 AI 推理需求变化,这类架构的价值正在上升。长上下文推理需要保存大量 KV Cache,但并不是所有缓存数据都必须始终留在最快的 HBM 中。系统可以把性能更敏感的数据保留在 HBM,将部分访问频率较低、对延迟要求相对没那么高的数据转移到外部 DRAM。
摩根士丹利认为,这既能缓解昂贵 HBM 的容量压力,也能提高现有 DRAM 的利用率。AI 也正在推动 CXL 从传统服务器内存扩展,走向更广泛的加速器内存连接与共享市场。
报告提到,Astera Labs 过去曾将 CXL 内存控制器的潜在市场规模估计在 40 亿美元以上。摩根士丹利目前预计,随着 AI 推理、KV Cache 卸载和机架级内存池化需求增长,到 2030 年,CXL 及相关内存连接半导体的潜在市场规模有望达到约 60 亿美元。
报告同时强调,这一数字属于分析师对潜在市场空间的预测,并非已经实现的市场收入。
Astera Labs 和 Marvell 被列为重点观察对象
在具体公司上,摩根士丹利重点提到 Astera Labs 和 Marvell。
Astera Labs 的机会主要来自 Leo 内存控制器产品。报告称,公司预计标准化和定制化 Leo 产品将在 2027 年于两家美国大型云服务商客户中开始规模放量,其中包括面向 AI 推理的 KV Cache 卸载设计。
Marvell 则通过 Structera X 和 Structera S 分别布局内存扩展与机架级内存池化。该公司此前预计,CXL 业务有望在 2028 年左右贡献超过 10 亿美元收入。
不过,摩根士丹利也表示,CXL 市场的实际规模仍难以精确预测。不同云厂商可能选择非 CXL 互连技术、更大容量 HBM,或者基于闪存的缓存方案,最终采用节奏可能与当前预期存在明显差异。
因此,围绕 CXL 的投资逻辑是否兑现,还需要继续观察云厂商实际部署进度、产品出货量以及相关业务收入。
大摩维持对美光和闪迪增持评级
对存储产业链来说,英伟达下调部分内存配置表面上并不是利好。如果单个 GPU 的 HBM 容量下降,单机架 LPDDR5 用量减少,存储厂商可出售的内存数量就可能低于原先规划。
摩根士丹利承认,从短期利润最大化角度看,这确实可能削弱存储厂商原本能够获得的部分需求与定价机会。但报告认为,这不应被简单理解为存储周期即将结束。关键在于,当前减配主要是供应约束推动,而不是客户不再需要那么多内存。
报告称,当 AI 厂商希望采购更多 DRAM,却拿不到足够供应时,下调配置可以帮助其维持系统交付。未来如果供给增加,厂商仍有动力重新提高配置水平,这也意味着当前未被满足的需求,可能形成后续采购空间。
基于这一判断,摩根士丹利维持对美光(MU)和闪迪(SNDK)的 Overweight(增持)评级。该行认为,存储供应紧张不会很快结束。
不过,报告并未回避周期风险。摩根士丹利称,最核心的风险仍来自 AI 需求本身。一旦模型开发、推理应用或算力投资增速明显放缓,计算与存储产业链都可能受到冲击。
报告还提到另一种更复杂的情形:AI 需求仍强,但数据中心建设因土地、电力或基础设施限制而延迟。在这种情况下,存储产品可能已经完成生产,却因服务器部署延后而无法按预期消化,进而造成阶段性的供需失衡。
摩根士丹利认为,这类建设瓶颈可能对存储厂商形成额外扰动,甚至让其短期表现与部分计算芯片企业出现分化。因此,后续判断存储周期能否延续,不能只看 DRAM 价格和 HBM 订单,还需要跟踪 AI 基础设施的实际部署进度。
报告关注的后续变量
摩根士丹利对这一轮 AI 内存周期的核心结论是,产业真正要解决的,不是等待更多内存,而是在内存持续稀缺的情况下,继续扩大 AI 的计算能力。
按报告所列,后续值得关注的变量包括:Rubin 实际出货配置是否降低、解耦式推理能否实现商业化规模部署、CXL 产品能否在 2027 年按计划放量,以及 AI 数据中心建设是否持续消化新增存储供给。
报告认为,如果这些技术调整能够维持 AI 系统部署,同时长期存储需求继续增长,那么存储与互连产业链可能共同受益;如果 AI 投资放缓,或土地、电力限制继续阻碍数据中心落地,当前供需紧张也可能面临重新定价。

