日本 AI 产业正加快降低对 Nvidia GPU 服务器的依赖。日经亚洲报道,美国 AI 基础设施公司 Penguin Solutions(PENG)计划在 2026 年第四季度于日本推出 MemoryAI KV 缓存服务器,试图用更低成本扩充大型语言模型(LLM)的推理内存容量。

这类替代方案的核心,是把原本受限于 GPU 高带宽内存(HBM)的 KV 缓存需求,转移到外部内存层,也让 HBM 市场面临新的压力。
Penguin Solutions用CXL切入AI推理内存瓶颈
报道指出,AI 推理负载约 70% 的性能瓶颈来自内存带宽与容量,仅 30% 属于计算集群。当 LLM 对话上下文所需的 KV 缓存超出 GPU 内置 HBM 的容量上限后,现有做法通常包括重新计算已丢弃的 token、把缓存卸载到 NVMe SSD,或直接增加更多 GPU,但这些方案分别会带来更高延迟或更高建设成本。
Penguin Solutions 推出的 MemoryAI KV 缓存服务器,瞄准的正是这一瓶颈。该产品采用 CXL(Compute Express Link)开放标准内存互连技术,在 GPU 集群之外建立新的内存层级,把 LLM 的 KV 缓存从 GPU HBM 卸载到外部 DDR5 内存模块,最高可配置 11 TB 容量,速度较 NVMe 方案快 10 倍。
报道将其称为业界首款量产就绪的 CXL 型 KV 缓存服务器。按报道预估,如果把 KV 缓存转移到外部内存,每 GB 成本可压缩到扩充 GPU 方案的三分之一到七分之一,给日本 AI 业者提供了一条不必继续扩大 Nvidia GPU 采购、也能扩大 LLM 推理规模的替代路径。
日本市场同步测试NPU低功耗推理路线
除内存优化外,另一条替代方案也在推进。报道称,丰通装置已于 2025 年 10 月与韩国 AI 初创 Rebellions 签署合作备忘录,双方将在日本市场共同推广 NPU 产品并开发市场。丰通装置目前也正与当地 AI 业者 Tomorrow Net,就搭载 Rebellions NPU 的服务器进行 PoC 测试。
NPU 的价值在于针对 AI 推理阶段所需的矩阵乘法与 transformer 运算进行架构优化。在相同推理任务下,这类芯片通常能以显著低于 GPU 的功耗,提供具竞争力的吞吐量,从而降低数据中心的电力与散热成本。
HBM需求结构面临压力,SK海力士、三星与美光被点名
从 AI 内存市场角度看,报道认为“去辉达化”浪潮也会波及主要内存厂商。CXL 方案的影响在于,客户扩充 KV 缓存容量时,不再一定要通过增加 GPU 来实现,而每张 GPU 又与 HBM 需求直接绑定。
按 Counterpoint 给出的全球 HBM 市场收入份额,SK 海力士占 58%,三星占 21%,美光占 21%。如果替代方案削弱整体市场对高成本 HBM 的需求,首当其冲的将是这三家厂商。

日经亚洲:AI重心转向推理,GPU主导地位面临长期变量
日经亚洲分析称,随着 NPU 普及,以及 Google 自研 TPU 等“去辉达化”技术方案出现,中长期来看,GPU 的供需格局将面临新的重要变量。
其依据是,AI 产业的计算重心正在从模型训练快速转向推理。训练属于偶发性、计算密集型任务,GPU 大规模并行算力优势更明显;推理则是持续性、内存密集型服务,架构更轻、功耗更低的 NPU,以及依靠 CXL 进行内存优化的方案,在经济性上更有吸引力。
在这一背景下,Penguin Solutions 的 CXL 内存方案与 Rebellions 的 NPU 服务器,分别从内存优化和推理芯片两个方向,提供了替代技术路径,也为韩国 AI 半导体厂商进入日本市场打开了一个战略窗口。

