CoreWeave 联合创始人兼首席发展官 Brannin McBee,以及企业发展与投资者关系副总裁 Nick Robbins,在 Key Context 近期访谈中谈到 AI 需求、neocloud 市场和基础设施瓶颈。原文作者为 Tae Kim,中文编译来自 Peggy、BlockBeats。两位高管给出的核心判断相当直接:AI 需求似乎每天都在以新的方式加剧,行业真正的限制因素也不再只是 GPU 数量,而是供电数据中心壳体、CPU、存储、电工、供应链执行与客户愿意为新一代算力承担的服务器成本。

CoreWeave 成立于 2017 年,为初创公司和大型企业提供大规模 GPU 算力,被视为 neocloud 领域较早进入市场的代表公司。AI 研究机构 SemiAnalysis 将其列为唯一获得最高级别“白金评级”的云服务商。CoreWeave 的位置也较特殊:它既服务 OpenAI、Anthropic、Meta、Google、Microsoft、Nvidia 等客户,也能直接接触研究实验室、企业客户和超大规模云服务商的需求变化。

智能体与推理把需求推向新阶段
在被问到智能体 AI 需求浪潮何时开始爆发时,Brannin McBee 表示,CoreWeave 在去年第四季度就看到了真正开端。当时公司正与客户进行工程层面的沟通,讨论客户预计在今年第一季度推向市场的产品。他说,CoreWeave 与客户之间存在深度互联的工程关系,这让公司能够提前观察趋势,而不是在变化发生后再响应。从 AI 市场产品角度看,他认为第一季度是推理和 AI 消费出现巨大拐点的时刻,而且这种加速延续至今。
Nick Robbins 对当前需求状态的描述更加简短。他在回答最近几周是否完全没有放缓迹象时说:“它似乎每天都在以新的方式加剧。”这也是整场访谈的主线:AI 工作负载本身正在变化,需求不只围绕 GPU 展开。随着智能体和推理能力在模型中兴起,CPU 与存储的重要性同步上升,数据中心设计也需要为更多服务器形态预留位置。

CPU、存储与 Vera Rubin 服务器进入规划核心
谈到 CPU 相对于 GPU 的需求上升趋势时,Brannin McBee 表示,CoreWeave 从 2023 年开始就在运行 CPU,公司一直拥有完整云产品。因此问题不是 CoreWeave 是否刚开始增加 CPU,而是客户究竟需要什么,以及这种需求在相对意义上是否上升。他给出的答案是“非常明确,确实如此”。他还表示,随着智能体和推理能力在模型中真正兴起,存储需求相较前几代也在上升。

Nick Robbins 进一步说明,未来确实会看到大量 Vera CPU 被部署在大量 Vera Rubin 服务器旁边。CoreWeave 去年已经从根本上重新设计基础数据中心方案,为更多存储和更多 CPU 留出空间,使它们能够部署在 GPU 旁边。他把这种设计调整归因于 CoreWeave 在生态系统中的位置:公司是服务所有最先进技术用户的独立云服务商之一,客户包括 Anthropic、OpenAI、Meta、Google、Microsoft、Nvidia 等。这形成了一个正向反馈循环,使 CoreWeave 能理解客户把技术带向哪里,并据此规划基础设施。
关于未来是否主要使用 Nvidia Vera CPU,Nick Robbins 表示这取决于具体工作负载。CoreWeave 的做法由客户需求驱动,公司已经披露预计会成为 Vera CPU 的早期且重要采用者。目前机群主要仍是 AMD,但随着时间推移,会根据客户需求调整。他还表示,客户对 Vera CPU 的兴趣非常浓厚。Brannin McBee 补充说,CoreWeave 98% 以上收入由合同驱动,公司不是猜测客户想要什么基础设施,而是由客户明确提出配置要求,客户在定义 CoreWeave 要建设什么。

竞争重点从芯片采购转向执行能力
谈及面对 SpaceX、Nebius、Oracle 等 neocloud,以及 Azure、AWS、Google 等超大规模云服务商的竞争,Brannin McBee 更愿意从第三方验证角度解释差异化。他说,除中国外,全球排名前十的 AI 实验室中有九家使用 CoreWeave 平台;SemiAnalysis 也一直将其性能单独列为最高水平。他表示,公司获得 GPU 分配并非因为与 Jensen 的私人交情,而是供应商对 CoreWeave 执行记录和工程能力有很深信心,相信公司能够在全球范围内体现其产品能力。

Nick Robbins 将客户类型与 CoreWeave 的能力逐一对应:公司能赢得超大规模云服务商客户,是因为擅长执行,能够以很快速度搭建系统,并保持良好运行;能赢得研究实验室客户,是因为提供性能最强的技术版本,并在每 token 效率上表现最好;能赢得企业客户,是因为基础设施运行良好,同时构建了被白金评级认可的编排层。他还提到,CoreWeave 正在构建覆盖推理和开发工具的成熟能力层,帮助企业把 AI 投入生产,把数据转化为模型,再转化为可在内部运行的智能体,并在这个过程中交叉销售 CoreWeave 云服务。
最大瓶颈是具备供电条件的数据中心壳体
对于当前瓶颈究竟是供电数据中心壳体、GPU 还是电工,Brannin McBee 的回答是 powered shells,也就是具备供电条件的数据中心壳体;更准确地说,是这些壳体内部的组件。他认可电工也是复杂领域中的关键因素。与此同时,他强调 CoreWeave 已经有 49 个这样的站点上线并运行,公司不是把希望押在一两个站点上,而是已经执行了 49 次。这让 CoreWeave 积累了供应链处理经验,也知道哪些供应商适合合作、哪些不适合合作。

关于 HBM 内存成本和短缺,Nick Robbins 表示,CoreWeave 的商业模式是在签署 GPU 采购订单、确定自身支付成本的同时,锁定向客户收取的 GPU 价格。更广义地说,这也是服务器价格,而服务器价格包含 HBM 成本。他说,目前获取组件并不是最大瓶颈,最大瓶颈仍是 powered shell。谈到 Vera Rubin 部署节奏时,他表示 CoreWeave 是全球第一家启动并全面验证 VR,即 Vera Rubin 机柜的公司,去年在 GB200、GB300 上也是如此。他预计 VR 会在今年晚些时候开始出现,真正大规模、强劲的部署爬坡会贯穿整个 2027 年;这一节奏与 GB 类似,GB 在 2025 年开始出现,但真正大规模爬坡贯穿 2026 年。按他的表述,未来 12 到 18 个月内,VR 将呈现非常相似的节奏。

