SemiAnalysis:OpenAI 自研推理芯片 Jalapeño 实测领先 Blackwell

SemiAnalysis:OpenAI 自研推理芯片 Jalapeño 实测领先 Blackwell

N
News Editor
2026-08-26 08:43:40
SemiAnalysis 披露的实验室测试显示,OpenAI 自研推理芯片 Jalapeño 在每兆瓦 token 吞吐量上超过英伟达 Blackwell,部分指标也高于下一代 Rubin。该芯片从 2024 年中启动开发到流片约 16 个月,由 OpenAI 与博通联合打造。报道还提到,OpenAI 将效能/瓦特作为核心目标,并规划在单个扩展网络内连接最多 2,048 个 XPU。

SemiAnalysis 披露的实验室测试数据显示,OpenAI 自研推理芯片 Jalapeño 在每兆瓦 token 吞吐量指标上超过英伟达现役旗舰 Blackwell,部分对比中也高于下一代 Rubin。这款芯片从设计到流片仅用了 16 个月,由 OpenAI 联手博通从零打造,属于其第一代 ASIC。

16 个月完成流片

报道提到,过去两年 OpenAI 一直低调推进 Jalapeño,直到 Hot Chips 2026 才正式公开。SemiAnalysis 称,该项目于 2024 年中启动,从团队招聘到制造流片约 16 个月,在 ASIC 开发中并不常见。

按照 SemiAnalysis 的说法,第一代芯片通常很难具备明显竞争力,但 Jalapeño 采用了另一条路线。该机构表示,在多个顶级开源模型上,Jalapeño 击败了其能够测试的所有英伟达、AMD 和谷歌芯片。文中将这一结果归因于 OpenAI 对软硬件协同设计的推进,以及其并未将芯片过度针对某一单一环节,而是选择做一款面向通用推理场景的高效芯片。

每兆瓦吞吐量测试领先 Blackwell

SemiAnalysis 表示,其受邀进入实验室,并使用 InferenceX 套件完成基准测试。按照披露结果,在每兆瓦总功耗下的 token 吞吐量表现中,Jalapeño 超过了所有对手。

报道特别提到,这一结果是在 Jalapeño 没有启用多 token 预测(MTP)的情况下实现的,而图表中的其他芯片均开启了 MTP。

  • 在 DeepSeek R1 模型上,并发数为 1 时,每用户每秒超过 700 个 token
  • 在 Kimi-K2.5 和 GPT-OSS 上,每用户每秒约 1,400 个 token
  • 所有模型的 GSM8k 评测结果与英伟达芯片持平

SemiAnalysis 认为,更公平的比较方式是看单 token 预测结果。在这一口径下,Jalapeño 仍领先所有竞争对手。报道还称,在低并发场景中,该芯片表现出较强的交互性,而且没有使用推测解码,也没有采用预填充与解码分离。

对标对象被指更接近 Rubin

SemiAnalysis 认为,把 Jalapeño 与 Blackwell 对比并不完整,也不完全公平。按其说法,Jalapeño 真正的对手更接近同样采用 HBM4 的 Rubin 系列芯片。

报道指出,Vera Rubin 系统已经开始向客户出货,而 Jalapeño 目前仍处于工程样品阶段,距离量产还有一段时间。SemiAnalysis 还表示,它原本就预期像 Jalapeño 这样的定制芯片会超过 Blackwell。根据文中数据,Vera Rubin NVL72 的每瓦效能是 GB200 NVL72 的 5.4 倍。即便如此,Jalapeño 在每兆瓦 STP 输出 token 吞吐量上仍然领先,并超过 Vera Rubin 的 MTP 结果。

OpenAI 把每瓦效能放在核心位置

报道称,OpenAI 将效能/瓦特作为设计目标,原因在于其当前受限的是数据中心电力,而不是预算或机房空间,因此每兆瓦可产出的 token 数变得格外关键。

在 Computex 2026 上,黄仁勋曾表示:「如果你有 1 吉瓦的电力,那么每瓦的吞吐量就是收入。」

SemiAnalysis 进一步指出,运营商无法轻易获得更多兆瓦。增加 GPU 数量与提升电网容量所需时间并不一致,数据中心电力上限还受到公用事业互联、基础设施、冷却能力以及 UPS 和备用发电设计等限制。报道称,这也带动了对表后电力容量的需求,也就是在数据中心本地建设燃气轮机和现场发电机,并称这正是 xAI 的 Colossus 2 严重依赖表后电力的原因。

单一扩展网络最多连接 2,048 个 XPU

架构方面,OpenAI 可以在单个扩展网络内连接多达 2,048 个 Jalapeño XPU。该扩展网络由本地域和全局域两部分组成。

  • 本地域:通过背板连接单机架内全部 128 个 XPU,每个 XPU 单向带宽 4.8Tb/s,并全对全连接到 6 个 102.4Tb/s 的 Tomahawk 6 ASIC
  • 全局域:通过铜缆和光互连混合方式,连接 16 个机架、共 2,048 个 XPU,每个 XPU 的全局链路单向带宽为 1.6Tb/s
  • 扩展网络约占总系统成本的 10%,报道称这为未来 10 兆到 20 兆参数模型保留了可选性

在系统设计上,OpenAI 没有把预填充和解码拆分到不同芯片池,草稿模型与主模型共用相同芯片和互连结构。报道称,这一方案牺牲了一部分理论效率,以换取实际运维上的便利,因为工作负载构成会随时间变化,若预先为异构预填充硅和解码硅配置固定数量,长期可能带来效率问题。

下一个目标指向 100MW

报道最后提到,Jalapeño 的首个生产 token 即将到来,下一目标是 100MW。文中称,当前障碍主要在硬件侧,包括产能、数据中心部署与运营能力,以及监控和韧性处理等;软件层面则被描述为已经完成验证。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
20

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。