Claude、Grok 同日上午异常,Memphis 机房成共同线索

Claude、Grok 同日上午异常,Memphis 机房成共同线索

N
News Editor
2026-09-05 06:42:21
9 月 3 日上午,ChatGPT、Claude、Grok 先后出现服务异常,但截至目前三家公司没有发布一份把事件串联起来的官方说明。SpaceX 已承认,Grok 中断源于其 Memphis 运算中心,并向受影响的运算合作伙伴致歉。报道提到,Anthropic 正租用位于 Memphis 的 Colossus 1,月费 12.5 亿美元;OpenAI 则称故障来自内部路由错误,发生时间也比前两家晚近 80 分钟。

9 月 3 日上午,OpenAI、Anthropic 与 xAI 的聊天服务在相近时段先后出现问题,影响到 ChatGPT、Claude、Grok 以及部分 Codex 用户。到目前为止,仍没有一份把三家公司事故直接串起来的官方说明。

唯一明确把两家公司联系起来的官方表态来自 SpaceX。该公司在 X 上发文称:「对于今天早上我们 Memphis 运算中心中断后,你在 Grok 上可能遇到的问题,我们感到抱歉。」它还补充说:「我们也要向受影响的运算合作伙伴致歉。」SpaceX 同时表示,所有系统均已恢复并正常运行。

三家故障时间并不一致

从各家的通报时间看,三起故障并没有完全重合。

  • Anthropic 在当天早上 6 时 23 分通报,部分 Claude 模型请求错误增加;到 9 时 16 分标示为已排除。
  • Grok 从 6 时 30 分开始异常,到 10 时 5 分恢复。
  • OpenAI 表示,ChatGPT 与 Codex 自 7 时 43 分起因内部路由错误无法使用,8 时 17 分修复。

Anthropic 与 Grok 的异常开始时间只差 7 分钟,OpenAI 则晚了将近 80 分钟。这段时间差,也让三家是否存在共同原因成为外界关注的焦点。

Anthropic 租用的机房就在 Memphis

SpaceX 提到的「运算合作伙伴」并非泛泛而谈。报道提到,SpaceX 在 2 月 2 日以全股票方式并购 xAI,合并后估值为 1.25 兆美元,xAI 此后成为 SpaceX 旗下业务。

5 月 6 日,SpaceX 又与 Anthropic 签下运算合约,向后者开放 Colossus 1 的算力。Anthropic 每月向 SpaceX 支付 12.5 亿美元,租用的正是位于 Memphis 的 Colossus 1。

Colossus 1 配备超过 22 万颗 NVIDIA GPU,包括 H100、H200 以及新一代 GB200。根据 xAI 官方公告,这批算力将被 Anthropic 用来「直接提升 Claude Pro 与 Claude Max 订阅用户的容量」。报道还提到,Colossus 1 位于 Memphis 西南边一处前 Electrolux 厂房,地址为 3231 Riverport Rd。

合同金额接近 SpaceX 原有年营收

根据 SpaceX 的 IPO 申请文件,Anthropic 这份合同的付款将持续到 2029 年 5 月。按每月 12.5 亿美元计算,一年约为 150 亿美元。

报道称,SpaceX 自身年营收约 180 亿美元,这意味着仅 Anthropic 一家的付款规模,就已接近 SpaceX 原本的全年营收。Anthropic 共同创办人兼运算长 Tom Brown 当时也曾在 X 上表示,自 6 月起,Anthropic 会把用量扩大到 Colossus 2 的 GB200。

在这个背景下,Claude 与 Grok 在 7 分钟内先后出问题,而 SpaceX 又承认当天该厂房发生中断,Memphis 机房因此成为目前最具体的一条共同线索。

OpenAI 说法更明确:内部路由错误

相比之下,OpenAI 对自身故障的说明更直接。Hacker News 上一则题为「为什么 OpenAI、Claude 与 Grok 同时挂掉」的讨论串引发大量回复,其中一条留言自称来自 OpenAI 当天事故的事件指挥官。

该留言写道:「我在 OpenAI 工作,我是昨天那次事故的事件指挥官。我们基础设施内部有一个路由错误,影响了部分产品。这跟 Astra 的发布无关。我们不评论其他业者的事故。」这段说法也排除了外界关于新模型上线导致故障的猜测。

报道指出,OpenAI 与 SpaceX 之间并不存在运算合作关系,且马斯克目前仍在与 OpenAI 打官司。再加上 OpenAI 的故障时间比前两家晚了近 80 分钟,这次事件更像是发生在同一上午的独立故障,而不是同一基础设施问题的直接延伸。

第三方云服务目前没有对应事故记录

把这次故障归咎于第三方云服务商的说法,目前也没有公开依据。报道提到,Microsoft Azure、AWS 与 Google Cloud 的状态页在当天都没有相关事故记录,Cloudflare 也直接表示「没有出现任何重大服务中断」。

同一天,Google Gemini 曾有零星异常回报,但 Google 没有确认出现大型故障。

关于共同原因,现阶段仍无定论

针对 9 月 3 日的异常,网上曾出现多种猜测,包括三家 AI 公司可能共用未公开的网络监控功能,或与政府监视有关,甚至有人联想到美国国家安全局过往的监控计划。报道指出,这类说法缺乏证据;如果只是收集流量记录,通常也不会直接导致客户服务同步中断。

文中提到,一个相对更能成立的解释是连锁超载:如果一家模型服务先失效,企业与个人用户可能会立刻把需求转向其他厂商,短时间内流量激增,进而压垮接手流量的平台。报道同时指出,AI 公司本身受限于 GPU 供应与数据中心容量,未必保留足以承接竞争对手全部流量的冗余空间。

截至目前,三家公司仍未给出一份统一说明,把当天的异常事件完整串联起来。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
600

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。