9 月 3 日上午,OpenAI、Anthropic 与 xAI 的聊天服务在相近时段先后出现问题,影响到 ChatGPT、Claude、Grok 以及部分 Codex 用户。到目前为止,仍没有一份把三家公司事故直接串起来的官方说明。
唯一明确把两家公司联系起来的官方表态来自 SpaceX。该公司在 X 上发文称:「对于今天早上我们 Memphis 运算中心中断后,你在 Grok 上可能遇到的问题,我们感到抱歉。」它还补充说:「我们也要向受影响的运算合作伙伴致歉。」SpaceX 同时表示,所有系统均已恢复并正常运行。
三家故障时间并不一致
从各家的通报时间看,三起故障并没有完全重合。
- Anthropic 在当天早上 6 时 23 分通报,部分 Claude 模型请求错误增加;到 9 时 16 分标示为已排除。
- Grok 从 6 时 30 分开始异常,到 10 时 5 分恢复。
- OpenAI 表示,ChatGPT 与 Codex 自 7 时 43 分起因内部路由错误无法使用,8 时 17 分修复。
Anthropic 与 Grok 的异常开始时间只差 7 分钟,OpenAI 则晚了将近 80 分钟。这段时间差,也让三家是否存在共同原因成为外界关注的焦点。
Anthropic 租用的机房就在 Memphis
SpaceX 提到的「运算合作伙伴」并非泛泛而谈。报道提到,SpaceX 在 2 月 2 日以全股票方式并购 xAI,合并后估值为 1.25 兆美元,xAI 此后成为 SpaceX 旗下业务。
5 月 6 日,SpaceX 又与 Anthropic 签下运算合约,向后者开放 Colossus 1 的算力。Anthropic 每月向 SpaceX 支付 12.5 亿美元,租用的正是位于 Memphis 的 Colossus 1。
Colossus 1 配备超过 22 万颗 NVIDIA GPU,包括 H100、H200 以及新一代 GB200。根据 xAI 官方公告,这批算力将被 Anthropic 用来「直接提升 Claude Pro 与 Claude Max 订阅用户的容量」。报道还提到,Colossus 1 位于 Memphis 西南边一处前 Electrolux 厂房,地址为 3231 Riverport Rd。
合同金额接近 SpaceX 原有年营收
根据 SpaceX 的 IPO 申请文件,Anthropic 这份合同的付款将持续到 2029 年 5 月。按每月 12.5 亿美元计算,一年约为 150 亿美元。
报道称,SpaceX 自身年营收约 180 亿美元,这意味着仅 Anthropic 一家的付款规模,就已接近 SpaceX 原本的全年营收。Anthropic 共同创办人兼运算长 Tom Brown 当时也曾在 X 上表示,自 6 月起,Anthropic 会把用量扩大到 Colossus 2 的 GB200。
在这个背景下,Claude 与 Grok 在 7 分钟内先后出问题,而 SpaceX 又承认当天该厂房发生中断,Memphis 机房因此成为目前最具体的一条共同线索。
OpenAI 说法更明确:内部路由错误
相比之下,OpenAI 对自身故障的说明更直接。Hacker News 上一则题为「为什么 OpenAI、Claude 与 Grok 同时挂掉」的讨论串引发大量回复,其中一条留言自称来自 OpenAI 当天事故的事件指挥官。
该留言写道:「我在 OpenAI 工作,我是昨天那次事故的事件指挥官。我们基础设施内部有一个路由错误,影响了部分产品。这跟 Astra 的发布无关。我们不评论其他业者的事故。」这段说法也排除了外界关于新模型上线导致故障的猜测。
报道指出,OpenAI 与 SpaceX 之间并不存在运算合作关系,且马斯克目前仍在与 OpenAI 打官司。再加上 OpenAI 的故障时间比前两家晚了近 80 分钟,这次事件更像是发生在同一上午的独立故障,而不是同一基础设施问题的直接延伸。
第三方云服务目前没有对应事故记录
把这次故障归咎于第三方云服务商的说法,目前也没有公开依据。报道提到,Microsoft Azure、AWS 与 Google Cloud 的状态页在当天都没有相关事故记录,Cloudflare 也直接表示「没有出现任何重大服务中断」。
同一天,Google Gemini 曾有零星异常回报,但 Google 没有确认出现大型故障。
关于共同原因,现阶段仍无定论
针对 9 月 3 日的异常,网上曾出现多种猜测,包括三家 AI 公司可能共用未公开的网络监控功能,或与政府监视有关,甚至有人联想到美国国家安全局过往的监控计划。报道指出,这类说法缺乏证据;如果只是收集流量记录,通常也不会直接导致客户服务同步中断。
文中提到,一个相对更能成立的解释是连锁超载:如果一家模型服务先失效,企业与个人用户可能会立刻把需求转向其他厂商,短时间内流量激增,进而压垮接手流量的平台。报道同时指出,AI 公司本身受限于 GPU 供应与数据中心容量,未必保留足以承接竞争对手全部流量的冗余空间。
截至目前,三家公司仍未给出一份统一说明,把当天的异常事件完整串联起来。

