Coinbase AI Pivot Stumbles as AWS Cooling Failure Triggers Multi-Hour Outage

Coinbase AI Pivot Stumbles as AWS Cooling Failure Triggers Multi-Hour Outage

N
News Editor 01
2026-07-04 14:03:11
A cooling failure at an AWS data center caused a prolonged Coinbase outage, affecting trading and balance updates. The incident highlights risks in the exchange's AI-driven operations strategy and single-availability-zone infrastructure.

加密货币交易所Coinbase(纳斯达克:COIN)再度向交易者证明,即便是最先进的交易平台,也难逃硬件故障的拖累。上周五,因亚马逊云服务(AWS)数据中心冷却系统故障,Coinbase遭遇了长达数小时的严重宕机,影响范围覆盖现货交易、Coinbase Prime、国际、衍生品、零售、高级及机构交易所等核心服务。这次事件不仅暴露了技术基础设施的脆弱性,更让市场对其AI驱动运营转型的战略产生严重质疑。

故障始末:冷却系统失效引发连锁反应

根据Coinbase官方技术报告,问题始于UTC时间5月7日23:50左右。内部监控系统检测到报价系统出现大规模故障,随即触发Sev1级事件响应。CEOBrian Armstrong在X平台上发文承认,此次宕机“不可接受”,其直接原因是AWS数据中心内“多个冷却器失效导致机房过热”。他强调,公司所有服务在设计上都会避免单一可用区故障导致全线瘫痪,但交易所业务因对延迟要求极高,采用了不同的基础设施架构——所有交易引擎集中部署在us-east-1区域的某个可用区内。

技术负责人Rob Witoff进一步披露细节:故障起源于“一小部分机架的热失控事件”,但问题并未局限在故障范围内。两处关键组件失效:一是匹配引擎底层硬件出现故障,需要立即执行恢复和故障转移操作;二是负责跨系统信息共享的分布式Kafka集群崩溃,恢复工作需要重建Kafka分区到新硬件代理,涉及数TB级别数据量。匹配引擎作为处理订单及维护订单簿的核心系统,采用分布式集群并需要满足法定人数(quorum)才能安全选择领导者并执行交易。由于数据中心约束导致部分节点无法正常运行,法定人数无法建立,零售、高级及机构交易所的交易活动全面暂停。

灾难恢复:从取消模式到拍卖模式再到恢复交易

工程团队在极端基础设施条件下执行了灾难恢复流程。他们首先试图建立法定人数并评估系统健康状态,同时需要开发、测试、部署并验证解决方案。Kafka的分布式架构每天处理数千TB数据,导致广泛的手动恢复工作。延迟的余额流问题持续存在,直到复制完成同步后才消失。Coinbase确认没有数据丢失。

当匹配引擎恢复服务后,市场没有立即全部开放。Coinbase首先将所有产品切换至仅取消模式,检查产品状态,然后将所有市场切换至拍卖模式,最后才逐步恢复Coinbase交易所的正常交易。Witoff强调,客户账户不会被暂时锁定,公司将在数周内提供事件详细报告。

然而,对于社交媒体上流传的“vibe coding”指责,工程师Josh Ellithorpe反驳称:“没有人靠‘氛围编程’搞砸了系统。不是非工程师发布了生产代码导致交易引擎崩溃。这不是故意的,也不是因为Coinbase没有设计故障转移系统。大规模下事情总会发生,别让键盘侠讲故事。”

AI转型阴影:裁员14%刚宣布即遭技术打脸

这次宕机发生在Coinbase刚宣布大规模裁员的敏感时期。据Cryptopolitan此前报道,Coinbase计划裁减700名员工,约占全体员工14%,旨在用AI系统替代人工流程。CEO Armstrong曾公开推动AI运营策略,希望通过自动化减少人力成本并提高效率。然而,这次因硬件冷却故障引发的全平台瘫痪,恰恰暴露出在关键基础设施完全依赖第三方云服务且高集中度架构下的脆弱性。

市场分析师指出,Coinbase的AI转型本应是其核心竞争力,但技术事故表明,自动化系统和AI接管操作订单处理之前,必须确保底层云基础设施的极端可靠性。当核心匹配引擎因“热失控”而停摆时,任何AI都无法绕过物理世界的限制。更何况,恢复过程中工程师需要手动进行Kafka分区重建、法定人数建立等操作,这与其宣称的AI主导运营形成鲜明对比。

市场影响与行业反思

事故发生后,Coinbase股票(COIN)在盘后交易中一度下跌超过3%,交易量显著放大。投资者对交易所云基础设施单点风险的担忧加剧,尤其是其将交易引擎集中部署在单一可用区的架构决策。虽然Coinbase声称这种设计源于低延迟行业需求,但本次事件表明,当冷却系统失效导致机房整体不可用时,所谓的分布式备份“并未能跨越可用区边界”,故障域并未被有效隔离。

此次宕机为整个加密货币行业敲响警钟:在追求毫秒级交易速度的同时,必须重新评估基础设施地理冗余与灾难恢复能力的优先级。Coinbase计划在几周内公布更详细的事后分析报告,届时市场将密切关注其是否会对AI运营策略及数据中心布局进行调整。对于正积极推进自动化运营的交易所而言,这次事件无疑提供了最沉重的反面教材——技术先进性与系统韧性之间,不能以牺牲可靠性为代价。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
300

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.