Coinbase's AI-Led Operations Pivot Backfires After 6-Hour AWS Cooling Outage

Coinbase's AI-Led Operations Pivot Backfires After 6-Hour AWS Cooling Outage

N
News Editor 01
2026-07-04 14:03:11
Coinbase suffered a 6-hour outage caused by AWS cooling system failure, disrupting spot, derivatives, and institutional trading. CEO Brian Armstrong called the event 'unacceptable' and acknowledged the AI-led operations pivot has backfired.

2026年5月7日,全球知名加密货币交易所Coinbase(纳斯达克:COIN)亚马逊AWS(纳斯达克:AMZN)数据中心冷却系统故障,导致平台出现长达6小时以上的全面宕机,影响范围涵盖现货交易、Coinbase Prime、国际站、衍生品、零售、高级交易及机构交易所。这是Coinbase历史上最严重的服务中断之一,也使其备受争议的AI主导运营转型战略再次被推上风口浪尖。

故障始末:从冷却失效到系统级连锁反应

根据Coinbase技术总监Rob Witoff发布的技术复盘,故障始于UTC时间5月7日23:50左右,内部监控系统检测到报价系统出现大规模中断。工程师随即创建多个Sev1级紧急事件。故障根源为AWS us-east-1区域某个数据中心内少量机架的“热事件”——冷却水系统多个冷水机组同时失效,导致硬件过热。

CEO Brian Armstrong在社交媒体X上表示:“我们经历了一次宕机,这种事情绝对不能接受。”他解释说,Coinbase所有服务设计上都应该在一个AWS可用区失效时保持在线,但交易所核心系统是一个例外:由于低延迟要求,交易所使用了与主架构不同的底层基础设施,且仅部署在单一可用区内。

Rob Witoff进一步披露了两个关键失效组件:一是撮合引擎下方的硬件故障,需要先进行恢复和故障切换操作;二是用于全系统信息共享的分布式Kafka集群崩溃,需要在新硬件代理上恢复分区,涉及数TB的数据。

恢复历程:取消-竞价-重新交易的三阶段策略

撮合引擎的失效导致了交易功能最大范围的停摆。由于系统需要至少半数节点在线才能达成“法定人数”并任命leader,而故障导致部分节点不可用,因此零售、高级和机构交易所都无法执行交易。值班支持与工程团队需在困难的底层基础设施条件下执行灾难恢复流程,重建法定人数并评估系统健康。

工程师团队不得不一边应对整体宕机,一边开发、测试、部署并验证解决方案。Kafka需要大量手动恢复,因为其分区架构每天处理数千TB数据。平衡信息流也因Kafka延迟而出现滞后,部分客户一度无法正常查看余额。Coinbase声明无数据丢失

当撮合引擎恢复服务后,Coinbase没有直接重新开放所有市场。首先将所有产品切换至仅取消模式,逐一检查产品状态,然后全部切换至竞价模式,最后才在Coinbase交易所上恢复正常交易。Rob强调,客户账户不会被临时锁定,详细的事后分析报告将在数周内发布。

AI转型策略的阴影:700人被裁,自动化替代不理想

在此次宕机事件之前,Coinbase正积极推进一项被市场称为“AI主导运营转型”的战略。据Cryptopolitan此前报道,公司计划裁撤约700名员工(占总员工14%),用自动化流程取代人工操作。Brian Armstrong曾公开表示,AI将帮助公司提高效率、降低成本。

然而,此次宕机事件暴露出一个核心问题:高度依赖AI与自动化的系统在面对物理基础设施故障时,缺少足够的人工应急干预能力。技术团队无法快速绕开节点故障,不得不进行复杂的维护与恢复操作。业内专家指出,Kafka集群的重建、撮合引擎的法定人数恢复等环节都需要经验丰富的工程师现场决策,而这正是被裁减岗位的核心职能。

前Coinbase工程师Josh Ellithorpe在社交媒体上驳斥了“代码崩溃”的指责:“没有人是用‘氛围编程’搞垮系统的,也不是非工程师推送了生产代码导致交易引擎崩溃。这不是故意的,也不是因为Coinbase没有设计故障切换系统。大规模运营下总会出问题,别让‘键盘教练’编造故事。”尽管如此,业界普遍认为,裁减大量技术运营人员后,面对复杂故障的响应效率已明显下降

市场影响与投资者反应

宕机消息公布后,Coinbase股价在盘后下跌约3.2%,报收此前167美元的日高点之下。分析人士指出,交易所可靠性是机构资金入场的重要前提,频繁的宕机将削弱市场对Coinbase的信心。尤其在AI转型尚未体现明显成本优势的背景下,此次事件可能促使更多机构客户考虑多元化做市方案。

与此同时,加密社区对“单一可用区”架构的批评增多。多个行业专家建议,交易所必须采用多区域、多可用区部署,即使牺牲部分速度,也要确保业务连续性。Coinbase目前虽拥有分布式备份副本,但备份与主系统之间并未完全隔离,导致故障蔓延。

行业教训:AI不能替代基础设施冗余

此次事件对整个加密行业敲响了警钟:追求极致的自动化和效率不能以牺牲基础设施韧性为代价。AWS的冷却系统故障虽然罕见,但大型交易平台在设计时应对此类“黑天鹅”事件有充分的容错预案。Coinbase将核心撮合引擎置于单一可用区的做法,在成本与性能之间选择了后者,却忽略了灾难恢复的复杂度。

Coinbase承诺将在数周内发布详细的事后分析报告。市场将持续关注其是否调整AI转型节奏,以及是否投资更可靠的物理基础设施架构。对于投资者而言,交易所的稳定性和技术架构始终是比AI概念更关键的估值指标。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
300

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.