Coinbase披露,2026年5月7日长达约8小时的服务中断,起因是 Amazon Web Services(AWS)一处数据设施的制冷系统故障。受影响后,平台交易、买卖、充币、提币和转账一度在多个产品中无法使用,零售和机构用��都被波及。
按公司发布的事故复盘,事件于美国东部时间5月7日19:20开始,AWS us-east-1 区域一个数据大厅内多台冷水机组同时失效,制冷能力丧失后触发热保护关机,相关服务器和存储系统被迫下线。到19:48,Coinbase交易停止,平台多项核心功能进入不可用状态。
AWS故障之外,Coinbase内部恢复链路也暴露问题
Coinbase称,AWS的可用区原本被设计为隔离故障影响,但这次中断扩散后,公司的恢复机制暴露出薄弱环节。工程团队在恢复过程中发现,撮合引擎在AWS终止某个集群放置组内的服务器后失去法定仲裁数,导致系统无法按预期维持运行。
更关键的是,该系统当时缺少自动跨可用区故障切换能力。工程师随后实施紧急代码变更,并重建基础设施以恢复服务。问题并未到此结束。Coinbase还表示,AWS托管Kafka服务在事故后未能自动重新分配分区领导者,这让事件流服务出现异常,报价系统、手续费计算、支付基础设施以及部分账本流水线都受到影响。
交易于5月8日凌晨分阶段恢复
为修复Kafka相关故障,工程团队与AWS团队一起手动执行分区重分配。Coinbase随后分阶段重启市场:5月8日2:25先恢复“仅可撤单”功能,3:49全面恢复交易。
事故发生后,Coinbase列出一系列整改措施。公司计划通过“warm”跨可用区备用系统提升撮合引擎冗余,并在生产环境中定期进行故障切换演练。Kafka部署也将从两个可用区扩展到三个可用区,同时补充新的工具、测试和运维流程,用于应对类似失效场景。Coinbase还表示,已通知相关监管机构,并继续完成与此次中断有关的正式影响评估。

