Coinbase披露8小时宕机原因:AWS制冷故障引发连锁中断

Coinbase披露8小时宕机原因:AWS制冷故障引发连锁中断

N
News Editor 01
2026-07-23 06:45:14
Coinbase公布5月7日交易中断复盘:AWS us-east-1机房制冷系统失效导致服务器停机,后续又叠加撮合引擎故障切换和Kafka问题,交易、充提等服务受影响约8小时。
CoinbaseAWS交易中断撮合引擎Kafka

Coinbase披露,2026年5月7日长达约8小时的服务中断,起因是 Amazon Web Services(AWS)一处数据设施的制冷系统故障。受影响后,平台交易、买卖、充币、提币和转账一度在多个产品中无法使用,零售和机构用��都被波及。

按公司发布的事故复盘,事件于美国东部时间5月7日19:20开始,AWS us-east-1 区域一个数据大厅内多台冷水机组同时失效,制冷能力丧失后触发热保护关机,相关服务器和存储系统被迫下线。到19:48,Coinbase交易停止,平台多项核心功能进入不可用状态。

AWS故障之外,Coinbase内部恢复链路也暴露问题

Coinbase称,AWS的可用区原本被设计为隔离故障影响,但这次中断扩散后,公司的恢复机制暴露出薄弱环节。工程团队在恢复过程中发现,撮合引擎在AWS终止某个集群放置组内的服务器后失去法定仲裁数,导致系统无法按预期维持运行。

更关键的是,该系统当时缺少自动跨可用区故障切换能力。工程师随后实施紧急代码变更,并重建基础设施以恢复服务。问题并未到此结束。Coinbase还表示,AWS托管Kafka服务在事故后未能自动重新分配分区领导者,这让事件流服务出现异常,报价系统、手续费计算、支付基础设施以及部分账本流水线都受到影响。

交易于5月8日凌晨分阶段恢复

为修复Kafka相关故障,工程团队与AWS团队一起手动执行分区重分配。Coinbase随后分阶段重启市场:5月8日2:25先恢复“仅可撤单”功能,3:49全面恢复交易。

事故发生后,Coinbase列出一系列整改措施。公司计划通过“warm”跨可用区备用系统提升撮合引擎冗余,并在生产环境中定期进行故障切换演练。Kafka部署也将从两个可用区扩展到三个可用区,同时补充新的工具、测试和运维流程,用于应对类似失效场景。Coinbase还表示,已通知相关监管机构,并继续完成与此次中断有关的正式影响评估。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
500

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。