加密货币交易所Coinbase(纳斯达克:COIN)于5月7日晚间遭遇了一次严重服务中断,原因是其依赖的AWS数据中心冷却系统故障,导致现货交易、Prime、国际及衍生品交易服务全面暂停,部分用户账户无法访问,余额显示延迟。Coinbase首席执行官布莱恩·阿姆斯特朗(Brian Armstrong)在社交媒体X上公开道歉,称此次宕机“不可接受”,并表示公司将重新审视基础设施设计中关于速度、客户共置与恢复时间之间的权衡。
事件经过:冷却故障引发连锁反应
据Coinbase工程主管罗布·维托夫(Rob Witoff)在X上发布的详细说明,故障始于5月7日晚间,内部系统开始出现异常,紧急响应团队随即介入调查。维托夫指出,由于核心交易系统无法在基础设施中断期间安全运行,平台被迫暂停所有交易活动。同时,内部消息系统速度下降,导致部分账户信息的更新出现滞后,直到恢复流程逐步追赶上来。
维托夫强调:“即使暂时失去对账户的访问权限,也是不可接受的。”恢复工作分阶段进行:Coinbase首先将受影响的负载从故障区域迁移,重建处理交易所需的关键系统,并让延迟的客户数据同步赶上。市场在恢复时采取了谨慎步骤:先开启仅取消订单模式,接着进行产品检查、拍卖模式,最后才恢复Coinbase交易所的正常交易。
CEO反思:速度与韧性的艰难平衡
阿姆斯特朗在5月8日的推文中指出,Coinbase大部分系统原本被设计为能够承受一个AWS可用区(Availability Zone)的故障,但在此次冷却故障中,集中式交易所并未按预期那样保持韧性。他坦言:“让交易所能够抵抗可用区故障是可能的,但这会引入不希望出现的延迟,并破坏客户共置(co-location)服务。”
阿姆斯特朗承诺:“鉴于此次事件,我们将重新评估这些权衡,确保为您提供最佳的交易场所。至少,当需要迁移可用区时,宕机时长应能大幅缩短。”这意味着Coinbase将在低延迟、客户共置需求与快速灾难恢复之间寻找新的平衡点。
市场影响与监管启示
此次宕机虽然持续时间有限,但对用户信心造成了明显冲击。在加密货币市场波动性仍存的背景下,交易所稳定性成为用户选择平台的关键指标。Coinbase作为美国合规交易所的代表,此次事件可能引发监管机构对关键金融基础设施依赖单一云服务商的质疑。目前,多数加密交易所采用AWS、谷歌云或微软Azure等云服务,一旦云提供商出现区域性故障,往往导致连锁反应。
行业分析人士指出,分布式架构与多云策略或许是解决之道,但这必然带来成本与复杂性的提升。Coinbase的此次经历为整个行业敲响了警钟:在追求极致撮合速度的同时,必须预留足够的安全冗余。受此消息影响,Coinbase股价在次日盘前交易中小幅下跌约1.2%,但随后企稳。

