美国加密货币交易所Coinbase(纳斯达克:COIN)再次因基础设施故障导致大规模服务中断,暴露出其AI驱动运营转型策略的潜在风险。 据官方披露,此次宕机源于亚马逊AWS(纳斯达克:AMZN)数据中心的冷却系统故障,导致交易、平台访问及余额更新等功能中断长达数小时。
问题始于5月7日23:50 UTC(北京时间5月8日7:50),内部监控系统检测到报价系统出现大范围故障。随后工程师启动多个Sev1级紧急事件响应,现货交易、Coinbase Prime、国际站、衍生品、零售版、高级版及机构交易所均受影响。CEO Brian Armstrong在X平台上承认“发生宕机”,称“这绝不可接受”,并解释原因系“AWS数据中心内多个冷水机组故障导致房间过热”。
高频交易架构单点依赖成隐患
Brian Armstrong表示,公司设计服务时确保单个AWS可用区故障不会导致全线离线,但交易所业务因极低延迟需求使用不同基础设施。平台工程负责人Rob Witoff详细披露技术细节:故障源于AWS us-east-1区域某个设施中一小部分机架的“热事件”。由于行业对速度的追求,Coinbase将交易所基础设施集中部署在单一可用区,虽然拥有分布式备份副本,但此次故障中部分组件失效未限制在边界内,导致恢复过程延长。
具体故障点有两处:匹配引擎下方的硬件出现故障,需先执行恢复与故障转移操作;负责系统间信息共享的分布式Kafka集群也发生宕机,工程师不得不将Kafka分区恢复到新硬件代理上,涉及数TB数据量。匹配引擎因需集群法定人数才能安全交易,而数据中心资源受限导致部分节点不健康,无法达成法定人数,从而阻止了零售、高级及机构交易所的交易活动。
工程师重建法定人数,分阶段恢复市场
Rob Witoff称,值班支持与工程团队必须在困难基础设施条件下执行灾难恢复流程,重建法定人数并评估系统健康。他们需要开发、测试、部署并验证解决方案,同时管理整个宕机。Kafka分区架构每日处理数千TB数据,需要大量手动恢复。所幸余额延迟流在复制同步后消失,Coinbase确认无数据丢失。
恢复匹配引擎后,市场并未同时重启。Coinbase先将所有产品切换为仅可取消模式,检查产品状态,再将所有市场切换为拍卖模式,最后才启用交易。Rob强调,用户账户不会临时被锁定,公司将在数周内提供详细事件报告。
AI转型战略与宕机事件的关联性
值得注意的是,此次宕机恰逢Coinbase推进AI替代人力的计划。据此前报道,Coinbase计划裁员700人(约占员工总数14%),用自动化流程取代人工操作。创始人Brian Armstrong曾力推AI运营转型以降低成本并提升效率。然而,此次因基础设施脆弱性导致的宕机事件,令市场质疑其裁员决策是否操之过急——当系统遇到非预期硬件故障时,减少人工运维团队可能会延长恢复时间。
行业分析师指出,Coinbase的高频交易架构虽追求速度,但单可用区依赖是明显的单点故障隐患。尽管AWS本身提供多可用区方案,但交易所为延迟优势而放弃冗余,这在此次冷却故障中暴露无遗。相比之下,传统证券交易所通常采用更严格的容错设计。
市场影响与行业反思
截至发稿,Coinbase股价未出现大幅波动,但此次事件可能动摇部分机构客户的信任。作为美国最大的合规加密货币交易所,Coinbase的稳健性被视为行业标杆。频繁的宕机(此前2023年也曾因流量激增导致服务中断)可能促使交易者转向竞争对手如Kraken或Binance.US。
资深工程师Josh Ellithorpe在X上发帖驳斥舆论:“没有人用‘vibe coding’搞砸了。既不是非工程师推送了生产代码搞垮交易引擎,也不是故意为之。更不是Coinbase没设计故障转移系统。大规模系统下事情会发生,别让业余选手编造故事。”但市场仍期待Coinbase在数周后发布的详细报告能提供根本性改进方案。
此次事件再次引发行业对交易所基础设施可靠性的讨论。在加密货币市场波动性高的背景下,交易所的任何交易中断都可能导致用户资金损失或套利机会错失。Coinbase若要维持其领先地位,必须在追求低延迟与保证系统弹性之间找到更优平衡。

