Coinbase(纳斯达克:COIN) 近日再次向加密货币交易者展示了云硬件故障如何拖累即使是高速交易所。5月7日,该公司因亚马逊云服务(AWS)数据中心冷却系统故障,导致旗下现货交易、Coinbase Prime、国际、衍生品、零售、高级及机构交易所等多个平台服务中断数小时,引发市场对其AI化运营战略的广泛质疑。
冷却故障引发连锁反应,匹配引擎与Kafka集群瘫痪
根据Coinbase官方技术说明,故障始于5月7日23:50 UTC。内部监控系统检测到大规模报价失败,工程师随即标记为Sev1级事件。受影响的服务包括现货交易、Coinbase Prime、国际交易、衍生品、零售、高级和机构交易所。CEO Brian Armstrong 在X平台发文承认“发生了宕机”,并称“这绝不可接受”。他指出,原因是“AWS数据中心内多个冷却器故障导致一个房间过热”。
平台工程主管 Rob Witoff 提供了更多细节:故障源自AWS us-east-1区域一小部分机架的热事件。Coinbase的交易所基础设施为追求低延迟而部署在单一可用区,虽然设计了分布式备份,但本次故障波及了核心组件——匹配引擎下方的硬件故障以及分布式Kafka集群宕机。Kafka集群负责全系统信息共享,需要恢复数TB数据。匹配引擎(Matching Engine)因无法在受损节点中达成法定人数(Quorum),导致交易全面暂停。
AI优化裁员决策再受审视,市场信心受挫
值得注意的是,Coinbase此前宣布裁减约14%员工(约700人),意图用AI替代人工流程。本次宕机事件恰逢其AI化转型的关键节点,引发业内对其技术可靠性的担忧。独立分析师 Josh Ellithorpe 在社交媒体上反驳了“非工程师推代码导致故障”的说法,称“大规模系统总会出问题,不要听业余玩家编故事”。但市场反应已经显现:Coinbase股价在盘后交易中下跌约2.3%,部分客户在社交平台表达了对服务稳定性的不满。
技术复盘显示,恢复过程耗时数小时:工程师首先执行灾难恢复流程,重建法定人数并评估系统健康;随后依次将市场切换为“仅取消”模式、拍卖模式,最终恢复交易。Coinbase承诺未来几周公布详细的事后分析报告,并强调没有客户数据丢失。
对行业启示:云依赖与AI运维的平衡难题
本次事件暴露了加密货币交易所过度依赖单一云服务商的风险。尽管Coinbase声称大部分服务设计为跨可用区冗余,但匹配引擎因延迟要求而集中部署,成为单点故障。随着更多交易所尝试用AI替代人力运维,硬件层面的脆弱性可能被放大。市场分析人士指出,Coinbase若不能尽快修复基础设施弹性问题,其AI战略信任度将进一步下降,尤其在机构客户中。
截至发稿,Coinbase尚未公布具体赔偿方案,但强调将加强监控与冗余测试。此次宕机也提醒整个行业:在追求速度和自动化的同时,基础物理设施的可靠性仍是不可忽视的基石。

