Coinbase发布7月14日服务中断事件复盘报告,披露称事故由一次例行配置更新中的 Kubernetes 资源名称冲突引发,导致关键网络组件失效,转账、银行卡交易及链上服务受到影响。不过,Coinbase表示,用户资金始终未面临风险。
事故发生经过
根据Coinbase披露的信息,7月14日美国东部时间12:34,公司向承载核心基础设施服务的共享生产 Kubernetes 集群部署了一项常规配置变更。Coinbase称,这项更新属于向新服务部署模型迁移的一部分,目的是提升系统性能和可靠性,并已按标准流程完成审核,当时被认定为低风险变更。
但预生产检查未发现资源名称冲突。该配置随后意外修改了集群中与 Istio Ingress Gateway 相关的 Kubernetes 资源,导致入口网关不可用。到美国东部时间12:37,所有进入该集群的流量中断,内部服务因此无法访问多个基础设施组件。
受影响业务范围
Coinbase表示,受影响的异步工作流几乎覆盖整套资金流转体系,包括交易结算、资产转账以及银行卡交易授权等。基础设施服务无法访问后,这些流程在平台范围内暂停。
- 零售用户无法完成链外交易、充值和提现,部分处理中交易显示为停滞,服务恢复后自动完成;
- Coinbase Card 借记卡交易暂时失败,信用卡支付仍可使用,但部分卡片管理功能不可用;
- Base 和 Solana 上的 Coinbase DEX 链上兑换服务暂停;
- Coinbase Exchange 和 Prime 机构客户出现转账及结算失败或延迟;
- Coinbase Developer Platform 客户无法完成开户、资金转移及入金服务。
恢复过程与处置
Coinbase称,在恢复期间,公司暂停了受影响流程,并通过 Retail、Exchange 和 Prime 状态页面持续更新进展。美国东部时间13:20,入口网关恢复运行;13:23,事件基本缓解。
此后,系统开始处理积压任务。Coinbase表示,大部分服务很快恢复,剩余队列也在数小时内完成清理。
后续改进措施
针对此次事故,Coinbase表示将从三方面提升系统可靠性:
- 扩展部署阶段防护机制,自动检测并阻止 Kubernetes 资源名称冲突,避免配置更新误影响其他组件;
- 增强部署工具与底层基础设施之间的冗余能力,避免故障同时影响恢复工具;
- 定期审查和演练紧急访问机制,提高重大故障情况下的恢复速度。
Coinbase表示,其目标始终是实现零停机运行,并将继续重构基础设施,以便未来即便出现类似故障,也能更快完成回滚和恢复。公司同时就此次事件给用户带来的影响致歉,并建议仍遇到相关问题的用户联系官方支持团队。

