事件经过:两次停机的时间与影响
Base 主网在 6 月 25 日和 26 日连续两天出现区块生产中断,持续时间分别为约 116 分钟和 20 分钟。根据官方发布的事后复盘报告,两次故障均未导致链上用户资产受损,资金始终处于安全可用状态。然而,中断期间网络完全停止出块,用户提交的交易无法上链,mempool 出现拥堵,eth_sendRawTransaction 请求持续返回错误。
故障根因:序列器状态管理 Bug
报告指出,故障的根本原因在于序列器(sequencer)的区块构建逻辑存在缺陷。具体来说,当一笔交易执行失败后,系统未能正确清理历史 journal 状态,导致后续合法交易在执行时发生 gas 计算异常,进而生成无效的状态转移区块,使得整条 L2 网络停止出块。这一缺陷属于序列器内部状态管理的问题,与底层链的安全机制无关。
在第一次停机后,官方通过补丁 PR #3806 修复了该逻辑缺陷,并恢复了区块生产。但序列器集群在重启过程中遇到了引擎重置的竞态条件,导致恢复同步受阻,这成为次日再次出现短暂停机的间接原因。第二次停机时间较短(20 分钟),主要源于重启流程的不完善。
后续改进:强化测试与恢复机制
为避免类似故障重现,Base 团队制定了多项改进措施。首先,将重点强化协议级的模糊测试(fuzz testing)与压力测试能力,以更早发现异常交易路径。其次,升级监控与运维体系,提升对异常状态的感知速度。此外,团队计划引入更优雅的恢复机制(graceful recovery),使网络在遭遇同类故障时能够更快自动恢复,减少对用户的影响。
此次事件提醒 L2 网络运维方,序列器作为中心化组件,其状态一致性与重启容错性至关重要。Base 作为 Coinbase 孵化的主流 L2 方案,其故障处理经验对于整个 Rollup 生态具有参考价值。

