事件概述:两次短暂停机
Base 官方发布事后复盘报告,确认主网在 6 月 25 日与 6 月 26 日分别发生两次区块生产中断。第一次停机持续约 116 分钟,第二次约 20 分钟。官方强调,事件仅影响出块流程,链上资产始终安全,用户资金在任何时刻都可用。
故障根因:序列器 journal 状态未正确清理
核心问题出在序列器(sequencer)的区块构建逻辑:在一次交易执行失败后,系统未能正确清理历史 journal 状态。这导致后续合法交易在执行时 gas 计算异常,进而生成无效的状态转移区块,最终使得整个 L2 网络停止出块。简而言之,状态残留(dirty state)污染了后续交易的 gas 估算,让序列器无法生成有效区块。
影响范围:区块链停止、交易失败、mempool 拥堵
中断期间,网络出现多重异常:区块生产完全停止,用户提交的交易无法上链,mempool 持续拥堵。eth_sendRawTransaction 请求不断返回错误提示。这些问题并非用户端操作失误,而是底层状态机故障导致的链上无响应。
修复与二次故障:补丁 PR #3806 与竞态条件
官方迅速定位问题并推出补丁(PR #3806),恢复区块生产。然而,在序列器集群重启过程中,引擎重置存在竞态条件(race condition),导致恢复同步受阻。这一竞态条件成为 6 月 26 日再次出现短暂停机的间接原因。表明首次修复未完全覆盖重启阶段的同步一致性问题。
后续改进:强化测试与优雅恢复
Base 表示将重点强化协议级模糊测试(fuzz testing)与压力测试能力,以更早发现异常交易路径,避免类似状态残留问题。同时升级监控与运维体系,并引入更优雅的恢复机制(graceful recovery),提升未来网络在类似故障中的快速恢复能力,减少停机时间与影响范围。

