故障复盘:序列器状态管理 Bug
Base 官方发布事后复盘报告,详细说明了 6 月 25 日与 26 日主网两次区块生产中断的起因。第一次中断持续约 116 分钟,第二次约 20 分钟。官方强调,事件未影响链上资产安全,用户资金始终可用。核心原因在于序列器的区块构建逻辑存在缺陷:在一次交易执行失败后,系统未正确清理历史 journal 状态,导致后续合法交易在进行 gas 计算时出现异常,进而生成无效的状态转移区块,最终使整个 L2 网络停止出块。
中断期间,网络出现了区块生产完全停止、交易无法上链以及 mempool 拥堵等问题,用户提交的 eth_sendRawTransaction 请求持续返回错误。Base 团队通过补丁(PR #3806)修复了该缺陷,恢复了区块生产。然而,由于序列器集群在重启过程中存在引擎重置的竞态条件,导致恢复同步受阻,这也成为了次日再次出现短暂停机的间接原因。
后续改进:强化测试与优雅恢复机制
针对此次事故,Base 团队规划了一系列技术改进。首先是强化协议级的模糊测试(fuzz testing)与压力测试能力,以更早发现异常交易路径,避免类似状态管理问题在主网触发。其次是升级监控与运维体系,提升对异常状态的实时捕获能力。最重要的是,Base 计划引入更加“优雅的恢复机制”(graceful recovery),在发生类似故障时,网络能够更快地自我修复并恢复区块生产,降低对用户交易体验的影响。
此次复盘展现了 Base 在面对 L2 网络复杂性问题时的透明度和技术应对思路。对于依赖 Base 生态的应用和用户而言,此次事件虽然短暂,但凸显了序列器作为 L2 核心组件的重要性,以及状态管理、竞态条件等底层细节对网络稳定性的关键影响。

