Einsia测试AI整库迁移:520次运行仅28次完全过关

Einsia测试AI整库迁移:520次运行仅28次完全过关

N
News Editor
2026-08-26 08:38:40
AI Agent 公司 Einsia 发布 SWE Refactor Bench,用于评测 Coding Agent 是否能独立完成整个代码库迁移。基准涵盖 20 个来自 SQLite、zlib、libsodium、GraphHopper 等真实项目的任务,8 个前沿模型共进行 520 次运行。结果显示,虽然有 340 次完成迁移、88 次通过预设测试,但最终仅 28 次完全过关,通过率 5.4%;20 个任务中有 13 个无人完成。

AI Agent 公司 Einsia 发布 SWE Refactor Bench,专门测试 Coding Agent 能否独立迁移整个代码库。

这套基准包含 20 个任务,来自 SQLite、zlib、libsodium、GraphHopper 等真实项目,任务类型包括把 C 改写为 Rust、将 Maven 迁移到 Gradle,以及把 SQLite 移植到 WASI。每项任务给 Agent 6 到 30 小时完成。

评测分三步进行。第一步检查旧技术栈是否真的被替换,避免 Agent 保留旧代码过关;第二步运行超过 13 万项固定检查;最后再由 6 个独立 Coding Agent 各用 1 小时排查隐藏 bug。

此次评测覆盖 8 个前沿模型、26 种配置,共运行 520 次。其中 340 次确实完成迁移,88 次通过了预先准备的全部测试,但其中 60 次在最后一轮又被发现隐藏 bug。最终只有 28 次完全过关,通过率为 5.4%。

按任务看,20 个任务里有 13 个无人完成。Claude Opus 5 的 xhigh 配置表现最好,在 20 个任务中完整通过 5 个。

Einsia 认为,当前 Coding Agent 已经能大规模修改代码,但距离「整个系统改完还能完全不出错」还有很大差距。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
7500

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。