Real-SWE测试企业私有代码,榜首Agent通过率仅38.8%

Real-SWE测试企业私有代码,榜首Agent通过率仅38.8%

N
News Editor
2026-09-11 09:30:11
YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,用真实企业私有代码测试 Coding Agent。任务来自生产环境,涉及算税、账单迁移、API 计费和客户数据迁移。结果显示,Fable 5.1 以 38.8% 排名第一,GPT-6 Astra 和 Gemini 3.8 Flash 分列其后;GLM 5.3 以 28.8% 排第四。公开的 10 个任务中,6 个整体通过率低于 15%,另有 1 个任务所有模型全部失败。

YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门用真实公司的私有代码测试 Coding Agent。

这套测试的任务直接来自企业生产环境,包括算税、账单迁移、API 计费和客户数据迁移。由于代码和答案都没有公开在网上,Agent 需要自行摸清公司的业务规则和代码结构。

测试结果显示,Fable 5.1 排名第一,通过率为 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排在第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。

在当前公开的 10 个任务中,有 6 个任务的整体通过率低于 15%,另有 1 个任务所有模型全部失败。

BlockBeats 表示,Real-SWE 更考验 Agent 在陌生项目中持续读代码、寻找规则并完成多步改动的能力。对于 GLM 5.3 的表现,智谱研究员 Xiaopu Peng 回应称,他们从 GLM-5.1 起就在训练长程任务,Real-SWE 比公开 SWE 榜更接近这类能力,这也能部分解释 GLM 5.3 为什么在这套榜单中表现突出。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。