YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门用真实公司的私有代码测试 Coding Agent。
这套测试的任务直接来自企业生产环境,包括算税、账单迁移、API 计费和客户数据迁移。由于代码和答案都没有公开在网上,Agent 需要自行摸清公司的业务规则和代码结构。
测试结果显示,Fable 5.1 排名第一,通过率为 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排在第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。
在当前公开的 10 个任务中,有 6 个任务的整体通过率低于 15%,另有 1 个任务所有模型全部失败。
BlockBeats 表示,Real-SWE 更考验 Agent 在陌生项目中持续读代码、寻找规则并完成多步改动的能力。对于 GLM 5.3 的表现,智谱研究员 Xiaopu Peng 回应称,他们从 GLM-5.1 起就在训练长程任务,Real-SWE 比公开 SWE 榜更接近这类能力,这也能部分解释 GLM 5.3 为什么在这套榜单中表现突出。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

