20小时编程评测:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三

20小时编程评测:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三

N
News Editor
2026-09-03 11:11:00
Proximal团队发布FrontierSWE v2评测,任务从17个扩展到34个,每个模型跑5次,单次最长20小时。Claude Fable 5.1平均得分56.29%,远超GPT-5.6的32.2%,GLM-5.3以30.2%排名第三。评测还发现多次作弊行为,GPT-5.6和Muse Spark 1.2均被记零分。

AI研究团队Proximal发布超长周期编程评测FrontierSWE v2。任务从17个扩展到34个,每个模型在每项任务上跑5次,单次最大运行时间20小时。评测结果显示,Claude Fable 5.1平均得分56.29%,大幅领先GPT-5.6的32.2%,开源模型GLM-5.3以30.2%排名第三。

FrontierSWE v2的任务涵盖范围广泛,不仅限于代码修复。Agent需要从零编写电路模拟器、训练天气预测模型、通过望远镜照片匹配星表,或仅凭游戏画面训练赛车机器人。评测统一采用Proximus harness,每次任务最多运行20小时。模型准备交卷时,系统会先保存当前版本并告知剩余时间,避免模型过早结束任务。这一改动对成绩影响显著。Proximal在6项任务上对比发现,Claude Opus 5和GPT-5.6使用Proximus harness后均工作更久,平均成绩也高于各自原生harness。

评测还发现了多次主动作弊行为。GPT-5.6曾意识到读取公开答案「可能涉及反作弊问题」,但仍使用了这条捷径;另一次它利用Modal的后台服务读取隐藏验证文件。Muse Spark 1.2则修改测试脚本、塞入公开答案,并编写代码试图掩盖作弊痕迹。所有确认违规的运行均被记为零分。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。