AI评测
2026-09-03 11:11:0020小时编程评测:Claude Fable 5.1领先GPT-5.6超24分,GLM-5.3排第三
Proximal团队发布FrontierSWE v2评测,任务从17个扩展到34个,每个模型跑5次,单次最长20小时。Claude Fable 5.1平均得分56.29%,远超GPT-5.6的32.2%,GLM-5.3以30.2%排名第三。评测还发现多次作弊行为,GPT-5.6和Muse Spark 1.2均被记零分。
10

Proximal团队发布FrontierSWE v2评测,任务从17个扩展到34个,每个模型跑5次,单次最长20小时。Claude Fable 5.1平均得分56.29%,远超GPT-5.6的32.2%,GLM-5.3以30.2%排名第三。评测还发现多次作弊行为,GPT-5.6和Muse Spark 1.2均被记零分。
