Terminal-Bench 4.0发布:GLM-5.3升至第三,反超GPT-5.6 Sol

Terminal-Bench 4.0发布:GLM-5.3升至第三,反超GPT-5.6 Sol

N
News Editor
2026-08-29 13:49:04
Terminal-Bench 发布 4.0,重新校准 Agent 执行任务的时间、CPU 与内存,并调整任务集。最新榜单中,GLM-5.3 + Claude Code 以 41.8% 升至第三,超过 GPT-5.6 Sol + Codex 的 37.3%,成为前三名中唯一的非 Anthropic 模型。相比 3.0 的第四名,GLM-5.3 反超 Sol 4.5 个百分点。

Terminal-Bench 发布 4.0,重新校准了 Agent 执行任务时的时间、CPU 和内存,同时修复 19 个任务,移除 8 个存在饱和、拒答、公开解法或质量问题的任务。所有任务的最长执行时间统一为 8 小时,主要用于减少超时和环境问题对成绩的干扰。

最新榜单:GLM-5.3 冲进前三

最新榜单中,Opus 5 + Claude Code 以 51.8% 的成绩位列第一,Fable 5 以 44.5% 位列第二。GLM-5.3 + Claude Code 取得 41.8%,排名第三,超过 GPT-5.6 Sol + Codex 的 37.3%。前三名中,GLM-5.3 是唯一不属于 Anthropic 的模型。

相较 3.0 的反超

在 Terminal-Bench 3.0 中,GLM-5.3 以 32.4% 排第四,落后 GPT-5.6 Sol 的 34.6%;到 4.0,GLM-5.3 升至第三,反超 Sol 4.5 个百分点。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
30

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。