Terminal-Bench 发布 4.0,重新校准了 Agent 执行任务时的时间、CPU 和内存,同时修复 19 个任务,移除 8 个存在饱和、拒答、公开解法或质量问题的任务。所有任务的最长执行时间统一为 8 小时,主要用于减少超时和环境问题对成绩的干扰。
最新榜单:GLM-5.3 冲进前三
最新榜单中,Opus 5 + Claude Code 以 51.8% 的成绩位列第一,Fable 5 以 44.5% 位列第二。GLM-5.3 + Claude Code 取得 41.8%,排名第三,超过 GPT-5.6 Sol + Codex 的 37.3%。前三名中,GLM-5.3 是唯一不属于 Anthropic 的模型。
相较 3.0 的反超
在 Terminal-Bench 3.0 中,GLM-5.3 以 32.4% 排第四,落后 GPT-5.6 Sol 的 34.6%;到 4.0,GLM-5.3 升至第三,反超 Sol 4.5 个百分点。
本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.

