AI研究机构 SemiAnalysis 点名 Gemini 3.8 Flash 和 Muse Spark 1.3,称它们是目前最明显的「benchmaxxed」模型之一,也就是对公开评测做了过度优化。
两款模型在 Terminal-Bench 2.1 的成绩分别为 89.4% 和 88.8%,已经接近 GPT-6 Astra 和 Claude Fable 5.1。换到刚发布不久的 Terminal-Bench 4.0 后,两者分数分别降至 19.1% 和 33.3%;Astra 和 Fable 5.1 在这一版本中的成绩则分别为 57.7% 和 55.8%。
争议集中在公开测试是否被针对性优化
SemiAnalysis 认为,问题可能出在公开测试越来越容易被定向优化。Terminal-Bench 2.1 的任务已全部公开,即便模型厂商不直接使用测试题训练,也可以购买与这些任务高度相似的强化学习环境数据。按这一说法,模型可能越来越擅长这套测试,但未必能泛化到新任务。
不过,SemiAnalysis 没有拿出 Google 或 Meta 购买这类数据的直接证据。
Alexandr Wang称Terminal-Bench 2.1已饱和
Meta 首席 AI 官 Alexandr Wang 随后反驳这一论点,称其「很蠢」。他举例称,GPT-5.6 Sol 在 Terminal-Bench 2.1 的成绩同样从 88.8% 降到 4.0 版本的 37.3%。
Wang 给出的解释是,Terminal-Bench 2.1 已经饱和,无法再有效区分顶尖模型,而 4.0 仍远未饱和。
Terminal-Bench 4.0调整了任务和资源限制
根据报道,Terminal-Bench 4.0 删除了 8 道已经饱和、已有公开解法或存在其他问题的任务,同时修改了 19 道题,并重新调整了时间、CPU 和内存等资源限制。

