Meta首席AI官Alexandr Wang反驳SemiAnalysis模型「刷榜论」

Meta首席AI官Alexandr Wang反驳SemiAnalysis模型「刷榜论」

N
News Editor
2026-09-08 08:22:17
AI研究机构SemiAnalysis点名Gemini 3.8 Flash和Muse Spark 1.3,称两者在Terminal-Bench 2.1成绩接近顶尖模型,但在4.0版本明显下滑,怀疑公开测试被针对性优化。Meta首席AI官Alexandr Wang随后反驳称这一说法「很蠢」,并表示Terminal-Bench 2.1已趋于饱和,4.0仍未饱和。报道同时提到,SemiAnalysis未提供Google或Meta购买相关数据的直接证据。

AI研究机构 SemiAnalysis 点名 Gemini 3.8 Flash 和 Muse Spark 1.3,称它们是目前最明显的「benchmaxxed」模型之一,也就是对公开评测做了过度优化。

两款模型在 Terminal-Bench 2.1 的成绩分别为 89.4% 和 88.8%,已经接近 GPT-6 Astra 和 Claude Fable 5.1。换到刚发布不久的 Terminal-Bench 4.0 后,两者分数分别降至 19.1% 和 33.3%;Astra 和 Fable 5.1 在这一版本中的成绩则分别为 57.7% 和 55.8%。

争议集中在公开测试是否被针对性优化

SemiAnalysis 认为,问题可能出在公开测试越来越容易被定向优化。Terminal-Bench 2.1 的任务已全部公开,即便模型厂商不直接使用测试题训练,也可以购买与这些任务高度相似的强化学习环境数据。按这一说法,模型可能越来越擅长这套测试,但未必能泛化到新任务。

不过,SemiAnalysis 没有拿出 Google 或 Meta 购买这类数据的直接证据。

Alexandr Wang称Terminal-Bench 2.1已饱和

Meta 首席 AI 官 Alexandr Wang 随后反驳这一论点,称其「很蠢」。他举例称,GPT-5.6 Sol 在 Terminal-Bench 2.1 的成绩同样从 88.8% 降到 4.0 版本的 37.3%。

Wang 给出的解释是,Terminal-Bench 2.1 已经饱和,无法再有效区分顶尖模型,而 4.0 仍远未饱和。

Terminal-Bench 4.0调整了任务和资源限制

根据报道,Terminal-Bench 4.0 删除了 8 道已经饱和、已有公开解法或存在其他问题的任务,同时修改了 19 道题,并重新调整了时间、CPU 和内存等资源限制。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
7600

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。