SemiAnalysis质疑谷歌Meta模型在公开基准上存在“刷榜”行为

SemiAnalysis质疑谷歌Meta模型在公开基准上存在“刷榜”行为

N
News Editor
2026-09-12 08:20:11
SemiAnalysis于9月8日连发五条推文,点名谷歌 Gemini 3.8 Flash 与 Meta Muse Spark 1.3 在公开评测中存在明显“刷榜痕迹”。其核心依据是,两款模型在 Terminal-Bench 2.1 排名靠前,但在8月29日上线、加入防作弊设计的 Terminal-Bench 4.0 中分数大幅下滑。争议随后扩大到训练数据采购、公开基准失真,以及评测机构兼做数据供应商的利益冲突问题。

9月8日,分析机构 SemiAnalysis 连发五条推文,直接点名谷歌和 Meta,称 Gemini 3.8 Flash 与 Muse Spark 1.3 是「刷榜痕迹最明显的两个模型」。

SemiAnalysis质疑谷歌Meta模型在公开基准上存在“刷榜”行为 2

其依据来自公开基准 Terminal-Bench 的两版成绩差异。按照 SemiAnalysis 列出的数据,在 Terminal-Bench 2.1 上,Gemini 3.8 Flash 得分 89.4,在 182 个模型中排名第 2,领先 88.4 分的 GPT-6 Astra。可到了 8 月 29 日刚上线的 Terminal-Bench 4.0,同一模型得分降至 19.1,在 14 个测试对象里排到第 12。作为对照,GPT-6 Astra 从 88.4 分降到 57.7 分。

Meta 首席 AI 官 Alexandr Wang 很快在评论区回应,称「这是个愚蠢的论点」。他举例称,GPT-5.6 Sol 在 2.1 版本上是 88.8 分,在 4.0 版本上降到 37.3 分,分差更大,但没人因此指控 Sol 刷榜。

Wang 同时表示,Meta 从未宣称 Muse Spark 1.3 可以与 Astra 或 Fable 5.1 处在同一强度层级,Meta 的说法是这款模型具有更高性价比。

SemiAnalysis质疑谷歌Meta模型在公开基准上存在“刷榜”行为 3

Terminal-Bench 4.0 上线后,榜单排名明显改写

Terminal-Bench 主要测试 Agent 在真实任务中的执行能力。评测方式是给模型一个终端和一个模糊目标,随后由系统自行规划路径、调用工具、编写脚本,并在报错时自行修复。

在此前已被行业使用大半年的 2.1 版本中,Gemini 3.8 Flash 以 89.4 分排名第 2,Muse Spark 1.3 以 88.8 分排名第 4,之后分别是 88.4 分的 GPT-6 Astra 和 85.02 分的 Claude Fable 5.1。

8 月 29 日发布的 Terminal-Bench 4.0 对评测题目和规则进行了大幅调整。新版本共有 66 道题,移除了 8 道已经被「刷穿」的旧题,重修了 19 道题,并统一加入 8 小时超时限制。

在防作弊部分,主办方设置了 35 条评分细则,还增加了一轮「对抗性作弊试验」,故意让 Agent 尝试钻奖励机制的空子,凡是能够被钻空子的题目会被直接剔除。

SemiAnalysis质疑谷歌Meta模型在公开基准上存在“刷榜”行为 4

新榜单公布后,排名出现明显变化。Claude Mythos 5.1(max)以 60.9 分排名靠前,GPT-6 Astra 和 Claude Fable 5.1 分别为 57.7 分和 55.8 分,Claude Opus 5 为 52.3 分。上一代 GPT-5.6 Sol 和 Terra 分别获得 37.3 分和 23.6 分。相比之下,Gemini 3.8 Flash 跌至 19.1 分;按 SemiAnalysis 给出的图表,Muse Spark 1.3 为 33.3 分。

按这一对比,在旧榜单上,Gemini 3.8 Flash 还能高于 GPT-6 Astra;到了新榜单,其分数已不到后者的三分之一,也落后于上一代的 GPT-5.6 Terra。

SemiAnalysis:公开题库不必直接泄题,也能被定向训练利用

SemiAnalysis 在第二条推文中把矛头指向了公开基准背后的训练数据交易。

SemiAnalysis质疑谷歌Meta模型在公开基准上存在“刷榜”行为 5

他们认为,Terminal-Bench 2.1 的任务是完全公开的,谷歌和 Meta 未必会直接拿原题训练,但可以购买与 TB 2.1 题型高度接近的数据。这样做不等于把原题塞进训练集,却能在效果上逼近作弊。

文中将这一做法描述为 2026 年刷榜的高阶玩法。相比过去把原题直接混入预训练语料、让模型死记硬背的「污染」方式,如今更常见的做法,是购买与公开基准高度相似的「模拟卷」,也就是封闭式任务系统,供模型试错并给予奖励。

SemiAnalysis 还列举了业界过往的污染案例:HumanEval 近四成样本被污染,GSM8K 在去污染后下降 13 分,SWE-bench 更换一套私有代码库重测后,分数出现腰斩。

按照文中数据,这类训练任务已经形成成熟交易市场。单个训练任务报价在 200 美元到 2000 美元之间,复杂的软件工程任务可达 2 万美元;克隆一个网站作为 UI 训练场约需 2 万美元;如果要复刻一个 Slack 量级的产品,起步价是 30 万美元;若客户要求独家买断,价格还可再提高 4 到 5 倍。

SemiAnalysis质疑谷歌Meta模型在公开基准上存在“刷榜”行为 6

根据 Epoch AI 的调研,Anthropic 内部曾讨论每年在这一领域投入 10 亿美元。单季合同经常达到六位数到七位数,有研究人员称平均价格约为每季 30 万至 50 万美元。

供给端方面,SemiAnalysis 称至少有 35 家公司在提供类似服务,多数是 20 人以下的初创团队。文中还提到,Scale AI 在被 Meta 入股前营收已超过 14 亿,Surge 的 ARR 也接近 10 亿。

Datacurve 被点名:既卖训练环境,也运营评测基准

随后,SemiAnalysis 直接点名 Datacurve。

SemiAnalysis质疑谷歌Meta模型在公开基准上存在“刷榜”行为 7

在用于测试长周期编程能力的 DeepSWE 1.1 榜单上,Muse Spark 1.3(max)以 75.4 分排名第一,GPT-6 Astra 和 Claude Opus 5 紧随其后,Gemini 3.8 Flash 以 73.8 分排在第四。

争议在于,DeepSWE 1.1 由 Datacurve 主办,而 Datacurve 的商业模式之一,正是向前沿实验室出售「专家级编码数据和强化学习环境」。换句话说,这家公司既运营自己的评测基准,也出售与模型训练相关的环境和数据。

在 SemiAnalysis 看来,这种结构意味着评测机构与数据供应商的角色发生重叠,利益冲突问题被摆上台面。

公开基准还能维持多久

SemiAnalysis 最后的判断,指向整个行业的公开评测体系。

SemiAnalysis质疑谷歌Meta模型在公开基准上存在“刷榜”行为 8

他们认为,所有高质量公开基准最终都会面临同一个问题,Terminal-Bench 4.0 也不会例外。它现在仍然具备区分度,只是因为发布时间还短,距今只有两周。只要题目保持公开,所谓前沿实验室迟早会围绕这些题目反复优化。

他们给出的应对方式,是建设更多高质量私有基准。但文中同时指出,评测一旦全面转向私有化,公开榜单可能会进一步沦为营销工具,真正有区分度的成绩只会在实验室与私有评测机构之间流转。

对于大型实验室而言,私有化评测意味着外界无法提前围绕题目做训练准备。但对开发者来说,那把用来统一衡量模型能力的公共尺子,也可能随之消失。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
2600

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。