SemiAnalysis质疑谷歌Meta模型在公开基准上存在“刷榜”行为
SemiAnalysis于9月8日连发五条推文,点名谷歌 Gemini 3.8 Flash 与 Meta Muse Spark 1.3 在公开评测中存在明显“刷榜痕迹”。其核心依据是,两款模型在 Terminal-Bench 2.1 排名靠前,但在8月29日上线、加入防作弊设计的 Terminal-Bench 4.0 中分数大幅下滑。争议随后扩大到训练数据采购、公开基准失真,以及评测机构兼做数据供应商的利益冲突问题。

SemiAnalysis于9月8日连发五条推文,点名谷歌 Gemini 3.8 Flash 与 Meta Muse Spark 1.3 在公开评测中存在明显“刷榜痕迹”。其核心依据是,两款模型在 Terminal-Bench 2.1 排名靠前,但在8月29日上线、加入防作弊设计的 Terminal-Bench 4.0 中分数大幅下滑。争议随后扩大到训练数据采购、公开基准失真,以及评测机构兼做数据供应商的利益冲突问题。

Anthropic在8月28日发布新报告,测试让Claude以“自动化对齐研究员”身份独立完成查文献、提方法、训练和评测。报告显示,在10类已知对齐失败上,系统均实现改善,且通用能力未见崩塌。在一项“弱模型对齐强模型”的实验中,Claude Sonnet 5在约60小时内试出50多个方案,最终把Claude Opus 4.8早期检查点的目标得分推到65%,Anthropic称这套流程较其生产级对齐方案效率高约15000倍。

AI 模型评测公司 Vals AI 完成 4000 万美元 A 轮融资,估值达到 4 亿美元。本轮由 a16z 领投,8VC、Pear VC、Bloomberg Beta、HRT Ventures 和 Next Ladder Ventures 等参投。公司主要评测 OpenAI、Anthropic、Google、Meta 与 xAI 的前沿模型。新资金将投向评测基础设施扩建,并推出基于企业 GitHub 代码库生成编程基准的测试工具。

Z.ai 发布 GLM-5.3,新模型基于与 GLM-5.2 相同的基础模型,靠扩大后训练实现能力提升。官方称,其内部编码基准 Z.ai Code Bench 得分较 GLM-5.2 提升 50%,在 Terminal Bench 3、Agents' Last Exam 等公开基准中达到开放模型领先水平。网络安全方面,GLM-5.3 在 CyberGym 漏洞发现测试中取得 84.5% 的成绩,并大幅领先前代。

8 月 14 日,Z.ai 发布 GLM-5.3。新模型沿用 GLM-5.2 基础架构,通过扩大后训练提升能力,在内部编码基准 Z.ai Code Bench 上较前代提升 50%,并在 Terminal Bench 3.0、Agents' Last Exam 等公开基准中达到开放模型领先水平。安全评测方面,CyberGym 漏洞发现成绩为 84.5%,利用链相关测试较前代明显改进。模型权重两周后开放,API 不再支持关闭思考模式,提供 low、high、max 三档推理强度。

Google DeepMind发布开源模型DiffusionGemma,官方称其在RTX 5090和H100上生成速度约为同尺寸自回归Gemma模型的4倍,但公开基准成绩全面低于标准Gemma 4。

XRP Ledger 3.2.0目标发布时间暂定为6月15日,核心服务器软件将从rippled更名为xrpld。节点运营方需调整脚本、监控与服务配置,普通XRP持有者无需操作。

由Ryan Shea开发的AI IQ平台将公开基准测试结果映射至人类IQ量表,最新排名显示GPT-5.5以136分位列第一,Claude Opus 4.7与Gemini 3.1 Pro并列第二。
