‹ 返回公开基准

公开基准

SemiAnalysis
2026-09-12 08:20:11

SemiAnalysis质疑谷歌Meta模型在公开基准上存在“刷榜”行为

SemiAnalysis于9月8日连发五条推文,点名谷歌 Gemini 3.8 Flash 与 Meta Muse Spark 1.3 在公开评测中存在明显“刷榜痕迹”。其核心依据是,两款模型在 Terminal-Bench 2.1 排名靠前,但在8月29日上线、加入防作弊设计的 Terminal-Bench 4.0 中分数大幅下滑。争议随后扩大到训练数据采购、公开基准失真,以及评测机构兼做数据供应商的利益冲突问题。

270
SemiAnalysis质疑谷歌Meta模型在公开基准上存在“刷榜”行为
Anthropic
2026-09-01 04:21:24

Anthropic测试AI自主做对齐研究:60小时内将效率提升约1.5万倍

Anthropic在8月28日发布新报告,测试让Claude以“自动化对齐研究员”身份独立完成查文献、提方法、训练和评测。报告显示,在10类已知对齐失败上,系统均实现改善,且通用能力未见崩塌。在一项“弱模型对齐强模型”的实验中,Claude Sonnet 5在约60小时内试出50多个方案,最终把Claude Opus 4.8早期检查点的目标得分推到65%,Anthropic称这套流程较其生产级对齐方案效率高约15000倍。

730
Anthropic测试AI自主做对齐研究:60小时内将效率提升约1.5万倍
Vals AI
2026-08-15 05:44:44

Vals AI 以 4 亿美元估值完成 4000 万美元 A 轮融资

AI 模型评测公司 Vals AI 完成 4000 万美元 A 轮融资,估值达到 4 亿美元。本轮由 a16z 领投,8VC、Pear VC、Bloomberg Beta、HRT Ventures 和 Next Ladder Ventures 等参投。公司主要评测 OpenAI、Anthropic、Google、Meta 与 xAI 的前沿模型。新资金将投向评测基础设施扩建,并推出基于企业 GitHub 代码库生成编程基准的测试工具。

1200
Vals AI 以 4 亿美元估值完成 4000 万美元 A 轮融资
Z.ai
2026-08-14 05:52:45

Z.ai发布GLM-5.3:编码基准提升50%,网络安全测试84.5%

Z.ai 发布 GLM-5.3,新模型基于与 GLM-5.2 相同的基础模型,靠扩大后训练实现能力提升。官方称,其内部编码基准 Z.ai Code Bench 得分较 GLM-5.2 提升 50%,在 Terminal Bench 3、Agents' Last Exam 等公开基准中达到开放模型领先水平。网络安全方面,GLM-5.3 在 CyberGym 漏洞发现测试中取得 84.5% 的成绩,并大幅领先前代。

1290
Z.ai发布GLM-5.3:编码基准提升50%,网络安全测试84.5%
智谱
2026-08-14 06:02:48

智谱发布GLM-5.3:编码能力提升50%,权重两周后开放

8 月 14 日,Z.ai 发布 GLM-5.3。新模型沿用 GLM-5.2 基础架构,通过扩大后训练提升能力,在内部编码基准 Z.ai Code Bench 上较前代提升 50%,并在 Terminal Bench 3.0、Agents' Last Exam 等公开基准中达到开放模型领先水平。安全评测方面,CyberGym 漏洞发现成绩为 84.5%,利用链相关测试较前代明显改进。模型权重两周后开放,API 不再支持关闭思考模式,提供 low、high、max 三档推理强度。

1410
智谱发布GLM-5.3:编码能力提升50%,权重两周后开放