Stanford, Berkeley and NVIDIA Launch LLM-as-a-Verifier, Topping Terminal-Bench 2 and SWE-Bench Verified

Stanford, Berkeley and NVIDIA Launch LLM-as-a-Verifier, Topping Terminal-Bench 2 and SWE-Bench Verified

N
News Editor 01
2026-07-08 02:24:12
Stanford AI Lab, Berkeley Sky Computing Lab and NVIDIA introduced LLM-as-a-Verifier, a framework that improves AI solution selection with continuous rewards and multi-dimensional evaluation. It outperformed traditional judge-based methods and ranked first on Terminal-Bench 2 and SWE-Bench Verified. The framework has been open-sourced.

斯坦福大学AI Lab、伯克利Sky Computing Lab联合英伟达近日提出名为LLM-as-a-Verifier的新方法,试图解决AI编程代理在多次执行同一任务时“答案质量不稳定”的难题。根据披露信息,这一方法已在Terminal-Bench 2SWE-Bench Verified两项基准测试中取得领先表现,并于4月9日发布时登顶相关榜单。对于正处于“AI+加密”叙事升温阶段的市场而言,这类底层验证能力的进步,也正在成为观察技术基础设施演进的重要信号。

为何需要“验证器”而不只是“裁判”

在AI编程任务中,同一个模型针对同一问题多次运行,往往会生成多个不同版本的解答,其中既可能包含正确方案,也可能夹杂错误输出。如果能从这些候选结果���自动筛选出最佳解,整体成功率就有机会超过单次运行表现。当前较主流的做法是使用另一个模型充当“裁判”,即LLM-as-a-Judge,对不同答案进行打分后选优。

不过,这一传统模式存在明显缺陷。素材显示,Judge方法在实际比较中常常给不同候选答案打出相同分数,导致模型难以判断孰优孰劣,评分颗粒度不足成为核心瓶颈。针对这一问题,研究团队提出Verifier框架,不再只看最终打分结果,而是进一步利用模型在各个评分等级上的概率分布,计算出连续奖励值,从而提高区分度。

核心机制:连续奖励、多次评估、三维拆解

与传统Judge相比,LLM-as-a-Verifier的改进主要体现在三个层面。首先,它不是简单读取“最后给了几分”,而是分析评分过程中不同等级对应的概率分布,并据此形成更细腻的连续奖励信号。这样的设计有助于避免多个答案因为落在同一离散分数而被判定为并列。

其次,Verifier会进行多次评估并取平均结果,以降低单次判断中的随机偏差。对于大语言模型而言,评估本身也可能受到采样波动影响,多轮复核可以提升稳定性。

再次,整体判断标准被拆分为三个独立维度,分别是:是否满足任务要求、输出格式是否正确、是否存在错误信号。这意味着系统并非只从单一总分出发,而是从更结构化的角度对解答进行检验,提高筛选的可解释性与鲁棒性。

实验数据:准确率与无平局表现更突出

根据公开结果,在以Gemini 2.5 Flash作为验证器的实验中,Verifier在单次运行下的准确率达到74.7%,显著高于传统Judge的57.0%。当评估重复到16次后,Verifier的准确率进一步升至77.4%,而Judge为70.2%

更值得关注的是“平局率”的变化。传统Judge在比较候选方案时,出现并列结果的比例达到26.5%;而Verifier在所有配置下实现了0%平局率。这说明其连续奖励设计不仅提升了平均准确率,也显著增强了候选方案之间的区分能力。对于需要在多个自动生成答案中快速选优的应用场景,这一指标具有很强的现实意义。

两项权威基准测试登顶

在实际任务验证中,Verifier同样展现出较强的效果。在Terminal-Bench 2测试中,研究者让GPT-5.4针对同一任务运行5次。若从中随机选择一个结果,成功率为81.8%;而使用Verifier进行筛选后,成功率提升至86.4%

SWE-Bench Verified上,研究团队从Claude Opus 4.5、Claude Opus 4.6和Gemini 3 Flash各选取一个候选解答,共计三个方案,再由Verifier进行筛选,最终将成功率从76.1%提高到77.8%。据素材描述,截至4月9日发布时,这两项结果均排名第一。与此同时,该框架目前已经开源,意味着更多开发者和研究团队可以基于这一方法进行复现和扩展。

对AI与加密市场意味着什么

虽然这项成果本身属于AI基础能力与工程验证范畴,但其外溢影响已超出单纯的学术竞赛成绩。当前加密行业对“AI代理”“链上自动执行”“去中心化算力与模型协作”等概念保持高度关注,而这些应用能否真正落地,一个关键前提就在于结果是否可验证、是否足够稳定。换言之,AI系统不只是要会生成答案,更要能从多个候选中可靠地选出最优解。

从市场叙事角度看,Verifier方案强化了“验证层”这一基础设施价值。对于AI Agent、自动化代码审计、智能合约开发辅助以及链上风控等场景而言,更高的筛选准确率可能意味着更低的错误率和更强的可用性。尤其是在加密环境中,代码漏洞、执行偏差和错误信号都可能直接对应资金风险,因此与验证、评估、鲁棒性相关的技术突破,往往更容易获得行业关注。

不过,投资者也需要保持理性。基准测试领先并不等同于商业化已经成熟,开源框架从研究成果走向大规模生产部署,仍需经过成本控制、泛化能力验证以及不同任务环境适配等多个阶段。此次消息更应被视为AI验证技术的一次重要进展,而非对相关概念资产的直接价值背书。

总体来看,斯坦福、伯克利与英伟达联合提出的LLM-as-a-Verifier,通过连续奖励机制、多次评估平均和三维结构化判断,在候选解答筛选上展现出优于传统Judge方法的性能。随着框架开源,这一方向后续是否能推动AI代理在开发、审计和自动执行等场景进一步落地,值得市场持续关注。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
400

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.