Stanford, Berkeley and NVIDIA Propose LLM-as-a-Verifier, Topping Terminal-Bench and SWE-Bench

Stanford, Berkeley and NVIDIA Propose LLM-as-a-Verifier, Topping Terminal-Bench and SWE-Bench

N
News Editor 01
2026-07-08 02:20:12
Stanford AI Lab, Berkeley Sky Computing Lab and NVIDIA introduced LLM-as-a-Verifier, a framework that improves solution selection for AI agents. The method outperformed LLM-as-a-Judge and ranked first on Terminal-Bench 2 and SWE-Bench Verified, with the framework now open-sourced.

斯坦福AI实验室与伯克利Sky Computing Lab联合英伟达,近期提出名为LLM-as-a-Verifier的新方法,试图解决AI编程代理在重复执行同一任务时“结果不稳定”的关键问题。研究指出,同一个任务多次运行后,模型往往会给出不同答案,其中既有正确解,也有错误解。如果系统能够从多次生成的候选方案中自动挑出最优解,整体成功率就有望显著高于单次运行表现。

从“裁判”到“验证器”的思路升级

当前主流做法通常被称为LLM-as-a-Judge,即让另一个大模型充当“裁判”,为候选答案打分并据此选择最佳方案。但研究团队指出,这种方式存在明显短板:评分粒度较粗,不同质量的答案可能获得相同分数,导致系统难以拉开差距,也难以稳定选出真正更优的结果。

相比之下,LLM-as-a-Verifier并不只看最终打分结果,而是进一步分析模型在各个评分等级上的概率分布,据此计算连续奖励值。研究团队还引入了多次评估取平均的机制,以降低随机波动带来的偏差。与此同时,整体评估过程被拆分为三个相互独立的维度,包括是否满足任务要求、输出格式是否正确、是否出现错误信号。这一设计使得验证过程更细致,也更适合处理编程与代理执行这类高复杂度任务。

实验结果:准确率与稳定性同步提升

根据披露的数据,在使用Gemini 2.5 Flash作为验证器时,LLM-as-a-Verifier单次运行准确率达到74.7%,而传统LLM-as-a-Judge为57.0%。当评估重复进行16次后,验证器方案的准确率进一步提升至77.4%,仍明显高于传统方法的70.2%

除了准确率优势,更值得注意的是其在“区分能力”上的改善。传统Judge方法在比较中出现并列评分的比例高达26.5%,意味着系统在大量情况下无法明确判断哪个方案更优。而Verifier在所有配置中实现了0%并列率,显示出更强的排序能力。对于需要从多个候选答案中筛选最优解的代理系统而言,这种差异具有现实意义,因为筛选效率和稳定性往往直接决定自动化执行的上限。

两项权威基准测试登顶

在实际应用层面,该方法在两项AI代理相关基准中都取得领先结果。首先,在Terminal-Bench 2测试中,对同一任务使用GPT-5.4运行5次后,若随机抽取一个结果,成功率为81.8%;引入Verifier进行筛选后,成功率提升至86.4%

其次,在SWE-Bench Verified中,研究团队从Claude Opus 4.5、Claude Opus 4.6和Gemini 3 Flash各选取一个解答,共形成3个候选方案。未经筛选时,成功率为76.1%;经过Verifier选择后,成功率提升至77.8%。根据素材信息,截至4月9日发布时,上述两项结果均位列第一。与此同时,该框架也已完成开源,为后续研究和产业采用提供了基础。

对AI与加密市场意味着什么

虽然这项成果本身来自AI研究领域,但其对加密行业的启示并不小。近一段时间,AI与加密的交叉叙事持续升温,尤其是在链上代理、自动化研究、智能交易执行以及开发者工具等方向,市场对“更可靠的AI系统”需求明显提升。对于依赖代码生成、策略执行或多轮任务调度的加密应用而言,模型不仅要会“生成”,更要会“验证”和“筛选”。从这个角度看,Verifier思路恰好切中了AI代理落地中的核心瓶颈。

市场层面,这类进展通常会强化投资者对AI基础设施、AI代理、模型评测与验证工具等细分赛道的关注。尤其是在加密叙事中,若相关项目能够把验证器机制用于链上智能代理、DeFi自动策略或安全审计流程,可能进一步提升外界对“AI可用性”而非单纯“AI概念”的估值预期。不过,需要强调的是,当前素材并未提供具体代币价格或项目融资信息,因此市场影响更多体现在中长期叙事和技术方向判断上,而非短期交易信号。

总体来看,斯坦福、伯克利与英伟达提出的LLM-as-a-Verifier,展示了AI代理从“会做题”走向“会挑对答案”的重要一步。随着框架开源,其方法论有望被更多开发者与平台吸收。对关注AI+Crypto融合趋势的市场参与者而言,这项进展值得持续跟踪,因为未来真正具备商业价值的AI系统,竞争焦点很可能不只是谁生成得更快,而是谁验证得更准、执行得更稳。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
300

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.