Stanford and Berkeley Propose LLM-as-a-Verifier, Topping Terminal-Bench and SWE-Bench

Stanford and Berkeley Propose LLM-as-a-Verifier, Topping Terminal-Bench and SWE-Bench

N
News Editor 01
2026-07-08 02:20:12
Stanford AI Lab, Berkeley Sky Computing Lab, and NVIDIA introduced LLM-as-a-Verifier, a new method for selecting better AI-generated solutions. It outperformed traditional LLM-as-a-Judge on Terminal-Bench 2 and SWE-Bench Verified, with the framework now open-sourced.

斯坦福AI Lab、伯克利Sky Computing Lab联合NVIDIA近日提出一种新的AI解答筛选方法——LLM-as-a-Verifier,目标是解决当前AI编程代理在多次执行同一任务时,输出结果质量不稳定的问题。研究指出,同一个任务在重复运行中往往会产生多个不同解答,其中既有正确结果,也可能包含错误方案。如果能够从中自动筛选出最佳答案,整体成功率就有机会显著高于单次运行的表现。

目前行业中较为常见的做法是“LLM-as-a-Judge”,即让另一套大模型充当裁判,对候选答案打分并选出优胜者。然而这一方式存在一个突出问题:评分颗粒度不足。不同质量的解答经常被给出相同分数,导致系统难以进一步区分优劣,影响最终选择效果。尤其在编程、终端执行和软件修复等复杂任务中,细微差别往往就决定了结果是否真正可用。

从“裁判打分”转向“验证器筛选”

与传统Judge框架不同,LLM-as-a-Verifier并不只看模型最终给出的单一评分,而是进一步分析模型在各个评分等级上的概率分布,并据此计算连续奖励值。相比离散分数,这种方式能保留更多判断信息,从而提高筛选的分辨率。简单来说,它不只是问“哪个好”,而是衡量“好多少”,让候选解之间的差异被更细致地呈现出来。

此外,该方法还引入了多次评估取平均的机制,以尽量消除单次判断中的随机偏差。研究团队将整体评估拆分为三个独立维度:是否满足任务要求、输出格式是否正确、是否存在错误信号。这种分项式验证逻辑,使得模型不再仅依赖一个笼统总分,而是基于更结构化的标准进行综合判断。

实验数据表现领先传统Judge方法

根据披露的实验结果,在采用Gemini 2.5 Flash作为验证器的设置下,LLM-as-a-Verifier在单次运行中的准确率达到74.7%,明显高于传统LLM-as-a-Judge的57.0%。如果将评估重复进行16次,Verifier的准确率进一步提升至77.4%,而Judge则为70.2%

更值得关注的是,传统Judge在候选方案比较中出现平分的情况达到26.5%,这意味着四分之一以上的比较无法有效拉开差距。而Verifier在所有配置中的平分率则为0%。对于需要自动化批量筛选结果的AI代理系统而言,能否稳定给出明确排序,直接关系到系统是否具备工程可用性。

在Terminal-Bench 2和SWE-Bench Verified取得第一

在更接近真实应用场景的基准测试中,Verifier同样展现出较强竞争力。在Terminal-Bench 2上,研究团队让GPT-5.4针对同一任务运行5次,如果随机选取一个结果,成功率为81.8%;而通过Verifier进行筛选后,成功率提升至86.4%。这一结果显示,筛选机制本身就能带来可观增益,而不仅仅依赖生成模型能力的提升。

SWE-Bench Verified上,团队从Claude Opus 4.5、Claude Opus 4.6和Gemini 3 Flash各选取一个候选解答,总计3个方案进行比较。随机选择时成功率为76.1%,采用Verifier筛选后升至77.8%。截至4月9日发布时,这两项成绩均排名第一。与此同时,该框架也已经完成开源,为后续研究与产业化落地提供了基础。

对AI与加密赛道意味着什么

虽然这项成果本身属于AI评估与代理优化领域,但其外溢影响同样值得加密市场关注。近年来,AI Agent、链上自动化工具、智能合约审计助手以及量化策略生成器,正在成为AI+Crypto叙事中的重要组成部分。对于这些应用而言,生成能力固然重要,但验证与筛选能力往往决定了系统是否能从“看起来聪明”走向“真正可靠”。

从市场角度看,Verifier思路的提升强化了一个趋势:未来AI基础设施的竞争,不只在于模型参数规模或推理速度,还包括结果评估、任务验证和自动选择机制。对于布局AI代理、开发者工具、去中心化算力与模型服务的加密项目来说,这类技术进步可能会推动市场重新评估“后处理层”和“验证层”的价值。特别是在链上环境中,错误执行的成本更高,因此更稳定的验证框架可能具备更强商业化潜力。

不过,投资者也需要保持理性。此次披露的是研究团队在特定基准和特定配置下取得的结果,是否能在更广泛的模型、任务类型和实际生产环境中保持同样优势,仍有待进一步观察。短期内,这类消息更适合作为判断AI基础设施技术演进方向的参考,而非直接等同于相关代币或板块的即时价值重估。

整体来看,LLM-as-a-Verifier的意义在于,它为AI代理“多跑几次、选最好的一次”提供了更高效且更精细的实现路径。在AI与加密交叉赛道持续升温的背景下,验证层能力的提升,可能会成为下一阶段基础设施竞争中的关键变量之一。

This article was originally published by Bit.Fan. For more cryptocurrency news and market insights, visit www.bit.fan.
300

Disclaimer:

The market information, project data, and third-party content displayed on this platform are for industry information sharing only and do not constitute any form of investment advice or return commitment.

Cryptocurrency trading carries high risks. Users should fully assess their risk tolerance and make independent decisions. All profits, losses, and legal responsibilities are borne by the users themselves.