斯坦福伯克利推LLM验证器,登顶Terminal与SWE基准

斯坦福伯克利推LLM验证器,登顶Terminal与SWE基准

N
News Editor 01
2026-07-08 02:20:12
斯坦福AI Lab、伯克利Sky Computing Lab与NVIDIA提出LLM-as-a-Verifier,通过连续奖励与多维评估优化AI解答筛选,在Terminal-Bench 2和SWE-Bench Verified刷新成绩,相关框架已开源。

斯坦福AI Lab、伯克利Sky Computing Lab联合NVIDIA近日提出一种新的AI解答筛选方法——LLM-as-a-Verifier,目标是解决当前AI编程代理在多次执行同一任务时,输出结果质量不稳定的问题。研究指出,同一个任务在重复运行中往往会产生多个不同解答,其中既有正确结果,也可能包含错误方案。如果能够从中自动筛选出最佳答案,整体成功率就有机会显著高于单次运行的表现。

目前行业中较为常见的做法是“LLM-as-a-Judge”,即让另一套大模型充当裁判,对候选答案打分并选出优胜者。然而这一方式存在一个突出问题:评分颗粒度不足。不同质量的解答经常被给出相同分数,导致系统难以进一步区分优劣,影响最终选择效果。尤其在编程、终端执行和软件修复等复杂任务中,细微差别往往就决定了结果是否真正可用。

从“裁判打分”转向“验证器筛选”

与传统Judge框架不同,LLM-as-a-Verifier并不只看模型最终给出的单一评分,而是进一步分析模型在各个评分等级上的概率分布,并据此计算连续奖励值。相比离散分数,这种方式能保留更多判断信息,从而提高筛选的分辨率。简单来说,它不只是问“哪个好”,而是衡量“好多少”,让候选解之间的差异被更细致地呈现出来。

此外,该方法还引入了多次评估取平均的机制,以尽量消除单次判断中的随机偏差。研究团队将整体评估拆分为三个独立维度:是否满足任务要求、输出格式是否正确、是否存在错误信号。这种分项式验证逻辑,使得模型不再仅依赖一个笼统总分,而是基于更结构化的标准进行综合判断。

实验数据表现领先传统Judge方法

根据披露的实验结果,在采用Gemini 2.5 Flash作为验证器的设置下,LLM-as-a-Verifier在单次运行中的准确率达到74.7%,明显高于传统LLM-as-a-Judge的57.0%。如果将评估重复进行16次,Verifier的准确率进一步提升至77.4%,而Judge则为70.2%

更值得关注的是,传统Judge在候选方案比较中出现平分的情况达到26.5%,这意味着四分之一以上的比较无法有效拉开差距。而Verifier在所有配置中的平分率则为0%。对于需要自动化批量筛选结果的AI代理系统而言,能否稳定给出明确排序,直接关系到系统是否具备工程可用性。

在Terminal-Bench 2和SWE-Bench Verified取得第一

在更接近真实应用场景的基准测试中,Verifier同样展现出较强竞争力。在Terminal-Bench 2上,研究团队让GPT-5.4针对同一任务运行5次,如果随机选取一个结果,成功率为81.8%;而通过Verifier进行筛选后,成功率提升至86.4%。这一结果显示,筛选机制本身就能带来可观增益,而不仅仅依赖生成模型能力的提升。

SWE-Bench Verified上,团队从Claude Opus 4.5、Claude Opus 4.6和Gemini 3 Flash各选取一个候选解答,总计3个方案进行比较。随机选择时成功率为76.1%,采用Verifier筛选后升至77.8%。截至4月9日发布时,这两项成绩均排名第一。与此同时,该框架也已经完成开源,为后续研究与产业化落地提供了基础。

对AI与加密赛道意味着什么

虽然这项成果本身属于AI评估与代理优化领域,但其外溢影响同样值得加密市场关注。近年来,AI Agent、链上自动化工具、智能合约审计助手以及量化策略生成器,正在成为AI+Crypto叙事中的重要组成部分。对于这些应用而言,生成能力固然重要,但验证与筛选能力往往决定了系统是否能从“看起来聪明”走向“真正可靠”。

从市场角度看,Verifier思路的提升强化了一个趋势:未来AI基础设施的竞争,不只在于模型参数规模或推理速度,还包括结果评估、任务验证和自动选择机制。对于布局AI代理、开发者工具、去中心化算力与模型服务的加密项目来说,这类技术进步可能会推动市场重新评估“后处理层”和“验证层”的价值。特别是在链上环境中,错误执行的成本更高,因此更稳定的验证框架可能具备更强商业化潜力。

不过,投资者也需要保持理性。此次披露的是研究团队在特定基准和特定配置下取得的结果,是否能在更广泛的模型、任务类型和实际生产环境中保持同样优势,仍有待进一步观察。短期内,这类消息更适合作为判断AI基础设施技术演进方向的参考,而非直接等同于相关代币或板块的即时价值重估。

整体来看,LLM-as-a-Verifier的意义在于,它为AI代理“多跑几次、选最好的一次”提供了更高效且更精细的实现路径。在AI与加密交叉赛道持续升温的背景下,验证层能力的提升,可能会成为下一阶段基础设施竞争中的关键变量之一。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
100

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。