前微软工程师多模型PR审查:AI编码变慢但bug率骤降

前微软工程师多模型PR审查:AI编码变慢但bug率骤降

N
News Editor 01
2026-07-22 20:45:14
前微软工程师Nolan Lawson采用多模型并行审查PR,利用Claude、Codex和Cursor Bugbot交叉验证,将误报率降至接近零。Anthropic Glasswing项目数据表明,AI找bug已不是瓶颈,验证与修复才是关键。
AI编码多模型审查PR审查代码质量AI编程工具

前微软、Salesforce资深工程师Nolan Lawson最近分享了一套新的工作流程:用多个大型语言模型同步审查每个pull request(代码合并请求),通过交叉验证找出真实bug,而不是追求快速产出更多代码。结果代码输出量没有增加,但质量明显改善。这套方法被称为“更有质感的vibe coding”——谨慎、有方法论、以品质为导向。

LLM天生擅长找bug,验证才是新瓶颈

Anthropic今年启动的Glasswing项目(Mythos系统的公开更新)提供了直接的数据基础。该系统让LLM agents大规模扫描真实开源代码:在超过1,000个开源项目中,估算发现6,202个高严重性或关键性漏洞,总计23,019个漏洞(含低严重性)。经独立资安公司逐一验证的1,752个漏洞里,90.6%被确认为真实问题62.4%属于高严重性或关键性等级。Anthropic在报告中写道:“软件安全的进展,曾经受限于找漏洞的速度,现在受限于验证、揭露、修补的速度。”AI已将瓶颈从“发现”推进到“处理能力”。

多模型交叉验证:三个模型同时审查一个PR

Lawson的核心做法是让多个不同厂商的模型同时跑PR审查,而非依赖单一模型。他的工具组合包括Claude code、OpenAI的Codex,以及Cursor Bugbot,三者同步对同一个pull request进行完全独立的审查,再汇总所有结果,按critical、high、medium、low四个严重等级排列输出。这个设计的精妙之处在于:单个模型容易误报,但多个来自不同训练数据和架构的模型同时指向同一个问题,误报率会大幅降低,覆盖率高。Lawson称:“误报率接近零,找到的bug覆盖度很高。”

决策流程很明确:所有critical和high问题必须先修;medium和low则评估修复成本与实际影响的比例,不值得的直接跳过;如果一个PR的critical问题太多,整个直接放弃重做,不在有根本问题的代码上打补丁。Lawson引用的研究指出,模型越多样,最终报告越准确,原理是“多元模型去偏差”:不同训练背景的模型对同一段代码产生的偏见方向不同,多数投票可有效过滤单模型的盲点。

速度下降,品质上升——旧bug被挖出,单元测试被迫补齐

实际运行这套流程后,Lawson的代码输出量没有增加,反而经常挖出既有的旧bug,不得不补写单元测试(针对每个小功能单独验证的自动化测试)。修旧问题的时间远多于推进新功能。这不是他预期的结果,但从另一个角度看,代码库的健康度正在被系统性强化的信号。Lawson把这种方式称为“更有质感的vibe coding”——更慢、更谨慎,但每行代码的存活时间更长、出问题概率更低。他强调,工程团队真正的目标从来不只是速度:每行代码都有维护成本和出问题的概率,用AI把代码写得更慢、更正确,才是可持续的路径。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。