AI复核论文掀出高比例问题,顶会复现审计结果引发关注

AI复核论文掀出高比例问题,顶会复现审计结果引发关注

N
News Editor
2026-08-09 08:20:07
针对 ICML 2026 论文的两项 AI 复现与核查项目显示,论文可复现性和客观错误问题正在被集中暴露。一项审计称,168 篇口头报告中有 92 篇具备至少 5 条可验证结论,其中 58 篇无法复现;另一项基于 GPT-5 的检查系统则称,顶级 AI 会议和期刊论文平均每篇检出 4.7 个客观错误,99.2% 的论文至少被标记出一个问题。不过,报道同时强调,无法复现并不等同于造假,AI 工具结果仍需人工复核。

AI 正在把学术论文的“复查成本”压到更低,也让不少已经发表的结果重新被放到台面上检验。

近期,多项围绕顶级 AI 会议论文的自动化复现和错误核查项目显示,已发表论文中的可复现性与客观错误问题,比外界通常设想得更普遍。

ICML 2026 口头报告论文被 AI Agent 系统复现审计

报道提到,7 月 22 日,美国某研究审查公司使用 AI Agent,对 ICML 2026 的全部 168 篇口头报告论文做了系统性的结果复现审计。

在这 168 篇论文中,有 92 篇具备至少 5 条可供验证的结论性声明。最终结果显示,AI Agent 能够成功复现超过四成结论的论文只有 34 篇;能复现八成以上结论的只有 8 篇。换句话说,这 92 篇论文里有 58 篇已经无法复现。

AI复核论文掀出高比例问题,顶会复现审计结果引发关注 3

需要区分的是,无法复现与研究造假并不是一回事。报道列出的复现失败原因包括:代码缺少关键文件、依赖库版本断裂、运行结果与论文描述不符。另有 4 篇论文依赖的模型已经下线,意味着对应实验结果已无法再被任何人复现。

个别案例中的偏差更加直接。一篇论文把“仅训练基础模型 0.77% 的参数”作为核心卖点,但其实际开源 checkpoint 显示训练了 6.31% 的参数,相差约 8 倍。另一篇论文给出了一张基于某评判模型的可靠性表格,但其开源代码中并没有该评判模型,也没有能够生成表格结果的脚本。

除上述审计外,2026 年 Hugging Face 与 AlphaXiv 还联合发起了面向 ICML 2026 的“Agent Reproduction Challenge”,邀请研究者使用 AI Coding Agent 对已接收论文进行自动化复现。报道称,结果同样“不乐观”。

AI复核论文掀出高比例问题,顶会复现审计结果引发关注 4

GPT-5 论文检查系统给出更大范围的错误统计

另一项被提及的研究出现在 2025 年底。该研究开发了一套基于 GPT-5 的论文检查系统,用于分析已经发表在顶级 AI 会议和期刊上的论文,目标是寻找可以客观验证的问题。

研究者明确表示:“我们只看‘客观错误’,我们不管论文的创新性和研究价值。”

最终结果显示,平均每篇论文被检测出 4.7 个客观错误,99.2% 的论文至少被标记出一个问题。

从错误类型看,数学与公式错误占比最高,达到 54.0%,包括方程式写错、推导逻辑存在漏洞、证明中的错误假设等。按会议划分,大约 30.8% 的 NeurIPS 论文和 23.8% 的 ICLR 论文,包含至少一个可能影响结果解读的实质性错误。

AI复核论文掀出高比例问题,顶会复现审计结果引发关注 5

时间维度上的变化也被单独指出。NeurIPS 论文的篇均错误数从 2021 年的 3.8 个升至 2025 年的 5.9 个,涨幅为 55.3%。

AI 降低了复查旧论文的门槛

报道认为,查文献、指出问题、撰写勘误,本来就是学术圈已有的正式产出形式。现在 AI 降低了检索、比对和复核成本,这类工作正变得更容易展开。

文中提到几种做法,包括把研究思路从“寻找全新选题”转向“寻找旧论文中的异常点”,重点关注高被引但争议较少的经典论文;也可以借助 AI 构建知识地图和研究谱系,梳理论文之间的引用关系、争议点和缺少验证的结论;还可以围绕长期被接受的假设继续追问,例如某个经典实验是否按照今天的标准被验证过,或某个被广泛引用的结论是否存在未被注意的限制条件。

AI复核论文掀出高比例问题,顶会复现审计结果引发关注 6

报道的判断是,过去这类追问的成本很高,研究者需要花大量时间查阅原始文献、逐项比较实验细节,而 AI 正在把这部分成本大幅压低。

从最新论文到百年前数据,AI 开始重查旧结论

这种变化并不只发生在 AI 论文领域。报道还提到,浙江实验室理论化学家 Pios 近期在使用 AI 预测分子沸点时,发现结果与一份 75 年前的化学数据库存在明显冲突。

Pios 最初先检查了自己的模型,但在手动回溯原始文献之后,他发现 AI 给出的结果是正确的。随后,Pios 又借助 AI 继续核查,进一步发现一份约一个世纪前、且被学界公认为权威的沸点测量值也存在错误。

这些数据已经在长时间里被不断引用,并被后续研究吸纳进文献体系。报道认为,这类问题长期未被发现,与科学文献体量过大直接相关。

AI复核论文掀出高比例问题,顶会复现审计结果引发关注 7

以 AI 领域为例,仅 ICLR 一家的年度投稿量,就从 2018 年的 1013 篇升至 2026 年的 19619 篇。在这样的规模下,一处早期错误一旦被后续论文反复引用,就可能沿着引用链持续传递,逐渐变成默认接受的“学术共识”。

而年代久远、引用链复杂、复核耗时且学术回报有限,也让大量已经进入文献体系的问题长期没有被系统审视。现在至少从技术能力上看,大规模重审既有科学文献开始变得可行。

AI 核查工具仍不能替代人工判断

报道最后也给出了边界。以 GPT-5 驱动的 Paper Correctness Checker 为例,其检测精确率为 83.2%,而且每次检测中仍有约四成真实错误未被检出。

AI复核论文掀出高比例问题,顶会复现审计结果引发关注 8

这意味着,AI 事实核查工具本身还不足以充当科学文献的最终裁判。它们可以提高筛查效率,但输出结果仍需要人工审核。

从这个角度看,论文发表本身并不意味着讨论结束。对一些研究来说,发表之后,才真正进入下一轮验证。

本文来自微信公众号“量子位”(ID:QbitAI),作者:程浅。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
720

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。