“我们都不读论文了”,一位 OpenAI 研究员的表态,直接把学术论文、顶会评审和前沿实验室之间的张力摆到了台面上。
这场讨论的导火索,是一篇效果好到让人难以理解的 ICLR 论文。网友继续追查后,发现论文结果背后另有“秘诀”,也让不少人开始重新审视:顶会论文如今到底还有多少经得起检验。
SAI抽查ICML 2026 Oral论文:105篇完成完整复现,只有8篇超过80%
今年 7 月,由芝加哥大学计算机科学与数据科学副教授谭宸浩联合创办的 SAI,公布了一次大规模“实验审稿”。
SAI 选取的对象,是 ICML 2026 全部 168 篇 Oral 论文。按照文中数据,今年 ICML 共收到 23918 篇投稿,最终只有 168 篇获得 Oral 资格,占比约 0.7%。也就是说,这次检查面对的,已经是两万多篇投稿中最靠前的一层。
和传统审稿只看论文文本、实验设计与结果不同,SAI Review 还会下载代码、模型和数据,配置运行环境,实际执行实验,再把跑出来的结果与论文原文逐项对照。

在全部 168 篇 Oral 论文中,只有 104 篇代码开源,最终 SAI 完成了 105 篇完整复现。复现结果并不理想:只有 34 篇复现了超过 40% 的主张,复现比例超过 80% 的,只剩 8 篇。
报告还提到,不管每篇论文至少包含 1 项、3 项还是 5 项可验证主张,复现得分中位数始终落在 28% 至 30%,整体分布变化不大。
即便排除未运行、提前中止或超出硬件能力的实验后,复现得分中位数仍只有 42% 至 50%;当每篇论文至少包含 3 项可验证主张时,这个中位数稳定在 42%。
最常见的问题,不是理论争议,而是代码根本跑不通
SAI 在复现过程中遇到的问题很集中:代码无法运行、文件缺失、说明不完整、依赖损坏,或者代码实际跑出的结果与论文中的叙述对不上。

还有 4 篇论文依赖已经下线的模型。对后来的研究者来说,即便愿意投入资金和时间,也无法重新得到相同结果。
SAI 还列出两个更具体的案例。
其中一篇论文把“只训练基础模型 0.77% 的参数”作为主要卖点,但实际发布的检查点训练了 6.31% 的参数,约为宣称数字的 8 倍。
另一篇论文展示了一张由裁判模型评分得到的可靠性表格,但在开源代码中找不到这个裁判模型,也没有脚本可以算出表格中的数字。

复现成本高,问题论文的外部核查反而更难
文中认为,SAI 的复现结果已经相当糟糕,但更棘手的是,当前暴露出来的还只是“有条件被发现”的问题。
没有代码的论文,外界几乎无从检查。即便代码完全公开,验证一篇论文也要投入大量时间、精力和资金,最后未必能得到令人满意的结果。
按照 SAI 基于 Google Cloud 公开按需价格给出的估算,完整重跑一篇 ICML Oral 论文的成本中位数约为 8900 美元。在这 105 篇论文中,有 17 篇复现成本超过 10 万美元,最昂贵的一篇接近 220 万美元。
论文越依赖大规模算力,独立复现就越困难。没有代码,别人没法查;有代码,也未必有人付得起复现的代价。

在这种情况下,一篇存在问题的论文,仍然可能顺利通过评审、获得引用,再进入简历,换来录取、教职或大实验室的工作机会。即便后来有人发现结果对不上,会议通常也很少重新审查,论文也未必会被撤回。
“不读论文”的另一面:招聘和晋升仍然离不开论文
在大模型领域,一些真正重要的进展,确实不再总是以论文形式出现。作为 OpenAI 的工程师,处在产业前沿,拥有更充足的算力、更快的实验反馈以及大量不公开的内部结果,会产生“不读论文”的感受,并不难理解。
但这句话之所以引发争议,也在于另一层现实并没有改变。
有评论讽刺,科技公司这样做有些像“上岸后抽走梯子”:从高校吸纳研究人员,建立在学术界公开积累的成果之上,用更高价格争夺人才和 GPU,自身越来越少接受同行评审,最后却反过来宣布学术研究“主要是骗局”。

这类说法带着情绪,但文章认为其中并非没有道理。因为前沿实验室里的人可以“不读论文”,想进入这些机构的人却仍然需要先发论文。
对于缺少产业经历的学生和年轻研究者来说,顶会论文依然是证明研究能力最直接的凭证。无论申请博士、寻找教职,还是进入 OpenAI 这样的前沿实验室,论文仍是获得关注的重要方式。
产业界研究者在进入大实验室之后轻视论文,但在筛选门外候选人时,依然会看论文数量、会议级别和引用成绩。
于是,论文处在一个很尴尬的位置:它在知识传播上的可信度受到质疑,但在人才竞争中的价值并没有消失。

学术理想、现实激励与研究门槛的错位
文章最后提到,“大实验室已经不读论文了”这句话之所以显得有些清高甚至傲慢,是因为真正有资格不读论文的人,往往已经借助论文跨过了那道门槛。
当然,文中也没有把所有学生都描述成精心设计骗局的人。一位高校研究者半开玩笑地说,他倒希望自己的学生已经有能力写出一篇夸大其词甚至造假的论文。
这句调侃背后,是另一种更直接的现实:有的人已经在“争做学术骗子”,还有的人仍在 LaTeX 里苦苦挣扎。
参考链接
- https://x.com/MathewShen42/status/2084465434506768867
- https://x.com/kellerjordan0/status/2084721463089902074
- https://sai.science/blog/how-much-science-is-verifiable
- https://x.com/mengyer/status/2085134204786921886
本文来自微信公众号“机器之心”(ID:almosthuman2014),作者:机器之心。

