TMLR主编抽问作者论文内容:10 篇待拒稿全部被拒

TMLR主编抽问作者论文内容:10 篇待拒稿全部被拒

N
News Editor
2026-09-26 04:49:11
机器学习期刊 TMLR 联合主编 Nihar B. Shah 在两周轮值期间,对 10 篇原拟直接拒稿的投稿发起作者约谈,结果全部被拒。7 场实际会谈中,仅 1 篇作者答对全部问题,另有 3 篇连基础问题都答不上来。文章还披露了 TMLR 今年面对投稿激增采取的配额、AI 审稿和清晰写作标准,并将这一现象与 NeurIPS、arXiv 及生物医学论文中的 AI 使用问题联系起来。

机器学习期刊 TMLR(Transactions on Machine Learning Research)一次小规模试验显示,一些论文作者甚至无法解释署有自己名字的论文内容。该刊联合主编、卡内基梅隆大学(CMU)的 Nihar B. Shah 在 9 月 16 日发表于官方博客的文章中披露,在他 2026 年 8 月 14 日至 28 日的轮值期间,曾从原本准备直接拒稿的投稿中非正式抽取 10 篇,逐一邀请作者沟通,结果这 10 篇论文最终全部被拒。

TMLR主编抽问作者论文内容:10 篇待拒稿全部被拒 2

Shah 在博客中把这次尝试概括为「向作者询问他们自己的论文」。他提出的问题并不复杂,例如论文的问题设定是什么、某个符号代表什么、摘要中的某项结论在正文何处得到支撑。如果论文确实由作者本人完成,这类问题通常不需要特别准备就能回答。

同为 TMLR 主编的 Gautam Kamath 在 𝕏 上转发相关文章时称这是一次「英勇的实验」,并表示它验证了不少人早已存在的怀疑:部分投稿者其实并不清楚自己的论文写了什么。

10 篇抽查稿件的处理结果

据 Shah 描述,他通过审稿平台 OpenReview 向作者发送简短信息,称一位主编希望在送审前与作者沟通,以便更好理解论文,并请对方通过邮件提供可约时间。

消息发出后,10 篇论文很快出现分化:其中 1 篇作者直接撤稿,1 位作者回复称事务繁忙,无法参加通话;其余 8 篇约定了会谈时间,但其中 1 位作者在约定时间未出现。

最终,Shah 实际与 7 篇论文的作者进行了会谈。作者身份并不单一,包括本科生、硕士生、博士生、高校教师和独立研究者。这批投稿大多是单作者论文,但并非全部如此。

Shah 的提问大致分为两类:

TMLR主编抽问作者论文内容:10 篇待拒稿全部被拒 3

  • 关于问题设定、符号含义以及论文声称结果的基础问题;
  • 关于具体技术表达式、理论结果和实验设计选择的细节问题。

在这 7 场会谈中,只有 1 篇论文的作者回答了全部问题。另有 3 篇的作者能够讲清整体思路,但在被追问技术细节后出现明显困难。剩下 3 篇情况最差,作者连基础问题都答不上来,而且这 3 篇全部是单作者论文。

Shah 写道,其中 2 位作者看起来对自己论文的内容几乎没有实质理解;另有 1 位作者甚至无法指出摘要中声称的几项关键结果,在正文的什么位置被给出或得到支撑。

即便是唯一一篇在问答中全部答对的论文,也没有通过。Shah 在审读时发现,这篇论文的一项主要结论存在重大错误,作者随后也予以承认。TMLR 对这篇论文作出直接拒稿处理,但允许作者在修正错误或收窄结论后重新投稿。其余 9 篇则被直接拒稿,且不开放重投。

会后出现的两件事

Shah 在文中还记录了两段插曲。

第一件事发生在会后。有 2 篇论文的作者在会谈时无法回答基础问题,但会后向 Shah 补发了书面答复。Shah 将这两封邮件提交给 AI 文本检测工具 Pangram,结果两者都被判定为「100% AI」。

第二件事出现在另一场会谈中。一位作者试图说明自己使用的分析方法,却在解释过程中,完整描述了一套 p-hacking 流程,也就是不断调整分析方式,直到数据呈现「显著」结果的做法。

TMLR主编抽问作者论文内容:10 篇待拒稿全部被拒 4

Shah 同时强调,他本人并不反对 AI。为了在两周内读完 8 篇论文,他自己也使用了大语言模型辅助理解内容,甚至借此学习了一些此前并不熟悉的概念。他关注的重点不是作者是否使用 AI,而是作者能否对署名内容负责。

TMLR 为什么要做这类试验

TMLR 创刊于 2022 年,由 JMLR 背后的团队运营。该刊以一种较为明确的审稿标准受到关注:重点看论文结论是否得到证据支撑,而不是把新颖性或是否达到 SOTA 作为拒稿理由。TMLR 的审稿人、执行编辑(Action Editor)和主编全部是无偿志愿者,这使得它在今年的投稿增长中承受了更大压力。

根据 TMLR 6 月发布的公告,过去一年里其投稿量增长到原来的 3 倍,其中单作者投稿增长至 13 倍,编辑部甚至见到有人在 1 天内提交 5 篇论文。Shah 在最新文章中给出的另一组数字更能说明变化:2023 年,TMLR 的直接拒稿比例约为 6%;如今这一比例已升至约 53%,意味着超过一半的投稿无法进入外审。

面对这种情况,TMLR 在今年夏天连续推出多项措施。

按作者设置年度投稿配额

第一项措施是为作者设置年度投稿配额。与一些会议采用「每人最多 N 篇」的固定上限不同,TMLR 使用的是一种「调和式」配额规则:一篇论文对每位作者额度的消耗,会随着合著者人数增加而递减。

  • 如果作者只投单作者论文,每年最多提交 2 篇;
  • 如果所有投稿都是 9 人合著,每年最多提交 9 篇;
  • 活跃审稿人和执行编辑的额度翻倍。

这项规则从 7 月 1 日起执行。TMLR 在公告中解释,没有按作者人数简单平摊额度,是为了避免有人通过挂名增加作者数量,从而换取更多投稿额度。

TMLR主编抽问作者论文内容:10 篇待拒稿全部被拒 5

为每篇投稿附加 AI 审稿意见

第二项措施是引入 AI 审稿。TMLR 在 7 月宣布,每篇投稿除常规人工审稿外,还会附带一份 AI 生成的审稿意见。该意见只评估论文的「可靠性」,也就是结论是否得到准确、清晰、令人信服的证据支撑,不做主观判断,也不给出录用建议,最终决定仍由执行编辑作出。经过评测,TMLR 选用了 CSPaper 的 AI 审稿器。

把表达清晰写入录用标准

第三项措施是在 8 月 28 日修改原有的「受众兴趣」标准,明确要求论文需要向读者清楚传达其发现。公告直接指出,当前 AI 写作常见的问题是表达绕、术语堆砌、难以读懂;如果一篇论文几乎完全由 AI 生成、缺少人的参与,以现有 AI 系统的水平,很可能达不到这一标准。

Shah 在文章结尾表示,这次约谈让编辑部对当前的直接拒稿流程更有信心,投稿配额制度以及对清晰写作的强调也被证明有帮助。

类似问题并不只出现在 TMLR

TMLR 遇到的情况并非个例。文章提到,今年以来,AI 领域多个重要发表渠道都在处理与 AI 写作相关的问题。

6 月初,NeurIPS 官方博客披露,在 NeurIPS 2026 立场论文(Position Paper)赛道的 971 篇投稿中,有 273 篇,即 28.2%,被 Pangram 判定为 AI 分数 100%。该赛道当年已明确要求论文必须「实质上由人类撰写」,AI 仅可用于文字润色等外围修改。

NeurIPS 还指出,AI 写作的增长并不局限于单一赛道。在「评测与数据集」赛道,Pangram 分数不低于 90% 的论文数量从 2025 年到 2026 年增长了十倍以上。不过,NeurIPS 也承认检测结果对参数设置敏感:如果改用中等尺寸的检测窗口,AI 分数位于 90% 至 100% 区间的论文比例会从 42.7% 降至 12.7%。

TMLR主编抽问作者论文内容:10 篇待拒稿全部被拒 6

更早的 5 月中旬,arXiv 计算机科学板块负责人 Thomas G. Dietterich 在社交媒体上宣布,如果一篇投稿中存在作者未检查大模型输出的「确凿证据」,例如幻觉参考文献,或正文中残留聊天机器人对话语句,所有作者将被禁止在 arXiv 投稿 1 年;此后再次投稿,必须先被正规同行评审渠道接收,才能在 arXiv 上架。Dietterich 强调,只要在论文上署名,每位作者就要对全部内容负责,不论这些内容是如何生成的。

相关数据也出现在其他学科。根据哥伦比亚大学发表在《柳叶刀》的一项研究,在 PubMed Central 收录的生物医学论文中,至少包含 1 条虚构引用的论文比例,已从 2023 年的约万分之 4,上升到 2026 年初的约万分之 57。

从检查文本转向检查作者本人

Shah 在文中直言,这次试验耗费了他 20 到 25 个小时,却只处理了 8 篇论文。面对当前投稿规模,这种方式很难直接推广。

不过,他也提到,团队正在研究可规模化的方法。就在几天前,Shah 与 CMU 的 Justin Payan、Bálint Gyevnár、Atoosa Kasirzadeh 发布了一篇论文,提出名为 greCAPTCHA 的评估方法。这个名字一半来自美国研究生入学考试 GRE,另一半来自用来区分人与机器的 CAPTCHA 验证码。

greCAPTCHA 的思路不是继续检测文本是否由 AI 写成,而是直接考作者本人。作者提交论文和个人贡献说明后,系统自动生成题目,作者在监考条件下作答,最终形成一份评估报告,供期刊、招聘或招生方参考。研究团队将其要考察的能力称为「核验能力(capacity to verify)」,即作者是否具备对自己贡献内容进行批判性评估的知识和推理能力。

题目分为 4 类:

TMLR主编抽问作者论文内容:10 篇待拒稿全部被拒 7

  • 在多个版本中识别论文真实报告的数据,也就是预置错误识别;
  • 解释论文中未明确说明理由的设计选择;
  • 解释论文默认读者已知的背景概念;
  • 指出方法会在什么具体条件下失效。

研究团队招募了 31 名研究者进行测试,每人分别就自己的论文和一篇陌生论文作答。结果显示,该系统区分「自己的论文」与「陌生论文」的 AUC 为 0.90;去掉选择题后,AUC 升至 0.934。选择题本身几乎没有区分度,AUC 只有 0.595,原因是答案往往可以直接在 PDF 中搜索到。

另一个结果也被特别提到:受试者面对本领域陌生论文和跨领域陌生论文时,得分没有统计学显著差异,这说明这套测试考察的并不只是领域知识。

文章举了一个具体例子。一位受试者在测试前把陌生论文交给 AI,让其从头到尾讲解了一遍,但面对深入问题仍无法作答;最终,这位受试者在陌生论文上的得分为 1.3,而在自己论文上的得分为 51。

不过,这套系统仍不成熟。论文报告的最低误判率约为 20%,也就是每 5 位真实作者中,可能有 1 位被误判。受试者最集中的不满来自评分机制:有人认为系统没有说明答案需要写到多细,也有人认为评分标准过于僵硬。一位作者在面对否定自己答案的评分标准时直接表示,「那个东西明明是我自己设计的」。

还有一些参与者指出,合作论文中的部分内容原本由其他合作者完成,自己本来就无法回答;也有人担心,这类测试会在无形中考察英语表达和打字速度,对非英语母语者及残障研究者并不公平。

Shah 在文末给出的判断

Shah 在文章结尾列出几项结论,其中两点尤其关键。

TMLR主编抽问作者论文内容:10 篇待拒稿全部被拒 8

第一点是署名与贡献分配。在当前科研生态中,学术贡献主要通过论文署名来认定。如果作者无法解释和捍卫自己的论文,那么一篇发表作品作为「研究者贡献」信号的价值就会明显下降。

第二点是审稿体系本身的循环。许多期刊和会议会邀请投稿作者去评审别人的论文。如果作者连自己的论文都看不懂,他们是否有能力承担审稿工作,自然会受到质疑。在 AI 审稿与 AI 写作同时进入流程的情况下,这一循环一旦断裂,同行评审体系的根基也会受到冲击。

Shah 也承认,这次试验本身存在明显局限:样本只有 10 篇,且是「非正式」抽取,全部来自原本就准备直接拒稿的稿件。因此,它所揭示的是被认定为低质量投稿中存在什么问题,而不能代表 TMLR 全部投稿的整体情况。Shah 自己也写道,这项试验的目的之一,就是检验现有直接拒稿流程是否可靠。

但这次试验至少给出了一条清晰底线:论文可以在写作过程中借助 AI,署名作者仍必须能够说明其中写了什么。

本文来自微信公众号「机器之心」(ID:almosthuman2014),作者:机器之心。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
200

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。