一项由 unslop 发布的研究把 arXiv 论文中的 AI 文本使用问题推上台前。研究称,在过去一年里,计算机科学领域 65% 的新论文被其检测器标记,而同期数学论文的标记率仅为 0.7%。
研究团队共扫描了 12750 篇 arXiv 论文,时间跨度从 2023 年 1 月到 2026 年 7 月,覆盖 10 个学科,每个领域每月抽取约 25 篇全文。对照组选取的是 2021 年至 2022 年的论文,即 ChatGPT 发布前的样本。
结果显示,在 2021 年至 2022 年期间,论文被标记的比例稳定在 0.4%;ChatGPT 发布后,这条曲线在数月内明显上升。最近一个完整季度,标记率达到 32%;到 2026 年初,峰值接近 39%。

不同学科之间差异明显
按学科划分,计算机科学的标记率最高,达到 65%。研究提到,在 ChatGPT 问世前,这一领域的基准值只有 0.2%。
其后依次是:定量生物学 56.3%,电气工程 51.3%,经济与金融 47%,应用物理 34%,统计 31.3%,凝聚态物理 24%,高能物理 14%,天体物理 10.7%。数学位列最后,仅为 0.7%。
在同一套检测工具、同一个论文库下,不同学科之间出现了接近 100 倍的落差。研究同时指出,这些数字仍只是下限,因为如果 AI 文本隐藏得足够深,检测器未必能够识别出来。

数学低标记率未必代表使用更少
对于数学论文仅有 0.7% 的结果,unslop 在报告中给出的解释是,现阶段还不能据此下结论。可能的情况有两种:一是数学研究者确实较少使用 AI;二是检测器本身难以处理数学论文。
原因在于,标准数学论文中充满符号、公式、定理和证明,真正以英语散文写成的句子并不多。而这套检测器主要识别句子结构、用词习惯和段落组织方式。数学论文里少量保留的文字,往往又是“设 X 为某某”“由引理 3 可推导”这类高度格式化表达,与检测器训练时接触到的科学英语并不一致。
研究团队也列出了方法上的限制。首先,数学 0.7% 的结果当前无法区分究竟是 AI 使用率低,还是检测器“看不懂”数学论文。其次,对照组规模较小,每个学科只有 200 篇 ChatGPT 出现前的论文样本;按 0.4% 的误报率计算,2000 篇论文里总共只有 8 篇被标记,这一水平只能视为粗略估计。再者,检测器本身无法覆盖所有 AI 文本,因此现有统计更接近下限,而不是完整比例。

另一项斯坦福研究给出补充样本
关于谁在使用 AI 处理学术写作,原文还提到斯坦福一项持续两年的研究。
2024 年 3 月,斯坦福 Weixin Liang 团队把研究对象扩展到同行评审文本。该团队称,在 ICLR 2024 的审稿意见中,约 10.6% 的句子被大语言模型大幅修改过。
到 2025 年 8 月,同一团队把样本扩大到 112 万篇论文,相关研究发表于《自然·人类行为》。结果显示,截至 2024 年 9 月,计算机科学论文摘要中经大语言模型修改的比例最高达到 22.5%。研究还称,预印本发布更频繁、处于竞争更激烈领域的研究者,使用这类工具的程度更高。

原文据此描述,在竞争更激烈的学科里,AI 写作正被当作提速工具使用。
检测器识别的是“机器味”
unslop 在报告中同时提醒,检测器无法区分“AI 做过语法润色”和“整篇文本由机器代写”。它识别的只是文字中的机器风格特征。
也就是说,65% 更准确的含义是“65% 的论文呈现出 AI 风格特征”,而不是“65% 的论文完全由 AI 写成”。

原文还提到,有研究者把自己多年前发表的旧论文放入检测工具后,结果显示其中 27% 到 74% 的内容被标记为可疑,尽管这些论文写作时 ChatGPT 尚未出现。
一个可能的原因是,当下学术写作越来越强调标准化措辞、规整结构以及围绕大型语言模型、基准测试等主题展开表达,这些特征更容易与检测器所定义的机器文本模式重合。与此同时,大语言模型本身又大量吸收学术论文作为训练材料,这也使得“像 AI”与“像学术写作”之间的边界变得更难划分。
“AI 味”正在变成新的判断标准
原文认为,围绕文本是否带有“AI 味”的判断,正在从一种模糊直觉变成可量化的检测思路。unslop 的做法,是把这种对文字风格的怀疑转成一套可以批量输出数字的工具。

但到目前为止,这种“AI 味”究竟由哪些成分构成,仍没有被精确测量。原文援引这一点指出,在学术写作中,文本本身的可信度判断正在发生变化:过去,愿意花时间组织和写下文字,本身就是一种背书;现在,即便措辞完整、结构工整,也可能先被怀疑是否借助了 AI。
本文来自微信公众号“新智元”,作者为 ASI 启示录,MarsBit 对内容进行了转载。

