日本《现代ビジネス》作者小林雅一近日测试 AI 文章检测工具 Pangram,分别输入一篇由 Google Gemini 生成的日文文章,以及一篇自己在生成式 AI 普及前写成的文章。检测结果显示,前者被判定为「100% AI 生成」,后者则被判定为「100% 人类撰写」。
这次测试的背景,是 Substack 早前引入 Pangram 后,外界开始讨论付费内容是否存在大量 AI 代笔的问题。ABMedia 提到,日本媒体这次将测试对象换成了日文文本。
Pangram 对日文进行了两次测试
第一项测试中,小林雅一要求免费版 Google Gemini 生成一篇日文文章,再把文本输入 Pangram。结果显示,这篇文章被判定为「100% AI 生成」。
第二项测试中,他改为输入一篇可以确认由真人完成的文章,也就是他在 2015 年出版的《AIの冲撃 人工知能は人类の敌か》后记原稿。由于 ChatGPT 在 2022 年 11 月才公开推出,这份 2015 年完成的原稿至少可以排除使用 ChatGPT 等当代大型语言模型生成的可能性。Pangram 对这篇文章的判定结果是「100% 人类撰写」。
ABMedia 据此写道,在这次规模很小的日文测试中,Pangram 同时识别出了 Gemini 生成内容,以及生成式 AI 浪潮前的人类原创文章。
两次样本不足以证明日文准确率
不过,报道也强调,这次测试只有两个样本,远不足以证明 Pangram 对日文也达到其官方宣称的 99.99% 准确率。
由于 Pangram 免费试用只能进行两次检测,小林雅一没有继续购买付费版做更多测试。他也明确提醒,不能仅凭两个样本,就对 Pangram 的日文识别能力做出决定性评价。
报道提到,Pangram 目前主要以英文服务对外提供,但从这次测试结果来看,它至少已经具备处理和识别日文 AI 文章的能力。
Pangram 如何识别 AI,公开信息仍然有限
Pangram 早前因被 Substack 引入而受到关注。相较过去一些 AI Detector 容易把真人文章误判为 AI,Pangram 宣称其识别准确率可达 99.99%,并特别降低 false positive(误报、伪阳性)的发生概率。
至于具体如何完成识别,Pangram 开发团队给出的说法较为笼统,只表示系统会结合「AI 生成文章所发出的大量微弱讯号」进行判断。
小林雅一认为,这个回答几乎没有透露实际技术细节,真正的识别方法很可能涉及公司的商业机密。报道也指出,AI Detector 长期面临的一个问题,就是用户很难知道模型究竟依据哪些特征,认定一篇文章由 AI 生成。即便准确率提高,判定方法缺乏可解释性的问题仍然存在。
争议不只在于是不是 AI 写的
ABMedia 在文中提到,如果只是让 Gemini 直接生成整篇文章,识别 AI 或许相对容易;但现实中的内容生产流程往往更复杂。作者可能自己完成采访与研究,再让 Claude 整理资料;也可能先建立文章论点,再让 ChatGPT 改写句子;或者先由 AI 生成初稿,再由真人大幅修改。
在这种情况下,问题已经不只是「这是不是 AI 写的」,而是「这篇文章里究竟有多少工作由 AI 完成」。报道指出,Pangram 的特别之处在于,它不只提供 AI 或 Human 的二元判断,也宣称能够估算同一份文档中 AI 与真人文字混合的比例。
Substack 引入后,付费内容更受关注
《现代ビジネス》还提到,Substack 引入 Pangram 后,一些过去受到欢迎的文章被判定为大量依赖 AI。尤其当作者向读者收取订阅费时,更容易引发「付费购买真人作品,却拿到 AI 生成内容」的不满。
不过,原文没有提供完整统计、具体创作者名单或事件规模,因此目前还不能据此判断,Substack 上究竟有多少付费内容由 AI 大量生成。
报道最后指出,在 AI 已经成为写作者日常工具之后,「使用 AI」本身很难再构成一条清晰边界。用 AI 找错字、整理采访逐字稿、协助研究,和让 Gemini 直接生成整篇文章,虽然都属于使用 AI,但对读者来说显然并不是同一件事。

