AI 公司对训练语料的争夺,正在把旧书市场推向一门隐秘生意。

据 Fortune 近期报道,今年以来,荷兰、德国、瑞士、西班牙等国的古书商陆续收到异常的大额订单。买家一次采购几千本学术书,品类分散,看起来并不像正常采购。
荷兰哈勒姆市古书商 de Vries 就收到过一封来自新加坡公司 2077AI 的邮件。对方称正在做多语种图书采集项目,附件里的 Excel 表格列出了 3000 多本不同题材书籍的采购清单,每本都标注了出版编号,并要求报价后寄往中国。de Vries 当时觉得这像一封离谱的诈骗邮件,没有理会。几周后,荷兰记者上门采访,他才意识到,这类订单背后连着的是 AI 行业对训练数据的需求。
至于这些书最终被谁用于训练什么模型,Fortune 报道称,买书公司拒绝回应。
类似情况不止一例。另一家加拿大公司 Zoom Books 被指每天凌晨 3 点到 5 点在欧洲书商网店批量下单,采购目标同样是彼此没有关联的冷门学术书。有书商对媒体表示,运费甚至比书本身还贵,但买家似乎并不在意。
这些书并不是买来阅读。报道提到,AI 公司需要 2022 年以前出版的纸质书,因为这类文本没有被 AI 生成内容污染,被视为更干净的训练语料。书到手后,行业常见做法是“破坏性扫描”:切掉书脊,高速扫描全部页面,再销毁纸质原件。
Anthropic 诉讼揭开训练数据来源
这条链条最完整的公开记录,来自美国的一场版权诉讼。
2024 年 8 月,美国作家 Andrea Bartz 等三人起诉 Claude 母公司 Anthropic,指控该公司未经授权使用其作品训练 AI 模型。案件推进至 2026 年初时,法院解封了超过 4000 页 Anthropic 内部文件,《华盛顿邮报》对这批文件进行了详细报道。

根据这些文件,2021 年到 2022 年间,Anthropic 通过 BitTorrent 从 LibGen 和 Pirate Library Mirror 两个盗版电子书网站下载了超过 700 万本书,并存入内部服务器。文件中的原话显示,管理层认为逐一与图书出版商谈授权“太过繁琐”。
最初提起诉讼的 3 位作家只是开始。案件随后扩大为集体诉讼,涉及约 50 万部作品。到 2025 年 6 月,法官 Alsup 作出一项分拆裁定:将书用于训练 AI 本身属于合理使用,但从盗版网站下载并永久存储并不成立。也就是说,训练行为本身未被认定为违法,但获取和保存材料的方式被区分对待。
按照案件信息,Anthropic 面临的赔偿上限为每本书 15 万美元。若按约 50 万部作品计算,理论赔偿上限极高。最终,双方以 15 亿美元达成和解,平均每本书约为 3000 美元。法院于今年 7 月 20 日最终批准该和解案,这也成为美国版权史上金额最大的集体诉讼和解。
“巴拿马项目”:买书、切书、扫描、销毁
事情并未止于从盗版网站下载电子书。
据《华盛顿邮报》2026 年 1 月报道,法院在案件审理期间解封的 4000 多页 Anthropic 内部文件中,还记录了另一套计划。Anthropic 在 2024 年初启动了一项内部代号为“巴拿马项目”的行动,专门聘请 Google Books 时期的前负责人,从二手书平台批量采购纸质书,计划在 6 个月内处理 50 万到 200 万本。
操作流程很直接:买来,切掉书脊,扫描,再销毁原件。内部文件把这项工作定义为“破坏性扫描全世界的书”,并特别注明“我们不希望外界知道我们在做这件事”。
与直接从盗版网站下载相比,这次的差别在于图书是付费购买的。法官随后认定,这种做法合法:买下一本书后,销毁纸质版本,只保留数字版本,始终只存在一份拷贝,不构成额外复制行为,因此符合版权法。
从执行层面看,这一判例为整个行业提供了一条规避更大法律风险的路径:如果从盗版网站获取图书会引发版权争议,那么改为购买纸质书,再扫描并销毁原件,风险会低得多。

配套服务开始出现
这条路径已不再只属于 Anthropic 一家公司。
据 Decrypt 报道,美国联邦法官在涉及 OpenAI 和 Meta 的单独版权案件中,也作出了类似的合理使用裁定。按文中说法,“焚书训练 AI”正在从个案变成被判例逐步承认的行业做法。
需求出现后,供给也很快跟上。404 Media 报道称,拥有超过 1.1 亿本书数据的图书数据库公司 ISBNdb,曾在官网上线一个面向 AI 公司的营销页面,标题是“为你的 AI 大模型提供纸质书语料采购服务”。页面提供从单笔 1000 本到 100 万本的批量采购,并承诺通过严格保密协议保护买家身份。
在报道发布后,ISBNdb 迅速撤下了该页面,并在官网声明称相关服务“从未实际上线”,该页面只是用于“测试市场兴趣”。
不过,404 Media 在同一篇报道中援引匿名书商说法称,从今年 4 月开始,这名书商的周销量已从约 20 本飙升至几百本。买家按 ISBN 编号精准下单,购买对象全部是彼此无关联的冷门书籍,唯一共性是都在 2022 年前出版。
这也解释了为什么买家执着于 2022 年前的纸质书。按照 ISBNdb 此前被撤下营销页面中的相关表述,这类图书不含 AI 生成内容,因此被视为更干净的训练语料。
沿着这条链条往下看,上下游已相当清晰:
- 数据库服务商提供选书清单和匿名采购通道;
- 全球各地二手书商负责供货;
- 扫描服务商负责切书脊和高速数字化;
- 销毁公司处理纸质残骸;
- 最终,数字化文本进入 AI 公司的训练流程。
反对声音与替代方案
这套做法也引来不少反对。

7 月 27 日,马斯克在 X 平台发文,对这种被形容为“现代焚书”的工业流程表达反对和讽刺。他写道:“我己要求 SpaceXAI 团队,将处理过的任何珍稀书籍都保存在一个图书馆里,并用‘笨办法’(非破坏性方式)去扫描它们,而不是直接切断书脊后扫描。”
如果没有法院文件公开,外界很可能不会知道买家的身份,也不会看到这条跨越采购、扫描和销毁环节的产业链。
从技术上说,销毁原书并不是唯一方案。Google 当年建设 Google Books 时,扫描了超过 4000 万本书,使用的是专利非破坏性扫描技术,图书扫描后归还图书馆,没有销毁原件。今年 7 月,马斯克也在社交媒体上公开要求旗下 xAI 团队对珍稀书籍采用无损扫描,并将原书保存进图书馆。
这种方式并非做不到,只是更慢,也更贵。按文中援引的 ISBNdb 博客一篇现已删除文章的分析,破坏性扫描之所以成为行业首选,核心原因只有一个:成本更低,速度更快。非破坏性扫描需要专用设备和更多人工,每本书的处理时间是破坏性扫描的数倍。
在激烈竞争下,谁先拿到更多高质量语料,谁就可能先占到优势。法庭判决也没有堵死这条路:买书、扫描、销毁,在现有判例下具备操作空间。
但文中也指出,合法和合理并不总是一回事。一本纸质书原本可以被转卖、借阅和传承,也可能在旧书店角落里躺上 20 年后,被陌生人再次翻开。扫描后销毁,它就变成公司服务器中的私有训练数据,不再作为可流通、可接触的公共知识存在。
作者在文末写道,自己每天都在使用 AI 写稿、查资料、整理思路,也承认这些产品确实改变了许多人的工作方式。但如果回头追问模型背后的训练数据如何取得,就会发现一些难以细看的环节。单独看,每个环节都有商业逻辑和法律依据;放在一起看,又让人难免产生疑问。

