纽约时报起诉 OpenAI 与微软的著作权诉讼,近期公开的解密文件披露了微软内部对大模型训练数据获取方式的尖锐评价。根据诉讼材料,微软应用科学总监 Brent Hecht 曾在内部备忘录中把相关做法称为「规模空前、令人震惊的窃盗」,甚至称其为「人类史上最大的劳动窃盗」。
这起案件已并入纽约南区联邦法院的多区诉讼。除纽约时报外,原告还包括 New York Daily News、Center for Investigative Reporting、Ziff Davis 以及多名图书作者,目前双方的简易判决动议正在审理中。
内部文件提到「末日循环」与流量下滑
诉讼文件显示,Hecht 在 2024 年 1 月的微软内部简报中,把 Copilot 带来的流量下滑称为「末日循环」。他写道,这种效应会「同时伤害我们模型与整个网络的表现」。
微软内部数据称,与传统 Bing 搜索相比,Copilot 这类「答案引擎」让纽约时报域名点击量最多下跌 93%。法律文件还列出,纽约时报与 Daily News 域名的跌幅在 83% 至 93% 之间,Ziff Davis 域名则下跌 51% 至 94%。
微软另一份内部文件写道:「一个终端产品威胁到其关键供应商的经济基础,这极不寻常,但这正是我们在 LLM 业务的『内容供应链』上所造成的处境。」文件还承认,生成式 AI 存在「真实风险」,可能「严重冲击那些产出基础模型训练资料之人的就业」。
高管证词与内部沟通内容被一并披露
根据起诉文件,微软 CEO Satya Nadella 在今年的证词中表示:「任何付费墙后的内容,任何想用来做 grounding 或训练的人都应该取得授权。」他还在宣誓下表示,如果得知 OpenAI 抓取并训练了付费墙后的信息,会「动用(微软的权利)要求 OpenAI 重新训练模型」。
诉讼材料还显示,Nadella 在宣誓下同意,人们与聊天机器人对话,「已经取代了……直接在 AI 平台上给你信息,而不需要去原始来源」;他同时承认,下载盗版内容「绝对」违法。
不过,起诉文件引述称,OpenAI 研究员 Nick Ryder 曾向总裁 Greg Brockman 提到一个「绕过纽约时报付费墙的 hack」,而 Brockman 的回复只有一句:「ah nice」。
OpenAI ChatGPT 负责人 Nick Turley 的内部通信则称,出版商面临来自聊天机器人的「生存威胁」,这类产品在很大程度上具有替代性,而且「会随着变好而越来越具替代性」。Brockman 也曾形容模型「非常擅长新闻」。
前 OpenAI 政策总监、现 Anthropic 联合创始人 Jack Clark 也在文件中写道,公司的工作「将越来越导致我们打造出取代那些定义社会『文化』之人劳动的系统」,并称「我们的工作会让人失业」。
起诉文件列出训练数据规模与项目代号
在训练数据规模方面,起诉文件称,OpenAI 的中期训练数据集包含超过 91,692 份来自纽约时报、Daily News 和 CIR 作品的副本。另一套源自 Common Crawl 的数据集,则包含超过 200 万份 nytimes.com 文件。
文件称,这些内容的获取渠道包括直接从 Bing 索引抓取。诉讼材料还指出,OpenAI 曾将整个 GPT-3 训练数据集交给微软,以供微软评估如何把 OpenAI 模型整合进自身商业产品。
文件同时称,微软也通过代号为「Project Taxi」和「Project Mango」的项目向 OpenAI 回传训练数据,其中 Project Mango 数据集至少包含 160,903 件新闻出版商的独特作品。
根据诉讼材料,微软在 2022 年曾因法律疑虑,以「Project Clear」为名删除两个训练数据集。文件还称,OpenAI 在构建 WebText 等数据集时,对抓取的新闻内容存在不成比例的依赖,并刻意从训练数据中移除版权声明,原因是研究人员「不希望模型输出」版权声明给用户。
微软回应,OpenAI未置评
对于上述文件内容,微软回应称,这些内部评论「反映的是一名员工的个人观点,不是法律分析,也不代表公司立场」。OpenAI 未回应置评请求。

