Anthropic 15亿美元和解案引发AI数据授权边界再审视

Anthropic 15亿美元和解案引发AI数据授权边界再审视

N
News Editor
2026-07-29 23:58:00
Anthropic与部分作者、出版商等权利人达成的15亿美元集体诉讼和解,焦点不在于给AI训练定价,而在于法院将数据取得、资料库建设、模型训练和后续使用拆开审查。文章指出,调用第三方模型、使用RAG或获取公开和付费资料,都不意味着企业当然拥有复制、切片、训练和长期保存权限。对中国AI公司而言,当前更现实的治理路径是先控制新增高风险数据,再清理历史存量,并建立可追溯的数据台账、授权边界和退出机制。
AnthropicAI版权数据授权合理使用RAG知识库政策监管数据合规

本文作者赵暄提出,AI公司的版权风险,很多时候在模型输出内容之前就已经发生。真正容易被忽视的,不是模型最后说了什么,而是资料从哪里取得、谁有权交付、企业拿到的是阅读权限还是复制、切片、训练和长期保存权限,以及这些资料最终进入了哪个知识库或模型版本。

Anthropic 15亿美元和解案引发AI数据授权边界再审视 2

2026年7月20日,美国联邦法院最终批准了 Anthropic 与部分作者、出版商等权利人达成的 15 亿美元集体诉讼和解。文中强调,这 15 亿美元并不是法院判决的侵权赔偿,也不是 AI 公司使用书籍训练模型的统一许可价格。案件更值得关注的地方,在于法院把数据取得、资料库建设、模型训练和后续使用拆开审查,而不是把整条数据使用链作为一个整体笼统判断。

法院为何支持训练,却没有让前端取数自动合法

在 Anthropic 案中,法院认为,在该案具体事实上,将书籍用于模型训练,是为了分析语言结构和统计关系,并不是向用户提供原书的替代品,因此相关训练具有转换性,可以构成合理使用。

法院还支持了一种较窄的数字化方式:购买纸质书后,将其扫描为数字件并销毁对应原件。在没有增加副本数量、没有对外传播的情况下,这类格式转换也可能获得支持。

但另一部分行为并未被一并纳入合理使用。文章指出,从盗版网站下载大量电子书,并放入永久、一般用途的资料库,法院并没有因为这些资料未来“可能用于训练”,就把前端的盗版下载和长期保存都视为合理使用。

这意味着,训练目的具有转换性,不会自动解决数据取得方式本身的问题。文章同时提醒,这也不等于法院已通过最终判决认定 Anthropic 承担盗版复制责任。相关责任和赔偿原本仍需继续审理,案件后来通过和解结束。Anthropic 支付 15 亿美元,更准确地说,是对集体诉讼、法定赔偿、庭审和上诉不确定性的集中定价,而不是向法院支付一笔所谓“AI训练费”。

作者用一个类比解释这一区别:厨师研究一本菜谱的结构和写法,与从盗版网站下载整套菜谱并永久存入自己的资料库,并不是同一件事。前者讨论的是怎样学习和使用作品,后者首先要回答资料从哪里来、为何可以复制,以及为何可以长期保存。

数据取得、导入复制、清洗切片、模型训练或知识库入库、检索输出和长期留存,属于同一条链上的不同环节。不能因为其中一步具有合法依据,就推定整条链条都没有问题。

调用第三方模型,企业自身的数据责任并不会消失

文章提到,很多 AI 创业公司并不训练基础模型,而是通过 API 调用第三方模型,再自行搭建行业知识库、RAG 系统、智能体或垂直应用。这样的模式,确实减少了企业直接训练基础模型的一部分风险,但并没有把企业处理自身数据的责任转移给上游模型厂商。

企业首先要区分“数据”和“作品”。单纯事实、数值、公式和通用信息,未必构成著作权法意义上的作品;但同一批资料中,可能同时包含文章、图片、报告、个人信息、商业秘密、平台数据权益和合同限制。

所以,判断一批资料能否进入 AI 系统,不能只问“有没有版权”,还要继续判断资料具体包含什么、企业通过什么方式取得,以及当前用途是否在授权范围内。

RAG 也不是版权真空地带。一份行业报告进入 RAG 系统,通常要经过下载、格式转换、清洗、切片、向量化和知识库存储。即使模型最终只输出几句总结,前面的技术处理中仍可能发生复制,也可能超出数据库协议或者客户授权范围。反过来,知识库中包含受保护作品,也不意味着每一次检索输出都必然侵权,仍需结合具体复制方式、输出内容和授权范围分别判断。

文章据此指出,“我们只是做 RAG”不能替代数据审查,调用第三方模型也不能替企业解决自行建设知识库、处理客户资料和持续优化产品时产生的责任。

中国AI公司最容易误解的三件事

不构成作品,不代表可以随意使用

即使某些内容不受著作权保护,仍可能涉及个人信息、商业秘密、平台规则、数据库权益和合同义务。企业不能因为判断某批资料“没有版权”,就直接认定不存在其他限制。

公开可见或付费购买,不等于可直接拿来训练

公开可访问,只能说明用户能够在特定条件下接触内容,并不当然意味着可以批量下载、复制、切片、微调或长期存入商业知识库。文章把购买数据库账号比作购买一张阅览室门票:通常允许查询和阅读,却未必允许把馆藏整体搬进企业知识库。

文中援引《著作权法》第二十九条指出,许可合同中未明确许可的权利,未经著作权人同意,另一方不得行使。因此,“来源合法”与“取得当前用途授权”是两件不同的事。能够阅读、能够下载、能够内部使用、能够建立知识库、能够用于模型训练,也不是天然相同的一组权利。

不适用《生成式人工智能服务管理暂行办法》,不等于没有其他义务

一些内部知识库、企业自用工具或特定 B 端服务,可能不直接适用该办法,但相关业务仍会受到著作权、个人信息、数据安全、反不正当竞争以及客户合同和平台条款约束。

Anthropic 15亿美元和解案引发AI数据授权边界再审视 3

“合理使用”不能被当成通用豁免

文章指出,Anthropic 案适用的是美国版权法,不能直接照搬到中国。《著作权法》第二十四条列明了合理使用的具体情形,我国目前也尚未设置一项普遍适用于商业性 AI 训练的文本与数据挖掘例外。

这并不意味着所有 AI 训练都必然侵权,但企业不能仅凭“训练具有创新性”“模型没有输出原文”或“使用不会替代原作品”,就直接得出合理使用结论。仍需具体判断技术处理中是否形成了作品复制,复制发生在哪个环节,模型、知识库或最终输出是否保留并呈现了可识别的作品表达,以及相关行为能否落入现行法律规定的具体情形。

文章还提到,最高人民法院已经提出,要稳妥审理大模型训练语料使用和人工智能生成内容侵权等新类型案件。这意味着国内裁判标准仍在持续形成,企业不宜把核心产品和数据资产完全建立在尚不确定的合理使用抗辩之上。

历史数据整改,先控增量,再清存量

对于已经运营一段时间的创业公司,最现实的问题往往不是以后怎么做,而是过去已经进入系统的数据怎么办。很多公司不可能立即停掉产品、清空知识库并重新训练,因此治理方案需要同时考虑法律风险、技术成本和业务连续性。

文章给出的更现实顺序是:先停止新增高风险数据,再盘点历史存量;先保存来源、合同和使用记录,再决定隔离、替换还是删除。

企业可以先建立一份数据清单,记录资料来源、取得时间、提供主体、合同和平台条款、使用目的、存储位置,以及进入了哪个知识库、微调任务或模型版本。

需要优先处理的高风险数据,包括来自盗版网站或来源无法说明的文件、供应商无法提供权利链证明的数据、明显超出客户授权范围使用的资料,以及通过规避付费墙、反爬措施或访问控制取得的内容。文章指出,这类行为除可能涉及著作权和合同风险外,还可能在符合相应条件时产生不正当竞争责任。

整改也并非只有“继续使用”和“立即删除”两个选项。企业可以先停止新增、限制访问,将可疑数据与生产环境隔离,再根据实际情况补充授权、使用合规数据替换,或者重新建设知识库和重新微调。确有必要删除时,还要确保能够定位相关文件、切片数据、向量记录和备份副本,并保留完整的内部审批和整改记录。

这些措施不能让过去的行为自动变得合法,但可以阻止风险继续扩大,也能在后续融资、客户审查或争议处理中证明,公司具备识别问题、限制影响和完成修复的能力。

资源有限的创业公司,可以先从数据台账做起

文章认为,数据治理不必一开始就建设一套庞大的合规系统。对资源有限的创业公司来说,最实用的起点,是先建立一张由业务、技术和法务共同维护的数据台账。

每批数据至少应记录:

  • 由谁提供;
  • 从哪里取得;
  • 依据什么合同或者平台条款;
  • 允许用于哪些场景;
  • 禁止用于哪些场景;
  • 进入了哪个产品、知识库或者模型版本;
  • 保存多长时间;
  • 发生投诉、授权到期或者合作终止后如何退出。

合同也要写进真实的技术场景。与其笼统约定“数据来源合法”或“供应商保证不侵权”,不如明确资料是否可以下载、复制、清洗、格式转换、切片、建立知识库、用于检索、微调、评测或模型优化,并写清适用产品、使用主体、期限和第三方权利主张的处理方式。

企业还需要知道,一批资料进入了哪个知识库或模型版本,能否单独隔离、替换和删除。无法定位的数据,一旦发生投诉就很难止损;无法拆分和退出的数据,也会显著增加融资、并购和大客户审查的不确定性。

法院拆开审查数据链条,给中国AI公司留下的提醒

文章最后指出,Anthropic 案最值得中国 AI 公司注意的,不是“训练构成合理使用”这一句孤立结论,也不是 15 亿美元这个数字,而是法院将不同的数据使用环节拆开审查:资料从哪里来、为什么可以复制、以什么目的进入资料库,以及为什么要被长期保存。

合理使用不是数据来源违法的免责标签,来源合法也不是可以任意训练、检索和长期保存的同义词。调用第三方模型可以降低一部分底层训练风险,却不能替企业解决自己建设知识库、处理客户资料和优化产品时产生的责任。

对创业公司而言,现在开始治理并不晚。文章给出的判断是,先管住今天新增的数据,再逐步处理过去留下的问题;越早建立来源记录、授权边界和退出机制,后续整改成本越低,也越容易把数据从潜在风险,转化为经得起融资和客户审查的公司资产。

本文最初由 Bit.Fan 发布。 欲了解更多加密货币新闻与市场洞察,请访问 www.bit.fan.
300

免责声明:

本平台展示的市场信息、项目资料与第三方内容仅用于行业信息分享,不构成任何形式的投资建议或收益承诺。

加密资产交易具有较高风险,用户应充分评估自身风险承受能力并独立作出决策,相关盈亏及法律责任由用户自行承担。