15亿美元:用盗版语料训练AI的清算单

当地时间7月20日,美国旧金山联邦法院最终批准Anthropic与作者群体达成的15亿美元版权和解。

这是目前已知美国版权案件中金额最高的一笔和解。按照和解方案,相关款项将用于补偿约50万部作品的权利人,平均每部作品对应约3000美元。超过91%的相关作者和出版商已经提出补偿请求,法院同时批准支付超过1.01亿美元的律师费。

15亿美元足够制造一个极具传播力的结论,AI公司因为使用版权作品训练模型,付出了美国版权史上最昂贵的代价。

但这个结论可能并不准确。

Anthropic付出的15亿美元,与其说是“AI训练费”,不如说是对盗版语料取得、复制和长期保存行为的一次高额清算。

一、法院没有否定AI训练的合理使用

本案始于2024年。包括Andrea Bartz、Charles Graeber和Kirk Wallace Johnson在内的多位作者起诉Anthropic,指控其从Books3、LibGen、PiLiMi等“影子图书馆”下载数百万本图书,并将其中部分作品用于训练Claude大模型。

案件审理过程中,法院实际上作出了两项方向并不完全相同的判断。

一方面,法院认为,Anthropic使用图书训练大语言模型,具有较强的转换性。在本案具体事实和证据条件下,这种训练行为可以构成美国版权法上的合理使用。

换言之,模型通过阅读大量作品学习语言规律,并不当然等于对作品表达的复制和替代。至少在这份裁判中,法院没有接受“未经许可使用版权作品训练模型必然构成侵权”的主张。

另一方面,法院认为,Anthropic为了建立一个可以反复使用的“中央图书馆”,从盗版网站下载并保存超过700万本图书,这些复制行为不能仅仅因为将来可能用于AI训练,就自动获得合理使用的保护。

训练目的与语料来源,是两个不同的问题。

AI训练可能具有转换性,并不意味着企业可以通过任何方式取得训练材料;最终用途可能合法,也不能倒推前端的盗版下载和复制行为合法。

这正是本案最重要的法律分界线。

二、15亿美元解决的核心,是语料从哪里来

如果把Anthropic的行为拆开看,整个案件至少包含四个不同环节:

从盗版网站批量下载图书;

将图书复制并存入企业“中央图书馆”;

从图书库中调取部分作品训练模型;

模型训练完成后生成新的内容。

社会讨论往往把这四个环节统称为“AI训练”,但版权法不会因为这些行为服务于同一项技术活动,就将它们视为一个不可分割的整体。

取得语料涉及复制是否合法;

保存语料涉及复制的目的、期限和必要性;

训练模型涉及转换性使用及其对原作品市场的影响;

生成内容则可能涉及表达相似、实质性替代以及输出端侵权。

Anthropic在训练环节获得了有利判断,却在语料取得和保存环节面临巨大风险。双方最终达成15亿美元和解,正是因为后一个环节可能带来的法定赔偿责任极为惊人。

因此,这笔和解不能被简单概括为“美国开始向AI训练收费”,更不能理解为所有利用版权作品训练模型的企业都需要按照每部作品3000美元支付许可费。

它真正发出的警告是,合理使用可以保护特定的使用方式,却不能替企业洗白盗版语料的来源。

三、和解金额很高,但没有形成统一判例

15亿美元的金额具有强烈的标志性,但和解并不等同于法院作出15亿美元的侵权赔偿判决。

Anthropic通过和解避免了案件继续进入审判,也没有因此承认所有相关AI训练行为均构成版权侵权。对于和解范围内的既有争议,案件将进入补偿分配和收尾阶段;但部分选择退出和解的作者、出版商,仍可能针对Anthropic另行提起诉讼。

更重要的是,此前关于训练行为构成合理使用的判断,只是在本案特定事实基础上作出的地区法院裁判,并没有为美国所有生成式AI案件建立普遍适用的规则。

不同案件中的语料来源、模型功能、输出方式、市场替代效果和权利类型都可能不同。图书训练案件的结论,也未必能够直接适用于音乐、图片、新闻报道、计算机程序或者影视作品。

所以,这次最终批准同时留下了两个看似矛盾、实则可以并存的信号:

第一,AI训练仍然存在被认定为合理使用的空间;

第二,以盗版方式建立训练语料库,可能产生足以威胁企业生存的赔偿风险。

这不是AI版权争议的终局,而是版权风险开始从笼统的“能不能训练”,转向对数据全生命周期的逐层审查。

四、AI企业需要建立的,不只是一份版权许可清单

过去,许多企业评估训练数据风险时,首先追问的是:使用这些作品训练模型是否构成合理使用?

Anthropic案表明,这个问题问得太晚了。

在判断训练用途之前,企业至少还要回答,

这些数据从哪里获得?下载平台是否具有合法授权?获取过程中是否绕过技术措施?企业保存了多少份副本?原始数据在训练完成后是否继续留存?谁曾经接触、复制和调用这些数据?如果发生争议,企业能否证明每一批数据的来源?

因此,AI版权合规不能只有一份“禁止使用数据清单”,而需要形成贯穿数据全生命周期的证据链:来源可追溯、权利可核验、用途可区分、存储可控制、删除可证明。

对于采购第三方数据集的企业,仅由供应商承诺“数据可以用于AI训练”远远不够。合同还应明确数据来源、授权范围、转授权能力、侵权赔偿、审计权以及问题数据的删除义务。

对于使用开源语料库的企业,“公开可下载”也不等于“版权已清洁”。开源的是数据集访问方式,还是数据集所包含作品的版权,是两个完全不同的问题。

对于已经积累大量历史训练数据的企业,更现实的工作是尽快完成一次语料资产盘点。将合法购买、获得许可、公开授权、网络抓取和来源不明的数据分别标识,并对高风险数据采取隔离、替换或者删除措施。

知产力判断

Anthropic案最容易被记住的是15亿美元。

但真正可能改变AI行业合规方式的,不是这个数字,而是法院在训练行为与语料取得之间划出的一条边界。

AI模型可以学习什么,和AI企业可以怎样获得学习材料,并不是同一个问题。

技术的转换性,可能为模型训练提供合理使用的空间;但再先进的技术目的,也不能当然成为盗版下载和无限期保存版权作品的通行证。

15亿美元不是对所有AI训练行为开出的一张统一价目表。它更像是一张迟到的账单,当训练语料的来源无法解释时,企业最终需要支付的,可能不是许可费,而是对整个数据取得方式的清算。

本文来自微信公众号 “知产力”(ID:zhichanli),作者:Shawn/MCP,36氪经授权发布。

发布时间:2026-07-21 19:18