大数跨境

专业漫谈 | 15亿美元揭开AI训练数据的版权风险

专业漫谈 | 15亿美元揭开AI训练数据的版权风险 Asone Global 合创出海研究
2026-07-23
5
导读:2026年7月20日,美国加利福尼亚北区联邦地区法院最终批准人工智能公司Anthropic与作家、出版商群体达成的15亿美元版权和解。此次和解涉及482,460部图书。按照和解基金规模测算,每部作品预

2026年7月20日,美国加利福尼亚北区联邦地区法院最终批准人工智能公司Anthropic与作家、出版商群体达成的15亿美元版权和解。

此次和解涉及482,460部图书。按照和解基金规模测算,每部作品预计可分配约3000美元,具体金额还需扣除律师费、管理费用等成本。同一作品存在多名版权人时,相关款项还要按照出版合同或适用比例进行分配。

事件始末

Anthropic是模型Claude的开发者。为了训练Claude,公司需要收集大量图书和其他文本资料,并将其转化为可供计算机识别和处理的数字文件。

为获取Claude训练所需的文本资料,Anthropic一方面购买纸质图书,将书籍拆解、扫描为数字文件,并销毁对应的纸质原件;另一方面,公司也曾从LibGen、PiLiMi等影子书库下载大量完整电子书。法院公开的案件材料显示,这些盗版电子书超过700万本,被集中存放在Anthropic内部的“中央书库”中。公司会根据具体模型和研究项目的需要,从中选取部分作品组成训练数据集,但书库本身并不只服务于某一次训练:一些图书始终没有进入具体项目,部分已经使用过的文件在训练结束后也未被删除,仍可能在后续研究中被再次调用。

2024年,多名作家提起集体诉讼,主张Anthropic未经许可下载、复制和使用其作品,侵犯了作者享有的版权。

2025年6月,法院就合理使用问题作出部分简易判决,将Anthropic的复制行为分为三类:

第一类是为训练特定大语言模型而制作的副本;

第二类是将合法购买的纸质图书转化为数字文件;

第三类是从盗版资源下载完整电子书,并将其纳入长期中央书库。

法院认可了前两类行为的合理使用主张,但认为从盗版资源下载图书并建立中央书库的做法不能获得同样的保护。按照当时的审理安排,法院还需在后续程序中进一步确定这部分行为是否构成侵权,以及Anthropic可能承担的赔偿责任。案件进入下一阶段前,双方选择通过和解解决争议。2026年7月20日,法院最终批准了双方达成的15亿美元和解方案。

案件中提到的700多万本盗版图书,是Anthropic中央书库所收集图书的整体规模。此次和解涉及的482,460部作品,则是从中筛选出的、符合版权登记和权利人资格等条件的作品,15亿美元和解解决的也只是其中部分作品的版权争议。

法院为何分开审查

从Anthropic训练人工智能模型的技术流程看,资料下载、文件保存和模型训练前后衔接,构成一套完整的数据处理过程;但在美国版权法下,下载、保存和训练分别涉及对作品的复制和使用,需要根据各自的来源、目的和使用方式单独判断是否构成侵权或合理使用。

Anthropic从网络取得完整电子书时,已经完成了一次复制;将文件长期存入中央书库,使其可以被不同项目反复调用;此后再从书库中选取部分作品训练特定模型,则属于具有特定目的的后续使用。Anthropic认为,这些图书最终被用于训练人工智能模型,而模型训练不同于阅读、销售和传播原作品,应当受到合理使用保护。

法院关注的重点在于,作品后来被用于模型训练,并不能改变企业最初取得作品的方式。Anthropic从盗版资源下载完整图书时,已经绕开了正常的购买和授权渠道。将这些图书长期保存在中央书库中,也使相关文件不再只是服务于某一次训练的临时副本,而成为可以由不同项目持续调用的内部资源。

因此,部分图书后来进入训练数据集,不能为整个中央书库提供合理使用依据。模型训练的新用途可以影响法院对训练环节的判断,却无法追溯消除盗版下载已经产生的版权问题,也不能当然支持企业在训练结束后继续长期保存完整作品。

法院因此将模型训练与作品的取得、保存分开审查。为训练特定模型制作副本,是否构成合理使用,需要结合训练目的和使用方式判断;作品通过何种渠道取得、是否被长期保存,以及能否被其他项目继续调用,则属于另一层面的版权问题。

法院审查后的结论

美国版权法判断未经许可使用作品是否构成合理使用,通常会综合考察使用目的和性质、作品性质、使用数量,以及相关使用对原作品市场造成的影响。

Anthropic将部分图书用于训练Claude模型。训练过程中,模型分析大量文本中的词语关系、语言结构和表达规律,最终形成处理和生成语言的能力。这种用途不同于向公众重新出版图书或直接向读者提供作品内容,训练形成的主要成果是模型参数和语言处理能力。

结合模型训练的实际需要,法院认为,为训练特定模型而制作副本具有新的技术用途。尽管训练使用了作品的完整内容,但完整复制在模型训练过程中具有一定必要性。训练副本本身也没有被作为电子书销售,没有直接替代消费者购买原作品。法院据此支持了Anthropic关于特定训练副本构成合理使用的主张。

中央书库的情况则不同。Anthropic从影子书库下载的是可以直接阅读、复制和传播的完整电子书。这些文件进入中央书库后,不只服务于某一个已经确定的训练项目,还可以被不同模型、研究任务及未来项目反复调用。部分图书并未进入任何具体模型训练,部分已经使用过的文件在训练完成后也没有删除。

在法院看来,这些文件已经不再是为某一次训练临时制作的技术副本,而是成为企业长期控制和使用的内部图书资源。Anthropic通过盗版渠道免费取得完整作品,绕开了原本需要购买或取得授权的正常交易渠道,对正版图书销售和版权许可市场造成了更直接的影响。

即使Anthropic后来购买了部分相同图书,也不能改变此前盗版下载行为的性质。后续购买只能为今后的使用建立合法来源,无法追溯消除已经完成的未经许可复制。

法院最终对两类行为作出了不同的审查结果:为训练特定大语言模型制作的副本,在本案事实条件下可以构成合理使用;从盗版资源下载完整图书并建立长期中央书库的行为,则不能因为部分作品后来被用于模型训练而获得同样的保护。法院因此拒绝了Anthropic针对盗版中央书库提出的合理使用主张,相关侵权责任和赔偿问题原本需要进入后续审理,最终由双方通过15亿美元和解解决。

15亿美元解决了什么

15亿美元是Anthropic与作家、出版商群体协商确定的集体诉讼和解金额,并非法院针对人工智能训练行为直接作出的赔偿判决。此次和解涉及482,460部作品。按照和解基金规模测算,每部作品预计对应约3000美元,但权利人最终能够获得的金额,还会受到律师费、管理费用、同一作品权利人数量及内部权利分配方式等因素影响。

双方接受这一金额,主要是为了提前控制继续诉讼的风险。案件如果进入后续审理,法院可能按照符合条件的作品分别计算赔偿。作品数量达到数十万部后,即使单部作品的赔偿金额有限,最终形成的赔偿金额也可能十分庞大。如果进一步认定Anthropic明知相关资料来自盗版渠道,赔偿风险还可能上升。

作者和出版商一方同样需要承担举证压力。他们不仅要证明作品权属和版权登记情况,还要确认Anthropic实际下载、保存了哪些作品,以及每一名集体成员是否符合索赔条件。案件继续审理还可能经历较长的审判和上诉程序,最终结果并不确定。

在这种情况下,和解使Anthropic提前确定了总体支出,也使符合条件的权利人能够在相对明确的范围内获得补偿。

需要强调的是,此次和解主要处理Anthropic过去从盗版资源下载、复制和保存特定作品引发的争议。没有为公司今后取得和使用训练数据提供永久免责。15亿美元解决的是特定案件、特定作品和特定历史行为形成的诉讼风险,而不是对人工智能训练版权问题作出的统一定价或最终结论。

Anthropic案对人工智能企业的合规警示

Anthropic案对人工智能企业最直接的提醒,是模型训练用途不能替代对数据来源和保存方式的审查。资料被用于模型训练,并不意味着企业可以通过任何渠道取得,也不意味着训练结束后可以长期保存并反复调用。

企业在收集训练资料时,应当核实文件来自正版购买、版权人许可、开放授权还是其他网络渠道,并确认授权范围是否覆盖模型训练及后续商业使用。对于长期保存的完整作品,还应明确使用项目、访问权限和删除期限。

企业应当区分特定项目使用的训练数据与长期保存的资料库。前者应围绕具体模型设置使用范围和保存期限,后者则需要更严格的数据来源审查和授权依据。

随着训练许可和数据交易机制逐步发展,后续争议还会继续围绕授权范围、许可价格、数据来源证明和模型输出展开。对于人工智能企业而言,不仅要说明数据用于什么模型,还要能够说明数据从哪里取得、依据什么权限使用,以及训练结束后如何保存或删除。

本文核心观点均为原创

数据搜集及文本润色环节借助AI工具辅助完成


——END——

欢迎关注【Asone Global 合创出海研究】公众号,私信公众号并点击“出海社群”加入我们,共同学习、共同成长。

【声明】内容源于网络
0
0
Asone Global 合创出海研究
1234
内容 595
粉丝 0
Asone Global 合创出海研究 1234
总阅读39.4k
粉丝0
内容595