大数跨境

浅析AI训练数据中著作权人的选择退出(Opt-Out)机制

浅析AI训练数据中著作权人的选择退出(Opt-Out)机制 金杜研究
2025-06-04
0
导读:本文将聚焦欧盟的著作权人选择退出(Opt-out)机制,梳理相关法律规定、分析争议细节,以期为读者提供参考。

如您希望下载PDF版本,请点击文末“阅读原文”获取。

引言

2025年5月3日消息,谷歌DeepMind副总裁伊莱·柯林斯(Eli Collins)承认,即使出版商通过“选择退出”(Opt-out)机制拒绝将其内容用于AI训练,谷歌仍然可以将其内容用于搜索专用AI工具“AI Overview”的训练,除非出版商选择不被搜索引擎收录。[1]这一新闻再次引发了内容产业界对“选择退出”机制有效性的强烈质疑。

著作权人的选择退出(Opt-put)机制最早由欧盟提出。欧盟2019年通过的《数字单一市场版权指令》(Directive on Copyright in the Digital Single Market,简称“DSM指令”)规定了文本与数据挖掘(Text and Data Mining,简称“TDM”)的著作权限制或例外,即允许“为文本和数据挖掘”目的,复制、摘录合法获取的作品和其他内容;但对于“非科学研究目的”进行的TDM,提供了著作权人的选择退出(Opt-out)机制:即著作权人可以适当方式明确保留著作权(即不允许他人未经授权使用其作品)[2]但是,Opt-out机制在实践中的有效性备受质疑,如Opt-out的具体方式较为模糊,AI训练信息透明度的缺乏导致著作权人无法从Opt-out中获益等。

欧盟2024年通过的《人工智能法案》(EU AI Act)[3]明确考虑了TDM与AI训练的相关性,指出任何将AI模型投放欧盟市场的AI提供者都应当遵守著作权人的权利保留声明,引发激烈讨论。本文将聚焦欧盟的著作权人选择退出(Opt-out)机制,梳理相关法律规定、分析争议细节,以期为读者提供参考。

01

选择加入(Opt-in)和选择退出(Opt-out)

选择退出(Opt-out)是与选择加入(Opt-in)相对应的概念,二者最早是数据隐私保护的两种方法,[4]在著作权法领域下有着新的含义:

选择加入(Opt-in)又称“明示同意”,即传统的“先授权后使用”原则。使用者只有在获得著作权人授权的情形下,才能够使用其作品,否则将构成著作权侵权;

选择退出(Opt-out)是指在著作权例外制度下,使用者无需授权即可使用作品,但是著作权人可以明确声明保留权利(即不允许未经授权使用作品)。此时,使用者仍需取得著作权人的授权才能使用其作品,否则将构成侵权。选择退出(Opt-out)机制的特点在于,要求著作权人明确有效地表示“未经授权不得使用”,否则将被视为“默示同意”。这实际上将原本由使用者承担的特定义务转移到著作权人身上。[5]

Opt-out机制的本意旨在平衡科技发展和著作权人利益,但在实践中却面临着来自人工智能行业和著作权人的双重批评。一方面,内容产业界大多反对设置Opt-out机制,他们更为支持“先授权后使用”的Opt-in机制;[6]另一方面,以OpenAI为代表的AI公司也对Opt-out机制表示质疑。AI公司主张更为广泛的TDM例外,[7]即不允许著作权人Opt-out,主张所有的TDM行为都不构成侵权。

02

Opt-out在欧盟的相关立法

欧盟2019年通过了DSM指令,在欧盟层面引入了TDM著作权例外制度,并要求各成员国在两年内将其转化为国内立法。TDM[8]是分析数字形式的文本和数据的自动化分析技术,能够从海量数据中提取有价值的信息和规律,是推动创新的重要工具。DSM指令第3条和第4条分别规定了“以科学研究为目的”TDM例外情形和“一般情况”的TDM例外情形。其中,在“一般情况”的TDM例外情形下,任何主体以文本和数据挖掘为目的(无论是否出于商业目的)复制、摘录合法获取的作品和其他内容,都不构成著作权侵权,但是著作权人以机器可读等适当方式明确保留其权利(即不允许未经授权使用作品)的情形除外。[9]上述规定正式引入了著作权人“选择退出”(Opt-out)机制。

2024年7月,欧盟发布的《人工智能法案》(EU AI Act)序言第106条明确指出,通用AI模型的提供商应当遵守著作权人根据DSM指令第4条第3款表达的权利保留声明。第53条第1款(c)[10]则进一步要求AI提供商“通过最先进的技术等手段,识别和遵守著作权人权利保留”

但是,上述规定都没有明确Opt-out的具体方式。那么究竟什么是“机器可读等适当方式”?什么是“最先进的技术等手段”能够识别的方式?对上述问题的解读,对司法实践中如何认定权利人是否作出了有效Opt-out以及AI提供商是否遵守了Opt-out都具有重要意义。

03

Opt-out方式的相关争议

关于Opt-out方式的争议主要包括以下几点:(1)机器可读是否是有效Opt-Out的必须要求?(2)网络条款中的自然语言声明是否可视为机器可读?(3)目前具体的Opt-out方式是否是有效的?

1. 机器可读(Machine-Readable)是否是有效Opt-out的必须要求?

“机器可读”,是指计算机可以读取和理解的表达方式。[11]欧盟DSM指令第4条第3款只规定了机器可读是适当方式,但并没有列举其他的适当方式。但是,DSM指令序言第18条却明确指出:“对于在线公开内容而言,只有通过使用机器可读的方式,包括元数据[12]以及网站或服务的条款和条件,才被视为权利保留的适当方式”。也就是说,这条序言中所提及的“适当方式”只能解释为机器可读的方式。[13]然而,该条序言并不具有强制力,因此欧盟各成员国在将欧盟立法转化为国内立法时的规定也各有不同:

“机器可读”属于Opt-Out必须要求的国家:在德国、奥地利、捷克等国家,其国内法中皆规定:只有“机器可读”的方式才是Opt-out的适当方式。如果并非机器可读,那么著作权人的保留声明将视为无效。[14]

“机器可读”不属于Opt-Out唯一方式的国家:欧盟中部分国家并不认为“机器可读”是唯一的合适方式。譬如,意大利在将DSM指令转化为国内法时,仅提及Opt-out应以“适当方式”作出,并没有强制要求必须是机器可读的。[15]也就是说,其他适当方式也可能具有法律效力。[16]但是,有观点认为,“不要求必须机器可读”这种过于宽泛的解释可能与TDM“分析数字形式的文本和数据的自动化分析技术”的本质不符。[17]

总的来看,目前欧盟大部分成员国法律规定均认为应对欧盟DSM指令的序言第18条作严格解释,即将“机器可读”视为著作权人声明保留其权利的唯一适当方式

2. 网站上服务条款中的自然语言的Opt-out是否可视为机器可读?

在实践中,著作权人常在网站的声明或服务条款中使用自然语言作出权利保留声明。但这种自然语言是否属于机器可读,仍然存在争议。DSM指令的序言指出:网站或服务的条款和条件是机器可读的。[18]欧盟AI Act第53条第1款(c)也指出,通用AI模型提供商应使用“最先进”(state-of-the-art)的技术等手段识别和遵守著作权人Opt-out的声明。

那么,如果最先进的技术可以识别自然语言,是否可以认为网站或服务条款中自然语言的Opt-out也是机器可读的呢?在2024年9月德国汉堡法院审理的Robert Kneschke v. LAION案中,法院肯定了这一观点。该案中,原告是摄影师Robert Kneschke,被告是非营利机构LAION。原告认为,被告未经授权将其摄影作品用于制作免费数据集的行为侵犯了原告的著作权。尽管法院最终认定被告的行为属于“以科学研究为目的”TDM例外情形,该情形下不允许著作权人“选择退出”,但是法院仍然对“机器可读”的解释发表了观点。法院认为,对“机器可读”的理解取决于访问作品时的技术发展。AI是目前最先进的技术之一,而目前的AI已经能够识别和分析自然语言,所以网站条款中自然语言的Opt-out是有效的权利保留声明[19]但是,并不是所有国家都支持上述观点。譬如,捷克2021年发布的关于修订《版权法》等其他相关法案的解释性备忘录中明确指出:“网站上的一般声明或内容使用条款不是保留声明的适当方式。”[20]

3. 有哪些具体的Opt-out方式?这些方式是否有效?

欧盟的有关法律中并未详细列举具体的Opt-out方式。实践中,大概存在以下几种表达形式:robots.txt、[21]元数据、[22]ai.txt、[23]“禁止训练”(Do Not Train)注册表、[24]网站使用条款和以信函的形式直接就个别作品通知开发者等。其中,robots.txt是目前最常用的Opt-out方法。它是一个位于网站的根目录中的文本文件,以机器可读方式指示网络爬虫,网站的哪些内容可以索引,哪些内容不应该索引。[25]

图1:www.cloudflare.com的robots.txt示例及常用语法解释

但是,robots.txt面临众多质疑,例如:

其在技术上并不阻止自动访问,不具有强制力,无法真正拦截“恶意”爬虫;

与整个页面相关联,robots.txt无法针对其中的特定作品进行Opt-out;

robots.txt仅能针对明确列举禁止的爬虫。未明确列举的爬虫可能无法被识别。

譬如,在2024年10月荷兰法院审理的DPG Media v. HowardsHome案中,[26]原告是DPG Media等三家媒体出版商,被告是HowardsHome公司,向客户提供了新闻聚合服务。原告主张被告未经授权即抓取原告新闻的行为侵犯了原告的复制权和向公众传播权。荷兰阿姆斯特丹地区法院认为,原告的robots.txt中仅禁止了特定的几个AI爬虫(如GPTBot、ChatGPT等),因此不足以认定原告出版商使用机器可读的方式进行了明确的权利保留。法院认定,被告的行为适用一般情况下的TDM例外,且不违反三步检验法,故不构成著作权侵权。

此外,Opt-out方式还面临着一些共性质疑:一是,除了网站使用条款以外,大部分Opt-out方式都要求著作权人有一定的技术水平;二是,大部分Opt-out方式作出的权利保留对重新发布的作品无效,即著作权人只能在自己发布作品时才能声明保留。[27]比如,robots.txt与特定网页关联,但是其他网页上的同一作品可能不受保护。而如果只在“Do not train”注册表中注册人物绘画的美术作品,那么包含人物绘画的电影海报也无法同时获得保护。

众多复杂且不够有效的方式为著作权人行使权利带来了不便。因此,世界主流观点支持通过合作共同确立Opt-out的方式标准,并探索更具强制力的Opt-out方式。例如,万维网联盟(W3C)提出了一种对TDM例外的权利保留Web协议TDMRep。[28]再如,世界经济合作与发展组织 (OCED) 在2025年2月发布的《人工智能训练中数据抓取引发的知识产权问题报告》(Intellectual Property Issues in Artificial Intelligence Trained on Scraped Data)中也提出鼓励开发标准技术工具,如强制性数据访问控制工具以及自动合同监控、直接支付系统等。[29]

04

Opt-out有效的前提——AI训练透明度

相比于Opt-out具体方式较为模糊的问题,更为根本的问题是:如果著作权人无法知晓其作品是否被用于TDM目的,也就无法判断其Opt-out是否被遵守。这实质上削弱了TDM例外赋予著作权人的议价能力。为了弥补这一制度缺陷,欧盟《人工智能法》规定了AI提供者的透明度义务,即要求其公开AI训练相关信息。该法第53条第1款(d)规定:通用AI模型提供者有义务根据AI办公室提供的模板,起草并公开一份关于通用AI模型训练内容的足够详细(sufficiently detailed)的摘要。[30]欧盟AI办公室2025年3月公布的摘要模版草案如下:[31]

图2:GPAI Code第三版草案透明度部分第6页“用于训练、测试和验证的数据信息”

但是,这种数据摘要模式仍然面临诸多质疑,主要有以下两点:一是根据目前摘要模版,权利人能否获得准确的数据集名称、网络爬取域名等以判断作品被使用的可能性仍然未知。[32]二是该模式下信息质量存疑,确保信息准确性将耗费大量资源。[33]

有观点指出,Opt-out机制的根本缺陷,在于个体作者难以从目前透明度条款要求公布的信息中判断自己的作品是否被用于训练,从而难以取得许可谈判优势以获取实质性利益,但AI开发者却需承担额外的合规成本。[34]英国也正在尝试在《数据使用和访问法案》中引入透明度条款,但面临涉及公共资金费用的质疑。[35]

结语

TDM例外中著作权人的选择退出(Opt-out)机制自提出以来,一直面临着实践中无法真实保护著作权人利益的质疑。如要真正实现在鼓励AI产业发展的同时平衡著作权人利益,仍需明确具体的Opt-out“适当方式”,进一步探索有强制力的、与特定作品关联的方式,同时完善透明度措施。值得一提的是,中国虽然尚未明确AI数据训练是否属于合理使用,但也在讨论是否采纳著作权人选择退出(Opt-out)机制,以避免著作权人的利益受到过分侵害。[36]

综上,AI公司在考虑欧盟地区的AI训练数据合规时应注意以下几点:第一,尽可能通过取得合法授权的方式获取训练数据;第二,积极推动Opt-out技术标准化,并通过最先进的技术等手段识别和遵守Opt-out;第三,遵守透明度义务,探索使著作权人能够识别其被用于AI训练的具体作品的机制;最后,积极与相关数据供应商合作,探索新许可方式。从权利人的角度而言,则应考虑采取以下措施进行有效的权利保留:如robots.txt(注意明确针对的爬虫)、元数据、“Do not train”登记表、ai.txt等。但是,权利人应谨慎在网站条款和条件中用自然语言作出权利保留。

向下滑动阅览

脚注:

[1] 参见:https://www.business-standard.com/technology/tech-news/google-can-train-search-ai-on-web-content-even-if-publishers-opt-out-125050400050_1.html ;https://www.bloomberg.com/news/articles/2025-05-03/google-can-train-search-ai-with-web-content-even-after-opt-out

[2] 欧盟“Directive on Copyright in the Digital Single Market”第4条,参见:https://eur-lex.europa.eu/eli/dir/2019/790/oj/eng

[3] 欧盟AI Act第53条第一款(c),序言105和106条,参见:https://artificialintelligenceact.eu/the-act/

[4] 最早出现在美国加利福尼亚州的CCPA和CPRA,参见:https://securiti.ai/blog/opt-in-vs-opt-out/  ;在2005年谷歌“数字图书馆计划”后在著作权领域获得广泛关注。该计划中,谷歌推出了Opt-out责任转移策略,若作者或出版商不愿谷歌扫描其作品,可以向谷歌提出请求,提出请求的版权人可在2009年9月4日前退出项目,如在此日期前没有提出请求的版权人,则被认为加入该项目,可获得谷歌的版权赔偿以及后续广告分成等费用。参见: https://mp.weixin.qq.com/s/63S1oLtNOg0zKqZxLhM9SA

[5] 冯恺:《个人信息“选择退出”机制的检视和反思》,载《环球法律评论》2020年第4期。

[6] 参见:https://www.aitrainingstatement.org/ ;https://europeanwriterscouncil.eu/2503joint_oppose_codeofpractice/

[7] OpenAI对英国版权咨询的回应,参见:https://openai.com/global-affairs/response-to-uk-copyright-consultation/

[8] 欧盟DSM指令第2条第2项将TDM定义为“任何旨在分析数字化的文本和数据,以获得模式、趋势和联系等信息的自动化分析技术” 参见:https://eur-lex.europa.eu/eli/dir/2019/790/oj/eng

[9] 欧盟“Directive on Copyright in the Digital Single Market”第4条,参见:https://eur-lex.europa.eu/eli/dir/2019/790/oj/eng

[10] 欧盟AI Act,参见:https://artificialintelligenceact.eu/the-act/

[11] 欧盟委员会对“Machine-Readable”的定义: “能够通过电子设备(如激光扫描仪、磁条读取器或磁盘驱动器)读取数据或指令。这些数据或指令可以以条形码存储、以磁性油墨书写或以数字形式记录在磁盘上,以便计算机进行解释和处理。”,参见:https://interoperable-europe.ec.europa.eu/collection/nifo-national-interoperability-framework-observatory/glossary/term/machine-readable

[12] 元数据是描述数据或数据集的信息,“关于数据的数据”,与作品本身相关。参见:https://www.ibm.com/think/topics/metadata;元数据Opt-out相关分析参见:https://blog.galalaw.com/post/102k8jn/to-opt-out-or-not-to-opt-out-the-question-of-the-opt-out-model-for-ai-traini ;https://www.mondaq.com/uk/copyright/1528404/how-to-opt-out-your-images-from-use-in-ai-training-german-court-considers-the-eu-text-and-data-mining-copyright-exceptions?msg=15 

[13] DSM指令序言第18条,参见:https://eur-lex.europa.eu/eli/dir/2019/790/oj/eng

[14] Technical Challenges of Rightsholders’ Opt-out From Gen AI Training after Robert Kneschke v. LAION. 参见:https://www.jipitec.eu/jipitec/article/view/422

[15] 意大利著作权法Section 70,Technical Challenges of Rightsholders’ Opt-out From Gen AI Training after Robert Kneschke v. LAION. 参见:https://www.jipitec.eu/jipitec/article/view/422

[16] 2023年11月在都灵大学法律系举办的国际会议“数据抓取的技术法律挑战”期间的讨论,来源文章Technical Challenges of Rightsholders’ Opt-out From Gen AI Training after Robert Kneschke v. LAION. 参见:https://www.jipitec.eu/jipitec/article/view/422

[17] Technical Challenges of Rightsholders’ Opt-out From Gen AI Training after Robert Kneschke v. LAION. 参见:https://www.jipitec.eu/jipitec/article/view/422

[18] 欧盟“Directive on Copyright in the Digital Single Market”序言18,参见:https://eur-lex.europa.eu/eli/dir/2019/790/oj/eng

[19] 但是德国法院认为无需就商业TDM例外是否适用达成结论性意见,因此该观点缺乏说服力。德国Robert Kneschke v. LAION案,2024年9月27日,参见:https://openjur.de/u/2495651.html;Technical Challenges of Rightsholders’ Opt-out From Gen AI Training after Robert Kneschke v. LAION. 参见:https://www.jipitec.eu/jipitec/article/view/422

[20] Explanatory memorandum (Důvodová zpráva) of the Czech Government to the Act. No. 429/2022 Coll. (amending the Czech Copyright Act implementing the CDSM Directive). Section § 39c,参见:file://172.17.7.144/redirect/win2016/wuyaxin1/Downloads/duvodova-zprava-sbcr-2022c193z0429-20211025.pdf ;https://www.zakonyprolidi.cz/cs/2022-429/souvislosti

[21] 参见: https://www.cloudflare.com/zh-cn/learning/bots/what-is-robots-txt/

[22] 元数据的定义参见:https://www.ibm.com/think/topics/metadata;元数据Opt-out相关分析参见:https://blog.galalaw.com/post/102k8jn/to-opt-out-or-not-to-opt-out-the-question-of-the-opt-out-model-for-ai-traini ;https://www.mondaq.com/uk/copyright/1528404/how-to-opt-out-your-images-from-use-in-ai-training-german-court-considers-the-eu-text-and-data-mining-copyright-exceptions?msg=15 

[23] 参见:https://site.spawning.ai/spawning-ai-txt

[24] 参见:https://spawning.ai/browser-extension

[25] 参见:https://cloud.tencent.com/developer/article/2465349 ;https://www.cloudflare.com/zh-cn/learning/bots/what-is-robots-txt/

[26] 荷兰DPG Media v. HowardsHome案,2024年10月30日,参见:https://uitspraken.rechtspraak.nl/details?id=ECLI:NL:RBAMS:2024:6563&showbutton=true&keyword=mediahuis&idx=3

[27] 参见:https://blog.galalaw.com/post/102k8jn/to-opt-out-or-not-to-opt-out-the-question-of-the-opt-out-model-for-ai-traini

[28] 参见:https://www.w3.org/community/reports/tdmrep/CG-FINAL-tdmrep-20240510/

[29] OCED“Intellectual Property Issues in Artificial Intelligence Trained on Scraped Data”报告,参见:https://www.oecd.org/en/publications/intellectual-property-issues-in-artificial-intelligence-trained-on-scraped-data_d5241a23-en.html

[30] 欧盟AI Act,参见:https://artificialintelligenceact.eu/the-act/

[31] 欧盟《通用人工智能行为准则》(General-Purpose AI Code of Practice)第三版草案,参见:https://digital-strategy.ec.europa.eu/en/library/third-draft-general-purpose-ai-code-practice-published-written-independent-experts

[32] TDM and generative AI:Lawful access and opt-outs,参见:https://papers.ssrn.com/sol3/papers.cfm?abstract_id=5036164

[33] Copyright and AI training data—transparency to the rescue? 参见:https://academic.oup.com/jiplp/article/20/3/182/7922541

[34] Copyright and AI training data—transparency to the rescue? 参见:https://academic.oup.com/jiplp/article/20/3/182/7922541

[35] 参见:https://bills.parliament.uk/publications/60909/documents/6540;https://publications.parliament.uk/pa/bills/cbill/59-01/0248/240248.pdf

[36] 支持引入“选择退出”机制的文章如曹新明、马子斌:《生成式人工智能对版权制度的挑战及应对》,载《中国版权》2023年第6期。反对引入“选择退出”机制的文章如张吉豫、汪赛飞:《大模型数据训练中的著作权合理使用研究》,载《华东政法大学学报》2024年第4期。

本文作者

宋海燕

国际合伙人

知识产权部

seagull.song@cn.kwm.com

业务领域:人工智能,跨国知识产权法及娱乐法,主要聚焦于传媒、娱乐、体育与高科技行业

宋海燕博士带领团队为各行业国内外跨国企业在出版、音乐、消费衍生品、电影、电视、真人秀综艺节目、主题乐园、游戏与电竞、体育赛事运营、数字媒体、虚拟人、NFT产品、元宇宙等领域提供战略性、商业性及法律建议,包括但不限于知识产权战略规划、版权链清查、版权运营、内容许可、影视节目融资、制作拍摄与发行、中外合拍、知识产权维权等。

感谢赵怡冰、黄娇娜对本文作出的贡献。

转载声明:好文共赏,如需转载,请直接在公众号后台或下方留言区留言获取授权。

封面图源:问题少年002·杜飞辰

【声明】内容源于网络
0
0
金杜研究
1234
内容 2607
粉丝 0
金杜研究 1234
总阅读100
粉丝0
内容2.6k