大数跨境

立法动向|欧盟就《生成式人工智能语境下网页爬虫指南》征求意见

立法动向|欧盟就《生成式人工智能语境下网页爬虫指南》征求意见 TMT法律论坛
2026-07-10
4
导读:2026年7月7日,欧洲数据保护委员会(EDPB)通过并发布《生成式人工智能语境下网页爬虫指南》

欢迎点击上方 TMT法律论坛 关注我们



导读

    LAW

NEWS

网络爬取已广泛用于数据分析、搜索服务及生成式AI训练。对AI企业而言,公开网页意味着数据“可访问”,但不当然意味着可无条件收集、保存、清洗、结构化并投入训练。


从各国现有法律体系看,网络爬取非由单一法律调整,而是随抓取对象和用途分别进入个人数据保护、版权/TDM规则和AI治理规则


2026年7月7日,欧洲数据保护委员会(EDPB)发布《生成式人工智能语境下网页爬虫指南》(Guidelines 03/2026 on web scraping in the context of generative AI,以下简称“Guidelines 03/2026”或“指南”)Version 1.0。指南目前为公开征求意见版本。




Guidelines 03/2026全文共3部分:“引言与范围—网页爬虫的定义—网页抓取与GDPR”,主要为以下内容:


主要内容



(一) 适用范围:生成式AI训练和微调中的外部网页数据

指南首先说明,生成式AI训练需要经过多个阶段,包括训练以及必要的微调。训练生成式AI需要来自各种来源的大量数据。(第2段)


原文聚焦两类典型场景(第3段):

  • 组织自行或外包互联网抓取数据以开发生成式AI;

  • 组织取得并复用其他组织(数据经纪商)已经抓取的数据集。





(二)网页爬虫的定义:抓取对象、类型、内容与流程


  1. 网页爬取界定为:

    使用自动化工具,从公开可用网络服务中提取并存储信息。如公共登记册、开放数据门户、新闻网站、社交媒体等,这些网站很可能包含个人数据。(第7段)


  2. 指南进一步从三个角度说明网页爬取的技术形态

  • 抓取类型:可分为目标型爬取非目标型爬取,区分标准在于收集标准的具体性和限制性,而非所用技术工具。(第8段)

  • 网页内容可分为静态内容和动态内容;动态内容抓取通常需要模拟用户与页面交互后再读取和提取数据。(第9段)

  • 运行维护:网页结构会频繁变化,爬虫可能需要定期监测和更新以保持功能正常。(第10段)


  1. 指南将网页爬取流程概括为四步

  • 确定数据收集标准;

  • 提取数据;

  • 清洗原始数据;

  • 最后进行结构化与存储

其中第一步还包括实施排除特定来源的措施,例如排除通过robots.txt、CAPTCHA等方式反对爬取的网站。(第11段)





(三)网页抓取与GDPR:涉及个人数据时的适用要求


这是指南篇幅最长的部分。其基本前提是:当网页抓取涉及个人数据的提取、清洗、结构化、存储等处理活动时,GDPR即适用。

个人数据包括直接识别信息,也包括可间接识别个人的信息。大规模抓取可能带来合法性基础、特殊类别数据、透明度、目的限制、最小化、公平性、准确性和问责挑战。(第12-15段):


1. 角色划分:控制者、共同控制者或处理者需个案判断(第16-20段)

  • 不同组织可能以不同程度参与训练数据集的收集过程。相关主体属于控制者、共同控制者还是处理者,应基于事实和具体处理安排个案分析。

  • 指南指出执行爬取者并不当然是控制者;如AI开发者指示爬取者按其书面要求建立训练数据集,爬取者可能是处理者,AI开发者通常是控制者;如双方共同决定处理目的和方式,则可能构成共同控制。(第16-20段)


2. 处理原则:合法、目的、透明、最小化和准确性(第21-42段)

  • 合法性与目的限制:控制者应结合拟抓取的数据集和网站类型,确保网页爬取个人数据的目的合法、具体、明确且正当。(第21-23段)

  • 透明度:大规模抓取中,如逐一通知数据主体不可行或需付出不成比例努力,控制者仍应公开相关信息(如通过隐私政策告知所涉个人信息类型、数据来源说明等),并采取适当措施保护数据主体权益。(第24-34段)

  • 数据最小化:数据最小化原则不禁止使用大规模数据训练AI模型,但要求排除与目的无关、不必要或不适当的个人数据,例如通过设定精确收集标准、数据映射、过滤、匿名化或假名化等方式控制处理范围。(第35-38段)

  • 准确性:对于来源复杂或可靠性不足的数据,控制者应尽量选择官方、可信且持续维护的数据源,记录抓取时间,并在用于AI训练前进行必要的准确性验证。(第39-42段)


3. 合法性基础:同意通常困难,正当利益需三步判断(第43-66段)

合法性基础需先行确定:抓取或复用已抓取数据前,需先确定合法性基础,GDPR第6(1)(f)条“正当利益”常被援引。(第43-45段)


正当利益的适用需满足三项累积条件(第46-53段),理解如下:


4.特殊类别数据:GDPR第9条规则及非预期收集问题(第67-77段)

指南最后讨论特殊类别个人数据。原则上,揭示种族或民族出身、政治观点、健康或性取向等特殊类别数据的处理受GDPR第9(1)条禁止;若有意爬取此类数据,除第6条合法性基础外,还需符合第9(2)条豁免例外。(第67段;GDPR第9(1)-(2)条)


但在实际网页抓取过程中,即使控制者并非为了获取特殊类别个人数据,并且已经采取过滤、排除来源等措施,仍可能由于互联网数据规模巨大、内容复杂,不可避免地获取并继续处理部分特殊类别个人数据。


对于控制者此部分无意(incidental)收集但仍可能非预期处理的特殊类别数据的情形,指南讨论CJEU在GC & Others, C-136/17中的思路,但明确该判决不是对GDPR第9条和第10条的一般豁免,只能在相似处理和类似情境中个案评估。(第68-73段)。控制者至少应“在其职责、权限和能力范围内”采取(第74-77段):

  • 收集前用精确标准和过滤器防止收集并排除高风险网站;

  • 收集后尽快删除已收集的特殊类别数据;

  • 模型开发中防止从模型提取此类数据并设置输出过滤;

  • 开发后持续监测输出,并更新过滤、限制提示或功能、考虑模型遗忘等。

  • 控制者还应能按问责原则证明条件满足、措施有效,并定期验证和更新。




结语

Guidelines 03/2026将生成式AI训练中的网页爬取放回既有数据保护处理链条中审视:谁决定目的和方式,谁就需要围绕合法性基础、透明度、最小化、准确性、数据主体权利及特殊类别数据建立可说明、可验证的安排。而该文件目前为公开征询版本,后续仍可能调整,需要持续关注动态。


附:指南章节内容索引




本期编辑:吴小旭 陈煜烺 张膑月





作者往期文章推荐



中伦解读


域外关注


【声明】内容源于网络
0
0
TMT法律论坛
聚焦数据合规、网络安全、GDPR、大数据、Fintech、人工智能、自动驾驶与电子商务等TMT领域的前沿法律实务,由中伦TMT团队运营,合作与沟通:DataLaw.pg@zhonglun.com。
内容 737
粉丝 1
TMT法律论坛 聚焦数据合规、网络安全、GDPR、大数据、Fintech、人工智能、自动驾驶与电子商务等TMT领域的前沿法律实务,由中伦TMT团队运营,合作与沟通:DataLaw.pg@zhonglun.com。
总阅读6.5k
粉丝1
内容737