2026 年 7 月 7 日,欧洲数据保护委员会(EDPB)通过了关于生成式人工智能背景下网络抓取的第 03/2026 号指南(1.0 版),并公开征求意见。该指南阐述了使用自动化工具从公开网络资源中提取个人数据以开发和训练生成式人工智能模型所涉及的 GDPR 合规问题,涵盖私营实体直接或委托第三方抓取外部互联网数据,以及从数据经纪商处获取已抓取数据集的情形。
一、背景
网络抓取是利用自动化工具从公开网络服务(如公共登记册、开放数据门户、新闻媒体、社交媒体及论坛等)提取和存储信息的技术,这些来源常包含个人数据。EDPB 在指南草案中将抓取行为区分为定向抓取和非定向抓取:
- 定向抓取:基于特定标准(如特定域名、语言或主题)进行收集。
- 非定向抓取:不设收集标准,软件无限制地跟踪链接。此类方式可能导致对互联网的大规模探索,增加数据控制者对所收集个人数据了解不足的风险。
二、指导原则要点
指南核心涉及组织角色认定、GDPR 第 5 条数据处理原则(合法性、目的限制、透明度、最小化、准确性)、第 6 条法律依据及第 9 条特殊类别数据处理。
01. GDPR 的适用性
EDPB 重申,只要网络抓取涉及个人数据的处理(提取、清洗、结构化、存储等),无论直接或间接识别自然人,GDPR 均适用。对于混合数据集,GDPR 适用于其中的个人数据部分。尽管确定数据类型和主体存在挑战,但组织仍需依据问责原则证明合规性。EDPB 特别指出,AI 模型可能记忆并复制训练数据中的个人数据,构成重大风险。
02. 控制器、联合控制器和处理器角色
执行抓取的组织未必是控制者,需逐案分析:
- 处理器:若 AI 开发商委托爬虫按指令(数据源、类别)创建数据集,爬虫方为处理器,开发商为控制者。
- 独立控制者:若 AI 开发商使用第三方已抓取的数据集,各方通常对各自独立的处理活动负责。
- 联合控制者:若双方共同决定处理目的和手段(如共同开发模型),则构成共同控制。
03. 合法性和目的限制
数据处理必须合法、公平、透明,且出于特定、明确的目的。EDPB 建议参考其 2024 年 12 月通过的《关于人工智能模型背景下个人数据处理相关数据保护问题的第 28/2024 号意见》以评估目的限制。
04. 透明度
告知数据主体是透明原则的核心。EDPB 承认大规模抓取时逐一告知往往不切实际。若提供信息需要不成比例的努力,可援引 GDPR 第 14 条第 5 款 (b) 项例外,但该例外不应被常规依赖(除公共利益、科研统计外)。控制者必须权衡努力程度与对主体的影响。
注意:若数据集有限、较新且主体可联系(如封闭用户群讨论),则必须单独告知。
替代措施:若依赖例外情况,控制者必须公开相关信息(如隐私政策),说明抓取来源性质、爬虫特征,并尽可能列出域名和 URL(含收集时间)。此外,还应采取以下措施:
- 公开数据保护影响评估报告(DPIA);
- 对数据进行匿名化或假名化;
- 缩短数据留存时间;
- 实施技术组织措施提升安全性。
若从第三方获取数据,最佳实践是直接链接至原始抓取控制者的网站,清晰解释收集条件。
05. 数据最小化
数据最小化原则不禁止使用大量数据,但禁止处理无关或不充分的数据。收集前应采取措施:
- 应用过滤器排除不必要类别(如银行交易、位置数据);
- 排除包含弱势群体或敏感数据(如财务、位置)的网站;
- 尊重 robots.txt、ai.txt 或 CAPTCHA 等反抓取技术信号。
06. 准确性
个人数据必须准确并及时更新,此要求同样适用于 AI 模型的输出。EDPB 建议:
- 从可靠来源抓取,避免次要或过时聚合器;
- 为数据添加时间戳;
- 在训练前验证数据准确性。
07. 法律依据
同意通常无效,因难以在抓取前识别并获得所有主体同意;网站无 robots.txt 也不等同于同意。合法利益(GDPR 第 6(1)(f) 条)是最常用依据,需满足三要素:
- 合法利益:必须真实存在且明确(如开发对话代理、欺诈检测),而非推测性。
- 必要性:评估是否存在侵入性更小的替代方案(如使用合成数据)。
- 平衡测试:权衡主体权利与控制者利益。
- 主体风险:大规模无差别抓取可能导致“寒蝉效应”或深度伪造风险;敏感数据(位置、财务、未成年人数据)权重更高。
- 合理预期:主体虽知数据可能被复用,但未必能预见所有用途。反抓取措施的存在是重要考量。
- 缓解措施:若主体利益优先,控制者需采取措施,如禁止访问登录墙后内容、限制收集时间段、提供选择退出机制、删除不必要数据及防止模型记忆。
示例:仅收集公开语音录音而无额外措施,难通过平衡测试;若仅使用公共领域文本、实施记忆保护并发布全面隐私政策,则可能合规。
08. 特殊类别的个人数据
原则上,无第 9 条例外情形下处理特殊类别数据属非法。但对于偶然和残留收集,可参照欧盟法院 GC 案判决,前提是控制者在“职责、权力和能力范围内”行事。EDPB 要求个案分析是否满足以下条件:
- 处理活动类似搜索引擎;
- 仅为附带收集,非有意为之;
- 难以评估是否包含此类数据;
- 已采取最低限度措施防止收集和传播。
最低措施包括:
- 收集前制定标准排除特定网站类别;
- 发现后立即删除特殊类别数据;
- 防止模型输出此类数据(应用输出过滤器);
- 持续监控模型输出,并在技术进步时采用“模型遗忘”技术。
指南发布之后
从事网络抓取或 AI 训练的公司应结合 EDPB 现有指南(特别是 1/2024 和 28/2024)审阅自身做法。尽管本指南目前为征求意见稿,但其反映了监管机构的评估立场。企业应重点关注:
- 排除特定数据类别和来源;
- 发布全面且可搜索的来源列表;
- 在合法利益平衡测试中落实缓解措施;
- 分阶段实施防止特殊类别数据泄露的措施。
此外,还需关注版权法及文本与数据挖掘相关的法律挑战。
来源:专业机构洞察
免责声明:本文内容仅用于学习交流及提供一般信息,不构成特定司法辖区内的经营决策依据或法律/监管建议。

