大数跨境

监管动态 | EDPB发布三份重磅指南:厘清生成式AI爬虫、匿名化、区块链个人数据处理规则

监管动态 | EDPB发布三份重磅指南:厘清生成式AI爬虫、匿名化、区块链个人数据处理规则 AI与数据合规出海实操
2026-08-26
1
导读:提示:完整原文可在文章末尾"阅读原文"处获取。
提示:完整原文可在文章末尾"阅读原文"处获取。


2026年7月8日,欧洲数据保护委员会(EDPB)在全体会议上一次性通过三份重要指南文件,分别为匿名化指南草案、生成式AI场景下网络爬虫指南草案,以及区块链技术处理个人数据指南最终版本。本次文件结合欧盟法院最新判例,回应大模型训练数据爬取、匿名数据边界、链上个人信息处理三大实务痛点,对出海欧盟的AI企业、区块链企业的数据合规工作具备极强指引效力。




 ▍ 一、匿名化指南草案:确立全新三重判定测试,抬高匿名数据认定门槛



新版匿名化指南,替代EDPB2014年旧版匿名化意见,参考欧盟法院C‑413/23 P EDPSSRB等生效判例,重新厘清GDPR框架下匿名数据与个人数据的边界。

1.严格区分三类概念

 匿名数据:完全无法识别特定自然人,不受GDPR约束;

 假名化数据:仍然属于个人数据,必须完整履行GDPR全部合规义务;

 AI合成数据不会自动等同于匿名数据,若通过推理可以回溯识别自然人,依旧属于个人数据范畴。

2.核心:三重累加测试(三项必须全部同时满足,才可认定匿名)

 无记录隔离:数据集不存在可以单独挑出某一个自然人的独特属性组合;

 无关联复原:该数据集记录无法和外部其他数据集关联锁定到同一个自然人;

 无信息推断:无法从数据集推导出会影响自然人权益的特定信息。

只要任意一项条件不达标,该数据集就属于个人数据,适用GDPR监管。

3.两套评估路径:场景化评估、简化评估

 场景化评估:需要评估第三方(黑客、合作方、监管机构)的识别能力,同时还要考虑未来技术进步带来的重识别风险;

 简化评估:仅可在低风险场景下使用,不能直接套用于AI训练大规模数据集。

4.相对可识别原则:同一套数据集,对A机构是匿名数据;但掌握额外外部数据库的B机构,存在重识别可能性,则不能将该数据对外当作匿名数据随意流通。

实务警示:简单脱敏、打码不等于匿名化。很多AI企业期望依靠脱敏规避GDPR义务,本次指南大幅收紧认定标准,企业需要完整落实三重测试,留存评估文档。

本份指南为草案,公开咨询截止时间2026‑10‑30,后续会根据公众反馈修改后发布最终版。

 ▍ 二、生成式AI网络爬虫指南草案:打破“网页公开即可随便抓取”行业误区



专门针对大模型训练开展网页数据爬取场景,是EDPB首次出台针对生成式AI爬虫专项合规指引。

1.核心立场:网页公开可以不受限制抓取

网页上对外公开的个人信息,并不脱离GDPR管辖;只要爬取行为涉及个人数据,就必须遵守GDPR全部规则。

2.法律基础的现实约束

 用户同意(consent)基本不适用于大规模网页爬虫训练大模型,实务层面几乎无法作为合法处理依据;

 企业最主要可选路径:合法利益(第61f项),必须完整完成三重平衡测试:必要性、比例性、权益平衡,不能直接拿来直接套用。

3.企业强制落实的合规义务清单

 开展DPIA数据保护影响评估,作为爬取前的前置动作;

 落实数据最小化:尽可能过滤掉特殊类别敏感个人信息,不要无差别全网大规模抓取;

 优先使用匿名化、合成数据等侵扰性更低替代数据源;

 留存完整审计记录:记录抓取来源域名、抓取时间戳、数据集版本;

 透明度义务:无法逐个向网页自然人告知时,必须在官网公开详细爬虫处理说明,设置便捷的用户反对、退出机制;

 抓取完成后开展数据校验,降低AI模型输出幻觉、泄露个人信息风险。

风险提示:仅靠robots协议不能直接豁免GDPR义务,robots只是网站技术意愿,不构成GDPR层面的合法基础。

本份爬虫指南同样属于草案,同步开放公众咨询至2026‑10‑30。

 ▍ 三、区块链处理个人数据指南



该指南完成全部公众咨询,形成正式终稿,对公链、许可联盟链全部生效适用,不需要再等待修订。

1.核心原则:区块链不可篡改,不等于可以豁免GDPR法律义务

技术上难以删除,不能作为拒绝履行数据主体权利(删除权、更正权)的抗辩理由

2.架构层面的合规建议:链上尽量不存放原始个人信息

 最优方案:原始个人敏感信息链下存储;链上仅保存哈希摘要、指针;当用户行使删除权时,删除链下原始数据,链上哈希将丧失指向个人信息的能力,实质实现“被遗忘权”;

 不建议直接将身份证、身份详情等原始个人信息直接写入链上交易。

3.厘清角色划分:区分数据控制者、数据处理者

智能合约部署方、节点运营方,需要结合实际业务判定身份;不同主体分别承担GDPR项下对应责任,不能以“去中心化”为由推脱合规义务。

4.强制要求:上线区块链业务前完成DPIA评估,评估链上处理个人信息带来的风险,落实设计即保护、默认保护原则。

 ▍ 四、出海企业综合合规启示



1.AI大模型训练业务

 放弃“公开网页随便爬取”惯性思维,重新梳理训练数据集来源;

 匿名化不能想当然,按照EDPB三重测试完成评估,形成书面评估报告;

 优先评估合法利益作为法律基础,完整执行平衡测试,做好DPIA、日志留存、用户反对通道。

2.区块链出海欧盟业务

 立刻排查链上是否存储原始个人身份信息,优先改造为链下存原始数据;

 设计可以落地的机制,响应数据主体删除、更正请求,不要拿区块链不可篡改作为挡箭牌;

 本指南已是终稿,可直接作为企业合规自查、整改的依据。

3.进度提示:匿名化、AI爬虫两份文件还在公众咨询阶段(截止2026‑10‑30),文本未来存在微调可能性,企业持续跟踪官方更新,提前布局合规,避免后续执法风险。

EDPB在2026年7月8日一次性释放三份重磅指引,直面生成式AI网页爬取、匿名化认定、区块链链上个人数据三大技术痛点。一方面,试图释放数据合理利用空间;另一方面,大幅划清红线,纠正行业不少通行的错误惯性认知。对于布局欧盟市场的AIWeb3、大数据企业,需要将三份指南纳入合规自查清单,对数据集采集、脱敏处理、链上存储架构开展梳理整改,为应对欧盟后续的数据监管执法做好准备。









作者简介


马军


 
行业领域:电信、互联网与高科技;新材料;医药与健康;

业务领域:人工智能与数据合规、竞争法、企业出海;

扫描二维码

了解作者详情


图片

【声明】内容源于网络
0
0
AI与数据合规出海实操
宁人(北京)律师事务所主任;专注AI&数据合规、企业出海等赛道; 钱伯斯、LEGALBAND、ALB“网络安全与数据合规”上榜律师; 致力于打造一家最懂AI与数据合规的律师事务所,现服务智谱、联想等20余家高科技企业。
内容 193
粉丝 0
AI与数据合规出海实操 宁人(北京)律师事务所主任;专注AI&数据合规、企业出海等赛道; 钱伯斯、LEGALBAND、ALB“网络安全与数据合规”上榜律师; 致力于打造一家最懂AI与数据合规的律师事务所,现服务智谱、联想等20余家高科技企业。
总阅读12.7k
粉丝0
内容193