下文将按“数据标注(annotation)+ 数据爬取(scraping)”的完整合规链路来写。
***
## 一、从“可用数据”到“可用的合规数据”
在 AIGC 和大数据时代,数据标注与数据爬取已经成为训练数据供应链的两大核心来源,但合法“拿到数据”和合法“使用数据”是两回事。
美国实践显示,围绕数据采集与标注的法律风险主要集中在四个维度:著作权与合理使用(fair use)、隐私与数据保护(GDPR/CCPA 等国际标准)、合同与技术保护措施(ToS/技术反爬)、以及监管机构(尤其是 FTC)的不正当/欺骗性行为审查。
***
## 二、数据爬取(Web Scraping):合法性边界与关键判例
### 1. hiQ Labs v. LinkedIn:公共数据爬取合法性与 CFAA 边界
hiQ Labs v. LinkedIn 是当前美国关于爬虫最具标志性的系列案件之一。
#### 事实背景
- LinkedIn:运营职业社交平台,大量用户档案对未登录公众可见,同时通过用户协议禁止自动化爬取及虚假账号。
- hiQ:一家数据分析公司,开发工具定期爬取公开 LinkedIn 个人资料,对员工跳槽风险等进行分析并向企业客户提供报告。
- 冲突升级:
- LinkedIn 向 hiQ 发律师函,指控其违反用户协议,并援引《计算机欺诈和滥用法案》(CFAA)等法律,发出停止通知,同时部署技术措施阻断 hiQ 的 IP 访问。
- hiQ 反诉,申请禁令,要求法院阻止 LinkedIn 利用 CFAA 阻止其访问公开页面。
#### 第九巡回法院的关键结论(CFAA 层面)
- 公共网页 ≠“未经授权访问”:
- 第九巡回法院认为,对无需登录、向公众开放的网页进行访问,不构成 CFAA 意义下的“未经授权访问”,因此 LinkedIn 不能单纯依靠 CFAA 禁止 hiQ 对公开资料的爬取。
- 判决强调,CFAA 立法意图针对“黑客式侵入”而非普通公众访问公开网页的行为,尽管这种访问可能违反网站条款。
这被业界解读为:对“公开可访问页面”的数据爬取,在美国至少不构成 CFAA 意义上的刑事或民事“黑客行为”。
#### 后续:合同与其他责任、和解结果
- 地方法院在后续判决中确认,即便 CFAA 不适用,hiQ 仍然可能构成对 LinkedIn 用户协议的违约,因为 hiQ 曾注册账号并同意相关条款,包括禁止爬取及假账号行为。
- LinkedIn 的技术阻断(封禁 IP 等)被认定为正当自力救济行为,属于为诉讼做准备的合理措施。
- 2022–2024 年间,案件经多轮程序后最终达成和解:
- hiQ 同意永久停止爬取 LinkedIn 数据;
- hiQ 需删除通过 LinkedIn 获得的全部数据、相关源代码以及基于这些数据开发的算法;
- 向 LinkedIn 支付 50 万美元赔偿;
- 同意 LinkedIn 在包括 CFAA、州级计算机滥用法、侵权挪用等多个法律依据下建立责任。
**合规启示:**
- “公开可见”不等于“可以随意用”:CFAA 风险减弱,但合同违约、隐私以及不正当竞争等路径仍然存在。
- 网站运营方可以通过用户协议 + 技术措施 + 诉讼组合拳控制爬取行为;被爬方的隐私承诺若与实际防护不符,自身也可能面临 FTC 审查。
### 2. 欧洲 CJEU:Ryanair v. PR Aviation——条款约定与无数据库权也能禁爬
在“国际标准”层面,欧盟法院在 Ryanair v. PR Aviation 中提供了重要比较法视角。
#### 事实要点
- PR Aviation:一家荷兰比价网站,使用自动化程序从 Ryanair 官网抓取航班信息,再向消费者出售机票预订服务。
- Ryanair:在网站条款中明确禁止自动化工具抓取数据用于商业目的。用户访问时必须点击同意这些条款才能继续浏览航班信息。
- 争议焦点:
- 冲突并非基于欧盟数据库权(该数据未受 sui generis 数据库权保护),而是围绕合同条款的效力。
#### CJEU 结论
- 即便数据本身不受数据库权保护,网站仍可通过有效的合同条款禁止商业性爬取行为。
- 访问者通过点击“我同意”方式,形成具有约束力的合同;违反条款的自动化爬取行为构成违约。
**合规启示:**
- 即使不适用特定知识产权法,网站也可以通过条款设计与技术措施联合限制爬取;
- 对爬取方而言,绕过或违反条款,可能构成合同责任或不正当竞争,在跨境数据抓取时尤其要关注目标网站所在法域的合同法与竞争法框架。
### 3. 监管视角:FTC 与“Great Scrape”——从隐私与不正当行为切入
美国加州法律评论的《The Great Scrape》文章系统分析了联邦贸易委员会(FTC)如何从“不公平或欺骗性行为”角度介入爬取问题。
- FTC Act 下“不公平行为”标准:
- 行为造成或可能造成重大损害;
- 消费者不能合理避免;
- 损害利益不被对消费者或竞争的反向利益所抵消。
- 对爬取方的潜在责任:
- 大量收集包括姓名、位置等个人数据并用于画像、广告投放或敏感用途,可能构成对消费者隐私的不公平侵害,尤其在未充分告知或未提供退出机制时。
- 对“被爬方”的责任:
- 如果平台在隐私政策中承诺“不会向第三方分享数据”或“采取合理措施防止未经授权访问”,却在技术上未对大规模爬取施加合理保护,FTC 可能认定为“欺骗性”或“不公平”实践。
**合规启示:**
- 爬取行为的合规性,不仅看“有没有侵入”,还要看数据的性质(是否含个人数据)、使用方式以及与用户隐私预期是否一致。
- 平台自身如果完全任由爬取发生,与公开隐私承诺不符,也有监管风险。
***
## 三、数据标注(Data Annotation):隐私、保密与跨境合规
数据标注是把原始数据(图像、音频、文本等)转化为训练可用结构化标签的过程,本身往往不改变底层法律风险:如果原始数据获取不合规,标注之后仍不合规,甚至风险升级。
### 1. 国际隐私与安全标准:GDPR、CCPA 等
专业标注服务提供商通常会强调符合 GDPR、CCPA、HIPAA 与 SOC 2 等标准,以争取大型客户的信任。
- GDPR(欧盟):
- 个人数据定义非常宽泛,包括可识别面孔的图片、IP 地址、Cookie、行为画像等。
- 标注公司通常作为“数据处理者”,必须依据数据控制者的书面指示处理数据,并采取适当的技术和组织措施保障安全(如访问控制、加密、分级权限)。
- CCPA / CPRA(加州):
- 保护所有加州居民的个人信息,包括姓名、地址、地理位置、线上行为数据、生物识别信息等。
- 赋予消费者知情权、删除权和“拒绝出售”其数据的权利;标注过程中若改变数据用途(例如由业务运营改为 AI 训练),需要评估是否构成“新目的”,并可能触发额外披露或同意义务。
- 行业认证:
- 一些标注企业宣称通过 GDPR、HIPAA、SOC 2 Type II 等认证/审查,意味着其在访问控制、加密、审计日志、第三方管理等方面达到一定标准。
### 2. 标注环节的典型风险点
- 身份直接可识别数据:带有人脸的图片、带姓名/车牌的监控视频、邮箱地址、地理位置轨迹等,均属高敏感度数据。
- 内部/机密业务数据:金融、医疗、政务、工业控制等领域,标注人员接触的数据本身可能受保密协议或行业监管约束(例如美国 HIPAA 对医疗数据的强管控)。
- 跨境传输:将欧盟或加州的个人数据交给海外标注团队(例如印度、东欧或东南亚),涉及跨境传输机制(标准合同条款、数据本地化等),一旦处理不当可能被监管机构问责。
### 3. 实务中的合规实践(行业“国际标准”做法)
以某些标注公司公开合规方案为例,其通常会采用以下措施以宣称符合 GDPR、CCPA 等标准:
- 数据最小化与脱敏:在标注前对原始数据进行脱敏,如对面孔打码、对姓名及账号等字段进行 pseudonymization 或 anonymization,减少直接识别风险。
- 访问控制:标注平台实施严格的账号管理和权限分级,对敏感数据启用额外审核与加密存储,仅授权必要人员访问。
- 合同体系:与客户签署数据处理协议(DPA),明确数据控制者/处理者身份、处理目的与期限、安全措施、分包方管理等条款。
- 安全认证与审计:通过 SOC 2 Type II 等审计证明其在数据安全、可用性、保密性方面达到一定成熟度,配合定期渗透测试与安全检查。
***
## 四、数据标注 + 爬取的组合风险:训练数据“源头责任”
在 AI 训练场景下,数据链通常是:“从网络或第三方爬取/收集 → 标注 → 汇入训练集”。此时,任何一环违法都会污染整个训练数据集,从而影响模型输出的合法性。
### 1. 美国版权局 2025 AI 报告:对“非法来源数据”的态度
2025 年 5 月,美国版权局发布关于生成式 AI 训练与合理使用的长篇报告,对训练数据合法性给出重要政策信号。
- 报告指出:明知使用由盗版或非法访问作品构成的数据集进行训练,应当在合理使用分析中“对使用方不利”。
- 报告认为:合理使用可以解决很多情形,但当使用不构成合理使用时,应依赖自愿许可市场(即通过授权获取数据),而不是简单以“训练需要”为由贸然使用。
这意味着,如果企业明知某些标注数据来源于未经许可的网络爬取(例如未经授权的付费内容、盗版影视剧、非法泄露数据库),其后续全部标注和训练环节在版权争议中都会处于弱势位置。
### 2. “Great Scrape”视角:隐私与爬取结合的风险
《Great Scrape》文章强调,AI 模型训练依赖的大规模爬取往往包含敏感个人信息,FTC 完全可能认为这样的数据链在隐私层面“不可公平避免”,从而认定为不公平行为。
- 若训练方未合理告知数据主体,且提供的退出机制不足,结合敏感数据的自动化画像,很可能在未来被 FTC 用于执法案例试点;
- 若平台自称“严格保护用户数据”却对大规模爬取不设任何技术防线,则也可能面临“欺骗性实践”的指控。
***
## 五、企业合规框架:从“爬前”到“训练后”的闭环治理
结合上述判例与政策,可以为跨国企业设计一套针对“数据爬取 + 标注”的专业合规框架。
### 1. 爬取前:合法性审查与数据源分级
- 数据源分级:
- 公开可访问页面(无需登录):标注为“公开源”,但须审查目标网站的 robots.txt、用户协议及其隐私政策是否明确禁止爬取或自动化访问。
- 登录后可见/付费内容:高风险源,需避免未经授权爬取,防止触犯 CFAA、合同和版权法规;需通过 API 或合同授权获取。
- 协议与技术规则:
- 避免注册账号后违反条款进行爬取(尤其是已点击同意禁止爬取条款);
- 不绕过验证码、IP 限制等明显反爬技术措施,否则可能被视为恶意规避。
### 2. 爬取中:个人数据与敏感数据控制
- 对含个人信息的字段(姓名、位置、社交关系等)进行分类标记,评估后续用途(模型训练、画像、推荐)与隐私法匹配度。
- 对儿童数据、医疗数据、位置轨迹等特殊类别数据,采用更严格的获取依据(同意、合同、合法利益评估等),必要时排除出训练集或仅限受控环境使用。
### 3. 标注环节:处理者合规与技术防护
- 与标注供应商签 DPA(数据处理协议),明确其作为处理者的身份与义务,并要求其符合 GDPR/CCPA 等标准,具备 SOC 2 或等效安全认证。
- 对高敏感数据实行脱敏标注:如仅标注“物体边界”“行为类别”,而不暴露身份信息;或使用合成数据替代真实敏感样本。
- 通过访问控制、日志审计、防偷拍屏幕、远程桌面限制等手段降低人工泄露风险。
### 4. 训练前:版权与来源审计(“干净数据”校验)
- 建立数据来源登记和审批机制,要求每个训练数据集标注“获取渠道”“法律依据”“是否包含未授权爬取内容/付费内容”。
- 对已知来源可疑的数据集(比如社区共享的“抓取全集”“影像大合集”)进行法律审查,必要时通过过滤、重新采样或转向授权替代品降低风险。
### 5. 训练后与产品阶段:透明度与权利救济
- 在隐私声明和产品白皮书中说明训练数据类型和来源类别(不必列出全部 URL,但可描述为“来自公开网页和授权数据库”等),并提供权利人和数据主体的联系与删除/退出机制。
- 为应对可能的版权或隐私投诉,建立“数据删除与模型再训练/降权”的应急流程;对于法院命令或监管要求的数据删除,结合 hiQ 和版权局报告的立场,预留删除已爬取数据、销毁部分模型或参数的技术路径。

