大数跨境

The Batch: 962 | Cloudflare 的网络爬虫风波

The Batch: 962 | Cloudflare 的网络爬虫风波 DeeplearningAl
2026-07-30
1

Cloudflare 推出 AI 流量精细化管控与变现新机制

核心摘要:Cloudflare 即将上线 AI 流量分级控制功能,允许网站发布者区分搜索索引爬虫与 AI 训练/智能体爬虫的访问权限。同时,其推出的变现工具将支持向特定访问者(含机器人)收取数据访问费用。

最新动态:精细化管控与数据变现

全球领先的 CDN 服务商 Cloudflare(覆盖近 20% 互联网流量)正式推出 AI 流量控制新功能。该功能默认阻止用于模型训练和智能体活动的机器人,但保留对搜索引擎爬虫的开放。此外,Cloudflare 宣布推出数据变现工具,允许客户针对网页、数据集、API 或 Model Context Protocol(MCP)资源的访问向指定对象(包括人类用户和机器人)收费。

运作机制:分类管控与 BotBase 数据库

访问权限的灵活切换

自 9 月 15 日起,Cloudflare 客户可根据用途独立配置爬虫权限:

  • 搜索机器人:专为搜索引擎建立内容索引,通常被视为带来流量的友好访客。
  • 智能体机器人(Agent bots):代表用户执行任务(如获取数据、完成购买)。
  • 训练机器人:收集数据用于 AI 模型训练。

客户可选择“完全阻止”、“仅阻止含广告页面”或“允许访问”。默认策略下,展示广告的页面将拦截训练及智能体机器人(包括谷歌、苹果、必应等兼具多用途的爬虫),但仍放行纯搜索爬虫。若爬虫身兼多职,系统将适用最严格的限制规则。

BotBase 与身份验证

Cloudflare 同步推出公开数据库 BotBase,基于行为对已知机器人进行分类追踪。带有"Verified(已验证)”标签的机器人意味着其运营方已通过身份核验,承诺遵守 robots.txt 指令且不绕过限制。这一机制支持更细粒度的管控,例如单独屏蔽某家公司的训练机器人,而允许其他公司的同类机器人访问。

按次付费的变现系统

新的变现系统允许网站发布者按请求次数向 AI 智能体收费。当智能体请求受保护资源时,Cloudflare 将在网络层先行验证付款,确认无误后才转发请求。目前该工具处于等待名单申请阶段,尚未正式发布。

新闻背景:AI 流量激增引发的博弈

数据显示,自动化系统产生的 HTTP 请求占比已超 57.5%,超越人类用户。由于搜索流量价值稀释,加之担忧内容被用于模型训练或广告被智能体绕过,部分发布者已开始退出 Google Search。Cloudflare 的新框架旨在平衡搜索红利与数据主权:奖励将搜索与训练分离的公司(如 OpenAI),而对未做区分的科技巨头(如谷歌、苹果、微软)形成制约。

重要影响:数据获取成本与技术门槛

质量网络数据仍是 AI 发展的基石,但获取途径正日益受限。这种摩擦不仅带来技术与经济成本,更可能加剧行业分化:资源匮乏的小型 AI 开发者将面临更高的数据获取门槛,难以与大公司竞争,后者往往已通过自有数据集或合作协议锁定关键知识。

行业观察:公平定义权的争夺

Cloudflare 试图扮演“收费关卡”角色,重构 AI 公司与内容发布者的利益分配。然而,这与多数 AI 公司坚持的“公开网络数据训练属于合理使用”原则相悖。未来局势取决于 Cloudflare 的市场影响力能否支撑其收费机制,以及最终是平台方的“公平”定义,还是 AI 行业的共识将占据主导。

【声明】内容源于网络
0
0
DeeplearningAl
吴恩达老师的人工智能教育传播平台.
内容 1319
粉丝 0
DeeplearningAl 吴恩达老师的人工智能教育传播平台.
总阅读19.6k
粉丝0
内容1.3k