【温馨提示】
自9月15日起,Cloudflare启用全新AI流量管理机制,新域名默认规则发生重大变化。“一刀切”封堵AI爬虫的时代已结束,配置不当可能导致内容被AI无偿抓取训练,或直接切断SEO流量来源。
政策解析:从“缺省开放”到“细粒度管控”
过去,网络运作多遵循“缺省开放(Default Allow)”原则,除非管理员在robots.txt或防火墙中主动拦截。Cloudflare新政策重新定义了边缘节点(Edge)的过滤逻辑,不再是非黑即白的全开放或全拦截,而是实施细粒度的分级管控。
需特别注意:阻挡AI训练爬虫不等于拦截所有机器人。若系统无法准确区分爬虫类型,极易引发“自伤式防护”,直接切断搜索流量。
Cloudflare AI新政四大关键规则
1. 改变缺省逻辑:由开放转为分区防御
含有广告及原创内容的页面,默认将阻挡未经授权的AI训练爬虫与AI Agent。若企业未手动调整默认策略,内容将自动拒绝大部分大模型的训练抓取。
2. 强制拆分“混合型爬虫(Hybrid Crawlers)”
以往部分AI厂商使用同一机器人既做搜索索引又抓取内容训练模型。新规要求AI企业必须明确区分爬虫身份。若爬虫未提供独立的拒绝训练选项,边缘节点将直接启动防御拦截。
3. 三维度爬虫分类法(Taxonomy)
Cloudflare将网络机器人划分为三大情境,以便管理者精准决策:
|
爬虫类别 |
运作目的 |
代表性爬虫 |
建议的企业对策 |
|
Search-搜索 |
检索并索引页面,引导传统搜索流量 |
|
必须放行:维护传统SEO转介流量的生命线 |
|
Agent-代理 |
代表用户即时检索最新信息并给出答案。 |
OAI-SearchBot、PerplexityBot |
策略性放行:品牌在 GEO(AI 搜索)被引用的核心来源 |
|
Training-训练 |
抓取内容并永久吸收至大模型参数中。 |
GPTBot、CCBot |
评估封锁或授权:无直接流量回报,属著作权资产管理范畴 |
4. HTTP 402按次付费(Pay Per Crawl)现状
Cloudflare的AI Crawl Control支持将封锁回应设置为“403 Forbidden”或“402 Payment Required”。需注意:
402状态码仅向爬虫发出“此内容需付费授权”的信号,不代表已收到款项。
该机制仍处于Private Beta阶段,需爬虫方与网站建立身份验证与支付流程。
若企业暂无明确的内容授权商业模式,优先做好“爬虫分流与防护”比急于设置402更具实务价值。
警惕三大风险:乱改设置致SEO与AI流量双损
该政策旨在保护企业数字资产,但若IT部门单方面设置防火墙而未与营销部门对齐,极易引发严重后果。
风险一:防御过头引发“自伤式断流”
部分管理员为省事,直接在Cloudflare后台一键勾选“Block AIBots”。由于Googlebot与Bingbot运作机制复杂,过于激进的CDN层级过滤规则可能将其挡在门外。因请求在边缘节点即被拦截,不会到达主服务器,导致内部Server Logs显示正常,但Google Search Console却出现抓取率归零、索引被清除的情况。
风险二:一刀切阻挡导致品牌在AI时代“被动隐形”
生成式引擎优化(GEO)的核心是让品牌内容被ChatGPT、Perplexity等AI工具引用。若因恐惧内容被抓而一并阻挡“Agent”与“Search”类爬虫,AI将无法检索到网站信息,导致品牌在生成式AI解答中失联,丧失潜在客户。
风险三:死守旧SEO逻辑难以应对“零点击搜索”
AI搜索“直接给出答案的模式”已导致传统SEO点击率下滑。若企业仍死守以PV(页面浏览量)为核心的传统SEO逻辑,发展路径将越走越窄。Cloudflare的按次付费机制暗示行业转型信号:内容可走向授权引用与直接变现模式。
企业自救方案:跨部门协同与三维防护矩阵
针对保护原创内容与避免误伤流量的两难困境,建议通过以下方案落地Cloudflare爬虫精细化配置,打通IT资安与营销部门目标。
以往Cloudflare控制台多由IT部门主导,侧重降低服务器负担与安全风险;营销部门则关注曝光与流量。目标错位是误杀爬虫的根源。企业应召开跨部门会议,共同制定“爬虫防蚊白名单(Crawler Matrix)”,避免负面影响。
企业应根据商业模式,对Cloudflare后台爬虫控制进行细粒度配置:
第一层(SEO防线):绝对放行
将“Googlebot”、“Bingbot”及相关验证工具纳入最高优先级白名单,确保HTTP状态码保持为200。
第二层(GEO阵地):条件式放行
允许“OAI-SearchBot”、“PerplexityBot”等具备即时引流能力的Agent爬虫访问,确保品牌内容能被AI生成答案时引用。
第三层(资产保护):严格封锁或导入Paywall
对纯粹用于大模型训练的爬虫(如GPTBot)实施封锁;对于拥有独家研究报告或高价值数据库的网站,可开启Cloudflare按次付费(HTTP 402)授权机制。
既然选择放行GEO爬虫,就要让AI能以最低的运算成本读懂内容:
深耕结构化数据(Schema Markup):全面导入JSON-LD格式,严格标注FAQ、How To、Product与Organization标签。
模块化实体知识(Entity-Based Writing):在文章中使用结构清晰的FAQ段落、比较表格与精确数据,提升内容被AI选为“标准答案来源”的权重。
30天落地行动清单
为帮助团队迅速落实改革,将转换工程简化为三个阶段:
1. 登录Cloudflare管理控制台,检查Security中的Bots与 AI Scrapers设置。
2. 确认是否开启了旧版一键阻挡规则,并比对Google Search Console的抓取统计图表,排除任何爬虫误杀可能。
3. 测试网站内核页面的HTTP回应头,确保搜索引擎能顺利取得 “200 OK”状态。
1. 根据前述的「三维度矩阵」,在Cloudflare自订防火墙规则(WAF Rules)中创建分层过滤机制。
2. 针对Agent类别爬虫打开放行,并阻挡未经授权的Training爬虫。
3. 监控资安事件日志(Security Events),观察是否成功拦截异常高频抓取,同时维持正常商业爬虫的通行。
1. 对网站重点产品页与高流量博客进行Schema结构化数据升级。
2. 布局第一方流量阵地(如电子报、会员专属内容、Line/Discord社群),降低对单一搜索管道的依赖度。
3. 评估网站高价值内容的变现潜力,针对独家数据或深度报告尝试设置API授权或付费墙。
Cloudflare的AI爬虫政策更新为企业提供了更细致的控制权。企业不应采用“全盘放行”或“一律封锁”的极端做法,而应依据内容价值与商业目标进行分层管理。
若不确定当前Cloudflare爬虫设置是否存在误杀搜索引擎爬虫的风险,建议联系专业团队排查现有规则隐患,获取可直接导入后台的爬虫白名单模板。

