本文基于 Cloudflare 官方博客及开发文档整理,建议结合业务实际调整策略。
9 月 15 日将至,Cloudflare 将调整默认安全设置。对于外贸独立站而言,这一变更直接关系到网站在 Google 及 AI 搜索引擎中的可见性。核心结论明确:AI 爬虫是流量与询盘的来源,而非单纯的威胁;盲目“全封”将导致错失商机。正确策略应是厘清规则,主动优化抓取权限。
01 新规核心解读
Cloudflare 于 7 月 1 日宣布将 AI 爬虫细分为三类:
- Search(搜索类):用于建立索引及供 AI 回答引用的爬虫。
- Agent(代理类):响应用户实时提问并访问网站的 AI 代理。
- Training(训练类):抓取内容用于模型训练的爬虫。
9 月 15 日起的默认变更:新加入域名、新开站点及未调整过设置的免费账号,将在含广告页面上默认阻止"Training"和"Agent"爬虫,但保留"Search"权限。
受影响群体:大量使用 Cloudflare 免费版 CDN 的外贸网站受冲击最大。若默认阻挡爬虫,将导致 GEO(生成式引擎优化)失效,产品页与 FAQ 无法被 AI 引用,直接丧失潜在客源。
关键例外与操作:现有付费客户保留原配置;所有客户均可在 9 月 15 日前手动退出(opt out)新默认值。
混合用途爬虫规则:需特别注意,若阻止"Training"类别,按新规则可能误伤 Googlebot、Bingbot 等兼具索引与 AI 喂养功能的混合型爬虫。
此外,Cloudflare 推出"Pay Per Use"模式(内容被引用生成答案时付费)及"Bot Preference Sync"功能(自动同步策略至 robots.txt),以简化管理流程。
02 外贸站策略:从屏蔽转向欢迎
面对“默认阻止”,外贸站切勿采取“一刀切”的全屏蔽策略。爬虫代表搜索引擎与 AI 对网站的认知,阻挡它们等同于切断自然流量与 AI 推荐流量。
错误封锁非白名单爬虫可能导致 Googlebot 或 Bingbot 被误伤,进而引发收录下降、排名下滑及询盘减少的连锁反应。数月积累的内容优化成果可能因单一防火墙规则付诸东流。
核心原则:必须放行搜索引擎爬虫,尽可能开放 AI 爬虫权限,仅针对模型训练及恶意采集行为实施限制。开放度越高,曝光机会越大,转化询盘越多。
03 四类爬虫的差异化应对
第一类:搜索引擎爬虫(必须放行)
包括 Googlebot、Bingbot、AdsBot-Google 等。此类爬虫决定网站的收录与排名,是流量基石,务必确保畅通无阻。
第二类:AI 搜索与答案引擎爬虫(重点引入)
服务于 AI 搜索结果及采购建议引用。这是未来外贸获客的增长点。应允许其自由访问公开获客页面,仅对敏感资料做必要限制。
第三类:AI Agent 实时访问(积极欢迎)
代表真实买家进行供应商对比、读取产品及认证信息。此类访问即潜在商机,除非出现高频异常抓取,否则不应拦截。
第四类:训练型与恶意采集爬虫(严格防范)
旨在抓取价格、技术参数等数据用于模型训练或竞品情报。此类行为不产生直接客户且增加服务器负载,应实施限速或拦截策略。
04 执行建议:内容分层与技术匹配
(后续内容略)

