官网产品介绍、服务范围和 FAQ 明明都能正常显示,为什么 ChatGPT、Gemini、Google AI Mode 等 AI 平台却很少引用?
问题可能不在内容写得不够多,而在于:AI 抓取系统根本没有稳定读取到这些内容。
对于使用 React、Vue、Headless CMS,或深度定制 WordPress 的 B2B 出海网站,这类问题尤其常见。
01|人能看到,不代表 AI 能抓到
用户打开网页时,浏览器会自动下载并执行 JavaScript,再调用内容接口,最终呈现完整页面。
但部分 AI 抓取系统可能不会执行全部脚本,也不会长时间等待异步请求完成。最终抓取到的页面,可能只有:
• 页面标题
• 导航和页脚
• 空白内容容器
• JavaScript 文件地址
产品介绍、价格说明、服务范围等核心内容,反而全部缺失。这就是典型的:浏览器显示正常,抓取结果却只剩一个“空壳”。
02|内容为什么会在抓取过程中“消失”?
常见原因主要有以下三类。
① 核心内容没有进入原始 HTML
服务器首次返回的 HTML 中只有页面框架,正文需要执行 JavaScript 后才生成。普通用户可以看到,但不执行脚本的抓取系统无法获取。
② 内容必须完成交互才会出现
部分内容只有在用户滚动页面、点击标签、展开模块或同意 Cookie 后才加载。抓取系统无法触发这些操作时,只能获得不完整页面。
③ CDN、WAF 或 Bot 规则误拦截
自动化请求可能被识别为机器人,从而收到验证码、挑战页面、空白响应,甚至出现 403、429 状态码。
⚠️ 需要注意:HTTP 状态码显示为 200,也不代表正文已经完整返回。
03|GEO 团队应该如何排查?🔍
不要一发现 AI 引用少,就马上增加文章、堆关键词。更有效的方法,是先确认内容究竟在哪个环节消失。
第一步:对比三种页面结果
针对同一个核心 URL,分别检查:
1. 服务器首次返回的原始 HTML
2. 浏览器执行脚本后的 DOM
3. 去掉导航、样式和脚本后的正文文本
如果原始 HTML 没有正文,但渲染后的 DOM 中存在,说明内容主要依赖客户端 JavaScript 生成。如果渲染后的 DOM 有正文,但文本提取结果仍然缺失,则可能是页面结构、隐藏属性或模板噪音造成的。
第二步:测试无交互环境
使用无痕窗口,在不登录、不滚动、不点击、不保留 Cookie 的情况下打开页面,确认产品介绍、服务范围和 FAQ 等核心信息能否自动加载。需要用户主动操作后才出现的内容,很难被稳定抓取。
第三步:检查资源和内容接口
通过浏览器开发者工具检查 JavaScript、CSS、Fetch、XHR 和内容 API,重点关注:
• 4xx、5xx 错误
• 跨域问题和接口超时
• Token、Session 或登录限制
• 关键脚本加载失败
页面框架加载成功,不代表负责返回正文的接口也成功。
第四步:检查 CDN、WAF 和地区规则
使用不同 User-Agent、无 Cookie 环境及不同地区网络访问同一页面,对比状态码、响应体大小、正文数量,以及是否出现验证码或挑战页面。
如果普通浏览器获得完整页面,而自动化请求得到的响应体明显更小,就需要重点检查 Bot 管理和安全规则。
第五步:让核心内容稳定进入 HTML
产品定位、服务范围、适用场景、FAQ、价格说明和关键结论,应尽量进入首次返回的 HTML。
根据网站架构,可以选择:
• 服务端渲染
• 静态页面生成
• 重点页面预渲染
• 为核心产品页提供稳定的静态内容版本
同时,不要把重要结论只放在图片、视频、Canvas 或必须点击的交互模块中。
04|修复后,还要持续监测什么?📊
技术调整完成,并不代表 GEO 工作已经结束。企业至少要持续监测三个层面:
页面响应:状态码、响应时间、重定向次数和接口失败情况。
内容提取:产品定位、服务范围、FAQ 和关键结论是否能够被完整读取。
AI 引用:ChatGPT、Gemini、Google AI Mode、Perplexity 等平台是否开始读取并引用官网核心页面。
技术可访问性只是基础条件。页面还需要有清晰的标题、明确的回答、真实的事实依据和完整的使用场景,才更有机会成为 AI 的参考来源。
当官网在浏览器中显示正常,但抓取工具只能获得页面框架时,继续增加文章不一定能解决问题。更合理的做法,是先选择 5—10 个核心产品页、服务页和 FAQ 页,系统检查服务器响应、原始 HTML、JavaScript、内容接口以及 CDN、WAF 安全策略。

