
AI 系统只能引用它能访问并信任的页面。本地页面要获得 AI 可见性,必须依次通过三道关卡:爬虫可达(排查 Cloudflare 拦截、robots.txt、noindex)、服务端渲染(确保关键内容在 HTML 中)、信息准确(清理遗留旧页面、保持商家数据一致)。Schema 的价值在于消歧义而非排名加分。
越来越多的消费者不再打开传统搜索引擎,而是直接向 ChatGPT、Perplexity 或 Google AI Overviews 提问:「附近哪家牙医诊所评价最好?」「这家餐厅现在还营业吗?」
但一个残酷的事实是:如果 AI 系统根本抓取不到你的页面,再精美的服务文案、再完整的 FAQ 都毫无意义。
Whitespark 创始人 Darren Shaw 在 Search Engine Journal 举办的一场 SEJ Live 直播中直言:「如果 AI 连你的网站都访问不了,你就不可能出现在 AI 的回答里。」这场对谈还邀请了 Duda 平台与产品战略总监 Russ Jeffery,两人围绕本地页面在 AI 搜索时代的可见性,拆解了从技术可达性到内容结构化的完整链路。
本文不复述直播流水账,而是从「AI 信任链」的视角重新梳理:一个本地页面要同时通过可达性、准确性、可解析性三道关卡,才可能被 AI 引用。
Jeffery 建议从最基础的控制项查起:robots.txt、noindex 指令、安全设置、站点地图,以及内容的渲染方式。他坦承自己也曾不小心把 noindex 标签留在线上环境,事后修复所花的时间远超一开始就做对。
值得注意的是,robots.txt 对合规爬虫而言更像一份「指导性政策」,而非硬性屏障。Jeffery 形容它是整条链路中「比较薄弱的一环」。真正私密的内容,应该在服务器或应用层面做限制,而不是指望 robots.txt 挡住。
Shaw 特别提醒,Cloudflare 经常默认拦截 AI 爬虫,而许多企业主根本不知道自己的开发者或主机商开启了这项设置。他遇到过一家 Shopify 站点,AI 爬虫被全面阻断,排查后发现元凶正是 Cloudflare。他的建议是:先确认是否启用了 Cloudflare,再逐项检查其爬虫规则。
两位嘉宾都认为,「默认拦截所有爬虫」这套策略本是给出版商设计的,却被无差别地应用到了所有网站。对于《时代》周刊或《纽约时报》这类内容方,拦截爬虫以索取付费授权是合理选择;但街边的咖啡馆、律师事务所、牙科诊所,没有任何理由拒绝 AI 爬虫。Jeffery 直接称其为「一个糟糕的默认值」。
核心原则:优化工作无法拯救一个 AI 系统访问不到的页面。可达性是所有本地 AI 可见性的前提。
Jeffery 观察到一个趋势:过去几年,JavaScript 渲染在 AI 场景下「不进反退」。Google 依然能较好地执行 JS 并索引内容,但新兴的 AI 系统大多不具备这个能力。
「ChatGPT 没有自己的索引,它们不会花时间去抓取并保存页面,」Jeffery 解释道。
他的建议很明确:通过服务端渲染(SSR)把重要内容直接放进 HTML 响应中,并实际验证爬虫收到了什么,而不是假设框架已经帮你处理好了。WordPress 和 Next.js 等成熟平台开箱即用或提供 SSR 选项。
Shaw 指出了一个新兴隐患:越来越多小企业主用 Claude Code 之类的工具「凭感觉」生成网站,产出的往往是重度依赖客户端 JavaScript 的 React 站点。
「如果你只是 vibe coding 一个网站,它们通常表现很糟糕,我建议大家重视这个问题。」
不过他也安抚了大多数企业主:使用 Duda、WordPress 或 Wix 建站的人,页面本身已经输出渲染后的 HTML,无需过度焦虑。真正需要做的是验证爬虫实际接收到的内容,并排查那些只有 JS 执行后才出现的关键文案,比如由组件动态加载的评论轮播。
至于 Cloudflare 近期力推的 markdown 版本页面,Jeffery 认为「目前还不是必须的」,他尚未发现任何 AI 搜索引擎依赖页面的 markdown 版本。可访问的服务端渲染 HTML 仍是第一优先级。
爬虫能进来只是第一步,信息正确才有价值。
在核查 AI Overviews 时,一个常见问题浮出水面:网站改版时开发者克隆了页面,留下了带 -old、-new、/home、v2 等后缀的孤立或重复 URL,却没有对原始页面做 de-index 处理。这些页面可能还挂着过时的电话号码或地址。
用户几乎不会通过导航访问它们,但爬虫会。Shaw 的评论一针见血:「AI 会把它抓走。」
常规的技术审计如果只检查死链,就会漏掉这些「僵尸页面」。无论使用什么平台,建议都做一次基础爬取审计:
这是整场对谈中唯一出现分歧的话题,而分歧本身恰恰最有价值。
Loren Baker(本文作者)表示自己是 Schema 的坚定支持者。他会把 Google Business Profile 的每一个数据点都映射到网站 Schema 中,而他服务的站点在本地包和传统自然结果中都获得了更好的可见性。但他并不认为 Schema 本身是排名因素,而是一种验证工具——帮助搜索引擎确认页面信息与商家档案一致。
Shaw 则持怀疑态度:「我从未见过任何值得注意的研究表明,做了 Schema 就能提升传统排名或 AI 可见性。」他引用了 Jake Hundley 的详细测试,结论是「什么都没发现」。
Shaw 认可 Schema 在消歧义方面的作用。例如,表格中的产品数据一旦用结构化数据表达,含义就变得明确无歧义,爬虫解析起来也更容易。
换句话说,Schema 的价值不在于「加分」,而在于「减少误读」。在 AI 系统需要从页面中提取事实来生成回答的场景下,这种减少误读的能力可能比传统排名信号更重要。
在海外市场讨论 AI 爬虫可达性与 Schema 验证的同时,国内 AI 搜索生态走出了一条不同路径。
百度文心一言、阿里通义千问、字节豆包、月之暗面 Kimi、智谱 GLM、讯飞星火等产品,在本地信息整合上更依赖自有生态内的数据源——百度地图、高德、大众点评、抖音 POI 等。这意味着国内商家的本地 AI 可见性,很大程度上取决于其在各大平台上的商家档案是否完整、准确、及时更新,而非单纯依赖官网的 Schema 标记。
但底层逻辑是相通的:AI 系统只能引用它能访问且信任的信息。 无论是海外的 ChatGPT 抓取官网,还是国内的豆包调用抖音 POI 数据,信息源的可达性与准确性始终是第一道门槛。对于同时经营海外业务的中国出海企业,本文提到的 Cloudflare 拦截、JS 渲染、僵尸页面三大陷阱尤其值得警惕。
综合 Shaw 与 Jeffery 的建议,可以按以下顺序排查:
-old、-new、v2 等后缀的可索引 URL 并处理正如 Shaw 所强调的,对绝大多数企业主而言,这些工作并不复杂。真正的风险在于「不知道自己的网站被屏蔽了」或「不知道旧页面还在被 AI 抓取」。定期审计,比事后补救划算得多。
最常见的原因是 Cloudflare 默认拦截 AI 爬虫,而网站所有者并不知情。其次是 robots.txt 配置错误、残留的 noindex 标签,以及内容依赖客户端 JavaScript 渲染导致爬虫无法读取。
不能。robots.txt 对合规爬虫只是一份「指导性政策」,并非硬性屏障。真正需要保护的内容应在服务器或应用层面做访问限制。
如果你使用 WordPress、Duda、Wix 等成熟平台,页面本身已输出渲染后的 HTML,通常无需额外处理。但如果你用 AI 工具生成了重度依赖 JavaScript 的站点,就需要验证爬虫实际能看到什么,必要时改为服务端渲染。
业界尚无定论。有观点认为 Schema 是有效的验证与消歧义工具,能帮助 AI 准确理解页面信息;也有专家指出缺乏有力研究证明 Schema 直接提升排名或 AI 可见性。务实做法是将其用于数据一致性校验,而非期待排名加分。
这些页面可能仍包含过时的电话、地址等信息,且未被 de-index。用户不会访问它们,但 AI 爬虫会抓取,导致 AI 回答中引用错误信息。建议定期爬取全站,排查带 -old、-new、v2 等后缀的可索引 URL。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

AI 搜索优化并非全新学科。本文从爬虫准入、内容匹配、事实可抽取、信息一致性与效果监测五个环节,拆解让页面被 AI 引用的可落地方法,并说明 AI 代理能代劳哪些工作。

Bing 每月处理数十亿次查询,其索引结果还输送到 Copilot、ChatGPT 等 AI 产品。本文拆解 Bing Webmaster Tools 的功能矩阵与配置路径,帮助站长在 AI 搜索时代提升内容可见性。

传统排名之外,品牌在 ChatGPT、Perplexity 等 AI 答案中是否被点名,正成为新的可见度战场。本文拆解一套可独立执行的 AI 可见度审计流程,并补充国内 AI 搜索生态的差异视角。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。