
Cloudflare 于2026年9月推出 Disallow AI Training 设置,允许站长通过 robots.txt 屏蔽 Google-Extended 和 Applebot-Extended,从而拒绝AI训练抓取,同时保留 Googlebot、Bingbot、Applebot 的搜索索引权限。早期数据显示训练爬虫拒绝率上升,而AI搜索爬虫拒绝率下降约13个百分点。
2026年9月中旬,Cloudflare上线了一项名为「Disallow AI Training」的开关,允许站长在不误伤搜索爬虫的前提下,拒绝AI训练用途的内容抓取。这看似只是一次产品更新,实则标志着内容生态中「索引权」与「训练权」的正式解绑。对于关注 Semrush Blog · GEO / AI Visibility 的从业者而言,这意味着AI可见性的管理颗粒度正在从「一刀切」走向「分层治理」。
过去,Googlebot、Bingbot、Applebot 同时承担搜索索引与AI训练数据采集的双重角色。站长一旦屏蔽其中任何一个,搜索结果中的收录也会一并消失——这种捆绑关系让许多内容方投鼠忌器。
Cloudflare 在9月15日推出的设置改变了这一局面。开启后,Bot Preference Sync 会自动向 robots.txt 写入两条规则:一条针对 Google-Extended,一条针对 Applebot-Extended。这两个 token 仅用于AI训练,不影响常规搜索抓取。Amazon、Anthropic、Meta、OpenAI 早已采用独立训练爬虫,Cloudflare 对其训练爬虫直接拦截,而 ChatGPT 搜索等工具仍可正常读取页面。
Googlebot、Bingbot、Applebot 之所以被「豁免」,是因为 Cloudflare 将其运营商标记为「Accountable」(可问责),前提是满足四项条件:提供 robots.txt 层面的训练退出机制、提供AI摘要退出机制、提供URL级别的训练可见性报告、承诺退出训练不影响搜索排名。
从公开信息看,Google 的URL级报告将在数周内上线,Apple 计划于次年推出,Microsoft 进度最慢——Bingbot 要到2027年初才会读取该 robots.txt 规则。这意味着现阶段若想阻止 Bing 将页面用于训练,只能依赖 NOARCHIVE meta 标签。
监测平台 SeenSure 在9月14日与16日两次测试了1,046个网站对八种AI爬虫的响应。其中746个站点使用 Cloudflare,变更后拒绝训练爬虫的比例明显上升:GPTBot 拒绝率从18.9%升至22.0%,ClaudeBot 从19.9%升至22.8%。
更值得玩味的是AI搜索爬虫的变化。Cloudflare 的公告并未提及AI搜索爬虫或智能体的策略调整,但拒绝率却各下降了约13个百分点。以 OAI-SearchBot 为例,变更前有16.9%的 Cloudflare 站点拒绝它,变更后骤降至3.0%。而未使用 Cloudflare 的300个站点则保持平稳。SEO 顾问 Aleyda Solis 在社交平台上分享该发现时指出:「搜索类别的变化幅度最大。」
如果这一趋势延续,ChatGPT 搜索和 Perplexity 将能读取大量此前被拒绝的 Cloudflare 托管页面。
需要厘清的是,该设置只决定内容能否用于训练模型,并不决定你是否出现在AI生成的答案中。站长实际上面对三个独立决策:搜索索引、AI训练、AI答案。Cloudflare 目前只覆盖训练环节,AI摘要的控制功能预计次年推出。
退出训练并非对所有站点都是最优解。对于不依赖广告的网站,Cloudflare 推荐的默认值仍是允许训练。希望被AI工具「认识」并主动提及的品牌,留在训练数据中可能带来隐性收益——尽管尚无AI公司量化过这种影响。对于靠内容广告变现的发布方,Cloudflare 则建议开启 Disallow AI Training。
还需注意,robots.txt 规则本质是「请求」而非强制,爬虫可以选择忽略。Cloudflare 能检测并拦截违规爬虫,但对 Google、Apple、Microsoft 三家,它依赖的是对方对「Accountable」标准的承诺。Cloudflare 表示将在 Cloudflare Radar 上公开追踪进展。
海外市场围绕 robots.txt 扩展 token 与「可问责」标准展开博弈,国内平台则走出了另一条路径。百度搜索资源平台早已支持通过 robots.txt 屏蔽特定爬虫,但AI训练与搜索索引的分离程度因厂商而异。字节跳动的豆包、月之暗面的 Kimi、深度求索的 DeepSeek 等产品在数据采集策略上各有侧重,多数尚未提供类似 Google-Extended 的独立训练退出 token。
阿里通义千问与智谱 GLM 在企业级内容合作中更倾向于通过授权协议而非爬虫协议来界定训练数据边界。这种差异意味着,面向国内市场的 GEO 策略不能简单照搬 Cloudflare 的配置逻辑,而需结合各平台的内容合作政策单独评估。
Semrush Site Audit 的「Blocked from AI Search」检查会读取 robots.txt 并列出哪些AI爬虫被哪些页面屏蔽。Google-Extended 在该列表中,因此开启 Disallow AI Training 后它会显示为被屏蔽状态。Googlebot、OAI-SearchBot 等搜索爬虫则不应出现在屏蔽列表中。
需要注意的是,Site Audit 仅读取 robots.txt,无法检测在 Cloudflare 防火墙层面设置的拦截。服务器日志可以,因此建议核查目标搜索爬虫是否仍返回200状态码。
AI Visibility Toolkit 则用于验证上述调整是否影响你在AI答案中的出现频率。它跨 ChatGPT、Google AI Mode、AI Overviews 和 Gemini 追踪品牌与页面表现,Visibility Overview 中的 Cited Pages 标签会列出哪些URL被引用、被多少提示词引用。建议在修改设置前记录基线数据,数周后再做对比。
更多关于AI可见性监测的方法论,可参考 Semrush 官方博客 以及 Google 搜索中心关于 robots.txt 的文档。
不会。该设置仅向 robots.txt 写入针对 Google-Extended 和 Applebot-Extended 的屏蔽规则,这两个 token 专用于AI训练,Googlebot 等搜索爬虫仍可正常抓取和索引页面。
通常会。OpenAI 的 OAI-SearchBot 与训练爬虫 GPTBot 是分开的。早期数据显示,Cloudflare 站点对 OAI-SearchBot 的拒绝率在变更后从16.9%降至3.0%,意味着更多页面可被ChatGPT搜索读取。
Microsoft 的进度落后于 Google 和 Apple。Bingbot 要到2027年初才会读取 robots.txt 中的训练退出规则,在此之前,阻止 Bing 将页面用于训练的唯一方法是添加 NOARCHIVE meta 标签。
不一定。Cloudflare 对非广告类站点的推荐默认值是允许训练。希望被AI工具识别并推荐的品牌,留在训练数据中可能带来可见性收益,尽管目前缺乏量化证据。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

AI代理正在重塑搜索生态。本文深度解析AI爬虫与传统搜索引擎的差异,提供从技术访问、内容架构到可信度构建的完整优化指南,并给出监测AI可见度的实用方法,帮助你的网站在AI答案市场中保持竞争力。

Semrush MCP 让 Claude 与 ChatGPT 可直接调用 SEO 数据。本文按关键词策略、竞争情报、内容优化与诊断四条工作流,整理 16 组可复制的提示词,并说明配置步骤与国内 AI 助手的替代路径。

把提示词丢给 AI 做 SEO,为什么第二次就失灵?本文拆解 Agentic SEO 的项目、技能、MCP、提示词四层架构,说明它与自动化和 AI 辅助的本质区别,并给出八条可落地工作流及国内对应方案。
최신 SEO·GEO 정보를 받아보세요.
개인정보를 존중합니다. 언제든 구독을 취소할 수 있습니다.