
Cloudflare 新增 Disallow AI Training 设置,允许网站拒绝 AI 训练抓取,同时保留 Googlebot、Applebot、Bingbot 的搜索抓取权限。只有选择 Block 才会完全切断这三家爬虫的访问。Bing 目前尚未支持 robots.txt 层面的禁止训练信号。
网站运营者长期面临一个两难:既要允许搜索引擎抓取以维持可见性,又要阻止 AI 公司拿内容去训练模型。Cloudflare 此前给出的方案过于粗暴——一旦选择阻止 AI 训练,Googlebot、Applebot、Bingbot 也会被一并挡在门外,因为这三个爬虫同时服务于搜索和训练两种用途。
现在,Cloudflare 用一套更细分的控制体系取代了旧逻辑。核心变化是新增 Disallow AI Training(禁止 AI 训练) 选项,它把「拒绝训练」和「拒绝搜索抓取」拆成了两件事。对于同时承担搜索与训练任务的混合型爬虫,只要 Cloudflare 认定其运营方属于「Accountable(可问责)」类别,搜索抓取仍被允许,训练抓取则被 robots.txt 中的偏好信号拒绝。
这一调整直接推翻了 2025 年 7 月公布的方案。当时 Cloudflare 计划从 9 月 15 日起,让所有阻止 AI 训练的站点同时屏蔽上述三家爬虫。如今的逻辑是:只有主动选择 Block(完全阻止),才会真正切断 Googlebot、Applebot 和 Bingbot 的访问,包括搜索用途。
Cloudflare 把爬虫管理拆成三个并列开关:Search(搜索)、Agent(智能体)、Training(训练)。Disallow AI Training 属于 Training 控制下的新档位。
启用后,被标记为 Accountable 的混合型爬虫仍可抓取页面用于搜索;其他纯训练爬虫则被挡下。Block 和 Block on pages with ads(在含广告页面阻止)这两个选项现在也覆盖混合型爬虫——此前 Cloudflare 刻意将它们排除在外,原因正是担心误伤搜索可见性。
对多数现有客户而言,不需要手动改动。系统会自动迁移:原先在 Training 中选择 Block 或 Block on pages with ads 的站点,会转为 Disallow AI Training;使用旧版 Block AI Bots 开关的站点,则获得「Allow for Search + Disallow AI Training + Agent 阻止含广告页面」的组合。Block AI Bots 和 Managed Robots.txt 两项功能即将弃用。若想彻底赶走混合型爬虫,唯一途径是选择 Block。新注册且以广告变现的域名,Training 预设直接就是 Disallow AI Training。
混合型爬虫能否在 Disallow AI Training 下继续搜索抓取,取决于 Cloudflare 是否将其运营方认定为 Accountable。这一标签源于 7 月启动的爬虫运营方谈判,需要满足或承诺满足四项条件:
Apple、Google、Microsoft 被认定符合要求,各自已有部分功能上线,其余功能附有截止日期承诺。Amazon、Anthropic、Meta、OpenAI 的相关爬虫也被列为 Accountable,原因是这些公司分别运行搜索爬虫和训练爬虫——它们的训练爬虫在 Disallow AI Training 下仍会被阻止。
Google:Disallow AI Training 通过针对 Google-Extended 的 Disallow 规则生效。根据 Google 爬虫文档,Google-Extended 不影响站点在 Google 搜索中的收录或排名。是否出现在 AI Overviews、AI Mode 和 Discover 的生成式 AI 功能中,由 Search Console 的独立设置控制,且该设置不影响 AI 训练。
Apple:规则作用于 Applebot-Extended。Apple 官方文档说明 Applebot-Extended 不抓取页面,也不参与搜索排名。若想阻止内容出现在 Siri 和搜索的 AI 生成答案中,需要使用 nosnippet 元标签。
Bing:选择 Disallow AI Training 目前不会向 Bing 发送 robots.txt 层面的禁止训练偏好,因为 Microsoft 尚未支持该信号。Bing 当前的退出方式是 NOARCHIVE 元标签。根据 Bing 文档,标记 NOARCHIVE 的内容不会被用于训练 Microsoft 的生成式 AI 模型,也不会在 Chat 和 Copilot 中被链接。
国内大模型厂商在内容抓取与训练边界上的做法,与 Cloudflare 这套控制体系有相似逻辑,但落地路径不同。百度通过搜索资源平台的「AI 创作」相关协议,允许站点声明内容是否可用于文心一言的训练与生成;阿里通义千问、字节豆包、月之暗面 Kimi 等则主要依赖自有爬虫的 robots.txt 协议与内容合作协议。DeepSeek 和智谱 GLM 在公开文档中更强调通过 API 服务条款约束训练数据来源,而非依赖爬虫层面的实时退出信号。
差异在于:海外市场由 Cloudflare 这类基础设施方居中协调,把退出机制标准化为 robots.txt 扩展;国内则更多由平台方与内容方一对一协商,缺少统一的「Accountable」认证框架。对于同时面向国内和海外用户的站点,这意味着需要维护两套内容授权策略。
Cloudflare 透露了几项时间表:Google 计划在未来数周内为 Google-Extended 推出 URL 级透明度工具;Apple 的同类工具预计明年上线;Microsoft 对 robots.txt 禁止训练偏好的支持目标定在 2027 年初。Cloudflare 自身的下一步重点是 AI 摘要控制——目标是在明年初实现通过单一设置调节内容被纳入摘要的数量,而不是逐家运营方单独配置。
Disallow AI Training 只阻止 AI 训练抓取,混合型爬虫(如 Googlebot)仍可抓取用于搜索;Block 则完全切断 Googlebot、Applebot、Bingbot 的访问,包括搜索用途。
不会。该设置通过 Google-Extended 的 Disallow 规则生效,Google 官方文档明确说明 Google-Extended 不影响搜索收录和排名。
尚不支持。Microsoft 计划在 2027 年初添加支持。当前 Bing 的退出方式是 NOARCHIVE 元标签,标记后内容不用于训练,也不会在 Copilot 中被链接。
多数不需要。原有的 Block 或 Block on pages with ads 选择会自动迁移到 Disallow AI Training,旧版 Block AI Bots 开关也会被替换。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

同一爬取与引荐比率被反复引用,却出现70,900比1到2,237比1的巨大差异。问题不在方法,而在分母中隐藏的四层变量。

Common Crawl 分析超 50 万 llms.txt 文件,发现 68% 来自模板,22% 无链接,部分网站误将其当作 robots.txt 使用。文章解析数据背后的认知鸿沟,并给出正确应对 AI 爬虫的实践建议。

乌克兰将战场无人机数据商业化,用于AI训练,吸引国防与商业公司,但引发治理与伦理问题。
獲取最新的 SEO 與 GEO 技術資訊。
我們尊重您的隱私,隨時可以取消訂閱。