Bingdada 技术博客Bingdada 技术博客
首页博客SEOGEOAI工具关于
登录注册
Logo

Bingdada 技术博客

专注于SEO搜索引擎优化和GEO生成式引擎优化以及未来人工智能发展趋势的技术博客

快速链接

  • 首页
  • 博客文章
  • 关于我们

联系方式

  • 398848662@qq.com

订阅我们的 Newsletter,获取最新的 SEO 和 GEO 技术资讯。

© 2024 Bingdada 技术博客. All rights reserved.

首页博客SEO基础Cloudflare AI 机器人拦截功能或误伤 Googlebot 索引,站长需警惕
Cloudflare AI 机器人拦截功能或误伤 Googlebot 索引,站长需警惕
SEO基础

Cloudflare AI 机器人拦截功能或误伤 Googlebot 索引,站长需警惕

bingdadabingdada
八月 5, 202611 次阅读约 5 分钟阅读
快速回答

是的,Cloudflare 的 AI 训练拦截功能可能将 Googlebot 归类为混合用途爬虫并误伤,导致网站无法被索引。站长应检查 Cloudflare 设置,避免全局拦截 AI 训练,并监控抓取日志以确保搜索引擎可正常访问。

核心要点
  • Reddit 用户发现 Cloudflare 的 AI 训练拦截功能导致 Googlebot 和 Bingbot 抓取 sitemap 时返回 403 错误。
  • Cloudflare 官方宣布从 2026 年 9 月 15 日起,将默认拦截混合用途爬虫(如 Googlebot)。
  • Google 的 John Mueller 已介入调查此问题。
  • 站长应审慎启用 AI 拦截功能,并监控 Search Console 中的抓取异常。
  • 建议使用 WAF 自定义规则仅拦截特定 AI 爬虫,而非全局拦截。
目录

目录

  • 事件起因:Reddit 用户的发现
  • Cloudflare 官方公告与政策变更
  • 对 SEO 从业者的影响与建议
  • 常见问题
  • Cloudflare 为什么要把 Googlebot 归类为“搜索+训练”机器人?
  • 如果 Googlebot 被拦截,我的网站会怎样?
  • 如何在不拦截 Googlebot 的情况下阻止 AI 爬虫?
  • 如果已经遇到 403 错误,该如何解决?
  • 总结

近期,有报告指出使用 Cloudflare 的 AI 训练机器人拦截功能,可能会导致 Googlebot 和 Bingbot 等合法搜索引擎爬虫无法正常索引网站。这一现象引发了 SEO 社区的广泛关注。Cloudflare 官方也已在公告中确认,从今年 9 月开始,将调整相关策略,届时混合用途的爬虫(如同时用于搜索索引和 AI 训练的 Googlebot)可能会被默认拦截。

事件起因:Reddit 用户的发现

一位 Reddit 用户在 r/SEO 社区发帖,称其在测试 Cloudflare 新推出的“AI Crawlers & Scrapers”功能时,遇到了意外情况。该用户表示:“当我将 AI 训练设置为‘拦截’时,Googlebot 和 Bingbot 在尝试抓取我的 sitemap 时开始收到 HTTP 403 错误。一旦我禁用 AI 训练拦截,sitemap 又可以正常访问了。”

该用户进一步指出,根据他的理解,Cloudflare 现在将 Googlebot 和 Bingbot 归类为“搜索+训练”机器人,因此启用训练拦截会影响它们。这让他陷入了两难:允许 AI 训练以换取搜索引擎的正常抓取,还是拦截 AI 训练而冒着 Google/Bing 抓取失败的风险。

Google 的搜索倡导者 John Mueller 对此回应,要求该用户发送私信以便进一步调查。也有其他用户猜测,这可能是 Cloudflare 拦截了伪装成 Googlebot 的恶意爬虫。但原帖作者澄清,问题并非如此,并提供了更多细节:“Cloudflare 仪表盘显示,当我启用 Bot Fight Mode 时,上传 sitemap 返回 403 错误。禁用后,403 消失。此外,在 AI 爬虫部分,Cloudflare 显示 Googlebot 和 Bingbot 被自动拦截。”

Cloudflare 官方公告与政策变更

根据 Cloudflare 官方公告,从 2026 年 9 月 15 日开始,Cloudflare 将对新域名启用更新的默认设置:在显示广告的页面上,被归类为“训练”或“代理”的机器人将被拦截,而“搜索”机器人仍被允许。同时,所有用于拦截 AI 训练的配置(包括旧的“Block AI bots”选项)也将拦截混合用途的爬虫。

Cloudflare 在公告中解释:“混合用途的爬虫,例如同时为搜索索引和 AI 训练收集数据的 Googlebot,将被所有配置拦截。”这意味着,如果站长启用了 AI 训练拦截,Googlebot 的访问可能会受到影响。虽然该政策计划在 9 月生效,但已有用户报告提前遇到了类似情况,这提醒我们应提前检查并调整相关设置。

对 SEO 从业者的影响与建议

这一变化对依赖搜索引擎自然流量的网站来说至关重要。如果 Googlebot 无法抓取网站,将直接导致页面无法被索引,进而严重影响搜索排名。

以下是几点实用建议:

  1. 检查 Cloudflare 设置:立即登录 Cloudflare 仪表盘,查看“AI Crawlers & Scrapers”和“Bot Fight Mode”等设置,确认是否存在可能误伤合法爬虫的配置。
  2. 审慎启用拦截功能:在启用任何 AI 训练拦截功能前,务必评估其对搜索引擎抓取的影响。可以考虑仅拦截已知的特定 AI 爬虫,而不是使用全局拦截。
  3. 监控抓取日志:定期检查 Google Search Console 和 Bing Webmaster Tools 的抓取报告,关注是否有异常增长或 403 错误。
  4. 关注官方更新:持续关注 Cloudflare 官方文档 和 Google 搜索中心博客,以获取最新的政策变动和技术建议。
  5. 使用 User-Agent 测试:通过 Cloudflare 的“Test”功能或在线工具,模拟 Googlebot 的 User-Agent 访问网站,验证是否会被拦截。

常见问题

Cloudflare 为什么要把 Googlebot 归类为“搜索+训练”机器人?

Cloudflare 将同时用于搜索索引和 AI 模型训练的爬虫定义为“混合用途”机器人。由于 Google 等公司会将抓取的数据用于训练其 AI 模型,因此这些爬虫在 Cloudflare 的新分类中被归为此类。

如果 Googlebot 被拦截,我的网站会怎样?

如果 Googlebot 无法抓取你的网站,你的网页将不会被 Google 索引,这意味着它们无法出现在搜索结果中,从而导致自然流量大幅下降。

如何在不拦截 Googlebot 的情况下阻止 AI 爬虫?

你可以创建 WAF 自定义规则,仅拦截已知的特定 AI 爬虫(例如 GPTBot、ClaudeBot 等),或者通过 robots.txt 文件进行管理。同时,确保不要启用 Cloudflare 的全局“Block AI Training”选项。

如果已经遇到 403 错误,该如何解决?

首先,检查 Cloudflare 仪表盘中的“AI Crawlers & Scrapers”和“Bot Fight Mode”设置,暂时禁用这些功能。然后,清除 Cloudflare 的缓存,并等待一段时间后再次尝试抓取。如果问题持续,建议联系 Cloudflare 支持团队。

总结

Cloudflare 对 AI 爬虫的拦截政策调整,为 SEO 社区带来了新的挑战。站长们需要平衡 AI 内容保护与搜索引擎抓取之间的关系。通过主动检查配置、监控抓取状态并关注官方更新,可以最大限度地降低误伤风险,确保网站健康的搜索可见度。

目录

  • 事件起因:Reddit 用户的发现
  • Cloudflare 官方公告与政策变更
  • 对 SEO 从业者的影响与建议
  • 常见问题
  • Cloudflare 为什么要把 Googlebot 归类为“搜索+训练”机器人?
  • 如果 Googlebot 被拦截,我的网站会怎样?
  • 如何在不拦截 Googlebot 的情况下阻止 AI 爬虫?
  • 如果已经遇到 403 错误,该如何解决?
  • 总结
常见问题
黄金广告位 · 限时招商
广告位招商中

把品牌放进读者的阅读流

文章内广告位,高注意力场景,适合新品发布与活动招募。

商务合作

标签

#SEO#Cloudflare#AI拦截#Googlebot#网站索引#Bingbot#爬虫管理
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

相关文章

付费搜索吸收有机流量下滑后,Q2增速放缓:SEO与PPC策略需重新审视
SEO基础

付费搜索吸收有机流量下滑后,Q2增速放缓:SEO与PPC策略需重新审视

付费搜索在吸收有机流量下滑后,Q2增速放缓。Tinuiti报告显示,Google搜索、YouTube和Instagram支出增长减缓,但亚马逊因Prime Day移至6月而大幅增长。广告主需重新评估策略。

8月 5约 8 分钟阅读
欧盟AI法案第50条:人工智能透明度规则的四大豁免
SEO基础

欧盟AI法案第50条:人工智能透明度规则的四大豁免

欧盟AI法案第50条要求AI生成内容必须标注,但提供了四项豁免:艺术/讽刺深度伪造、出版商人工编辑、标准编辑辅助工具、交互式AI明显使用。文章深入解析每项豁免的适用条件及存在的模糊性。

8月 4约 5 分钟阅读
开放知识格式 v0.2 增加信任层:尚无 AI 代理读取,但价值远不止于此
SEO基础

开放知识格式 v0.2 增加信任层:尚无 AI 代理读取,但价值远不止于此

开放知识格式 v0.2 增加了信任层,但尚无 AI 代理读取。其真正价值在于迫使网站所有者以机器视角审视内容,通过诚实回答“来源、时效、背书”三问,揭示网站的结构与信任缺口。

8月 4约 7 分钟阅读

订阅我们的 Newsletter

获取最新的 SEO 与 GEO 技术资讯。

我们尊重您的隐私,随时可以取消订阅。

评论 ({count}) (0)

登录后即可参与讨论

登录注册
还没有评论,来抢沙发吧