
Cloudflare 的 Bot Preference Sync 会自动把控制台中的 AI 机器人策略写入 robots.txt,解决声明与执行脱节的问题。但它只能按 Search、Agent、Training 三个类别统一设定,无法针对单个爬虫细化规则,且新客户默认开启,站长可能因此失去对 AI 爬虫策略的精细控制权。
网站运营者常常面对一个尴尬现实:robots.txt 里写的规则,和边缘网络实际执行的策略,往往是两套互不沟通的系统。文件是几个月前手写的,拦截规则是后来在控制台里改的,两者之间没有任何机制保证一致。这种割裂本身就会成为爬虫无视规则的借口——当你的声明与执行相互矛盾,对方就有理由认为你的偏好不值得尊重。
Cloudflare 推出的 Bot Preference Sync(机器人偏好同步)正是瞄准这个痛点。按照其公告描述,它会把控制台里设定的机器人策略自动转换为 robots.txt 条目,并用 # BEGIN Cloudflare Bot Preference Sync 与 # END Cloudflare Bot Preference Sync 标记包裹后置顶写入你的文件,原有内容保留在下方。该功能据称从免费套餐起提供,新客户默认开启。
问题不在于自动化本身,而在于它把「你的网站对 AI 爬虫说什么」这个决定权,以一种无法表达真实业务逻辑的形式,默认交给了服务商。
Cloudflare 在公告中提出一个论点:当网站声明的偏好与实际执行的规则不一致时,部分爬虫会以此为依据忽略你的偏好,甚至尝试绕过你的执行规则。这个判断很可能是对的,但公告没有说明是哪些爬虫、有多少、依据什么数据得出。Cloudflare 处于网络流量的关键位置,是最有条件点名的一方,却一个名字都没有给出。
这恰恰印证了许多法律与技术分析中反复出现的观点:robots.txt 与边缘拦截必须保持一致,否则就是在给对方提供「合理忽视」的论据。参考 RFC 9309 关于机器人排除协议的标准,robots.txt 本质上是一种自愿遵守的约定,缺乏强制力,因此一致性尤为关键。
Bot Preference Sync 的生成逻辑基于三个设置项,位于安全设置与 AI 机器人策略配置之下:Search(搜索)、Agent(智能体)、Training(训练)。三者可选值相同:全站拦截、仅拦截含广告页面、允许。Cloudflare 维护的爬虫清单决定每个爬虫归入哪一类,用户无法把某个具体爬虫排除在同步之外。官方给出的细化控制方案是:关闭同步,自己维护文件。
但真实世界的策略往往比三个类别更细。举例来说,某站长可能允许 OpenAI 的 GPTBot、Anthropic 的爬虫和 PerplexityBot,同时拦截 Bytespider 与 meta-externalagent。这些公司都在训练模型,区别在于:前三者能把内容呈现在向助手提问的用户面前,后两者只取不予。这是逐个爬虫做出的商业判断,而 Training 设为禁止会误伤愿意授权的 OpenAI,设为允许又无法把 Meta 和字节跳动与其他爬虫区分开。没有任何一个设置能描述这种策略。
当 Training 设为禁止时,Cloudflare 会写入禁止训练声明,并拦截所有被其判定为「不透明」的 AI 爬虫。所谓透明,需要满足四项条件:爬虫必须通过任意机制尊重 robots.txt 中的禁止训练偏好;必须给站长提供退出 AI 摘要的方式;必须提供 URL 级别的可见性,说明哪些页面被用于训练,以及搜索结果指标;必须能公开证明禁止训练不会损害传统搜索排名。
这四项条件没有点名任何公司,但第二和第四条明显指向 Google。第四条 Google 已经满足——其爬虫文档说明 Google-Extended 控制内容是否用于训练 Gemini 模型,且不影响网站在 Google 搜索中的收录与排名。第二条则是 Google 尚未给出答案的:如何退出 AI 摘要。
在 AI 爬虫治理这件事上,国内厂商的节奏与海外略有不同。百度、字节跳动等平台较早通过自有爬虫协议与内容合作机制来处理训练数据授权,而 DeepSeek、通义千问、文心一言等模型方更多依赖公开数据集与自有采集体系。对于国内站长而言,Cloudflare 这类「一键同步」工具的启发在于:把声明与执行统一起来确实能减少争议,但前提是策略粒度足够细。如果自动化只能表达粗粒度的三类选项,反而可能让网站失去对自身内容的精细控制权。
Bot Preference Sync 解决的是真实问题:声明与执行脱节。但它用默认开启、按类别设定、不可排除单个爬虫的方式解决,等于把决策权转移给了平台。对于策略简单、只想快速合规的站点,这是省事的选择;对于需要逐个爬虫权衡商业回报的站点,关闭同步、手工维护仍然是更合理的路径。真正值得关注的不是这个功能好不好用,而是当越来越多网站把 robots.txt 交给同一个服务商生成时,互联网的爬虫规则会不会趋同到只剩几个预设档位。
它是 Cloudflare 推出的一项功能,会把控制台中的 AI 机器人策略自动转换为 robots.txt 条目并置顶写入网站文件,原有内容保留在下方,据称免费套餐即可使用,新客户默认开启。
手动维护可以针对单个爬虫逐一设定规则,而 Bot Preference Sync 只能按 Search、Agent、Training 三个类别统一设定,无法排除某个具体爬虫,粒度更粗。
robots.txt 本身依赖爬虫自愿遵守,当声明与执行矛盾时,部分爬虫会以此为由忽略你的偏好,因此两者保持一致是维护规则有效性的基础。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

一起跨域Canonical导致的去索引事件引发SEO社区热议,Google的John Mueller回应称根本原因在于网站技术错误而非Canonical标签本身。本文深度剖析事件经过、Google官方立场,并提供诊断修复方案。

Google、Cloudflare 与微软各自推进 AI 内容付费方案,但在付费触发点、网站主控制权和数据透明度上存在根本分歧。本文从三个维度拆解差异,并补充国内厂商的本土路径。

SEJ 调研显示,流量与转化正在脱钩,GEO 投入增速远超效果验证,而测量信心严重不足。本文拆解 2027 年搜索预算该停什么、量什么、投什么。
最新の SEO・GEO 情報をお届けします。
プライバシーを尊重します。いつでも購読を解除できます。