
爬取与引荐比率衡量AI平台抓取网页与送回访客的比例,但同一平台的数字可相差17倍。原因是分母中隐藏了四层变量:统计窗口、爬虫类型、样本网站构成,以及引荐是否包含原生应用流量。引用时必须带上这些上下文才有意义。
在SEO与AI搜索的交汇地带,"爬取与引荐比率"(crawl-to-refer ratio)已成为一个被频繁引用的关键指标。然而,围绕Anthropic的这一比率,市面上流传着多个版本:70,900比1、38,000比1、23,951比1、11,122比1、10,300比1、4,580比1,以及2,237比1。所有这些数字都被归因于Cloudflare,且都在约13个月内发布。其中两个甚至声称来自同一个月,却相差约17倍。
这并非简单的数据错误或刻意误导。Cloudflare公开了清晰的计算方法,并在引入该指标的博文中坦诚披露了自身局限性。问题出在一个比率本身——它是一个分子除以一个分母,而这个分母内部实际上叠了四层变量,几乎没有人会在引用时把这些变量一并带上。
简单来说,每个AI公司都会运行爬虫来抓取你网站上的页面。其中一些平台在用户阅读答案并点击下方来源链接时,也会给你带来访客。这个比率就是比较两者:平台抓取了多少页面,又送回了多少访客。5比1意味着它抓取了5个页面,送回1个访客;70,000比1则意味着它抓取了7万个页面,只送回1个访客。
这个指标之所以出现,是因为旧的网络经济契约被打破了。传统搜索引擎爬虫抓取你的页面,并以流量作为回报,这种交换是开放网络上内容发布的经济基础。而AI系统直接在原地给出答案,抓取仍在继续,回馈却大幅减少。这个比率是衡量这种失衡最简洁的表达,因此它迅速传播,出现在董事会幻灯片中,并开始影响哪些爬虫被允许进入网站的真实决策。
Cloudflare在2025年7月引入了爬取与引荐比率,并明确说明了计算方法:取某个平台相关用户代理发出的、响应为HTML的总请求数,除以Referer头部包含该平台相关主机名的HTML内容请求总数,再归一化为单个引荐。这就是全部公式,公开、明确,任何拥有服务器日志的人都可以复现。
他们还公布了削弱自身指标的部分,这比大多数公司做得更多。问题不在于方法,而在于一个精心构建的数字离开发布方之后会发生什么。
在Cloudflare的发布博文中,样本期是2025年6月19日至26日,仅一周,Anthropic得出70,900比1,而Mistral为0.1比1——每爬取一次就送回10个引荐。同月的另一篇博文中,Anthropic的2025年6月数字是73,000比1,OpenAI为1,700比1,Google大约每引荐一次爬取14次。同一发布方、同一个月、不同窗口、不同数字。
下游现在同时流传着季度数据、月度数据、滚动28天数据和单周数据,仿佛它们是同一种测量。窗口有多重要?Cloudflare报告Google的比率周环比移动了19.4%,并将其归因于GoogleBot从某一天开始的爬取量下降。一个爬取调度决策在七天内让公布的数字移动了五分之一。两位分析师善意地选择不同窗口,会得出不同答案,而两者都是对的。
Cloudflare表示,一个平台的训练爬虫和用户请求爬虫在不同用户代理下运行,但在分析中被聚合到单一平台名称下。这两种行为毫无共同之处:一个大规模消耗且设计上不返回任何东西,另一个按需抓取并可能产生引用。合并在一起,平台数字描述的既不是前者也不是后者。这也使得与Google的标准比较在结构上不成立,因为有些运营方运行功能分离的爬虫群,另一些则运行统一爬虫,聚合值在两边测量的是不同种类的对象。
Cloudflare看到的是穿越Cloudflare的流量。这是一个巨大的样本,但仍然是样本,且偏向于位于其后的资产。当一位分析师在同一时期针对Cloudflare网络和自己的较小商业面板测量同一指标时,某个平台的比率大约翻了一倍。仅面板构成就足以移动数字。
分母不是引荐,而是自我申报的引荐。只有当请求携带了标明平台主机名的Referer头部时,引荐才会进入计算。Cloudflare直接说明,Claude原生应用引荐的流量不包含该头部,他们认为其他供应商的原生应用也是如此,因此引荐计数只捕获了基于Web的工具,计算结果可能高估了比率。
这个问题的核心不在于有人粗心或有人在编造。每个数字都有真实来源,发布方可信,文档公开。失败仍然发生了。
这让人想起另一类更隐蔽的问题:供应商内容引用看似存在实则不存在的来源。而这里,每个来源都真实,但数字仍然分散在一个数量级之内。
对于SEO从业者和内容策略师来说,教训是明确的:当你看到"某平台爬取与引荐比率为X比1"时,你需要追问四个问题——统计窗口是多长?包含了哪些爬虫?样本来自哪些网站?引荐是否包含原生应用流量?缺少任何一个答案,这个数字都无法真正用于决策。
Google在5月开发者大会上表示,AI Mode月活用户已突破10亿,且查询量"自推出以来每季度增长一倍以上"。这个增长率的表述同样没有给出基数——每季度翻倍却没有基准,是一个无法使用的增长率。这与本文讨论的问题如出一辙:一个设定规模的公告,内部却藏着同样的测量陷阱。
在国内AI搜索生态中,类似的爬取与引荐失衡同样存在,但测量方式有所不同。百度、字节跳动等平台同时运营传统搜索和AI问答产品,其爬虫行为与流量回馈往往在同一个生态内闭环,这使得单一平台的爬取与引荐比率更难独立剥离。
文心一言、通义千问、DeepSeek、豆包、Kimi、智谱GLM、讯飞星火等产品在答案生成中越来越多地引用网页来源,但国内尚未形成像Cloudflare那样公开、可复现的标准化比率指标。对于国内内容方而言,更实际的观察维度是:哪些AI产品在答案中保留了可点击的来源链接,以及这些链接实际带来了多少可归因的访问。
它衡量的是某个AI平台抓取你网站页面的次数,与它送回访客次数之间的比例。例如70,000比1意味着它抓取了7万个页面,只送回1个访客。
因为统计窗口、包含的爬虫类型、样本网站构成,以及引荐是否包含原生应用流量这四个变量在不同测量中各不相同,导致结果差异巨大。
方法本身公开、明确且可复现。问题在于分母内部叠加了四层变量,而引用者通常不会把这些变量一并带上。
不要盲目相信单一比率数字。应追问统计窗口、爬虫类型、样本来源和引荐定义,并结合自身服务器日志进行独立验证。
它正在影响哪些爬虫被允许进入网站的真实决策。理解其局限性,有助于制定更合理的爬虫管理策略,避免基于误导性数字做出过激反应。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
Поместите бренд в ленту читателя
Рекламные места внутри статей — моменты высокого внимания, идеальны для запуска продуктов и набора на мероприятия.
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

ChatGPT 正在成为新的购物与获客入口,品牌面临付费广告与 GEO 自然优化的双轨选择。本文拆解两条路径的运作逻辑、投入时机与协同策略,并结合国内 AI 搜索商业化现状给出实操建议。

Meta 同日发布两份 Muse 文档:消费者公告零次提及攻击与提示注入,工程博客却出现 39 次,并承认代理随时可能处于被攻击状态。这种叙事落差揭示了 AI 代理行业普遍存在的沟通问题。

Cloudflare 推出 Disallow AI Training 新设置,将拒绝 AI 训练与阻止搜索抓取彻底分离。Googlebot、Applebot、Bingbot 在满足 Accountable 条件时仍可抓取搜索,网站不再被迫二选一。
Получайте свежие материалы по SEO и GEO.
Мы уважаем вашу конфиденциальность. Отписаться можно в любой момент.
Войдите, чтобы присоединиться к обсуждению