Технический блог BingdadaТехнический блог Bingdada
ГлавнаяБлогSEOGEOAEOAIИнструментыО нас
ВойтиРегистрация
Logo

Технический блог Bingdada

Технический блог, посвящённый SEO, GEO и тенденциям развития искусственного интеллекта.

Быстрые ссылки

  • Главная
  • Статьи блога
  • О нас

Контакты

  • 398848662@qq.com

Подпишитесь на нашу рассылку, чтобы получать свежие материалы по SEO и GEO.

© 2024 Bingdada 技术博客. All rights reserved.

Статья на упрощённом китайском. Перевести на Русский в один клик.
ГлавнаяБлогSEO基础爬取与引荐比率的数字迷雾:为何同一指标能相差17倍
爬取与引荐比率的数字迷雾:为何同一指标能相差17倍
SEO基础

爬取与引荐比率的数字迷雾:为何同一指标能相差17倍

bingdadabingdada
сентября 11, 202647 прочтений8 мин чтения
post.quickAnswer

爬取与引荐比率衡量AI平台抓取网页与送回访客的比例,但同一平台的数字可相差17倍。原因是分母中隐藏了四层变量:统计窗口、爬虫类型、样本网站构成,以及引荐是否包含原生应用流量。引用时必须带上这些上下文才有意义。

post.keyTakeaways
  • Anthropic的爬取与引荐比率有至少七个版本,从70,900比1到2,237比1,均归因于Cloudflare且发布于约13个月内。
  • Cloudflare的计算方法公开可复现,问题不在方法,而在分母内部叠加了四层几乎无人携带的变量。
  • 统计窗口差异足以让Google的比率在七天内移动19.4%,不同窗口的测量结果都可能是正确的。
  • 训练爬虫与用户请求爬虫被聚合到同一平台名称下,使得平台数字既不描述前者也不描述后者。
  • 引荐计数只捕获携带Referer头部的Web流量,原生应用流量被排除,导致比率可能被高估。
Содержание

Содержание

  • 引言:一个被反复引用的数字,为何答案各不相同
  • 什么是爬取与引荐比率
  • 方法本身没有问题
  • 分母里藏着四层变量
  • 第一层:统计窗口
  • 第二层:统计了哪个机器人
  • 第三层:统计了谁的网站
  • 第四层:最关键的一层
  • 为什么这很重要:从数字迷雾到决策依据
  • 国内视角:同类指标在国内的实践
  • 常见问题
  • 爬取与引荐比率到底是什么?
  • 为什么同一个平台的比率会有多个版本?
  • Cloudflare的计算方法有问题吗?
  • 网站运营者应该如何应对?
  • 这个指标对SEO策略有什么影响?
  • 结论:数字需要上下文才有意义
  • 关于 Bingdada

引言:一个被反复引用的数字,为何答案各不相同

在SEO与AI搜索的交汇地带,"爬取与引荐比率"(crawl-to-refer ratio)已成为一个被频繁引用的关键指标。然而,围绕Anthropic的这一比率,市面上流传着多个版本:70,900比1、38,000比1、23,951比1、11,122比1、10,300比1、4,580比1,以及2,237比1。所有这些数字都被归因于Cloudflare,且都在约13个月内发布。其中两个甚至声称来自同一个月,却相差约17倍。

这并非简单的数据错误或刻意误导。Cloudflare公开了清晰的计算方法,并在引入该指标的博文中坦诚披露了自身局限性。问题出在一个比率本身——它是一个分子除以一个分母,而这个分母内部实际上叠了四层变量,几乎没有人会在引用时把这些变量一并带上。

什么是爬取与引荐比率

简单来说,每个AI公司都会运行爬虫来抓取你网站上的页面。其中一些平台在用户阅读答案并点击下方来源链接时,也会给你带来访客。这个比率就是比较两者:平台抓取了多少页面,又送回了多少访客。5比1意味着它抓取了5个页面,送回1个访客;70,000比1则意味着它抓取了7万个页面,只送回1个访客。

这个指标之所以出现,是因为旧的网络经济契约被打破了。传统搜索引擎爬虫抓取你的页面,并以流量作为回报,这种交换是开放网络上内容发布的经济基础。而AI系统直接在原地给出答案,抓取仍在继续,回馈却大幅减少。这个比率是衡量这种失衡最简洁的表达,因此它迅速传播,出现在董事会幻灯片中,并开始影响哪些爬虫被允许进入网站的真实决策。

方法本身没有问题

Cloudflare在2025年7月引入了爬取与引荐比率,并明确说明了计算方法:取某个平台相关用户代理发出的、响应为HTML的总请求数,除以Referer头部包含该平台相关主机名的HTML内容请求总数,再归一化为单个引荐。这就是全部公式,公开、明确,任何拥有服务器日志的人都可以复现。

他们还公布了削弱自身指标的部分,这比大多数公司做得更多。问题不在于方法,而在于一个精心构建的数字离开发布方之后会发生什么。

分母里藏着四层变量

第一层:统计窗口

在Cloudflare的发布博文中,样本期是2025年6月19日至26日,仅一周,Anthropic得出70,900比1,而Mistral为0.1比1——每爬取一次就送回10个引荐。同月的另一篇博文中,Anthropic的2025年6月数字是73,000比1,OpenAI为1,700比1,Google大约每引荐一次爬取14次。同一发布方、同一个月、不同窗口、不同数字。

下游现在同时流传着季度数据、月度数据、滚动28天数据和单周数据,仿佛它们是同一种测量。窗口有多重要?Cloudflare报告Google的比率周环比移动了19.4%,并将其归因于GoogleBot从某一天开始的爬取量下降。一个爬取调度决策在七天内让公布的数字移动了五分之一。两位分析师善意地选择不同窗口,会得出不同答案,而两者都是对的。

第二层:统计了哪个机器人

Cloudflare表示,一个平台的训练爬虫和用户请求爬虫在不同用户代理下运行,但在分析中被聚合到单一平台名称下。这两种行为毫无共同之处:一个大规模消耗且设计上不返回任何东西,另一个按需抓取并可能产生引用。合并在一起,平台数字描述的既不是前者也不是后者。这也使得与Google的标准比较在结构上不成立,因为有些运营方运行功能分离的爬虫群,另一些则运行统一爬虫,聚合值在两边测量的是不同种类的对象。

第三层:统计了谁的网站

Cloudflare看到的是穿越Cloudflare的流量。这是一个巨大的样本,但仍然是样本,且偏向于位于其后的资产。当一位分析师在同一时期针对Cloudflare网络和自己的较小商业面板测量同一指标时,某个平台的比率大约翻了一倍。仅面板构成就足以移动数字。

第四层:最关键的一层

分母不是引荐,而是自我申报的引荐。只有当请求携带了标明平台主机名的Referer头部时,引荐才会进入计算。Cloudflare直接说明,Claude原生应用引荐的流量不包含该头部,他们认为其他供应商的原生应用也是如此,因此引荐计数只捕获了基于Web的工具,计算结果可能高估了比率。

为什么这很重要:从数字迷雾到决策依据

这个问题的核心不在于有人粗心或有人在编造。每个数字都有真实来源,发布方可信,文档公开。失败仍然发生了。

这让人想起另一类更隐蔽的问题:供应商内容引用看似存在实则不存在的来源。而这里,每个来源都真实,但数字仍然分散在一个数量级之内。

对于SEO从业者和内容策略师来说,教训是明确的:当你看到"某平台爬取与引荐比率为X比1"时,你需要追问四个问题——统计窗口是多长?包含了哪些爬虫?样本来自哪些网站?引荐是否包含原生应用流量?缺少任何一个答案,这个数字都无法真正用于决策。

Google在5月开发者大会上表示,AI Mode月活用户已突破10亿,且查询量"自推出以来每季度增长一倍以上"。这个增长率的表述同样没有给出基数——每季度翻倍却没有基准,是一个无法使用的增长率。这与本文讨论的问题如出一辙:一个设定规模的公告,内部却藏着同样的测量陷阱。

国内视角:同类指标在国内的实践

在国内AI搜索生态中,类似的爬取与引荐失衡同样存在,但测量方式有所不同。百度、字节跳动等平台同时运营传统搜索和AI问答产品,其爬虫行为与流量回馈往往在同一个生态内闭环,这使得单一平台的爬取与引荐比率更难独立剥离。

文心一言、通义千问、DeepSeek、豆包、Kimi、智谱GLM、讯飞星火等产品在答案生成中越来越多地引用网页来源,但国内尚未形成像Cloudflare那样公开、可复现的标准化比率指标。对于国内内容方而言,更实际的观察维度是:哪些AI产品在答案中保留了可点击的来源链接,以及这些链接实际带来了多少可归因的访问。

常见问题

爬取与引荐比率到底是什么?

它衡量的是某个AI平台抓取你网站页面的次数,与它送回访客次数之间的比例。例如70,000比1意味着它抓取了7万个页面,只送回1个访客。

为什么同一个平台的比率会有多个版本?

因为统计窗口、包含的爬虫类型、样本网站构成,以及引荐是否包含原生应用流量这四个变量在不同测量中各不相同,导致结果差异巨大。

Cloudflare的计算方法有问题吗?

方法本身公开、明确且可复现。问题在于分母内部叠加了四层变量,而引用者通常不会把这些变量一并带上。

网站运营者应该如何应对?

不要盲目相信单一比率数字。应追问统计窗口、爬虫类型、样本来源和引荐定义,并结合自身服务器日志进行独立验证。

这个指标对SEO策略有什么影响?

它正在影响哪些爬虫被允许进入网站的真实决策。理解其局限性,有助于制定更合理的爬虫管理策略,避免基于误导性数字做出过激反应。

结论:数字需要上下文才有意义

爬取与引荐比率是一个有价值的概念,它清晰表达了AI时代内容交换的失衡。但一个比率只有在你知道它的分子、分母以及所有隐藏变量时,才真正可用。下次看到"某平台比率为X比1"时,请记住:同一个数字,可能因为四个看不见的选择,而相差17倍。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

Содержание

  • 引言:一个被反复引用的数字,为何答案各不相同
  • 什么是爬取与引荐比率
  • 方法本身没有问题
  • 分母里藏着四层变量
  • 第一层:统计窗口
  • 第二层:统计了哪个机器人
  • 第三层:统计了谁的网站
  • 第四层:最关键的一层
  • 为什么这很重要:从数字迷雾到决策依据
  • 国内视角:同类指标在国内的实践
  • 常见问题
  • 爬取与引荐比率到底是什么?
  • 为什么同一个平台的比率会有多个版本?
  • Cloudflare的计算方法有问题吗?
  • 网站运营者应该如何应对?
  • 这个指标对SEO策略有什么影响?
  • 结论:数字需要上下文才有意义
  • 关于 Bingdada
post.faq
Премиум рекламное место · Ограниченное время
Рекламные места в аренду

Поместите бренд в ленту читателя

Рекламные места внутри статей — моменты высокого внимания, идеальны для запуска продуктов и набора на мероприятия.

Сотрудничество

Теги

#SEO指标#Search Engine Journal#Cloudflare#AI爬虫#爬取与引荐比率
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Похожие статьи

ChatGPT 广告与 GEO 双轨并行:品牌如何在 AI 搜索时代抢占新流量入口
SEO基础

ChatGPT 广告与 GEO 双轨并行:品牌如何在 AI 搜索时代抢占新流量入口

ChatGPT 正在成为新的购物与获客入口,品牌面临付费广告与 GEO 自然优化的双轨选择。本文拆解两条路径的运作逻辑、投入时机与协同策略,并结合国内 AI 搜索商业化现状给出实操建议。

сент. 167 мин чтения
Meta Muse 同日双文档:面向用户的安全叙事与面向工程师的威胁模型为何截然不同
SEO基础

Meta Muse 同日双文档:面向用户的安全叙事与面向工程师的威胁模型为何截然不同

Meta 同日发布两份 Muse 文档:消费者公告零次提及攻击与提示注入,工程博客却出现 39 次,并承认代理随时可能处于被攻击状态。这种叙事落差揭示了 AI 代理行业普遍存在的沟通问题。

сент. 168 мин чтения
Cloudflare 新开关:网站可拒绝 AI 训练,同时保住搜索引擎收录
SEO基础

Cloudflare 新开关:网站可拒绝 AI 训练,同时保住搜索引擎收录

Cloudflare 推出 Disallow AI Training 新设置,将拒绝 AI 训练与阻止搜索抓取彻底分离。Googlebot、Applebot、Bingbot 在满足 Accountable 条件时仍可抓取搜索,网站不再被迫二选一。

сент. 167 мин чтения

Подпишитесь на рассылку

Получайте свежие материалы по SEO и GEO.

Мы уважаем вашу конфиденциальность. Отписаться можно в любой момент.

Комментарии ({count}) (0)

Войдите, чтобы присоединиться к обсуждению

ВойтиРегистрация
Комментариев пока нет, будьте первым