Bingdada Tech BlogBingdada Tech Blog
HomeBlogSEOGEOAEOAIToolsAbout
Log inSign up
Logo

Bingdada Tech Blog

A technical blog focused on SEO, GEO, and future AI trends.

Quick Links

  • Home
  • Blog Posts
  • About Us

Contact

  • 398848662@qq.com

Subscribe to our Newsletter for the latest SEO and GEO insights.

© 2024 Bingdada 技术博客. All rights reserved.

This article is in Simplified Chinese. Translate it to English with one click.
HomeBlogSEO基础llms.txt 被误用为访问控制?Common Crawl 分析揭示 AI 抓取协议的认知鸿沟
llms.txt 被误用为访问控制?Common Crawl 分析揭示 AI 抓取协议的认知鸿沟
SEO基础

llms.txt 被误用为访问控制?Common Crawl 分析揭示 AI 抓取协议的认知鸿沟

bingdadabingdada
September 9, 202666 reads9 min read
Quick Answer

Common Crawl 的分析表明,大量网站将 llms.txt 误用为 robots.txt 来设定 AI 爬虫的访问权限,但 llms.txt 并不具备强制访问控制能力。网站所有者应优先在 robots.txt 中配置规则,并确保 llms.txt 内容与之保持一致。

Key Takeaways
  • Common Crawl 分析 50 万+ llms.txt 文件,发现 68% 来自插件或模板自动生成,22.56% 完全不包含链接。
  • 部分网站混淆了 llms.txt 与 robots.txt 的功能,试图在 llms.txt 中定义爬虫屏蔽规则,但这些规则并无实际效力。
  • 在 32 个看似拒绝 CCBot 的站点中,没有任何一个在 robots.txt 中完全屏蔽 CCBot,规则严重不同步。
  • 提示注入在 llms.txt 中极为罕见,50 万文件中仅确认 4 个真实案例。
  • llms.txt 的未来走向由插件和网站构建工具主导,而非人工编写。
Contents

Contents

  • 数据背后的真实图景:模板化与链接缺失
  • 概念混淆:当 llms.txt 被误当作 robots.txt
  • 提示注入的真实存在与稀有性
  • 方法论边界与数据解读的局限性
  • 国内视角:大模型生态下的网站协议应对
  • 未来走向:从手动编写到工具驱动
  • 常见问题
  • llms.txt 与 robots.txt 的核心区别是什么?
  • 网站所有者是否应该在 llms.txt 中设置爬虫屏蔽规则?
  • Common Crawl 的数据说明了什么趋势?
  • 提示注入在 llms.txt 文件中常见吗?
  • 国内站长应如何应对 AI 爬虫?
  • 关于 Bingdada

随着生成式 AI 与搜索引擎的深度融合,网站所有者与 AI 爬虫之间的博弈正进入一个新阶段。一个名为 llms.txt 的提议标准,旨在为 AI 系统提供网站内容的精选清单,但最新的行业数据分析显示,这一格式在实际应用中正被大量网站误解和误用,甚至被当作 robots.txt 的替代品来设定访问权限。

数据背后的真实图景:模板化与链接缺失

Common Crawl 近期对超过 50 万个 llms.txt 文件进行了深度分析,其研究数据揭示了该协议在实际部署中的几个显著特征。作为一家非营利组织,Common Crawl 运营着知名的 CCBot 爬虫,其数据被广泛用于大语言模型的训练。该机构的高级研究工程师 Malte Ostendorff 分享了这次分析的详细结果。

分析发现,高达 68% 的 llms.txt 文件来源于插件或模板自动生成,而非人工精心编写。更值得关注的是,22% 的文件中完全不包含任何链接。在结构完整性方面,仅有 49% 的文件具备了完整的标准结构,即包含 H1 标题、摘要引用块以及链接列表。另有 32% 的文件为每个链接添加了简短的描述说明。

从生态系统的角度看,网站建设平台 Wix 贡献了样本中 41% 的文件。而 WordPress 生态中流行的 All in One SEO 插件则在约 73,000 个文件中从不写入摘要,但其链接中位数高达 138 个——这暗示该插件实际上将 llms.txt 当作另一种形式的站点地图在使用。GoDaddy 的域名停放页面文件甚至在没有链接的情况下通过了所有结构检查,完全充当了销售页面的角色。

概念混淆:当 llms.txt 被误当作 robots.txt

llms.txt 格式的核心定位是为 AI 系统提供一个网站页面的精选列表,它本身不具备任何强制访问控制的能力。正如 Common Crawl 的分析报告所指出的,该文件“不授予任何权限,也不阻止任何访问,且没有爬虫有义务读取它”。真正的访问规则应当由 robots.txt 来定义。

然而,分析发现大量网站似乎混淆了这两个概念。Common Crawl 在 llms.txt 的路径下发现了 136,578 个 robots.txt 文件,约占返回 HTTP 200 状态码响应总数的 10%。在被分析的文件中,有 1,570 个文件明确引用了特定的爬虫名称,其中 32 个文件看似明确拒绝了 CCBot。

通过对这些站点的 robots.txt 进行交叉验证,结果颇具戏剧性:在可访问的 31 个站点中,没有任何一个在 robots.txt 中完全屏蔽 CCBot。其中 5 个站点明确允许访问,11 个站点限制了特定路径但允许其他路径,15 个站点则完全没有设置任何限制。

更令人费解的是,某个网站的 llms.txt 文件声称自“2026 年 6 月起”屏蔽 CCBot,但其 robots.txt 文件实际上通过通配符规则明确允许了该爬虫的访问。这种时间上的错位与规则上的矛盾,清晰地展示了 llms.txt 作为一种“政策描述”而非“政策本身”所面临的现实困境。Common Crawl 明确表示,CCBot 真正遵循的是 robots.txt 中的规则。

提示注入的真实存在与稀有性

针对 AI 模型的提示注入攻击是业界关注的另一焦点。Common Crawl 采用了最严格的检测标准,最终在 10 个文件中发现了疑似针对模型本身的指令。经过人工复核,确认了 4 个真实的注入案例,其中包括一个文件的摘要部分指示模型忽略先前指令并获取第二个文件的内容。其余 6 个为误报,主要是文档中为了解释控制令牌而进行的引用。

值得注意的是,研究人员强调这一发现并不意味着 llms.txt 文件普遍存在提示注入问题。在确认的实际案例中,都是个体有意插入以表达某种观点。此外,还有 3,793 个文件展示了较为温和的引导性语言,例如“请优先关注这些页面”。

方法论边界与数据解读的局限性

在解读这些数据时,必须明确其采样范围的局限性。本次分析的样本来源于 CCBot 近期能够正常抓取的网站,这意味着样本仅在爬虫可访问的站点内具有随机性,而非整个互联网的代表。报告中也指出,其 11% 的 /llms.txt 采用率与 Ahrefs 或 Web Almanac 的数据并不具备直接可比性,因为统计的总体基数不同。

此外,基于单次抓取的分析无法判断模板化文件、策略语言或提示注入是否呈现增长趋势,也无法确认是否有任何 AI 系统真正读取了这些文件。关于策略和注入的统计均基于关键词匹配,实际数量很可能被低估。

国内视角:大模型生态下的网站协议应对

这一现象对国内的大模型与搜索生态同样具有警示意义。随着百度文心一言、阿里通义千问、DeepSeek、月之暗面 Kimi 以及智谱 GLM 等国产大模型的快速发展,国内网站的 AI 抓取流量也在显著增加。与海外类似,国内站长也面临着如何规范 AI 爬虫行为的困惑。目前,国内尚未形成类似 llms.txt 的广泛共识性标准,但主流的搜索引擎如百度已经针对 AI 搜索场景调整了爬虫策略。对于国内站长而言,与其依赖尚未成熟的 llms.txt 提议,不如优先确保 robots.txt 文件的准确配置,并关注各大 AI 服务商官方发布的爬虫 UA 名单。

未来走向:从手动编写到工具驱动

自今年八月 llms.txt v2 更新引入链接关系以方便查找页面的 Markdown 版本后,该格式的底层逻辑并未改变——它依然不具备强制执行能力。随着插件和网站构建工具如今贡献了 Common Crawl 发现的三分之二的文件,该格式的实际应用方式将更多取决于这些工具的输出逻辑,而非网站所有者的手动编写。

对于网站所有者和 SEO 从业者而言,正确的做法是:将 llms.txt 视为一种推荐机制,而将访问控制的真正权限牢牢掌握在 robots.txt 手中。若希望限制 CCBot 或任何其他爬虫,最佳实践是在 robots.txt 中明确声明,并确保 llms.txt 中的任何描述与 robots.txt 的实际规则保持一致。正如 Search Engine Journal 的 Matt G. Southern 所报道的那样,理解这些文件之间的差异,是避免网站抓取策略陷入混乱的第一步。

常见问题

llms.txt 与 robots.txt 的核心区别是什么?

llms.txt 是一种提议性标准,旨在为 AI 系统提供网站内容的精选列表,帮助它们更好地理解网站结构。它不具备任何强制力,爬虫可以完全忽略它。而 robots.txt 是互联网公认的访问控制标准,爬虫会遵循其中的规则来决定是否抓取及抓取哪些路径。简而言之,llms.txt 是“推荐”,robots.txt 是“规则”。

网站所有者是否应该在 llms.txt 中设置爬虫屏蔽规则?

不建议。在 llms.txt 中写入屏蔽规则(如“Disallow: CCBot”)没有实际效力,因为该格式不承载访问控制功能。要真正阻止特定爬虫(如 CCBot、GPTBot),必须在网站的 robots.txt 文件中进行声明。如果坚持在 llms.txt 中提及,也应确保内容与 robots.txt 的规则保持一致,避免产生信息矛盾。

Common Crawl 的数据说明了什么趋势?

Common Crawl 的分析显示,当前绝大多数 llms.txt 文件来自模板或插件自动生成,且大量文件存在链接缺失或结构不完整的问题。更关键的是,许多网站混淆了 llms.txt 与 robots.txt 的功能,试图在 llms.txt 中定义访问策略,这反映出该标准在实际部署中面临严重的认知与实践脱节。

提示注入在 llms.txt 文件中常见吗?

不常见。在 Common Crawl 分析的 50 万个文件中,仅确认了 4 个真实的提示注入案例。虽然另有 3,793 个文件包含较温和的引导性指令,但总体而言,提示注入并非 llms.txt 生态中的普遍现象。不过,随着该格式的普及,网站所有者与 AI 服务商仍需保持警惕。

国内站长应如何应对 AI 爬虫?

国内站长应首先关注各大 AI 服务商(如百度、阿里、字节跳动等)官方发布的爬虫 UA 与访问规则,在 robots.txt 中做好精细化管理。同时,可以关注 llms.txt 等国际标准的发展,但不必急于部署。核心原则是确保 robots.txt 的准确性,这是所有合规爬虫都会遵循的基线。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

Contents

  • 数据背后的真实图景:模板化与链接缺失
  • 概念混淆:当 llms.txt 被误当作 robots.txt
  • 提示注入的真实存在与稀有性
  • 方法论边界与数据解读的局限性
  • 国内视角:大模型生态下的网站协议应对
  • 未来走向:从手动编写到工具驱动
  • 常见问题
  • llms.txt 与 robots.txt 的核心区别是什么?
  • 网站所有者是否应该在 llms.txt 中设置爬虫屏蔽规则?
  • Common Crawl 的数据说明了什么趋势?
  • 提示注入在 llms.txt 文件中常见吗?
  • 国内站长应如何应对 AI 爬虫?
  • 关于 Bingdada
FAQ
Premium Ad Space · Limited Time
Advertise with us

Put your brand in the reader feed

In-article ad slots: high-attention moments perfect for product launches and event recruitment.

Partnership

Tags

#SEO#robots.txt#AI 搜索#llms.txt#Common Crawl#CCBot#AI 爬虫
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Related Posts

谷歌搜索排序架构或将迎来单模型革命:DeepMind 自回归排序论文深度解读
SEO基础

谷歌搜索排序架构或将迎来单模型革命:DeepMind 自回归排序论文深度解读

谷歌 DeepMind 联合高校发布论文,提出用自回归排序(ARR)取代传统两阶段搜索排序架构。本文深度解读其技术原理、实验结果及对 SEO/AEO 的潜在影响。

Sep 128 min read
新闻网站域名迁移的SEO陷阱:一次切换为何导致搜索可见度暴跌98%?
SEO基础

新闻网站域名迁移的SEO陷阱:一次切换为何导致搜索可见度暴跌98%?

英国一家新闻出版商从 .co.uk 迁移至 .com 后,新闻搜索可见度在两周内暴跌 98%。该案例揭示了传统 SEO 工具与趋势新闻查询追踪系统的测量差异,以及新闻网站域名迁移中主机名信任重建的隐性挑战。

Sep 99 min read
AI修复工作需求激增87%:当AI生成的“垃圾内容”成为自由职业者的新金矿
SEO基础

AI修复工作需求激增87%:当AI生成的“垃圾内容”成为自由职业者的新金矿

Freelancer.com数据显示,AI生成内容的修复工作需求在过去一年激增87%。本文深入分析这一趋势背后的市场逻辑,探讨AI时代自由职业者角色的转变,以及搜索引擎和平台方对AI垃圾内容的应对策略。

Sep 49 min read

Subscribe to our Newsletter

Get the latest SEO & GEO insights.

We respect your privacy. You can unsubscribe at any time.

Comments ({count}) (0)

Sign in to join the discussion

Sign inSign up
No comments yet, be the first to comment