
llms.txt 是一项提案中的开放标准,用 Markdown 格式为 AI 爬虫提供网站核心内容的精选索引,帮助大模型更高效地定位高价值页面。目前尚无主流模型厂商确认使用,但采用量在 14 个月内增长约 17.5 倍,部署成本低,可作为面向 AI 流量的前瞻性布局。
ChatGPT、Google AI Overviews、Perplexity 等 AI 平台正在重塑用户获取信息的路径。这些系统依赖爬虫抓取网页内容,再从中挑选素材来生成回答。问题在于:现代网站大量依赖 JavaScript 渲染,导航层级深、历史内容堆积如山,爬虫往往难以快速定位到真正重要的页面。而爬虫没抓到的内容,自然也不会出现在 AI 的答案里。
llms.txt 正是为缓解这一矛盾而提出的方案。它试图给 AI 爬虫一个经过人工筛选的「内容地图」,让机器一眼看清网站的核心结构与高价值页面。本文将从实际效用、行业采用现状、文件结构规范以及落地方法四个层面展开分析,帮助你判断是否值得在自己的站点上部署这一文件。
llms.txt 是一项尚在提案阶段的开放标准,目标是为大语言模型(LLM)提供一份结构化的网站内容索引。它的核心逻辑并不复杂:与其让 AI 爬虫在站点中漫无目的地游走,不如主动提供一份精选清单,告诉机器哪些页面最值得关注。
我们早已熟悉 robots.txt 和 XML sitemap 这类面向传统搜索引擎的协议。llms.txt 的差异在于,它专门面向那些可能引用你内容来回答用户提问的 AI 模型。目前业界有一种推测:部署 llms.txt 可能提升内容在 AI 生成回答中的曝光率,并带来推荐流量。但截至撰稿时,这一假设尚缺乏公开的实证数据支撑。
不过,围绕 llms.txt 的工具生态正在成形。例如 Google Lighthouse 已在站点审计中检查该文件是否存在。这释放出一个信号:即便主流模型厂商尚未公开确认使用该文件,行业已开始认真对待它。
其一,现代网页对爬虫并不友好。 多数 AI 爬虫只能读取页面的基础 HTML,无法执行 JavaScript 来获取动态加载的内容。llms.txt 以纯文本 Markdown 格式呈现,绕开了渲染难题,让爬虫能快速消化关键信息。
其二,信息过载导致抓取效率低下。 爬虫的抓取预算有限,如果大量时间耗费在导航菜单、Cookie 弹窗和过时博客上,真正希望被引用的产品页或文档页可能根本轮不到。llms.txt 的作用就是把这些高价值页面直接推到爬虫面前,提高被读取、索引并在 AI 回答中被准确呈现的概率。
llms.txt 采用 Markdown 格式编写,文件名必须为全小写的 llms.txt。Markdown 是一种轻量级标记语言,GitHub README 文件用的就是它,AI 系统解析起来也相当顺畅。
常见的语法元素包括:# 表示一级标题,## 表示二级标题,> 用于引用块,- 或 * 用于无序列表,[文本](链接) 用于超链接,冒号后接描述文字,三个反引号用于代码块。
一个符合官方规范的基础结构通常是:一级标题写站点或产品名称,可选的引用块做简要介绍,随后用多个二级标题分组罗列相关链接,每条链接后可用冒号附加说明。
# 公司名称
> 一句话描述公司业务
## 产品
- [产品一](https://example.com/product-1): 产品一的简要说明
- [产品二](https://example.com/product-2): 产品二的简要说明
## 文档
- [快速开始](https://example.com/docs/getting-started): 平台入门指南
- [API 参考](https://example.com/api): 完整 API 文档
对于大型或结构复杂的网站,可以进一步使用三级、四级标题划分子板块,甚至引入表格和代码片段来展示 API 用法。只要语法合法,额外的结构反而能为 AI 爬虫提供更多上下文。
从公开数据看,llms.txt 的采用曲线相当陡峭。2025 年 7 月,全球仅有 951 个域名发布了该文件;到 2026 年 9 月,这一数字攀升至 16,670 个,约 14 个月内增长 17.5 倍。对于一个 2024 年底才出现的提案来说,这样的增速不容忽视。
但把镜头拉远:16,670 个域名在全球数亿活跃网站中仍只占极小比例。这意味着增长是真实的,但窗口期依然敞开。现在部署 llms.txt,并不会让你陷入红海竞争,反而可能领先绝大多数同行。
想查看某个站点的 llms.txt,只需在域名后加上 /llms.txt 即可。以 Hugging Face 为例,其文件面向开发者文档,使用了多级标题(#、##、###、####)将内容拆分为独立板块,并包含完整的代码示例,结构清晰,便于机器读取。
海外围绕 llms.txt 的讨论,核心诉求是让 AI 爬虫更高效地理解站点结构。国内大模型产品在这一方向上也有类似探索,但路径有所不同。
百度的文心一言、阿里的通义千问、深度求索的 DeepSeek、字节的豆包、月之暗面的 Kimi 以及智谱 GLM 等,在训练数据与联网检索环节,普遍依赖自有爬虫体系与合作伙伴的内容供给。与 llms.txt 这种「站点主动声明」的机制相比,国内更多通过平台侧的收录协议、开放平台接口和内容合作来打通数据链路。
差异在于:llms.txt 走的是「网站主自下而上提供索引」的路线,而国内生态目前更偏向「平台自上而下建立内容池」。对于同时面向海外 AI 流量的中文站点,部署 llms.txt 可以作为补充手段;若主要受众在国内,则优先关注各平台官方的收录与内容合作渠道,可能更为实际。
判断是否部署 llms.txt,可以从三个维度权衡:
需要清醒认识的是,目前没有任何主流模型厂商公开承诺会读取 llms.txt。它更像是一张「低价期权」:投入有限,若标准被广泛采纳则回报可观,即便未被采纳也不会造成实质损失。
robots.txt 用于告诉爬虫哪些页面不要抓取,是限制性协议;llms.txt 则是主动推荐哪些页面值得阅读,是引导性文件。两者目的相反,可以并存。
目前没有公开证据表明它能直接提升排名或引用率。它的潜在价值在于帮助 AI 爬虫更高效地发现高价值内容,但效果取决于模型厂商是否采纳该标准。
放在网站根目录下,即 https://你的域名/llms.txt,文件名必须全小写,格式为 Markdown。
可以使用多级标题划分子板块,用表格整理结构化数据,用代码块展示 API 示例。只要 Markdown 语法合法,更丰富的结构通常有助于爬虫理解上下文。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

AI Overviews 外链占比升至 26.2%,但点击后可能进入 AI Mode 而非网站。本文拆解 Google 链接形态、统计口径差异,以及国内 AI 搜索的另一种解法。

AI代理不会修复糟糕的受众数据,只会以更快速度和更大规模放大其缺陷。本文解析为何品牌在AI搜索中被提及却未被购买,以及GEO与AI可见性的关键区别。

给 AI 提供纯文本镜像只解决了「读」的问题,却把页面上的可操作能力一并剥离。本文从语义化 HTML、WebMCP 工具面与 WebAIM 最新数据出发,分析 GEO 实践中被忽视的动作层缺口。
最新の SEO・GEO 情報をお届けします。
プライバシーを尊重します。いつでも購読を解除できます。