llms.txt:为 LLM 准备的索引文件

llms.txt:为 LLM 准备的索引文件

在 AI 爬虫生态中,llms.txt 是一个相对较新且充满争议的文件。它由 Answer.AI 的 Jeremy Howard 于 2024 年 9 月提出,旨在为语言模型提供一份经过筛选的站点内容索引。然而,尽管越来越多的站点开始部署这一文件,关于它是否真正被 AI 引擎读取,目前仍缺乏确凿证据。

llms.txt 是 Answer.AI 于 2024 年提出的一项发布约定:在 /llms.txt 提供一份经过筛选的 Markdown 文件,说明 LLM 应优先读取哪些页面。越来越多的站点已经采用它,但至今没有证据表明 AI 引擎确实会读取这个文件。它适合以低成本预先部署,将来仍可沿用,但不会直接带来引用。

关键洞察:llms.txt 的价值在于「低成本预先部署」——发布成本约等于零,如果未来有引擎开始读取,现有文件也能继续使用。但把 llms.txt 视为今天的 GEO 增长杠杆,是过度解读;它改善的是内容被采用之前的可读性和可检索性,不会直接提高可引用性。

llms.txt 的本质:一项发布约定,不是访问控制

llms.txt 是放在站点根目录的 Markdown 文件(/llms.txt),由 Answer.AI 的 Jeremy Howard 于 2024 年 9 月提出(见 原始提案)。

GEO Wiki 工作定义:llms.txt 是一项尚处于提案阶段的发布约定。它用一份经过筛选并去除网页噪声的 Markdown 文件,告诉 LLM 应优先阅读哪些页面、去哪里获取干净文本。它让页面更易读取(减少 HTML 噪声,并在上下文窗口有限时节省空间),既不控制访问,也不帮助引擎发现内容。

提案将其表述为:「一个 Markdown 文件,提供简要背景和说明,并列出更多详细 Markdown 文件的链接」(见 Answer.AI)。

相关主题与对应条目如下:

  • 文件格式,以及发布端与读取端的实际采用情况:本条目下文
  • 怎么做:按 CMS/技术栈生成文件并保持更新:部署 llms.txt
  • 谁在维护规范、标准化进展及采纳者名单:llms.txt 工作组
  • 制定访问策略(llms.txt 不负责这项工作):robots.txt
  • AI 爬虫的工作机制:AI 爬虫

站点采用 ≠ 引擎读取

站点发布了文件,不代表 AI 引擎会读取它;这和 面向 AI 的 Schema.org §2 所说的「标记不是信号」是同一个道理。如果把站点端(站点发布该文件)和引擎端(AI 引擎是否真的读取它)混为一谈,就容易产生错误预期。

站点端 引擎端
含义 站点发布 /llms.txt AI 引擎在抓取或推理时读取并使用它
状态 已有站点采用,而且数量还在增加:文档平台会自动生成;抽样研究中约 10% 的域名已经部署(Search Engine Journal,2025-11-20 尚未得到证实:没有任何主流厂商在文档中说明会读取第三方的 llms.txt
证据 Mintlify 会自动生成并托管该文件;Anthropic、Google、Perplexity 也都在各自的文档站点提供了该文件 OpenAI(bots 文档)、Anthropic、Perplexity、Google 的爬虫文档都未提及 llms.txt

厂商在自家站点发布 llms.txt,容易让人误以为其爬虫也会读取这类文件。Anthropic 为自己的开发者文档发布了 llms.txt,但 ClaudeBot 的公开爬虫文档从未说明它会读取这个文件。站点自行发布一份,不代表其爬虫会读取其他站点的文件。GPTBotPerplexityBot 的文档也是如此,对 llms.txt 均无说明。

因此,现阶段只能把 llms.txt 当作一项低成本且向前兼容的预先部署不能指望它直接带来引用。发布成本约等于零;目前能够确认的并不是 AI 厂商会读取它,而是任何愿意读取它的工具,现在都能以低成本获取一份经过筛选并去除网页噪声的内容清单。

关键洞察:Google 搜索布道师 John Mueller 曾公开把 llms.txt 类比为早期的 keywords meta 标签,「没有任何 AI 服务说过它们在用 llms.txt,看服务器日志就知道,它们根本不会去查它」(Reddit,2025 年 4 月,经 Search Engine Journal 报道)。不过,这仍不足以否定下文提到的低成本使用价值。

规范的文件格式

不同技术栈的具体生成方法见 部署 llms.txt;按照 llmstxt.org,llms.txt 的标准结构如下。

# 项目名称

> 一段简短的项目摘要(blockquote):读懂下文所需的关键信息。

零或多段自由说明文字(不带标题),用于补充上下文。

## Docs
- [快速开始](https://example.com/quickstart.md): 如何上手
- [API 参考](https://example.com/api.md): 完整端点列表

## Optional
- [更新日志](https://example.com/changelog.md): 上下文紧张时可跳过
元素 是否必需 用途
# H1 项目名 ,唯一必需的元素 说明文件对应的项目或实体
> blockquote 摘要 建议提供 简要说明阅读下文所需的关键信息
自由说明段落 可选 补充上下文,不带标题
## H2 链接列表小节 可选;可设置多个 经过筛选的链接列表,每条为 [名称](url): 备注
## Optional 小节 可选 优先级较低的链接,上下文窗口空间不足时 LLM 可以跳过llmstxt.org

llms.txt 与 llms-full.txt 并不相同,而且目前最常见的 llms-full.txt 这个名称其实不在规范中。官方提案定义的是两个经处理生成的扩展文件 llms-ctx.txtllms-ctx-full.txt,由 llms_txt2ctx 工具从 llms.txt 生成(见 Answer.AI)。目前广泛部署的 llms-full.txt 会把所有文档正文合并成一个文件;这是 Mintlify 推广后形成的通行约定,并非原始规范(Mintlify,2024-11-20)。更准确地说,llms.txt 是一份经过筛选的内容索引;全量变体则是一份可以整段交给模型的正文合集,但也可能超出上下文窗口容量(见下文)。

llms.txt、robots.txt 与 sitemap.xml:三个文件,三种职责

最常见的误解,就是把这三个根目录文件混为一谈。它们的职责并不重叠,彼此也不能替代。

文件 主要用途 不能做什么
robots.txt 访问控制:机器人能否抓取某个路径(机制详见 robots.txt 不负责内容筛选、呈现或排名;这些规则表达访问要求,但不能强制爬虫遵守
sitemap.xml 内容发现与完整覆盖:完整列出供索引的内容(Sitemap 与 IndexNow 不负责筛选,也不授予访问权;它不是精选清单
llms.txt 内容筛选与简洁呈现:用一份去除网页噪声的 Markdown 文件,说明应优先阅读这些页面 不授予或拒绝访问,不保证完整列出所有内容,也不是排名信号

所以,llms.txt 不是面向 AI 的 sitemap(否则会混淆内容筛选与完整覆盖),也不是面向 AI 的 robots.txt(否则会混淆阅读提示与访问规则)。抓取权限与访问规则见 robots.txt,相关的爬虫机制见 AI 爬虫;llms.txt 既不会允许,也不会阻止任何一次抓取。

llms.txt 能做什么、不能做什么

根据现有证据,llms.txt 的作用可以归纳如下。和 可引用性 §5面向 AI 的 Schema.org §6 一样,以下结论都有证据支持,不作夸大。

llms.txt llms.txt 不能
提供一份经过筛选、去除网页噪声且占用 token 较少的阅读清单 授予或拒绝爬虫访问(≠ robots.txt
让自己能够控制的工具今天就能以低成本读取正确页面 阻止训练,或保证抓取、索引、引用
以约等于零的成本先备好内容,供日后可能读取它的引擎使用 供浏览器或终端用户读取
向任何愿意遵循这项约定的工具说明站点结构 充当排名或引用信号

已知情况应如何理解:

  • 采用它的站点越来越多,文档平台会自动生成该文件:这只能证明站点端确有采用,不能证明引擎端会读取;发布不等于会被读取
  • Anthropic、Google、Perplexity 都发布了 llms.txt:这只说明它们在自家文档站点上托管了该文件;其爬虫文档并未说明会读取你的文件
  • 一项覆盖 30 万域名的研究测得约 10% 的采纳率:采纳确实存在,但研究没有发现它目前会影响引用(SEJ,2025-11-20
  • 一项为期 90 天、覆盖 10 个站点的研究跟踪了部署前后的 AI 流量:研究建议把它当作类似 sitemap 的基础设施,而非增长手段(Search Engine Land,2026-01-20

不同引擎对 llms.txt 的处理可能不同,具体见 ChatGPT SearchPerplexity AIClaude。截至 2026 年 5 月,没有任何厂商在文档中说明会读取 llms.txt。

常见误用:哪些做法会适得其反或没有效果

常见误用 为什么看起来合理 实际问题
用 llms.txt 来「阻止 AI 训练我的站点」 看到文件是为 AI 准备的 这是最严重的职责混淆:它只提示阅读优先级,不负责访问控制;用于访问控制的文件是 robots.txt
期待发布 llms.txt 后就能被引用 其他面向 AI 的文件会影响可见度 引擎是否会读取它至今未获证实(见上文);它只适合预先部署,以备未来使用,不能直接提高引用。内容能否被引用仍取决于页面本身(可引用性
继续使用与线上站点脱节的陈旧 llms.txt 文件发布时内容准确 一份内容错误的精选清单比没有这份文件更糟,它会让愿意读取它的工具读取失效或过时的 URL
把整个 sitemap 塞进 llms.txt 想尽量多列链接,覆盖更多内容 这会失去筛选的意义;llms.txt 用于精选内容,sitemap.xml 才负责完整列出页面
llms-full.txt 内容多到超出上下文窗口,或塞满导航杂项 希望把全部内容交给模型 这会失去节省 token 的优势,而节省 token 正是这个文件的核心价值
本该由构建过程生成,却改成手工维护 误以为文件很少变化 这样很容易与站点实际内容脱节,正确做法见 部署 llms.txt

关键洞察:llms.txt 的价值完全取决于内容是否经过筛选并保持最新;未经筛选或无人维护的 llms.txt 弊大于利,它会让愿意读取该文件的工具访问错误页面,反而降低该文件在这些工具中的可信度。

它对 GEO 的价值有多大

SEO vs GEO 所述,SEO 的现有基础仍然有效,llms.txt 只是一项尝试性补充;不应夸大它的实际价值。

发布 llms.txt 的合理之处,在于节省上下文窗口空间。一份经过筛选并去除网页噪声的内容清单,能降低任何会读取它的 LLM 工具处理站点内容时的成本,包括你自己的 RAG、AI 编码代理,以及愿意遵循这项约定的第三方工具。如果日后有厂商开始读取,现有文件也能继续使用。发布成本(尤其是自动生成时)约等于零,潜在损失也约等于零;未来若有引擎采用,也可以直接使用现有文件。

因此,llms.txt 在 GEO 中适合以低成本预先部署不是直接带来引用的手段。发布它,是因为它成本低、将来仍可沿用,而不是因为它今天能带来引用;规模最大的两项实测都没有发现它会影响引用(SEJ,30 万域名Search Engine Land,10 站点)。在内容处理流程中,llms.txt 先解决可读性/可检索性问题;页面被读取后能否被采用,则属于 可引用性问题。完整流程见 Answer Loop

围绕这项约定的支持与质疑,与 生成式引擎优化 面临的讨论相似。支持者认为,这项约定虽要走很长的路,但不宜断言它不会成功(Search Engine Land,2025-03-28);下文中的质疑者则指出 robots.txt 和 sitemap 已经覆盖了大部分需求。这两种判断并不冲突:llms.txt 值得以低成本部署,却不足以单独构成一套策略。

如何使用与后续维护

需要完成的事 相关条目或工具
根据线上站点生成初稿 llms.txt 生成器
按技术栈生成并部署它 部署 llms.txt
了解规范维护方式、采纳者名单与标准化进展 llms.txt 工作组
制定访问策略(llms.txt 不负责访问控制) robots.txt
了解相关的爬虫机制 AI 爬虫
查找用于内容发现与完整覆盖的文件 Sitemap 与 IndexNow
确认某个具体引擎是否会读取它 ChatGPT Search · Perplexity AI · Claude
了解页面被读取后能否获得引用 可引用性
把这些工作纳入完整的 GEO 方法 生成式引擎优化

关键洞察:如果能以低成本保持文件更新,就值得发布 llms.txt;访问策略应写入 robots.txt,内容能否获得引用仍取决于页面本身。llms.txt 只是站点主动提供的一份精选阅读清单它既不能授予访问权也不能直接使页面获得引用

中国企业部署 llms.txt 的特别考量

对于面向中国市场的企业,llms.txt 的部署需要考虑以下几个因素:

首先,国内 AI 引擎对 llms.txt 的支持情况尚不明确。文心一言、通义千问、豆包等引擎的爬虫政策尚未公布是否读取此类文件。建议关注各厂商的官方文档更新,但不要将其视为当前的 GEO 策略重点。

其次,如果企业有面向国际受众的英文内容平台,部署 llms.txt 的成本很低且可能带来未来收益。特别是技术文档类和 API 文档类站点,Mintlify 等文档平台已经支持自动生成 llms.txt。

第三,国内企业的 llms.txt 内容应优先考虑中文和英文双语版本。如果站点同时提供中英文内容,建议分别为各语言版本部署对应的 llms.txt 文件,或者在同一个文件中按语言分组列出链接。

第四,建议将 llms.txt 的部署纳入内容管理流程。由于 llms.txt 的价值取决于内容是否最新,建议与 CMS 或文档系统联动,确保文件生成后自动同步站点内容变化。

常见问题解答

发布 llms.txt 能让我的内容被 AI 引用吗?

现有证据表明,不能。没有任何公开信息确认主流 AI 引擎会读取 /llms.txt,规模最大的两项实测也都没有发现它会影响引用:覆盖 30 万域名的研究得出的结论是,它「似乎并不直接影响 AI 引用频次,至少目前还没有」;为期 90 天、覆盖 10 个站点的研究则建议把它当作类似 sitemap 的基础设施,而不是增长手段。内容能否获得引用,仍取决于页面本身。发布 llms.txt 的理由是成本低、向前兼容,而不是它能带来引用。

ChatGPT、Claude、Perplexity 或 Gemini 会读我的 llms.txt 吗?

截至 2026 年 5 月,没有任何厂商公开说明其爬虫或推理环节会读取第三方的 /llms.txt。OpenAI、Anthropic、Perplexity 和 Google 的官方爬虫文档都未提及它;Google 的 John Mueller 说,服务器日志显示这些 AI 服务「根本不会去查它」。不过,Anthropic、Google 和 Perplexity 都为自家文档发布了 llms.txt,容易让人误以为它们的爬虫也会读取这类文件。实际上,这只能说明它们在自己的站点上托管了该文件,不能证明它们的爬虫会读取你的文件。

llms.txt 是 robots.txt 或 sitemap.xml 的替代品吗?

不是。三个文件都放在根目录,但各有职责。robots.txt 负责访问控制,决定机器人能否抓取某个路径。sitemap.xml 帮助引擎发现内容,完整列出供索引的页面。llms.txt 负责筛选内容,以去除网页噪声的 Markdown 说明应优先阅读哪些页面。三者不能互相替代:llms.txt 既不是面向 AI 的 sitemap(否则会混淆内容筛选与完整覆盖),也不是面向 AI 的 robots.txt(否则会混淆阅读提示与访问规则)。

llms.txt 是官方标准吗?

不是。它由 Answer.AI 的 Jeremy Howard 于 2024 年 9 月提出,目前由社区非正式维护,未经 IETF 或 W3C 批准。规范托管在 llmstxt.org,社区登记处列出了采纳者。确实已有站点采用,但范围仍然有限:一项覆盖 30 万域名的研究发现,约 10% 的抽样域名部署了它。采用者虽然逐渐增多,但它仍处于提案阶段,还不是已经定型的标准。

那我还值得发布 llms.txt 吗?

值得,但要满足两个前提:成本足够低(最好由构建过程自动生成),而且文件能与线上站点保持同步。发布它,并不是因为已经有 AI 厂商承诺读取,而是因为它几乎没有成本,将来若有引擎开始读取,现有文件也能继续使用;它现在也能供你控制的工具使用,包括自有 RAG、AI 编码代理,以及愿意遵循这项约定的第三方工具。不过,文件必须经过筛选并保持最新。陈旧或未经筛选的 llms.txt 弊大于利,会让愿意读取它的工具访问错误页面,反而降低这些工具对该文件的信任。

延伸阅读

llms.txt 的技术实现指南

正确实施 llms.txt 需要关注以下几个技术要点:

文件位置与访问

llms.txt 必须放在站点根目录,路径为 /llms.txt。确保该文件可以通过 HTTP GET 请求直接访问,返回 200 状态码和纯文本内容。不要将 llms.txt 放在需要认证的路径下,也不要通过 robots.txt 禁止访问。

内容生成方式

根据站点类型,可以选择不同的内容生成方式:

  • 静态站点:在构建时生成 llms.txt,与站点一起部署
  • CMS 站点:通过插件或自定义代码动态生成 llms.txt
  • 文档站点:使用 Mintlify、Docusaurus 等文档工具,它们通常内置 llms.txt 生成功能
  • API 驱动站点:通过 API 获取内容元数据,生成 llms.txt

内容更新频率

llms.txt 的内容应保持与站点同步。建议的更新频率:

  • 内容频繁更新的站点:每次内容变更时自动更新 llms.txt
  • 内容更新较少的站点:每周或每月检查一次,确保文件与站点一致
  • 静态内容站点:内容基本不变时,可以每月检查一次

llms.txt 与 SEO 的关系

虽然 llms.txt 主要面向 AI,但它与 SEO 也有间接关系:

  • 内容结构清晰:制作 llms.txt 的过程会促使网站结构更加清晰,这也有助于 SEO
  • 精选内容:llms.txt 的筛选过程有助于识别高质量内容,这些内容通常也是 SEO 的重点
  • 导航优化:llms.txt 的链接结构可以为网站导航提供新思路

因此,实施 llms.txt 不仅是对 AI 的适配,也是对网站整体质量的提升。

llms.txt 的实际案例分析

以下案例展示了不同类型站点部署 llms.txt 的实践和效果。

案例一:技术文档站点的 llms.txt 部署

某开源软件项目采用了以下策略:

  • 自动生成:使用 Docusaurus 内置的 llms.txt 生成功能,在构建时自动生成
  • 内容筛选:只列出核心文档页面,排除 API 参考和开发者指南等详细页面
  • 多语言支持:为英文和中文分别生成 llms.txt 文件
  • 版本管理:将 llms.txt 纳入 Git 版本控制,每次文档更新时自动重新生成

实施效果:虽然目前尚无证据表明 AI 引擎读取了该站点的 llms.txt,但项目维护者发现,制作 llms.txt 的过程帮助团队重新梳理了文档结构,发现并修复了多个链接失效问题。

案例二:企业新闻站点的 llms.txt 部署

某跨国公司采用了以下策略:

  • 手动维护:由市场部手动维护 llms.txt,每周更新一次
  • 内容精选:只列出最新的新闻稿和重要的公司资讯页面
  • 格式规范:遵循 llms.txt 规范,包含项目摘要和链接列表
  • 访问测试:定期测试 llms.txt 的访问性,确保文件可正常访问

实施效果:该站点发现,手动维护 llms.txt 的成本较高,容易与网站实际内容脱节。后来改为自动化生成,显著降低了维护成本。

llms.txt 的未来发展展望

虽然目前 llms.txt 尚未得到主流 AI 引擎的正式支持,但以下发展趋势值得关注:

  • 标准化进展:llms.txt 工作组正在推动标准的完善,未来可能会有更明确的规范
  • 工具支持:越来越多的文档工具和 CMS 开始支持 llms.txt 生成
  • 引擎采纳:虽然目前尚无官方确认,但未来可能有 AI 引擎开始支持读取 llms.txt
  • 生态整合:llms.txt 可能与 robots.txt、sitemap.xml 等其他文件形式整合,形成更完整的站点配置体系

对于企业而言,以低成本预先部署 llms.txt 是一项风险低、潜在收益不确定的投资。如果未来有引擎开始读取,现有文件可以直接使用;即使没有,制作 llms.txt 的过程也能帮助优化网站结构和内容质量。

常见问题

JSON-LD是什么?

JSON-LD是Schema.org推荐的标记格式,用于向AI和搜索引擎描述页面内容结构。正确的JSON-LD标记可以显著提升AI对内容的理解。

llms.txt文件的作用?

llms.txt是位于网站根目录的文本文件,用于指导LLM爬虫如何抓取和使用网站内容。正确配置可以保护知识产权并优化内容引用。

多模态信号对GEO的影响?

AI不仅能理解文本,还能分析图片、视频等多媒体内容。通过Alt文本、结构化标记和多媒体优化,可以增强AI对内容的理解。

达摩

晓名 AI・GEO CTO & 创始人,专注生成式引擎优化实战

需要 GEO 优化?

立即联系我们,获取免费诊断报告。

获取免费诊断 →