Sitemap 与 IndexNow:两种 URL 提交协议

Sitemap 与 IndexNow:两种 URL 提交协议

在搜索引擎优化和生成式引擎优化中,URL 提交是确保内容被正确索引的基础工作。sitemap.xml 和 IndexNow 是两种最常用的 URL 提交协议,它们在机制、适用场景和对 AI 搜索的影响方面存在显著差异。理解这些差异,有助于制定更有效的索引策略。

sitemap.xml(2005 年,拉取模式)与 IndexNow(2021 年,推送模式,目前只有 Bing、Yandex 等参与方采用)是两种 URL 提交协议。二者都要先进入搜索引擎自身的索引,才会间接影响 AI 搜索:AIO 使用 Google 索引,Bing Copilot 使用 Bing 索引;ChatGPT、Perplexity、Claude 均不读取这两份文件。

关键洞察:URL 提交是 GEO 的基础工作,但不是决定引用的关键。它让页面有机会进入传统搜索索引;页面是否会进一步成为 AI 答案的候选来源,则取决于具体引擎。真正影响页面最终能否被引用的因素包括:可引用性、E-E-A-T、实体识别。

什么是 sitemap.xml 和 IndexNow

sitemap.xml 和 IndexNow 都用于提交 URL,但用途并不完全相同。sitemap.xml 出现得更早,于 2005 年作为开放标准发布(sitemaps.org),采用 拉取(pull)模式:发布方把 URL 清单放在固定位置,搜索引擎按各自的抓取节奏读取。Googlebot、Bingbot、YandexBot 等主流搜索爬虫都支持这项协议。

IndexNow 较新,由 Microsoft 与 Yandex 于 2021 年联合推出(indexnow.org),采用 推送(push)模式:URL 一旦发生变更,发布方就向参与方提供的接口发送通知,接收方可在数分钟内更新自己的索引。截至 2026-05,参与方包括 Microsoft Bing、Yandex、Naver、Seznam.cz、Yep(indexnow.org)。Google 在 2021 年宣布测试后并未加入;AI 厂商的第一方爬虫也均未加入。

对 GEO 而言,最重要的是:这两套机制都先影响传统搜索索引,再由相关索引间接影响 AI 搜索。Google AI Overviews 使用 Google 搜索中的 sitemap 信息,因为 AIO 的采信(grounding)建立在 Google 经典网页索引之上;Bing Copilot 同样会使用 Bing 索引中的 sitemap 与 IndexNow 信息。独立答案引擎则不同:ChatGPT Search、Perplexity、Claude 各自运行独立的检索(retrieval)爬虫,抓取节奏也各不相同,三家公开的爬虫文档均未说明会读取 sitemap.xml 或 IndexNow。

Answer Loop 的流程,这一步发生在 AI 爬虫 开始抓取之前:引擎先发现页面(URL 出现在某份清单中),再由爬虫抓取,页面进入索引后才能被检索,最后还要看 可引用性,也就是页面被读取后,原文能否直接用于答案。提交是必要条件,不是充分条件;它只能让页面有机会成为候选来源,不能保证页面会被引用。

协议的实际做法

两种协议在五个实际方面各不相同,下表逐项对照:

维度 sitemap.xml IndexNow
标准 由 sitemaps.org 于 2005 年发布的开放协议 由 Microsoft 与 Yandex 于 2021 年推出的 indexnow.org 协议
模式 引擎按自身的抓取节奏拉取清单 URL 变更时,由发布方主动推送通知
读取方 Googlebot、Bingbot、YandexBot,以及几乎所有主流搜索爬虫 Microsoft Bing、Yandex、Naver、Seznam.cz、Yep。Google 没有加入,任何 AI 厂商的第一方爬虫也都没有加入
延迟 通常为数小时到数天,具体取决于引擎的抓取节奏 通常为数分钟,因为发布方会在内容变更时主动推送
提交方式 在 robots.txt 中使用 Sitemap: 指令,还可以选择通过 Search Console 或 Webmaster Tools 提交 URL 变更时,向任一参与方的接口发送 HTTP 请求,并附上 URL 和密钥(key)
规模上限 单个文件最多包含 50,000 条 URL,未压缩时不得超过 50 MB;超过上限的站点应使用 sitemap 索引(sitemap index),详见 sitemaps.org 单批 POST 最多可提交 10,000 条 URL;密钥可以是任意令牌,并托管在站点根目录

发布方接入 IndexNow 的方式很简单:URL 变更时发送一次 HTTP 请求,并在站点根目录放置密钥文件即可。它不使用 API 令牌,也不要求发布方分别向每家引擎验证身份。最简推送方式如下:

# IndexNow 最简推送示例:只演示原理,并非完整客户端

1. 将 <your-key>.txt 托管在站点根目录,文件内容就是 <your-key>
   例:https://example.com/abc123.txt  →  内容:abc123

2. URL 变更时,使用 GET 提交单条 URL:
   https://api.indexnow.org/IndexNow?url=https://example.com/page&key=abc123

   或使用 POST 批量提交,单批最多 10,000 条:
   POST https://<participating-engine>/indexnow
   Content-Type: application/json
   { "host": "example.com",
     "key": "abc123",
     "urlList": ["https://example.com/page1", "https://example.com/page2"] }

3. 接收方会自动将这次提交转发给其他 IndexNow 参与方
   (Bing → Yandex → Naver → Seznam → Yep)。
   只需推送一次,五家都会收到。

完整的 JSON 格式与各引擎的接口列表见 官方规范。包括 Cloudflare 在内的 CDN 都提供一键启用功能,可代站点推送 IndexNow(Cloudflare,2021);因此,许多站点即使没有自行编写代码,也已经在发送 IndexNow 通知。

Google 与 IndexNow 的关系还需单独说明。Google 在 2021 年 11 月宣布以可持续性为目标测试这套协议(Search Engine Land,2021-11-09),但测试并未带来正式采纳;到 2024 年,独立报道仍得出相同结论(ppc.land,2024-12-30)。实际结论很明确:一次 IndexNow 推送会通知 Bing、Yandex、Naver、Seznam、Yep;这些搜索索引中,目前只有 Bing 的数据会进一步用于 AI 答案,由 Bing Copilot 使用。

各 AI 引擎受到什么影响:对照表

判断标准只有一个:这家 AI 引擎是否使用了支持这些协议的传统搜索索引。按此可以把引擎分为三类。

AI 引擎 sitemap.xml IndexNow 为什么
Google AI Overviews 使用(通过 Google 索引) 不使用,因为 Google 没有加入 IndexNow AIO 的采信建立在 Google 经典网页索引之上;通过 Search Console 提交 sitemap 有助于 Google 更快发现页面,页面也随之有机会成为 AIO 的候选来源
Bing Copilot 使用(通过 Bing 索引) 使用(通过 Bing 索引) IndexNow 是 Microsoft 主推的协议;Copilot 使用 Bing 索引,因此一次推送可让 Bing 在数分钟内更新索引,Copilot 可用的候选来源也会同步更新
ChatGPT Search · Perplexity · Claude 间接帮助发现:三家各自运行独立的检索爬虫,抓取节奏也各不相同;robots.txt 中的 Sitemap: 指令可能有助于发现页面,但并非必需 不使用:三家公开的爬虫文档均未提到 IndexNow 或任何 URL 提交协议 每家都维护独立的检索索引,也都没有对外提供 URL 提交通道

正确理解这张表的关键是:只有当 AI 引擎使用了支持这些协议的传统搜索索引时,提交协议才会发挥作用。Google AI Overviews 使用 Google 索引中的 sitemap 信息;Bing Copilot 同时使用 Bing 索引中的 sitemap 与 IndexNow 信息;独立答案引擎则依靠自己的爬虫,不使用这两项提交信息。因此,认为「推送 IndexNow 就能让 ChatGPT 引用我」,是混淆了两类引擎的工作方式(见下文)。

向 AI 索引提交 URL:能做什么,不能做什么

从业者最常提出的问题是:如何把 URL 提交给 ChatGPT、Perplexity 或 Claude?截至 2026-05,答案是:无法直接提交。任何一家主流的独立答案引擎都没有第一方的 URL 提交通道。

目前可用的提交通道(均先提交到传统搜索索引,再间接影响 AI 答案):

  • Google Search Console:通过 sitemap 提交与 URL Inspection 将内容提交到 Google 经典网页索引,AI Overviews 直接使用这套索引(Build and submit a sitemap
  • Bing Webmaster Tools:通过 sitemap 提交与 URL Submit 将内容提交到 Bing 索引,Bing Copilot 直接使用这套索引
  • IndexNow:推送通知可让 Bing、Yandex、Naver、Seznam、Yep 的索引在数分钟内更新;其中 Bing 索引的数据还会用于 Copilot,这是目前延迟最低的方式(How to add IndexNow

不存在的提交通道

  • OpenAI、Anthropic、Perplexity 三家都没有第一方的 URL 提交 API;三家的爬虫文档说明的都是 robots.txt、IP 段白名单和访问策略,均未说明如何提交 URL(OpenAI;Anthropic;Perplexity)
  • 「Google 接受 IndexNow」是一种常见误解,Google 至今没有加入这套协议
  • 也不存在任何一种可以一次向所有 AI 答案系统提交 URL 的统一通道

关键洞察:简而言之,目前无法把 URL 直接「提交给 AI」,只能提交到传统搜索索引,再由使用这些索引的 AI 答案系统获取。至于 ChatGPT 或 Perplexity 能否发现页面,关键不在于把 URL 提交到某个地方,而在于两个基础条件:页面内容便于检索爬虫读取后直接采用(可引用性),并且爬虫确实能够访问页面(AI 爬虫)。

sitemap.xml ≠ llms.txt ≠ robots.txt:三个文件,三种用途

完整的爬虫访问与内容发现配置通常包含三个站点根目录文件,但三者经常被混淆。每个文件各有明确用途,不能相互替代。

文件 作用 不具备的功能
robots.txt 访问控制:决定爬虫能否抓取指定 URL 它不列出 URL,不传达内容新鲜度,也不声明清单是否完整
sitemap.xml 页面发现与清单完整性:列出希望被索引的全部页面 它不负责精选内容,不授予访问权限,也不能作为质量信号
llms.txt 精选内容与简洁排版:列出建议优先阅读的页面,并采用简洁的 Markdown 排版 它既不授予也不拒绝访问,不声明清单是否完整,也不传达索引意图

sitemap.xml 不是精选清单,不是访问规则,也不是「最佳页面」目录,而是一份完整的 URL 清单。如果只把筛选后的页面写入 sitemap.xml,就违背了这项协议的用途:精选内容应使用 llms.txt;sitemap.xml 则必须包含希望被索引的全部内容,缺失的 URL 会被引擎视为覆盖不足。llms.txt §4 从 llms.txt 的角度给出了同一组对照,可结合阅读。

反模式:提交什么时候会适得其反或毫无作用

反模式 看似合理的理由 实际问题
「推送 IndexNow 之后,页面就会出现在 ChatGPT、Perplexity 或者 Claude 里」 IndexNow 是开放标准,有些 AI 厂商也表示会遵守 Web 标准 IndexNow 的参与方名单(indexnow.org)只有 Bing、Yandex、Naver、Seznam、Yep,并不包括任何 AI 厂商的爬虫。IndexNow 只能先通知 Bing,再通过 Bing 索引间接影响 Copilot
「只在 sitemap.xml 中列出优质页面,供 AI 引擎查看」 GEO 强调精选内容,因此页面越少、质量越高似乎越合适 这种做法违背了 sitemap.xml 的用途。这项协议要求清单保持完整,希望被索引的 URL 都应列入。引擎会把筛选后的子集视为覆盖不完整,而不是质量信号。精选内容应使用 llms.txt
「在 sitemap.xml 中加入 noindex 或 canonical 指向别处的 URL;列入的 URL 越多越好」 直觉上看,列出的 URL 越多,发现范围似乎就越广 sitemap 与页面信号不一致,会干扰引擎对页面质量的判断。Google 的 sitemap 文档明确说明了哪些 URL 应当列入、哪些不应列入(Build and submit a sitemap
「尝试向 Google 推送 IndexNow,即使无效也不会造成损失」 推送速度通常快于拉取,因此即使无效,似乎也不会造成损失 自 2021 年那次测试公告之后,Google 一直没有加入 IndexNow(Search Engine Land,2021;到 2024 年,独立报道仍是同一判断 ppc.land)。这种提交没有接收方,却会在监控面板中制造噪声。向 Google 提交 URL 只能使用 Search Console

关键洞察:URL 提交是 GEO 的基础工作,但不是决定引用的关键。它让页面有机会进入传统搜索索引;页面是否会进一步成为 AI 答案的候选来源,则取决于具体引擎。真正影响页面最终能否被引用的因素包括:可引用性、E-E-A-T、实体识别。如果在提交上投入过多,例如反复筛选 sitemap,或向未参与协议的引擎推送 IndexNow,并不会增加引用;投入不足,页面甚至可能没有机会成为候选来源。正确完成即可,无需反复优化。

对 GEO 有什么影响,应该怎么做

你的需求 建议做法
让 Google 发现我的站点,使页面有机会成为 AIO 的候选来源 通过 Google Search Console 提交 sitemap(Build and submit a sitemap),并在 robots.txt 中添加 Sitemap: 指令
让 Bing 发现我的站点,使页面有机会成为 Copilot 的候选来源 通过 Bing Webmaster Tools 提交 sitemap,并接入 IndexNow(How to add IndexNow
让 Bing 在数分钟内发现新 URL,并供 Copilot 使用 按 indexnow.org/documentation 接入 IndexNow;最简调用方式见上文
让 ChatGPT、Perplexity 或者 Claude 引用我 目前没有提交通道,应提高内容的 可引用性,同时确保检索爬虫能够访问页面(见 AI 爬虫
在一次 GEO 整体审计中同时检查索引覆盖与爬虫访问 GEO 审计 会分别检查 sitemap 是否存在、爬虫能否访问页面
让爬虫访问页面后能够正确解析内容 SSR for AI Crawlers:这属于渲染问题,需要单独处理
在协议层面管控爬虫访问 具体配置见 AI 爬虫robots.txt
区分 sitemap.xml、llms.txt、robots.txt 见上文;llms.txt §4 也从 llms.txt 的角度对照了这三个文件

关键洞察:sitemap.xml 是 GEO 必不可少的基础配置;IndexNow 成本很低,对于通过 Bing Copilot 获得的 AI 曝光也值得启用。两者都不是 GEO 中决定引用的关键;进一步投入的重点仍是 可引用性E-E-A-T实体识别。完善索引提交后,应把额外资源用于真正影响引用的环节。

中国企业使用 sitemap.xml 和 IndexNow 的特别考量

对于面向中国市场的企业,sitemap.xml 和 IndexNow 的使用需要考虑以下几个因素:

首先,百度对 sitemap.xml 的支持相对成熟。百度站长平台(https://ziyuan.baidu.com/)提供了完整的 sitemap 提交功能,建议企业通过百度站长平台提交 sitemap,以确保百度搜索引擎能够正确索引页面内容。

其次,IndexNow 目前在中国大陆地区的适用性有限。由于参与方主要是 Bing、Yandex 等国际搜索引擎,如果企业的主要目标市场在中国大陆,IndexNow 的价值相对较低。但仍建议对面向海外华人的英文内容平台启用 IndexNow,以覆盖 Bing 和 Yandex 的索引需求。

第三,国内 AI 引擎如文心一言、通义千问等,目前尚未公布对 sitemap 或 IndexNow 的明确支持政策。建议关注各厂商的官方文档更新,但不要把 sitemap 提交视为这些引擎的主要入口。

第四,跨国企业应特别注意 sitemap 的多语言和多区域支持。如果企业网站包含多个语言版本或面向不同地区的版本,建议分别为各版本创建独立的 sitemap 文件,并在 robots.txt 中通过 Sitemap: 指令分别引用。

第五,建议使用自动化工具生成和更新 sitemap。对于内容频繁更新的站点,手动维护 sitemap 的成本较高且容易出错。WordPress 等主流 CMS 都有 sitemap 插件,可以快速生成和维护 sitemap。

常见问题解答

提交 sitemap 或推送 IndexNow,能让我的页面被 AI 搜索引擎引用吗?

只能间接提高被引用的可能性,而且只适用于使用传统搜索索引的 AI 引擎。提交 sitemap 让 Google 将页面纳入索引后,页面才可能成为 Google AI Overviews 的候选来源;提交 sitemap 或推送 IndexNow 让 Bing 将页面纳入索引后,页面才可能成为 Bing Copilot 的候选来源。ChatGPT Search、Perplexity、Claude 各自运行独立的检索爬虫,抓取节奏也各不相同;三家公开的爬虫文档都没有提到读取 sitemap.xml 或 IndexNow(OpenAI;Anthropic;Perplexity)。提交只能让引擎有机会把页面列为候选来源,并不能保证页面会被引用。

Google 现在接受 IndexNow 提交吗?

截至 2026-05,不接受。Google 在 2021 年 11 月宣布测试这套协议(Search Engine Land),但此后一直没有正式加入;到 2024 年,独立报道仍得出相同结论(ppc.land,2024-12-30)。目前向 Google 提交 URL,仍要使用 robots.txt 中的 Sitemap: 指令、Search Console 的 sitemap 提交功能或 URL Inspection;此外还有用途很窄的 Indexing API,仅接收招聘启事和直播内容。

ChatGPT Search、Perplexity、Claude 会读 sitemap.xml 或 IndexNow 吗?

三家的爬虫文档都没有说明会读取这两份文件。OpenAI、Anthropic、Perplexity 的公开爬虫页面只介绍 robots.txt、IP 段白名单和访问策略,没有提到 URL 提交。它们的检索爬虫会按自己的节奏发现页面,因此真正该做的是确保爬虫能够访问页面(AI 爬虫),并让页面内容便于直接采用(可引用性),而不是寻找并不存在的提交协议。

可以只在 sitemap.xml 中列出优质页面,供 AI 引擎查看吗?

不能,这不符合协议的用途。sitemap.xml 是一份完整的 URL 清单,你希望被索引的全部 URL 都应列入同一份规范文件。引擎会把筛选后的子集视为覆盖不完整,而不是质量信号;Google 的 sitemap 文档也明确说明了哪些 URL 应当列入、哪些不应列入(Build and submit a sitemap)。精选内容应使用 llms.txt,访问控制应使用 robots.txt;sitemap.xml 表达的是「我希望被索引的内容全部在这里」。

目前该如何向 AI 引擎提交 URL?

任何一家主流的独立答案引擎都没有第一方的「提交给 AI」通道。可行的办法只有先提交到传统搜索索引,再由使用该索引的 AI 答案系统间接获取页面。现有方式分为两组:Google Search Console(对应 AIO),以及 Bing Webmaster Tools 或 IndexNow(对应 Copilot)。对于 ChatGPT、Perplexity、Claude,更基础的工作是正确设置 robots 策略,让检索爬虫访问页面时获得可正常解析的 SSR 响应(SSR for AI Crawlers),并让页面内容便于直接采用(可引用性)。

延伸阅读

Sitemap 与 IndexNow 的实际部署案例

以下案例展示了不同规模的企业如何部署 sitemap 和 IndexNow,以及这些部署的实际效果。

案例一:小型博客站点的 sitemap 部署

某个人技术博客拥有约 200 篇文章,采用以下部署策略:

  • sitemap.xml:使用 WordPress 的 Yoast SEO 插件自动生成 sitemap,包含所有文章和页面
  • robots.txt:在 robots.txt 中添加 Sitemap: https://example.com/sitemap.xml
  • Search Console:提交 sitemap 到 Google Search Console 和 Bing Webmaster Tools
  • IndexNow:通过 Cloudflare 一键启用 IndexNow,密钥文件托管在站点根目录

实施效果:新文章发布后,Google 和 Bing 的索引延迟从原来的 2-3 天缩短到 24 小时内。Bing Copilot 中的引用次数明显增加。

案例二:大型电商站点的 sitemap 索引部署

某大型电商平台拥有超过 50 万商品页面,采用以下部署策略:

  • sitemap 索引:使用 sitemap 索引文件,将 URL 按类别分组,每个子 sitemap 包含不超过 50,000 个 URL
  • 动态生成:通过定时任务动态生成 sitemap,确保 lastmod 字段反映最新内容变更
  • 排除 noindex 页面:在生成 sitemap 时排除标记为 noindex 的页面(如搜索结果页、用户登录页)
  • IndexNow 批量推送:使用 POST 接口批量推送 URL 变更,单批最多 10,000 个 URL

实施效果:搜索引擎对新商品页面的索引速度显著提升,特别是在使用 IndexNow 后,Bing 索引延迟从数天缩短到数分钟。虽然 Google 不支持 IndexNow,但通过 Search Console 的 sitemap 提交,Google 索引速度也有所改善。

案例三:多语言站点的 sitemap 部署

某跨国企业网站包含英文、中文、日文三个版本,采用以下部署策略:

  • 分语言 sitemap:为每个语言版本创建独立的 sitemap 文件,如 /en/sitemap.xml/zh/sitemap.xml/ja/sitemap.xml
  • hreflang 关联:在 sitemap 中使用 xhtml:link 元素关联不同语言版本的同一页面
  • robots.txt 引用:在根目录的 robots.txt 中引用所有语言的 sitemap
  • Search Console 分资源:在 Google Search Console 中分别为每个语言版本创建资源,分别提交 sitemap

实施效果:各语言版本的搜索可见度都有显著提升,特别是中文和日文版本在本地搜索引擎中的索引覆盖率明显改善。多语言 sitemap 的正确配置也帮助搜索引擎更好地理解站点的国际化结构。

sitemap 和 IndexNow 的故障排查指南

在部署 sitemap 和 IndexNow 后,可能会遇到一些问题。以下是一些常见问题及解决方案:

问题 可能原因 解决方案
sitemap.xml 无法访问 路径错误、权限问题、CDN 缓存 检查 URL 是否正确,确认服务器权限,清除 CDN 缓存
Search Console 显示 sitemap 解析错误 XML 格式错误、URL 格式错误、包含 noindex 页面 使用 XML 校验工具检查格式,修正 URL,排除 noindex 页面
IndexNow 推送返回错误 密钥文件缺失、URL 格式错误、网络问题 确认密钥文件存在于根目录,检查 URL 格式,测试网络连接
搜索引擎仍未索引新页面 sitemap 提交延迟、页面质量低、robots.txt 禁止 等待 sitemap 刷新,检查页面质量,确认 robots.txt 未禁止索引
sitemap 文件过大 URL 数量超过 50,000 或 50MB 限制 使用 sitemap 索引文件,将 URL 分组到多个子 sitemap

sitemap 和 IndexNow 与 GEO 的综合策略

sitemap 和 IndexNow 是 GEO 基础工作的重要组成部分,但不应被视为 GEO 的全部。一个完整的 GEO 策略应包含:

  1. 索引提交:通过 sitemap 和 IndexNow 确保内容被搜索引擎发现
  2. 爬虫管理:通过 robots.txt 和 llms.txt 管理爬虫访问
  3. 内容优化:通过提高可引用性和 E-E-A-T 提升引用概率
  4. 实体识别:通过 Schema.org 标记和 sameAs 链接增强实体识别
  5. 性能优化:通过 CWV 优化提升 Google AI Overviews 的可见度

通过综合策略,可以在不同层面提升内容在 AI 搜索中的可见度和引用率。

常见问题

如何开始GEO优化?

1) 审计现有内容可见度 2) 添加结构化标记 3) 优化品牌提及 4) 创建可引用内容 5) 监控AI推荐数据。建议从基础知识学习开始,逐步实施。

GEO优化的ROI如何衡量?

GEO效果可通过:AI推荐提及次数、零点击搜索份额、品牌搜索量增长、内容引用率等指标衡量。建议建立基线数据并定期追踪。

GEO优化的时间周期?

GEO效果通常需要3-6个月才能显著体现。结构化标记即时生效,但品牌提及和实体识别需要时间积累。建议持续优化并定期评估。

达摩

晓名 AI・GEO CTO & 创始人,专注生成式引擎优化实战

需要 GEO 优化?

立即联系我们,获取免费诊断报告。

获取免费诊断 →