在搜索引擎优化和生成式引擎优化中,URL 提交是确保内容被正确索引的基础工作。sitemap.xml 和 IndexNow 是两种最常用的 URL 提交协议,它们在机制、适用场景和对 AI 搜索的影响方面存在显著差异。理解这些差异,有助于制定更有效的索引策略。
sitemap.xml(2005 年,拉取模式)与 IndexNow(2021 年,推送模式,目前只有 Bing、Yandex 等参与方采用)是两种 URL 提交协议。二者都要先进入搜索引擎自身的索引,才会间接影响 AI 搜索:AIO 使用 Google 索引,Bing Copilot 使用 Bing 索引;ChatGPT、Perplexity、Claude 均不读取这两份文件。
关键洞察:URL 提交是 GEO 的基础工作,但不是决定引用的关键。它让页面有机会进入传统搜索索引;页面是否会进一步成为 AI 答案的候选来源,则取决于具体引擎。真正影响页面最终能否被引用的因素包括:可引用性、E-E-A-T、实体识别。
什么是 sitemap.xml 和 IndexNow
sitemap.xml 和 IndexNow 都用于提交 URL,但用途并不完全相同。sitemap.xml 出现得更早,于 2005 年作为开放标准发布(sitemaps.org),采用 拉取(pull)模式:发布方把 URL 清单放在固定位置,搜索引擎按各自的抓取节奏读取。Googlebot、Bingbot、YandexBot 等主流搜索爬虫都支持这项协议。
IndexNow 较新,由 Microsoft 与 Yandex 于 2021 年联合推出(indexnow.org),采用 推送(push)模式:URL 一旦发生变更,发布方就向参与方提供的接口发送通知,接收方可在数分钟内更新自己的索引。截至 2026-05,参与方包括 Microsoft Bing、Yandex、Naver、Seznam.cz、Yep(indexnow.org)。Google 在 2021 年宣布测试后并未加入;AI 厂商的第一方爬虫也均未加入。
对 GEO 而言,最重要的是:这两套机制都先影响传统搜索索引,再由相关索引间接影响 AI 搜索。Google AI Overviews 使用 Google 搜索中的 sitemap 信息,因为 AIO 的采信(grounding)建立在 Google 经典网页索引之上;Bing Copilot 同样会使用 Bing 索引中的 sitemap 与 IndexNow 信息。独立答案引擎则不同:ChatGPT Search、Perplexity、Claude 各自运行独立的检索(retrieval)爬虫,抓取节奏也各不相同,三家公开的爬虫文档均未说明会读取 sitemap.xml 或 IndexNow。
按 Answer Loop 的流程,这一步发生在 AI 爬虫 开始抓取之前:引擎先发现页面(URL 出现在某份清单中),再由爬虫抓取,页面进入索引后才能被检索,最后还要看 可引用性,也就是页面被读取后,原文能否直接用于答案。提交是必要条件,不是充分条件;它只能让页面有机会成为候选来源,不能保证页面会被引用。
协议的实际做法
两种协议在五个实际方面各不相同,下表逐项对照:
| 维度 | sitemap.xml | IndexNow |
|---|---|---|
| 标准 | 由 sitemaps.org 于 2005 年发布的开放协议 | 由 Microsoft 与 Yandex 于 2021 年推出的 indexnow.org 协议 |
| 模式 | 引擎按自身的抓取节奏拉取清单 | URL 变更时,由发布方主动推送通知 |
| 读取方 | Googlebot、Bingbot、YandexBot,以及几乎所有主流搜索爬虫 | Microsoft Bing、Yandex、Naver、Seznam.cz、Yep。Google 没有加入,任何 AI 厂商的第一方爬虫也都没有加入 |
| 延迟 | 通常为数小时到数天,具体取决于引擎的抓取节奏 | 通常为数分钟,因为发布方会在内容变更时主动推送 |
| 提交方式 | 在 robots.txt 中使用 Sitemap: 指令,还可以选择通过 Search Console 或 Webmaster Tools 提交 |
URL 变更时,向任一参与方的接口发送 HTTP 请求,并附上 URL 和密钥(key) |
| 规模上限 | 单个文件最多包含 50,000 条 URL,未压缩时不得超过 50 MB;超过上限的站点应使用 sitemap 索引(sitemap index),详见 sitemaps.org | 单批 POST 最多可提交 10,000 条 URL;密钥可以是任意令牌,并托管在站点根目录 |
发布方接入 IndexNow 的方式很简单:URL 变更时发送一次 HTTP 请求,并在站点根目录放置密钥文件即可。它不使用 API 令牌,也不要求发布方分别向每家引擎验证身份。最简推送方式如下:
# IndexNow 最简推送示例:只演示原理,并非完整客户端
1. 将 <your-key>.txt 托管在站点根目录,文件内容就是 <your-key>
例:https://example.com/abc123.txt → 内容:abc123
2. URL 变更时,使用 GET 提交单条 URL:
https://api.indexnow.org/IndexNow?url=https://example.com/page&key=abc123
或使用 POST 批量提交,单批最多 10,000 条:
POST https://<participating-engine>/indexnow
Content-Type: application/json
{ "host": "example.com",
"key": "abc123",
"urlList": ["https://example.com/page1", "https://example.com/page2"] }
3. 接收方会自动将这次提交转发给其他 IndexNow 参与方
(Bing → Yandex → Naver → Seznam → Yep)。
只需推送一次,五家都会收到。
完整的 JSON 格式与各引擎的接口列表见 官方规范。包括 Cloudflare 在内的 CDN 都提供一键启用功能,可代站点推送 IndexNow(Cloudflare,2021);因此,许多站点即使没有自行编写代码,也已经在发送 IndexNow 通知。
Google 与 IndexNow 的关系还需单独说明。Google 在 2021 年 11 月宣布以可持续性为目标测试这套协议(Search Engine Land,2021-11-09),但测试并未带来正式采纳;到 2024 年,独立报道仍得出相同结论(ppc.land,2024-12-30)。实际结论很明确:一次 IndexNow 推送会通知 Bing、Yandex、Naver、Seznam、Yep;这些搜索索引中,目前只有 Bing 的数据会进一步用于 AI 答案,由 Bing Copilot 使用。
各 AI 引擎受到什么影响:对照表
判断标准只有一个:这家 AI 引擎是否使用了支持这些协议的传统搜索索引。按此可以把引擎分为三类。
| AI 引擎 | sitemap.xml | IndexNow | 为什么 |
|---|---|---|---|
| Google AI Overviews | 使用(通过 Google 索引) | 不使用,因为 Google 没有加入 IndexNow | AIO 的采信建立在 Google 经典网页索引之上;通过 Search Console 提交 sitemap 有助于 Google 更快发现页面,页面也随之有机会成为 AIO 的候选来源 |
| Bing Copilot | 使用(通过 Bing 索引) | 使用(通过 Bing 索引) | IndexNow 是 Microsoft 主推的协议;Copilot 使用 Bing 索引,因此一次推送可让 Bing 在数分钟内更新索引,Copilot 可用的候选来源也会同步更新 |
| ChatGPT Search · Perplexity · Claude | 间接帮助发现:三家各自运行独立的检索爬虫,抓取节奏也各不相同;robots.txt 中的 Sitemap: 指令可能有助于发现页面,但并非必需 |
不使用:三家公开的爬虫文档均未提到 IndexNow 或任何 URL 提交协议 | 每家都维护独立的检索索引,也都没有对外提供 URL 提交通道 |
正确理解这张表的关键是:只有当 AI 引擎使用了支持这些协议的传统搜索索引时,提交协议才会发挥作用。Google AI Overviews 使用 Google 索引中的 sitemap 信息;Bing Copilot 同时使用 Bing 索引中的 sitemap 与 IndexNow 信息;独立答案引擎则依靠自己的爬虫,不使用这两项提交信息。因此,认为「推送 IndexNow 就能让 ChatGPT 引用我」,是混淆了两类引擎的工作方式(见下文)。
向 AI 索引提交 URL:能做什么,不能做什么
从业者最常提出的问题是:如何把 URL 提交给 ChatGPT、Perplexity 或 Claude?截至 2026-05,答案是:无法直接提交。任何一家主流的独立答案引擎都没有第一方的 URL 提交通道。
目前可用的提交通道(均先提交到传统搜索索引,再间接影响 AI 答案):
- Google Search Console:通过 sitemap 提交与 URL Inspection 将内容提交到 Google 经典网页索引,AI Overviews 直接使用这套索引(Build and submit a sitemap)
- Bing Webmaster Tools:通过 sitemap 提交与 URL Submit 将内容提交到 Bing 索引,Bing Copilot 直接使用这套索引
- IndexNow:推送通知可让 Bing、Yandex、Naver、Seznam、Yep 的索引在数分钟内更新;其中 Bing 索引的数据还会用于 Copilot,这是目前延迟最低的方式(How to add IndexNow)
不存在的提交通道:
- OpenAI、Anthropic、Perplexity 三家都没有第一方的 URL 提交 API;三家的爬虫文档说明的都是 robots.txt、IP 段白名单和访问策略,均未说明如何提交 URL(OpenAI;Anthropic;Perplexity)
- 「Google 接受 IndexNow」是一种常见误解,Google 至今没有加入这套协议
- 也不存在任何一种可以一次向所有 AI 答案系统提交 URL 的统一通道
关键洞察:简而言之,目前无法把 URL 直接「提交给 AI」,只能提交到传统搜索索引,再由使用这些索引的 AI 答案系统获取。至于 ChatGPT 或 Perplexity 能否发现页面,关键不在于把 URL 提交到某个地方,而在于两个基础条件:页面内容便于检索爬虫读取后直接采用(可引用性),并且爬虫确实能够访问页面(AI 爬虫)。
sitemap.xml ≠ llms.txt ≠ robots.txt:三个文件,三种用途
完整的爬虫访问与内容发现配置通常包含三个站点根目录文件,但三者经常被混淆。每个文件各有明确用途,不能相互替代。
| 文件 | 作用 | 不具备的功能 |
|---|---|---|
| robots.txt | 访问控制:决定爬虫能否抓取指定 URL | 它不列出 URL,不传达内容新鲜度,也不声明清单是否完整 |
| sitemap.xml | 页面发现与清单完整性:列出希望被索引的全部页面 | 它不负责精选内容,不授予访问权限,也不能作为质量信号 |
| llms.txt | 精选内容与简洁排版:列出建议优先阅读的页面,并采用简洁的 Markdown 排版 | 它既不授予也不拒绝访问,不声明清单是否完整,也不传达索引意图 |
sitemap.xml 不是精选清单,不是访问规则,也不是「最佳页面」目录,而是一份完整的 URL 清单。如果只把筛选后的页面写入 sitemap.xml,就违背了这项协议的用途:精选内容应使用 llms.txt;sitemap.xml 则必须包含希望被索引的全部内容,缺失的 URL 会被引擎视为覆盖不足。llms.txt §4 从 llms.txt 的角度给出了同一组对照,可结合阅读。
反模式:提交什么时候会适得其反或毫无作用
| 反模式 | 看似合理的理由 | 实际问题 |
|---|---|---|
| 「推送 IndexNow 之后,页面就会出现在 ChatGPT、Perplexity 或者 Claude 里」 | IndexNow 是开放标准,有些 AI 厂商也表示会遵守 Web 标准 | IndexNow 的参与方名单(indexnow.org)只有 Bing、Yandex、Naver、Seznam、Yep,并不包括任何 AI 厂商的爬虫。IndexNow 只能先通知 Bing,再通过 Bing 索引间接影响 Copilot |
| 「只在 sitemap.xml 中列出优质页面,供 AI 引擎查看」 | GEO 强调精选内容,因此页面越少、质量越高似乎越合适 | 这种做法违背了 sitemap.xml 的用途。这项协议要求清单保持完整,希望被索引的 URL 都应列入。引擎会把筛选后的子集视为覆盖不完整,而不是质量信号。精选内容应使用 llms.txt |
「在 sitemap.xml 中加入 noindex 或 canonical 指向别处的 URL;列入的 URL 越多越好」 |
直觉上看,列出的 URL 越多,发现范围似乎就越广 | sitemap 与页面信号不一致,会干扰引擎对页面质量的判断。Google 的 sitemap 文档明确说明了哪些 URL 应当列入、哪些不应列入(Build and submit a sitemap) |
| 「尝试向 Google 推送 IndexNow,即使无效也不会造成损失」 | 推送速度通常快于拉取,因此即使无效,似乎也不会造成损失 | 自 2021 年那次测试公告之后,Google 一直没有加入 IndexNow(Search Engine Land,2021;到 2024 年,独立报道仍是同一判断 ppc.land)。这种提交没有接收方,却会在监控面板中制造噪声。向 Google 提交 URL 只能使用 Search Console |
关键洞察:URL 提交是 GEO 的基础工作,但不是决定引用的关键。它让页面有机会进入传统搜索索引;页面是否会进一步成为 AI 答案的候选来源,则取决于具体引擎。真正影响页面最终能否被引用的因素包括:可引用性、E-E-A-T、实体识别。如果在提交上投入过多,例如反复筛选 sitemap,或向未参与协议的引擎推送 IndexNow,并不会增加引用;投入不足,页面甚至可能没有机会成为候选来源。正确完成即可,无需反复优化。
对 GEO 有什么影响,应该怎么做
| 你的需求 | 建议做法 |
|---|---|
| 让 Google 发现我的站点,使页面有机会成为 AIO 的候选来源 | 通过 Google Search Console 提交 sitemap(Build and submit a sitemap),并在 robots.txt 中添加 Sitemap: 指令 |
| 让 Bing 发现我的站点,使页面有机会成为 Copilot 的候选来源 | 通过 Bing Webmaster Tools 提交 sitemap,并接入 IndexNow(How to add IndexNow) |
| 让 Bing 在数分钟内发现新 URL,并供 Copilot 使用 | 按 indexnow.org/documentation 接入 IndexNow;最简调用方式见上文 |
| 让 ChatGPT、Perplexity 或者 Claude 引用我 | 目前没有提交通道,应提高内容的 可引用性,同时确保检索爬虫能够访问页面(见 AI 爬虫) |
| 在一次 GEO 整体审计中同时检查索引覆盖与爬虫访问 | GEO 审计 会分别检查 sitemap 是否存在、爬虫能否访问页面 |
| 让爬虫访问页面后能够正确解析内容 | SSR for AI Crawlers:这属于渲染问题,需要单独处理 |
| 在协议层面管控爬虫访问 | 具体配置见 AI 爬虫 与 robots.txt |
| 区分 sitemap.xml、llms.txt、robots.txt | 见上文;llms.txt §4 也从 llms.txt 的角度对照了这三个文件 |
关键洞察:sitemap.xml 是 GEO 必不可少的基础配置;IndexNow 成本很低,对于通过 Bing Copilot 获得的 AI 曝光也值得启用。两者都不是 GEO 中决定引用的关键;进一步投入的重点仍是 可引用性、E-E-A-T、实体识别。完善索引提交后,应把额外资源用于真正影响引用的环节。
中国企业使用 sitemap.xml 和 IndexNow 的特别考量
对于面向中国市场的企业,sitemap.xml 和 IndexNow 的使用需要考虑以下几个因素:
首先,百度对 sitemap.xml 的支持相对成熟。百度站长平台(https://ziyuan.baidu.com/)提供了完整的 sitemap 提交功能,建议企业通过百度站长平台提交 sitemap,以确保百度搜索引擎能够正确索引页面内容。
其次,IndexNow 目前在中国大陆地区的适用性有限。由于参与方主要是 Bing、Yandex 等国际搜索引擎,如果企业的主要目标市场在中国大陆,IndexNow 的价值相对较低。但仍建议对面向海外华人的英文内容平台启用 IndexNow,以覆盖 Bing 和 Yandex 的索引需求。
第三,国内 AI 引擎如文心一言、通义千问等,目前尚未公布对 sitemap 或 IndexNow 的明确支持政策。建议关注各厂商的官方文档更新,但不要把 sitemap 提交视为这些引擎的主要入口。
第四,跨国企业应特别注意 sitemap 的多语言和多区域支持。如果企业网站包含多个语言版本或面向不同地区的版本,建议分别为各版本创建独立的 sitemap 文件,并在 robots.txt 中通过 Sitemap: 指令分别引用。
第五,建议使用自动化工具生成和更新 sitemap。对于内容频繁更新的站点,手动维护 sitemap 的成本较高且容易出错。WordPress 等主流 CMS 都有 sitemap 插件,可以快速生成和维护 sitemap。
常见问题解答
提交 sitemap 或推送 IndexNow,能让我的页面被 AI 搜索引擎引用吗?
只能间接提高被引用的可能性,而且只适用于使用传统搜索索引的 AI 引擎。提交 sitemap 让 Google 将页面纳入索引后,页面才可能成为 Google AI Overviews 的候选来源;提交 sitemap 或推送 IndexNow 让 Bing 将页面纳入索引后,页面才可能成为 Bing Copilot 的候选来源。ChatGPT Search、Perplexity、Claude 各自运行独立的检索爬虫,抓取节奏也各不相同;三家公开的爬虫文档都没有提到读取 sitemap.xml 或 IndexNow(OpenAI;Anthropic;Perplexity)。提交只能让引擎有机会把页面列为候选来源,并不能保证页面会被引用。
Google 现在接受 IndexNow 提交吗?
截至 2026-05,不接受。Google 在 2021 年 11 月宣布测试这套协议(Search Engine Land),但此后一直没有正式加入;到 2024 年,独立报道仍得出相同结论(ppc.land,2024-12-30)。目前向 Google 提交 URL,仍要使用 robots.txt 中的 Sitemap: 指令、Search Console 的 sitemap 提交功能或 URL Inspection;此外还有用途很窄的 Indexing API,仅接收招聘启事和直播内容。
ChatGPT Search、Perplexity、Claude 会读 sitemap.xml 或 IndexNow 吗?
三家的爬虫文档都没有说明会读取这两份文件。OpenAI、Anthropic、Perplexity 的公开爬虫页面只介绍 robots.txt、IP 段白名单和访问策略,没有提到 URL 提交。它们的检索爬虫会按自己的节奏发现页面,因此真正该做的是确保爬虫能够访问页面(AI 爬虫),并让页面内容便于直接采用(可引用性),而不是寻找并不存在的提交协议。
可以只在 sitemap.xml 中列出优质页面,供 AI 引擎查看吗?
不能,这不符合协议的用途。sitemap.xml 是一份完整的 URL 清单,你希望被索引的全部 URL 都应列入同一份规范文件。引擎会把筛选后的子集视为覆盖不完整,而不是质量信号;Google 的 sitemap 文档也明确说明了哪些 URL 应当列入、哪些不应列入(Build and submit a sitemap)。精选内容应使用 llms.txt,访问控制应使用 robots.txt;sitemap.xml 表达的是「我希望被索引的内容全部在这里」。
目前该如何向 AI 引擎提交 URL?
任何一家主流的独立答案引擎都没有第一方的「提交给 AI」通道。可行的办法只有先提交到传统搜索索引,再由使用该索引的 AI 答案系统间接获取页面。现有方式分为两组:Google Search Console(对应 AIO),以及 Bing Webmaster Tools 或 IndexNow(对应 Copilot)。对于 ChatGPT、Perplexity、Claude,更基础的工作是正确设置 robots 策略,让检索爬虫访问页面时获得可正常解析的 SSR 响应(SSR for AI Crawlers),并让页面内容便于直接采用(可引用性)。
延伸阅读
- 生成式引擎优化(GEO)
- AI 爬虫
- robots.txt
- llms.txt
- 可引用性
- E-E-A-T
- 实体识别
- 答案循环
- SSR for AI Crawlers
- Google AI Overviews
- Bing Copilot
- ChatGPT 搜索
- Perplexity AI
- Claude
Sitemap 与 IndexNow 的实际部署案例
以下案例展示了不同规模的企业如何部署 sitemap 和 IndexNow,以及这些部署的实际效果。
案例一:小型博客站点的 sitemap 部署
某个人技术博客拥有约 200 篇文章,采用以下部署策略:
- sitemap.xml:使用 WordPress 的 Yoast SEO 插件自动生成 sitemap,包含所有文章和页面
- robots.txt:在 robots.txt 中添加
Sitemap: https://example.com/sitemap.xml - Search Console:提交 sitemap 到 Google Search Console 和 Bing Webmaster Tools
- IndexNow:通过 Cloudflare 一键启用 IndexNow,密钥文件托管在站点根目录
实施效果:新文章发布后,Google 和 Bing 的索引延迟从原来的 2-3 天缩短到 24 小时内。Bing Copilot 中的引用次数明显增加。
案例二:大型电商站点的 sitemap 索引部署
某大型电商平台拥有超过 50 万商品页面,采用以下部署策略:
- sitemap 索引:使用 sitemap 索引文件,将 URL 按类别分组,每个子 sitemap 包含不超过 50,000 个 URL
- 动态生成:通过定时任务动态生成 sitemap,确保 lastmod 字段反映最新内容变更
- 排除 noindex 页面:在生成 sitemap 时排除标记为 noindex 的页面(如搜索结果页、用户登录页)
- IndexNow 批量推送:使用 POST 接口批量推送 URL 变更,单批最多 10,000 个 URL
实施效果:搜索引擎对新商品页面的索引速度显著提升,特别是在使用 IndexNow 后,Bing 索引延迟从数天缩短到数分钟。虽然 Google 不支持 IndexNow,但通过 Search Console 的 sitemap 提交,Google 索引速度也有所改善。
案例三:多语言站点的 sitemap 部署
某跨国企业网站包含英文、中文、日文三个版本,采用以下部署策略:
- 分语言 sitemap:为每个语言版本创建独立的 sitemap 文件,如
/en/sitemap.xml、/zh/sitemap.xml、/ja/sitemap.xml - hreflang 关联:在 sitemap 中使用
xhtml:link元素关联不同语言版本的同一页面 - robots.txt 引用:在根目录的 robots.txt 中引用所有语言的 sitemap
- Search Console 分资源:在 Google Search Console 中分别为每个语言版本创建资源,分别提交 sitemap
实施效果:各语言版本的搜索可见度都有显著提升,特别是中文和日文版本在本地搜索引擎中的索引覆盖率明显改善。多语言 sitemap 的正确配置也帮助搜索引擎更好地理解站点的国际化结构。
sitemap 和 IndexNow 的故障排查指南
在部署 sitemap 和 IndexNow 后,可能会遇到一些问题。以下是一些常见问题及解决方案:
| 问题 | 可能原因 | 解决方案 |
|---|---|---|
| sitemap.xml 无法访问 | 路径错误、权限问题、CDN 缓存 | 检查 URL 是否正确,确认服务器权限,清除 CDN 缓存 |
| Search Console 显示 sitemap 解析错误 | XML 格式错误、URL 格式错误、包含 noindex 页面 | 使用 XML 校验工具检查格式,修正 URL,排除 noindex 页面 |
| IndexNow 推送返回错误 | 密钥文件缺失、URL 格式错误、网络问题 | 确认密钥文件存在于根目录,检查 URL 格式,测试网络连接 |
| 搜索引擎仍未索引新页面 | sitemap 提交延迟、页面质量低、robots.txt 禁止 | 等待 sitemap 刷新,检查页面质量,确认 robots.txt 未禁止索引 |
| sitemap 文件过大 | URL 数量超过 50,000 或 50MB 限制 | 使用 sitemap 索引文件,将 URL 分组到多个子 sitemap |
sitemap 和 IndexNow 与 GEO 的综合策略
sitemap 和 IndexNow 是 GEO 基础工作的重要组成部分,但不应被视为 GEO 的全部。一个完整的 GEO 策略应包含:
- 索引提交:通过 sitemap 和 IndexNow 确保内容被搜索引擎发现
- 爬虫管理:通过 robots.txt 和 llms.txt 管理爬虫访问
- 内容优化:通过提高可引用性和 E-E-A-T 提升引用概率
- 实体识别:通过 Schema.org 标记和 sameAs 链接增强实体识别
- 性能优化:通过 CWV 优化提升 Google AI Overviews 的可见度
通过综合策略,可以在不同层面提升内容在 AI 搜索中的可见度和引用率。