在 robots.txt 的众多指令中,Google-Extended 是一个特殊且常被误解的存在。它既不是传统意义上的爬虫,也不是用于访问控制的通用指令,而是一个专门控制内容用途的产品令牌。理解它的实际作用范围,对于制定正确的 AI 内容策略至关重要。
Google-Extended 是 robots.txt 中用于控制内容用途的令牌,并非爬虫。它决定 Google 抓取的内容能否用于官方列出的 Gemini 训练与采信,不影响 Google 普通搜索的收录或排名。
关键洞察:Google-Extended 产生不了独立的流量标识,因为它的 HTTP 用户代理不存在。请求仍由 Google 现有的用户代理(如 Googlebot)发出,因此日志中不会出现独立的 Google-Extended 标识。验证策略应以配置为依据,而非试图在日志中追踪该令牌。
Google-Extended 的本质:用途控制令牌
Google-Extended 是一项可写入 robots.txt User-agent: 字段的独立产品令牌(product token)。Google 根据相应规则,决定现有爬虫抓取的内容能否用于官方列出的 Gemini 训练,或作为采信(grounding)依据(见 Google's common crawlers)。
这里有两个概念不能混为一谈。这个令牌使用 robots.txt 的语法,但并不代表一个 HTTP 客户端。Google 明确说明,Google-Extended 没有独立的 User-Agent 字符串。
| 字段 | 当前含义(核对日期:2026 年 7 月 22 日) |
|---|---|
| 对象类型 | 控制内容用途的独立产品令牌 |
| 请求身份 | 没有独立的 HTTP 用户代理身份 |
| 实际抓取 | 由 Google 现有的用户代理完成 |
| 控制的用途 | Google 官方文档列出的 Gemini 训练与采信 |
| 对 Google 搜索的影响 | 不影响普通搜索的收录或排名 |
Google 的 common crawlers 页面既介绍实际发出请求的爬虫,也介绍面向具体产品的控制令牌,因此 Google-Extended 会列在其中。不能仅凭页面所属目录判断其性质,仍应以 Google 当前爬虫文档 对各字段的明确说明为准。
这种做法在 Robots Exclusion Protocol 中并不常见。按照 RFC 9309 的通常约定,爬虫产品令牌应出现在相应的 HTTP User-Agent 字符串中。Google 则明确将 Google-Extended 用作内容用途控制令牌。因此,应把它视为用途控制令牌,而不是身份未公开的爬虫。
没有独立爬虫:控制规则如何生效
系统会分开处理抓取请求与抓取后的用途判断:
Google 现有用户代理抓取 URL
│
▼
Google 读取该主机的 Google-Extended 规则
│
┌─────┴─────┐
▼ ▼
允许使用 禁止使用
│ │
▼ ▼
用于列出的训练 排除在列出的训练
或采信流程 或采信流程之外
禁止规则不会阻止抓取请求本身。Googlebot 仍可能为搜索而抓取同一 URL,服务器日志也会继续记录 Googlebot,而不是 Google-Extended。规则限制的是抓取后的用途,也就是 Google 能否将内容用于文档列出的流程。
同理,只匹配 Google-Extended 的 WAF 规则也不会生效。这个令牌没有可供匹配的请求字符串、专属 IP 范围,也没有用于核验身份的反向 DNS。网络层决定请求能否获取内容;Google-Extended 决定已获取的内容可以用于什么目的。
Applebot-Extended 的工作方式相似:它本身不抓取页面,只控制 Applebot 已抓取数据的用途。不过,两者适用范围不同。Apple 的令牌用于基础模型训练,Google 当前的令牌还涵盖若干实时采信用途。
它控制哪些 Gemini 用途
Google 当前将两类用途归入同一个令牌。因此,只把 Google-Extended 当作训练退出开关已不准确。
| 用途类别 | Google 当前列出的产品或功能 | 禁止后的影响 |
|---|---|---|
| 未来模型训练 | 供 Gemini Apps 和 Vertex AI API for Gemini 使用的模型 | 内容不再用于符合条件的训练 |
| Gemini 采信 | Gemini Apps | 内容不再作为官方列出的实时采信依据 |
| Google Cloud 产品中的 Google 搜索采信 | 支持此功能的 Google Cloud 产品 | 内容不再用于这类采信 |
| 搜索生成式 AI 所用模型的训练 | 用于生成搜索 AI 回答的模型 | 按照 Google 的说明,发布者应使用 Google-Extended 限制这项训练 |
Google Cloud 的产品名称仍在变化。当前的 Grounding with Google Search 文档 明确说明,Gemini Enterprise Agent Platform 不会把禁止 Google-Extended 的网页作为采信依据。Google 已将较早的 Vertex AI 文档迁移至新的产品目录,因此复核策略时应以当前官方页面为准,不能只看某个固定的产品名称。
关键洞察:这项控制推出时间不长,适用范围却已发生重要变化。2023 年 9 月首次发布时,主要面向 Bard 和 Vertex AI 模型的训练退出。2026 年 6 月,Google 开始测试独立的搜索 AI 控制。截至 2026 年 7 月,当前文档涵盖 Gemini 训练与列出的采信用途。适用产品清单会随相关政策持续更新,不能据此推断 Google-Extended 将永久覆盖 Google 的所有 AI 产品。
Google 搜索、AI Overviews 与 AI Mode:Google-Extended 不控制这些
最常见的误解是,以为禁止 Google-Extended 就能让网站退出 Google AI Overviews 或 AI Mode。它并不决定网站链接和内容能否出现在这些搜索功能中。
Google 当前提供的相关控制分属不同层次:
| 功能或决策 | 当前控制手段 | Google-Extended 的作用 |
|---|---|---|
| 普通搜索的抓取与索引 | Googlebot、robots.txt、noindex 及其他搜索控制 |
不影响收录或排名 |
| 搜索摘要及可展示的页面片段 | nosnippet、max-snippet、data-nosnippet、预览控制 |
不直接参与搜索 |
| 生成式 AI 中的展示与采信 | Search Console 的搜索生成式 AI 控制(如已开放) | Google-Extended 不参与,另有独立控制 |
| 生成搜索 AI 回答所用模型的训练 | Google-Extended | Google 指示发布者使用此令牌 |
| 官方列出的 Gemini Apps 与 Cloud 采信 | Google-Extended | 可直接控制这些用途 |
页面能否进入这些搜索功能,仍取决于 Googlebot。Google 的 2026 年 7 月 AI 优化指南 说明,页面必须已被索引,并符合显示搜索摘要的条件;若该项独立控制已向相应的 Search Console 资源开放,还须通过该资源允许页面进入搜索生成式 AI 功能。搜索 AI 采用检索增强生成(RAG),从 Google 搜索索引中选取页面。
这项独立搜索控制推出不久,尚未全面开放。2026 年 1 月,Google 还在研究如何让网站单独退出搜索生成式 AI 功能;6 月 3 日,Google 开始面向部分英国站长测试 Search Console 开关。截至 7 月 22 日,帮助页仅说明该功能正在向部分站长开放,尚未宣布在全球正式推出。
通过该开关排除某项 Search Console 资源后,其链接和内容将不会出现在 AI Overviews、AI Mode 以及 Discover 的生成式 AI 功能中,也不会成为这些功能的采信依据。网站将失去这些功能带来的展示和流量。Google 表示,这项选择不会成为其他搜索功能的收录或排名信号。
Search Console 帮助页 还明确说明,该开关不控制 AI 训练。如果要限制生成搜索 AI 回答所用模型的训练,Google 仍要求发布者使用 Google-Extended。因此,Google-Extended 不影响搜索排名,却能限制这类模型训练,两者并不矛盾。
如何编写 robots.txt 规则
若要禁止该主机上的所有内容用于 Google-Extended 列出的用途,可在该主机的 robots.txt 中加入具名规则组:
User-agent: Google-Extended
Disallow: /
这不会阻止 Googlebot。如果搜索可见度很重要,应采用上述规则,不要改为禁止 Googlebot。
按路径设置时,可以允许一份公开报告,同时禁止同一目录中的其他内容:
User-agent: Google-Extended
Disallow: /members/
Allow: /members/public-report/
由于公开报告的 Allow 路径更长、更具体,因此会优先匹配;/members/ 下的其余内容仍不得用于 Google 为该令牌列出的用途。
Google 的 robots.txt 解析规则 有几个要点,需要逐项测试:
- 产品令牌匹配不区分大小写,但 URL 路径可能区分大小写
- 针对同一具名令牌的多个规则组会合并
- 具名令牌的规则组不会与通配符
*的规则组合并 - 最具体的匹配路径优先;长度相同时,采用限制较少的规则
实际配置仍建议沿用官方大小写。这样既便于审核,也可避免通用解析器、检查工具或同事将有效但少见的写法误判为拼写错误。
如果没有适用的禁止规则,就表示允许文档列出的用途。空的 Disallow: 并不是退出设置,只用注释说明策略也无法形成机器可读的规则。
robots.txt 按协议、主机和端口分别生效。不能假定 https://example.com/robots.txt 中的规则也适用于 https://docs.example.com、http://example.com 或非默认端口上的服务。协议细节和异常响应见 robots.txt,部署检查见 AI 爬虫访问审计。
关键洞察:无法通过日志识别时,如何验证策略?Google-Extended 不会产生独立的流量标识,因此验证工作应以配置为依据。可以直接验证:目标
/robots.txt以纯文本返回 200、每个协议/主机/端口均提供预期的规则组、解析器对代表性路径给出预期结果。不能直接确认:某种协议是否专门服务于 Google-Extended 所列用途、屏蔽后 Googlebot 抓取量是否下降(Googlebot 仍服务于搜索)、规则是否会删除此前收集的数据。
常见配置错误
| 错误做法 | 为什么看起来合理 | 实际后果 |
|---|---|---|
为拒绝 Gemini 训练而禁止 Googlebot |
实际抓取由 Googlebot 完成 | 可能损害搜索抓取、索引,以及进入搜索 AI 功能的资格 |
在日志中搜索 Google-Extended |
大多数机器人令牌都代表请求身份 | 不会匹配到请求,因为它没有 HTTP 用户代理 |
| 把它当作只控制训练的令牌 | 发布之初主要强调训练 | 当前文档还列出了 Gemini Apps 与 Google Cloud 的采信用途 |
| 用它退出 AI Overviews 或 AI Mode | 这些功能也使用 Gemini 模型 | 搜索中的展示与采信由另一项 Search Console 控制 |
| 决定认为它与搜索 AI 完全无关 | 它确实不控制搜索收录或排名 | Google 要求用它限制生成搜索 AI 回答所用模型的训练 |
| 把 llms.txt 当作退出设置 | 它可供机器读取,也与 AI 有关 | Google 搜索会忽略它,它也无法表达是否允许 Google-Extended 所列用途 |
| 把 robots.txt 当作安全防护指令 | 名称中有 Disallow |
RFC 9309 明确说明这些规则不是访问授权 |
| 仅更新主域名 | 容易误以为一份文件可以覆盖全站 | 子域名、协议、端口或 CDN 边缘节点可能提供不同策略 |
| 认为设置一次便永久有效 | 指令本身不会过期 | 适用产品与搜索控制会变化,静态文件不会自动跟进 |
代价最大的错误,是为了拒绝官方列出的后续 AI 用途而一并禁止 Googlebot,进而影响普通搜索。如果目标是保留普通搜索,同时拒绝 Google-Extended 控制的用途,就应保持 Googlebot 可抓取,并单独配置 Google-Extended。部署任何「阻止全部 AI」的预设前,都应逐行检查规则。
风险最高的错误,是将 robots.txt 当作安全机制。私有内容、需要授权的内容或仅限客户访问的内容,都必须采用身份验证和访问授权。robots.txt 是一份公开且依赖自愿遵守的文件,无法阻止不合规客户端、伪造的用户代理或普通浏览器访问已公开的 URL。
如何选择访问策略
目前没有哪种设置能在拒绝训练的同时保留 Google-Extended 列出的所有采信机会。选择时必须明确相应取舍。
| 发布者目标 | 指令或控制 | 对可见度和内容用途的影响 |
|---|---|---|
| 保留普通搜索和搜索 AI 中的展示,拒绝 Google-Extended 列出的用途 | 允许 Googlebot 抓取;禁止 Google-Extended |
进入普通搜索的资格不受影响,但内容将无法用于符合条件的训练,也会失去官方列出的 Gemini 与 Cloud 产品采信机会 |
| 允许官方列出的训练与采信 | 不禁止 Google-Extended |
内容仍可用于 Google 当前列出的用途 |
| 退出 AI Overviews、AI Mode 与 Discover 中的生成式 AI 功能 | 如已开放,使用 Search Console 生成式 AI 控制 | 链接和内容不再出现在这些功能中,也不再被采信,因此会失去展示和流量;这项设置不影响其他搜索功能 |
| 完全退出 Google 搜索 | 使用 noindex 等搜索专用控制 |
失去普通搜索可见度;只用 Google-Extended 无法做到 |
| 保护非公开或付费内容 | 要求身份验证和访问授权 | 内容不再供公开抓取;robots.txt 只能作为补充声明 |
关键洞察:真正需要决定的是,是否同时允许训练和采信,而不是设想可以只拒绝训练、不承担其他代价。网站可能不愿让内容进入未来模型训练,却希望作为最新信息来源被 Gemini Apps 或支持 Google 搜索采信的 Cloud 产品引用。目前,这个令牌无法分别表达这两个目标。
是否参与搜索 AI 功能,还要单独决定。发布者可以保留普通搜索,同时通过尚在有限开放阶段的 Search Console 控制退出 AI Overviews 和 AI Mode;代价是失去这些功能可能带来的展示和流量。这项控制不能替代 Google-Extended;若要限制符合条件的模型训练,仍须使用后者。
两项选择都应记录在案,注明预期用途、负责人、涉及的 Search Console 资源与主机、具体指令或控制设置、部署日期和下次复核日期。可通过 AI 爬虫访问审计 留存部署证据,并结合 Google Gemini 与 Google AI Overviews 评估平台影响。
策略记录模板
建议企业建立以下策略记录模板,确保 Google-Extended 决策的可追溯性:
- 决策目的:明确是退出训练、退出采信,还是两者都退出
- 负责人:指定负责实施和维护策略的人员
- 涉及主机:列出所有受影响的域名和子域名
- 具体指令:记录 robots.txt 中的实际配置
- 部署日期:策略生效的时间点
- 复核日期:下次检查策略是否仍然适用的日期
- 影响评估:预估对搜索可见度和 AI 引用的影响
中国企业实施 Google-Extended 策略的特别考量
对于面向中国市场的企业,Google-Extended 策略的实施需要考虑以下几个因素:
首先,Google 搜索在中国大陆地区的市场份额有限。如果企业的主要目标用户在中国大陆,Google-Extended 策略对整体 AI 可见度的影响可能相对较小。但仍需考虑海外用户和国际内容的需要。
其次,中国企业在 Google 平台的存在形式多样。如果是跨国企业或面向海外华人的内容平台,Google-Extended 策略的重要性会相应提高。建议根据目标受众的地理分布制定差异化策略。
第三,国内 AI 引擎如文心一言、通义千问等,目前尚未公布类似的用途控制令牌。这意味着国内 AI 的内容使用策略透明度较低,企业难以通过类似机制控制内容的训练用途。
第四,建议企业定期复核 Google 的官方文档。Google-Extended 的适用范围已经发生过多次变化,从最初的 Bard 和 Vertex AI 训练,扩展到当前的 Gemini 训练与采信,再到正在测试的独立搜索 AI 控制。静态的策略文档可能很快过时。
常见问题解答
Google-Extended 是爬虫吗?
不是。Google 将它定义为控制内容用途的独立产品令牌。它没有单独的 HTTP 用户代理字符串,实际抓取仍由 Google 现有的用户代理完成。应把它理解为一项针对已抓取内容的用途规则,而不是能在服务器日志中识别的机器人。
禁止 Google-Extended 会影响 Google 搜索排名吗?
不会。Google 明确表示,Google-Extended 不影响网站能否进入 Google 搜索,也不是搜索排名信号。如果搜索可见度很重要,应继续允许 Googlebot。禁止 Google-Extended 影响的是已抓取内容能否用于官方列出的 AI 用途,并不影响普通搜索抓取。
Google-Extended 能让网站退出 AI Overviews 或 AI Mode 吗?
不能。它既不能阻止网站链接和内容出现在这些功能中,也不能阻止内容成为回答的采信依据。Google 正在测试另一项 Search Console 生成式 AI 控制,适用于 AI Overviews、AI Mode 和 Discover 中的生成式 AI 功能。Google-Extended 与这些搜索功能相关的作用,则限于控制符合条件的模型训练,包括生成搜索 AI 回答所用模型的训练。
服务器日志能证明 Google-Extended 规则已经生效吗?
不能。Google-Extended 不会以独立身份发出请求,因此日志中看不到相应的身份变化。应核对 robots.txt 文件、主机范围、规则组的解析结果、缓存状态和 Google 当前文档。Googlebot 继续访问属于正常现象,并不表示规则失效。
我能禁止 Gemini 训练,同时保留 Google-Extended 涵盖的全部采信用途吗?
目前 Google 没有为训练和采信设置相互独立的 Google-Extended 指令,同一个令牌覆盖文档列出的两类用途。禁止它不仅会限制训练,还会失去 Gemini Apps 和部分 Google Cloud 产品中符合条件的采信机会。
延伸阅读
- AI 爬虫
- robots.txt
- Applebot-Extended
- llms.txt
- GPTBot
- Google Gemini
- Google AI Overviews
- AI 爬虫访问审计
- 生成式引擎优化(GEO)
Google-Extended 实施的技术细节
正确实施 Google-Extended 需要关注以下技术细节:
robots.txt 文件的部署检查
部署 Google-Extended 规则后,建议按以下步骤验证:
- 直接访问 robots.txt:使用浏览器或 curl 访问
https://example.com/robots.txt,确认文件以纯文本返回 200 状态码 - 检查规则解析:使用 Google 的 robots.txt 测试工具,验证规则是否按预期解析
- 多主机检查:如果站点有多个子域名,每个子域名都需要单独配置 robots.txt
- CDN 缓存检查:如果使用了 CDN,确认 CDN 缓存的 robots.txt 与源站一致
- 协议检查:确保 http 和 https 协议都能正确访问 robots.txt
Google-Extended 规则的测试方法
由于 Google-Extended 不产生独立的流量标识,测试其规则是否生效需要采用间接方法:
- 规则解析测试:使用 Google 的 robots.txt 测试工具,输入不同的 URL 路径,确认禁止规则是否正确匹配
- 边界测试:测试 Allow 和 Disallow 规则的边界,确认优先级是否正确
- 合并测试:如果有多条 Google-Extended 规则,测试它们是否按预期合并
- 历史数据验证:禁止规则不会影响已抓取的内容,但会排除未来用于训练的数据
- 内容分级:将内容分为公开内容、会员内容和敏感内容,对不同级别的内容采用不同的 Google-Extended 策略
- 授权谈判:如果企业正在与 OpenAI 或其他 AI 厂商进行内容授权谈判,Google-Extended 策略应与谈判立场一致
- 品牌保护:对于品牌声誉敏感的内容(如财报、法律声明),建议禁止 Google-Extended,避免内容被用于可能损害品牌形象的场景
- 合规要求:某些行业(如金融、医疗)可能有合规要求,需要限制内容被用于 AI 训练,Google-Extended 是满足这些要求的工具之一
- 作用层次不同:robots.txt 指令控制的是抓取行为,Google-Extended 控制的是抓取后的用途
- 执行方式不同:robots.txt 由爬虫在抓取前读取,Google-Extended 由 Google 在抓取后读取
- 影响范围不同:robots.txt 影响的是页面是否被访问,Google-Extended 影响的是已访问内容的使用方式
- 可分离性:可以允许 Googlebot 抓取,同时禁止 Google-Extended 用途,两者可以独立配置
- 高价值内容:如独家研究、专业分析,建议保留 Google-Extended,以获得 Gemini 采信机会
- 中等价值内容:如常规文章、产品说明,可以根据版权政策决定是否禁止
- 低价值内容:如临时页面、内部文档,建议禁止 Google-Extended
- 搜索可见度优先:如果搜索流量是主要业务来源,应确保 Googlebot 可抓取,同时评估 Google-Extended 的影响
- 品牌保护优先:如果品牌保护是主要考量,可以考虑禁止 Google-Extended,避免内容被用于可能损害品牌形象的场景
- 授权谈判优先:如果企业正在与 OpenAI 进行授权谈判,Google-Extended 策略应与谈判立场一致
- 技术复杂度:评估实施 Google-Extended 的技术复杂度,确保能够正确配置和维护
- 监控能力:评估是否有能力监控 Google-Extended 策略的效果,如搜索可见度变化、引用率变化等
- 应急方案:准备应急方案,如策略实施后发现负面影响,能够快速回滚
Google-Extended 与企业内容策略的整合
Google-Extended 策略不应孤立制定,而应与企业整体内容策略整合:
通过整合策略,可以确保 Google-Extended 的实施既符合技术最佳实践,也符合业务目标和合规要求。
Google-Extended 与相关令牌的对比
理解 Google-Extended 与其他类似令牌的区别,有助于制定更精确的策略。
Google-Extended 与 Applebot-Extended 的对比
| 维度 | Google-Extended | Applebot-Extended |
|---|---|---|
| 用途 | 控制内容用于 Gemini 训练与采信 | 控制内容用于 Apple Intelligence 训练 |
| 独立爬虫 | 无,由现有爬虫执行抓取 | 无,由 Applebot 执行抓取 | 用户代理 | 无独立 UA | 无独立 UA |
| 控制范围 | 训练 + 实时采信 | 仅训练 |
| 退出搜索 AI | 不能,需使用 Search Console 控制 | 不适用 |
| 日志标识 | 无法直接识别 | 无法直接识别 |
Google-Extended 与 robots.txt 通用指令的对比
Google-Extended 与传统的 robots.txt 指令有本质区别:
Google-Extended 策略的企业决策框架
企业在制定 Google-Extended 策略时,可以参考以下决策框架:
第一步:评估内容价值
第二步:评估业务目标
第三步:评估技术影响
通过这个决策框架,企业可以系统地评估 Google-Extended 策略的利弊,做出符合自身情况的选择。