Google-Extended:控制内容用途的令牌,而非爬虫

Google-Extended:控制内容用途的令牌,而非爬虫

在 robots.txt 的众多指令中,Google-Extended 是一个特殊且常被误解的存在。它既不是传统意义上的爬虫,也不是用于访问控制的通用指令,而是一个专门控制内容用途的产品令牌。理解它的实际作用范围,对于制定正确的 AI 内容策略至关重要。

Google-Extended 是 robots.txt 中用于控制内容用途的令牌,并非爬虫。它决定 Google 抓取的内容能否用于官方列出的 Gemini 训练与采信,不影响 Google 普通搜索的收录或排名。

关键洞察:Google-Extended 产生不了独立的流量标识,因为它的 HTTP 用户代理不存在。请求仍由 Google 现有的用户代理(如 Googlebot)发出,因此日志中不会出现独立的 Google-Extended 标识。验证策略应以配置为依据,而非试图在日志中追踪该令牌。

Google-Extended 的本质:用途控制令牌

Google-Extended 是一项可写入 robots.txt User-agent: 字段的独立产品令牌(product token)。Google 根据相应规则,决定现有爬虫抓取的内容能否用于官方列出的 Gemini 训练,或作为采信(grounding)依据(见 Google's common crawlers)。

这里有两个概念不能混为一谈。这个令牌使用 robots.txt 的语法,但并不代表一个 HTTP 客户端。Google 明确说明,Google-Extended 没有独立的 User-Agent 字符串。

字段 当前含义(核对日期:2026 年 7 月 22 日)
对象类型 控制内容用途的独立产品令牌
请求身份 没有独立的 HTTP 用户代理身份
实际抓取 由 Google 现有的用户代理完成
控制的用途 Google 官方文档列出的 Gemini 训练与采信
对 Google 搜索的影响 不影响普通搜索的收录或排名

Google 的 common crawlers 页面既介绍实际发出请求的爬虫,也介绍面向具体产品的控制令牌,因此 Google-Extended 会列在其中。不能仅凭页面所属目录判断其性质,仍应以 Google 当前爬虫文档 对各字段的明确说明为准。

这种做法在 Robots Exclusion Protocol 中并不常见。按照 RFC 9309 的通常约定,爬虫产品令牌应出现在相应的 HTTP User-Agent 字符串中。Google 则明确将 Google-Extended 用作内容用途控制令牌。因此,应把它视为用途控制令牌,而不是身份未公开的爬虫。

没有独立爬虫:控制规则如何生效

系统会分开处理抓取请求与抓取后的用途判断:

Google 现有用户代理抓取 URL
             │
             ▼
Google 读取该主机的 Google-Extended 规则
             │
       ┌─────┴─────┐
       ▼           ▼
    允许使用      禁止使用
       │           │
       ▼           ▼
用于列出的训练    排除在列出的训练
或采信流程        或采信流程之外

禁止规则不会阻止抓取请求本身。Googlebot 仍可能为搜索而抓取同一 URL,服务器日志也会继续记录 Googlebot,而不是 Google-Extended。规则限制的是抓取后的用途,也就是 Google 能否将内容用于文档列出的流程。

同理,只匹配 Google-Extended 的 WAF 规则也不会生效。这个令牌没有可供匹配的请求字符串、专属 IP 范围,也没有用于核验身份的反向 DNS。网络层决定请求能否获取内容;Google-Extended 决定已获取的内容可以用于什么目的。

Applebot-Extended 的工作方式相似:它本身不抓取页面,只控制 Applebot 已抓取数据的用途。不过,两者适用范围不同。Apple 的令牌用于基础模型训练,Google 当前的令牌还涵盖若干实时采信用途。

它控制哪些 Gemini 用途

Google 当前将两类用途归入同一个令牌。因此,只把 Google-Extended 当作训练退出开关已不准确。

用途类别 Google 当前列出的产品或功能 禁止后的影响
未来模型训练 供 Gemini Apps 和 Vertex AI API for Gemini 使用的模型 内容不再用于符合条件的训练
Gemini 采信 Gemini Apps 内容不再作为官方列出的实时采信依据
Google Cloud 产品中的 Google 搜索采信 支持此功能的 Google Cloud 产品 内容不再用于这类采信
搜索生成式 AI 所用模型的训练 用于生成搜索 AI 回答的模型 按照 Google 的说明,发布者应使用 Google-Extended 限制这项训练

Google Cloud 的产品名称仍在变化。当前的 Grounding with Google Search 文档 明确说明,Gemini Enterprise Agent Platform 不会把禁止 Google-Extended 的网页作为采信依据。Google 已将较早的 Vertex AI 文档迁移至新的产品目录,因此复核策略时应以当前官方页面为准,不能只看某个固定的产品名称。

关键洞察:这项控制推出时间不长,适用范围却已发生重要变化。2023 年 9 月首次发布时,主要面向 Bard 和 Vertex AI 模型的训练退出。2026 年 6 月,Google 开始测试独立的搜索 AI 控制。截至 2026 年 7 月,当前文档涵盖 Gemini 训练与列出的采信用途。适用产品清单会随相关政策持续更新,不能据此推断 Google-Extended 将永久覆盖 Google 的所有 AI 产品。

Google 搜索、AI Overviews 与 AI Mode:Google-Extended 不控制这些

最常见的误解是,以为禁止 Google-Extended 就能让网站退出 Google AI Overviews 或 AI Mode。它并不决定网站链接和内容能否出现在这些搜索功能中。

Google 当前提供的相关控制分属不同层次:

功能或决策 当前控制手段 Google-Extended 的作用
普通搜索的抓取与索引 Googlebot、robots.txt、noindex 及其他搜索控制 不影响收录或排名
搜索摘要及可展示的页面片段 nosnippetmax-snippetdata-nosnippet、预览控制 不直接参与搜索
生成式 AI 中的展示与采信 Search Console 的搜索生成式 AI 控制(如已开放) Google-Extended 不参与,另有独立控制
生成搜索 AI 回答所用模型的训练 Google-Extended Google 指示发布者使用此令牌
官方列出的 Gemini Apps 与 Cloud 采信 Google-Extended 可直接控制这些用途

页面能否进入这些搜索功能,仍取决于 Googlebot。Google 的 2026 年 7 月 AI 优化指南 说明,页面必须已被索引,并符合显示搜索摘要的条件;若该项独立控制已向相应的 Search Console 资源开放,还须通过该资源允许页面进入搜索生成式 AI 功能。搜索 AI 采用检索增强生成(RAG),从 Google 搜索索引中选取页面。

这项独立搜索控制推出不久,尚未全面开放。2026 年 1 月,Google 还在研究如何让网站单独退出搜索生成式 AI 功能;6 月 3 日,Google 开始面向部分英国站长测试 Search Console 开关。截至 7 月 22 日,帮助页仅说明该功能正在向部分站长开放,尚未宣布在全球正式推出。

通过该开关排除某项 Search Console 资源后,其链接和内容将不会出现在 AI Overviews、AI Mode 以及 Discover 的生成式 AI 功能中,也不会成为这些功能的采信依据。网站将失去这些功能带来的展示和流量。Google 表示,这项选择不会成为其他搜索功能的收录或排名信号。

Search Console 帮助页 还明确说明,该开关不控制 AI 训练。如果要限制生成搜索 AI 回答所用模型的训练,Google 仍要求发布者使用 Google-Extended。因此,Google-Extended 不影响搜索排名,却能限制这类模型训练,两者并不矛盾。

如何编写 robots.txt 规则

若要禁止该主机上的所有内容用于 Google-Extended 列出的用途,可在该主机的 robots.txt 中加入具名规则组:

User-agent: Google-Extended
Disallow: /

这不会阻止 Googlebot。如果搜索可见度很重要,应采用上述规则,不要改为禁止 Googlebot。

按路径设置时,可以允许一份公开报告,同时禁止同一目录中的其他内容:

User-agent: Google-Extended
Disallow: /members/
Allow: /members/public-report/

由于公开报告的 Allow 路径更长、更具体,因此会优先匹配;/members/ 下的其余内容仍不得用于 Google 为该令牌列出的用途。

Google 的 robots.txt 解析规则 有几个要点,需要逐项测试:

  • 产品令牌匹配不区分大小写,但 URL 路径可能区分大小写
  • 针对同一具名令牌的多个规则组会合并
  • 具名令牌的规则组不会与通配符 * 的规则组合并
  • 最具体的匹配路径优先;长度相同时,采用限制较少的规则

实际配置仍建议沿用官方大小写。这样既便于审核,也可避免通用解析器、检查工具或同事将有效但少见的写法误判为拼写错误。

如果没有适用的禁止规则,就表示允许文档列出的用途。空的 Disallow: 并不是退出设置,只用注释说明策略也无法形成机器可读的规则。

robots.txt 按协议、主机和端口分别生效。不能假定 https://example.com/robots.txt 中的规则也适用于 https://docs.example.comhttp://example.com 或非默认端口上的服务。协议细节和异常响应见 robots.txt,部署检查见 AI 爬虫访问审计

关键洞察:无法通过日志识别时,如何验证策略?Google-Extended 不会产生独立的流量标识,因此验证工作应以配置为依据。可以直接验证:目标 /robots.txt 以纯文本返回 200、每个协议/主机/端口均提供预期的规则组、解析器对代表性路径给出预期结果。不能直接确认:某种协议是否专门服务于 Google-Extended 所列用途、屏蔽后 Googlebot 抓取量是否下降(Googlebot 仍服务于搜索)、规则是否会删除此前收集的数据。

常见配置错误

错误做法 为什么看起来合理 实际后果
为拒绝 Gemini 训练而禁止 Googlebot 实际抓取由 Googlebot 完成 可能损害搜索抓取、索引,以及进入搜索 AI 功能的资格
在日志中搜索 Google-Extended 大多数机器人令牌都代表请求身份 不会匹配到请求,因为它没有 HTTP 用户代理
把它当作只控制训练的令牌 发布之初主要强调训练 当前文档还列出了 Gemini Apps 与 Google Cloud 的采信用途
用它退出 AI Overviews 或 AI Mode 这些功能也使用 Gemini 模型 搜索中的展示与采信由另一项 Search Console 控制
决定认为它与搜索 AI 完全无关 它确实不控制搜索收录或排名 Google 要求用它限制生成搜索 AI 回答所用模型的训练
llms.txt 当作退出设置 它可供机器读取,也与 AI 有关 Google 搜索会忽略它,它也无法表达是否允许 Google-Extended 所列用途
把 robots.txt 当作安全防护指令 名称中有 Disallow RFC 9309 明确说明这些规则不是访问授权
仅更新主域名 容易误以为一份文件可以覆盖全站 子域名、协议、端口或 CDN 边缘节点可能提供不同策略
认为设置一次便永久有效 指令本身不会过期 适用产品与搜索控制会变化,静态文件不会自动跟进

代价最大的错误,是为了拒绝官方列出的后续 AI 用途而一并禁止 Googlebot,进而影响普通搜索。如果目标是保留普通搜索,同时拒绝 Google-Extended 控制的用途,就应保持 Googlebot 可抓取,并单独配置 Google-Extended。部署任何「阻止全部 AI」的预设前,都应逐行检查规则。

风险最高的错误,是将 robots.txt 当作安全机制。私有内容、需要授权的内容或仅限客户访问的内容,都必须采用身份验证和访问授权。robots.txt 是一份公开且依赖自愿遵守的文件,无法阻止不合规客户端、伪造的用户代理或普通浏览器访问已公开的 URL。

如何选择访问策略

目前没有哪种设置能在拒绝训练的同时保留 Google-Extended 列出的所有采信机会。选择时必须明确相应取舍。

发布者目标 指令或控制 对可见度和内容用途的影响
保留普通搜索和搜索 AI 中的展示,拒绝 Google-Extended 列出的用途 允许 Googlebot 抓取;禁止 Google-Extended 进入普通搜索的资格不受影响,但内容将无法用于符合条件的训练,也会失去官方列出的 Gemini 与 Cloud 产品采信机会
允许官方列出的训练与采信 不禁止 Google-Extended 内容仍可用于 Google 当前列出的用途
退出 AI Overviews、AI Mode 与 Discover 中的生成式 AI 功能 如已开放,使用 Search Console 生成式 AI 控制 链接和内容不再出现在这些功能中,也不再被采信,因此会失去展示和流量;这项设置不影响其他搜索功能
完全退出 Google 搜索 使用 noindex 等搜索专用控制 失去普通搜索可见度;只用 Google-Extended 无法做到
保护非公开或付费内容 要求身份验证和访问授权 内容不再供公开抓取;robots.txt 只能作为补充声明

关键洞察:真正需要决定的是,是否同时允许训练和采信,而不是设想可以只拒绝训练、不承担其他代价。网站可能不愿让内容进入未来模型训练,却希望作为最新信息来源被 Gemini Apps 或支持 Google 搜索采信的 Cloud 产品引用。目前,这个令牌无法分别表达这两个目标。

是否参与搜索 AI 功能,还要单独决定。发布者可以保留普通搜索,同时通过尚在有限开放阶段的 Search Console 控制退出 AI Overviews 和 AI Mode;代价是失去这些功能可能带来的展示和流量。这项控制不能替代 Google-Extended;若要限制符合条件的模型训练,仍须使用后者。

两项选择都应记录在案,注明预期用途、负责人、涉及的 Search Console 资源与主机、具体指令或控制设置、部署日期和下次复核日期。可通过 AI 爬虫访问审计 留存部署证据,并结合 Google GeminiGoogle AI Overviews 评估平台影响。

策略记录模板

建议企业建立以下策略记录模板,确保 Google-Extended 决策的可追溯性:

  • 决策目的:明确是退出训练、退出采信,还是两者都退出
  • 负责人:指定负责实施和维护策略的人员
  • 涉及主机:列出所有受影响的域名和子域名
  • 具体指令:记录 robots.txt 中的实际配置
  • 部署日期:策略生效的时间点
  • 复核日期:下次检查策略是否仍然适用的日期
  • 影响评估:预估对搜索可见度和 AI 引用的影响

中国企业实施 Google-Extended 策略的特别考量

对于面向中国市场的企业,Google-Extended 策略的实施需要考虑以下几个因素:

首先,Google 搜索在中国大陆地区的市场份额有限。如果企业的主要目标用户在中国大陆,Google-Extended 策略对整体 AI 可见度的影响可能相对较小。但仍需考虑海外用户和国际内容的需要。

其次,中国企业在 Google 平台的存在形式多样。如果是跨国企业或面向海外华人的内容平台,Google-Extended 策略的重要性会相应提高。建议根据目标受众的地理分布制定差异化策略。

第三,国内 AI 引擎如文心一言、通义千问等,目前尚未公布类似的用途控制令牌。这意味着国内 AI 的内容使用策略透明度较低,企业难以通过类似机制控制内容的训练用途。

第四,建议企业定期复核 Google 的官方文档。Google-Extended 的适用范围已经发生过多次变化,从最初的 Bard 和 Vertex AI 训练,扩展到当前的 Gemini 训练与采信,再到正在测试的独立搜索 AI 控制。静态的策略文档可能很快过时。

常见问题解答

Google-Extended 是爬虫吗?

不是。Google 将它定义为控制内容用途的独立产品令牌。它没有单独的 HTTP 用户代理字符串,实际抓取仍由 Google 现有的用户代理完成。应把它理解为一项针对已抓取内容的用途规则,而不是能在服务器日志中识别的机器人。

禁止 Google-Extended 会影响 Google 搜索排名吗?

不会。Google 明确表示,Google-Extended 不影响网站能否进入 Google 搜索,也不是搜索排名信号。如果搜索可见度很重要,应继续允许 Googlebot。禁止 Google-Extended 影响的是已抓取内容能否用于官方列出的 AI 用途,并不影响普通搜索抓取。

Google-Extended 能让网站退出 AI Overviews 或 AI Mode 吗?

不能。它既不能阻止网站链接和内容出现在这些功能中,也不能阻止内容成为回答的采信依据。Google 正在测试另一项 Search Console 生成式 AI 控制,适用于 AI Overviews、AI Mode 和 Discover 中的生成式 AI 功能。Google-Extended 与这些搜索功能相关的作用,则限于控制符合条件的模型训练,包括生成搜索 AI 回答所用模型的训练。

服务器日志能证明 Google-Extended 规则已经生效吗?

不能。Google-Extended 不会以独立身份发出请求,因此日志中看不到相应的身份变化。应核对 robots.txt 文件、主机范围、规则组的解析结果、缓存状态和 Google 当前文档。Googlebot 继续访问属于正常现象,并不表示规则失效。

我能禁止 Gemini 训练,同时保留 Google-Extended 涵盖的全部采信用途吗?

目前 Google 没有为训练和采信设置相互独立的 Google-Extended 指令,同一个令牌覆盖文档列出的两类用途。禁止它不仅会限制训练,还会失去 Gemini Apps 和部分 Google Cloud 产品中符合条件的采信机会。

延伸阅读

Google-Extended 实施的技术细节

正确实施 Google-Extended 需要关注以下技术细节:

robots.txt 文件的部署检查

部署 Google-Extended 规则后,建议按以下步骤验证:

  1. 直接访问 robots.txt:使用浏览器或 curl 访问 https://example.com/robots.txt,确认文件以纯文本返回 200 状态码
  2. 检查规则解析:使用 Google 的 robots.txt 测试工具,验证规则是否按预期解析
  3. 多主机检查:如果站点有多个子域名,每个子域名都需要单独配置 robots.txt
  4. CDN 缓存检查:如果使用了 CDN,确认 CDN 缓存的 robots.txt 与源站一致
  5. 协议检查:确保 http 和 https 协议都能正确访问 robots.txt

Google-Extended 规则的测试方法

由于 Google-Extended 不产生独立的流量标识,测试其规则是否生效需要采用间接方法:

  • 规则解析测试:使用 Google 的 robots.txt 测试工具,输入不同的 URL 路径,确认禁止规则是否正确匹配
  • 边界测试:测试 Allow 和 Disallow 规则的边界,确认优先级是否正确
  • 合并测试:如果有多条 Google-Extended 规则,测试它们是否按预期合并
  • 历史数据验证:禁止规则不会影响已抓取的内容,但会排除未来用于训练的数据
  • Google-Extended 与企业内容策略的整合

    Google-Extended 策略不应孤立制定,而应与企业整体内容策略整合:

    • 内容分级:将内容分为公开内容、会员内容和敏感内容,对不同级别的内容采用不同的 Google-Extended 策略
    • 授权谈判:如果企业正在与 OpenAI 或其他 AI 厂商进行内容授权谈判,Google-Extended 策略应与谈判立场一致
    • 品牌保护:对于品牌声誉敏感的内容(如财报、法律声明),建议禁止 Google-Extended,避免内容被用于可能损害品牌形象的场景
    • 合规要求:某些行业(如金融、医疗)可能有合规要求,需要限制内容被用于 AI 训练,Google-Extended 是满足这些要求的工具之一

    通过整合策略,可以确保 Google-Extended 的实施既符合技术最佳实践,也符合业务目标和合规要求。

    Google-Extended 与相关令牌的对比

    理解 Google-Extended 与其他类似令牌的区别,有助于制定更精确的策略。

    Google-Extended 与 Applebot-Extended 的对比

    维度 Google-Extended Applebot-Extended
    用途 控制内容用于 Gemini 训练与采信 控制内容用于 Apple Intelligence 训练
    独立爬虫 无,由现有爬虫执行抓取 无,由 Applebot 执行抓取
    用户代理 无独立 UA 无独立 UA
    控制范围 训练 + 实时采信 仅训练
    退出搜索 AI 不能,需使用 Search Console 控制 不适用
    日志标识 无法直接识别 无法直接识别

    Google-Extended 与 robots.txt 通用指令的对比

    Google-Extended 与传统的 robots.txt 指令有本质区别:

    • 作用层次不同:robots.txt 指令控制的是抓取行为,Google-Extended 控制的是抓取后的用途
    • 执行方式不同:robots.txt 由爬虫在抓取前读取,Google-Extended 由 Google 在抓取后读取
    • 影响范围不同:robots.txt 影响的是页面是否被访问,Google-Extended 影响的是已访问内容的使用方式
    • 可分离性:可以允许 Googlebot 抓取,同时禁止 Google-Extended 用途,两者可以独立配置

    Google-Extended 策略的企业决策框架

    企业在制定 Google-Extended 策略时,可以参考以下决策框架:

    第一步:评估内容价值

    • 高价值内容:如独家研究、专业分析,建议保留 Google-Extended,以获得 Gemini 采信机会
    • 中等价值内容:如常规文章、产品说明,可以根据版权政策决定是否禁止
    • 低价值内容:如临时页面、内部文档,建议禁止 Google-Extended

    第二步:评估业务目标

    • 搜索可见度优先:如果搜索流量是主要业务来源,应确保 Googlebot 可抓取,同时评估 Google-Extended 的影响
    • 品牌保护优先:如果品牌保护是主要考量,可以考虑禁止 Google-Extended,避免内容被用于可能损害品牌形象的场景
    • 授权谈判优先:如果企业正在与 OpenAI 进行授权谈判,Google-Extended 策略应与谈判立场一致

    第三步:评估技术影响

    • 技术复杂度:评估实施 Google-Extended 的技术复杂度,确保能够正确配置和维护
    • 监控能力:评估是否有能力监控 Google-Extended 策略的效果,如搜索可见度变化、引用率变化等
    • 应急方案:准备应急方案,如策略实施后发现负面影响,能够快速回滚

    通过这个决策框架,企业可以系统地评估 Google-Extended 策略的利弊,做出符合自身情况的选择。

常见问题

如何开始GEO优化?

1) 审计现有内容可见度 2) 添加结构化标记 3) 优化品牌提及 4) 创建可引用内容 5) 监控AI推荐数据。建议从基础知识学习开始,逐步实施。

GEO优化的ROI如何衡量?

GEO效果可通过:AI推荐提及次数、零点击搜索份额、品牌搜索量增长、内容引用率等指标衡量。建议建立基线数据并定期追踪。

GEO优化的时间周期?

GEO效果通常需要3-6个月才能显著体现。结构化标记即时生效,但品牌提及和实体识别需要时间积累。建议持续优化并定期评估。

达摩

晓名 AI・GEO CTO & 创始人,专注生成式引擎优化实战

需要 GEO 优化?

立即联系我们,获取免费诊断报告。

获取免费诊断 →