GEO

ROBOTS 策略 · 官方来源矩阵

决定 robots.txt 应如何管理 AI 爬虫。

把搜索曝光、模型训练和用户触发抓取分开判断;工具只生成供应商当前文档明确支持 robots.txt 控制的分组。

先选择运营立场

预设会填写全部可控 token,复制前仍可逐项修改。

控制矩阵

每个 token 都明确选择

只有“可控制”行会进入草稿;提示行解释用户触发行为,但不会生成误导规则。

OpenAIOAI-SearchBot
搜索发现可控制

OpenAI 搜索爬虫,用于在 ChatGPT 搜索中展示并链接网站。

与 GPTBot 独立;允许它不等于允许训练抓取。

OAI-SearchBot: 你的指令
OpenAIGPTBot
模型训练可控制

OpenAI 爬虫,内容可能用于训练基础模型。

Disallow 是针对未来内容的信号,与 ChatGPT 搜索收录分开。

GPTBot: 你的指令
OpenAIChatGPT-User
用户抓取仅作提示

由用户操作触发的 OpenAI 抓取器,并非自动网络爬虫。

OpenAI 表示 robots.txt 可能不适用,且它不决定搜索收录,因此不生成规则。

仅作提示
AnthropicClaudeBot
模型训练可控制

Anthropic 爬虫,网页内容可能用于模型训练。

Anthropic 当前文档称其 bots 遵守 robots.txt。

ClaudeBot: 你的指令
AnthropicClaude-SearchBot
搜索发现可控制

Anthropic 搜索爬虫,用于改善搜索结果质量。

应与 ClaudeBot 的训练访问分开决定。

Claude-SearchBot: 你的指令
AnthropicClaude-User
用户抓取可控制

为用户请求触发的 Anthropic 抓取器。

Anthropic 当前说明可用 robots.txt 控制;屏蔽可能降低用户请求的网页抓取能力。

Claude-User: 你的指令
GoogleGoogle-Extended控制 token,并非 HTTP User-Agent
训练 + grounding可控制

Google 用于 Gemini 训练及 Google Search grounding 的控制 token。

它没有独立 HTTP User-Agent,也不影响 Google 搜索收录或排名。

Google-Extended: 你的指令
PerplexityPerplexityBot
搜索发现可控制

Perplexity 搜索爬虫,用于展示并链接网站。

Perplexity 表示它不用于基础模型训练。

PerplexityBot: 你的指令
PerplexityPerplexity-User
用户抓取仅作提示

Perplexity 的用户触发抓取器,并非爬站或训练 bot。

Perplexity 表示它通常忽略 robots.txt,因此不生成规则。

仅作提示

部署边界

生成内容特意保持窄范围。请把它作为审核材料,而非直接替换文件。

  1. 01将草稿合并到现有 robots.txt;整份替换可能删除其他搜索爬虫规则。
  2. 02发布前再次确认供应商文档;名称、用途和 robots 行为都可能变化。
  3. 03即使 robots.txt 允许,WAF、CDN、托管规则或 IP 屏蔽仍可能拒绝爬虫。
  4. 04robots.txt 不保证访问,也不保证收录、模型可见度、提及或引用;用户触发抓取器可能有不同行为。

发布前须知

Allow 能保证 AI 引擎访问或引用网站吗?

不能。robots.txt 是爬虫偏好信号;网络控制、供应商系统、相关性和产品行为是独立条件。

为什么输出没有 ChatGPT-User 和 Perplexity-User?

官方文档描述的用户触发行为可能不适用或通常忽略 robots.txt。生成规则会夸大控制能力。

可以用输出覆盖现有 robots.txt 吗?

不可以。只把审核过的分组合并进现有文件,保留搜索和资源规则,再测试线上响应。