OAI-SearchBotOpenAI 搜索爬虫,用于在 ChatGPT 搜索中展示并链接网站。
与 GPTBot 独立;允许它不等于允许训练抓取。
ROBOTS 策略 · 官方来源矩阵
把搜索曝光、模型训练和用户触发抓取分开判断;工具只生成供应商当前文档明确支持 robots.txt 控制的分组。
预设会填写全部可控 token,复制前仍可逐项修改。
控制矩阵
只有“可控制”行会进入草稿;提示行解释用户触发行为,但不会生成误导规则。
OAI-SearchBotOpenAI 搜索爬虫,用于在 ChatGPT 搜索中展示并链接网站。
与 GPTBot 独立;允许它不等于允许训练抓取。
GPTBotOpenAI 爬虫,内容可能用于训练基础模型。
Disallow 是针对未来内容的信号,与 ChatGPT 搜索收录分开。
ChatGPT-User由用户操作触发的 OpenAI 抓取器,并非自动网络爬虫。
OpenAI 表示 robots.txt 可能不适用,且它不决定搜索收录,因此不生成规则。
ClaudeBotAnthropic 爬虫,网页内容可能用于模型训练。
Anthropic 当前文档称其 bots 遵守 robots.txt。
Claude-SearchBotAnthropic 搜索爬虫,用于改善搜索结果质量。
应与 ClaudeBot 的训练访问分开决定。
Claude-User为用户请求触发的 Anthropic 抓取器。
Anthropic 当前说明可用 robots.txt 控制;屏蔽可能降低用户请求的网页抓取能力。
Google-Extended控制 token,并非 HTTP User-AgentGoogle 用于 Gemini 训练及 Google Search grounding 的控制 token。
它没有独立 HTTP User-Agent,也不影响 Google 搜索收录或排名。
PerplexityBotPerplexity 搜索爬虫,用于展示并链接网站。
Perplexity 表示它不用于基础模型训练。
Perplexity-UserPerplexity 的用户触发抓取器,并非爬站或训练 bot。
Perplexity 表示它通常忽略 robots.txt,因此不生成规则。
生成内容特意保持窄范围。请把它作为审核材料,而非直接替换文件。
不能。robots.txt 是爬虫偏好信号;网络控制、供应商系统、相关性和产品行为是独立条件。
官方文档描述的用户触发行为可能不适用或通常忽略 robots.txt。生成规则会夸大控制能力。
不可以。只把审核过的分组合并进现有文件,保留搜索和资源规则,再测试线上响应。