很多人在 robots.txt 里写一行 Disallow 屏蔽 GPTBot,以为这样就不会再被 ChatGPT 引用,结果实际效果与预期并不相符。GPTBot 只负责抓取用于模型训练的数据;真正影响网页能否出现在 ChatGPT 回答中的,是另一个爬虫 OAI-SearchBot。同一家公司会为不同任务使用不同的 User-Agent。先弄清清单上的每个名称负责什么,才不会把 robots.txt 的放行与屏蔽规则写反。
先分清一个基本概念:AI 爬虫实际上有三类
- 训练型爬虫:抓取内容并纳入模型训练语料,通常离线处理,与用户当前看到的回答没有直接关系。代表包括 GPTBot(OpenAI)、ClaudeBot(Anthropic)、CCBot(Common Crawl)、Meta-ExternalAgent、Bytespider(ByteDance)。
- 搜索/索引型爬虫:为 AI 回答引擎建立可实时检索的索引,直接影响网页能否成为引用来源。代表包括 OAI-SearchBot(ChatGPT search)、PerplexityBot、Googlebot(AI Overviews 使用其现有索引)和 Applebot(Siri 与 Apple Intelligence)。
- 用户触发型爬虫:当用户在对话中粘贴你的 URL,或要求即时核实时才会抓取。通常一次只读取一个页面,也不会进入训练集。代表包括 ChatGPT-User、Perplexity-User 和 Claude-User。
如果希望内容被 AI 引用,后两类爬虫不应屏蔽。搜索/索引型爬虫无法访问,你的网页就进不了候选来源池;用户触发型爬虫被拦截,即使别人主动把链接交给 AI,它也读不到内容。训练型爬虫则可以根据品牌策略单独决定:担心内容被无偿用于训练,就选择屏蔽;希望提高内容进入模型底层语料的概率,就选择放行。混淆这三个层级,正是大多数 robots.txt 规则写反的根源。
OpenAI:GPTBot、OAI-SearchBot、ChatGPT-User
- GPTBot:用于训练,User-Agent 中包含 "GPTBot/1.2",robots.txt token 为 "GPTBot"。OpenAI 还公布了该爬虫的 IP 网段(JSON 文件),可用于核验访问是否来自官方爬虫。
- OAI-SearchBot:负责将网页纳入 ChatGPT 的搜索与引用来源,token 为 "OAI-SearchBot"。屏蔽它,相当于主动放弃在 ChatGPT 中获得曝光,但它恰恰也是最容易被误屏蔽的爬虫。
- ChatGPT-User:用户在对话中要求浏览或核实你的 URL 时触发,token 为 "ChatGPT-User"。它执行实时、单页抓取,内容不会被纳入训练。
Google-Extended 不是爬虫,而是一个开关
Google-Extended 经常被列入“AI 爬虫清单”,但它并不是会出现在服务器日志里的爬虫,而是 robots.txt 中的产品 token。放行或屏蔽它,只会影响 Google 是否将你的内容用于 Gemini 训练和部分生成用途,完全不会影响 Googlebot 的常规索引。因此,屏蔽 Google-Extended 不会让网站退出 Google 搜索,通常也不会导致内容从 AI Overviews 中消失,因为 AI Overviews 主要使用 Googlebot 已有的索引数据。Apple 的 Applebot-Extended 采用了相同设计:它是控制 Apple Intelligence 训练的开关,与负责常规索引的 Applebot 并不相同。
PerplexityBot,以及那些不守规矩的爬虫
如果希望内容被 Perplexity 引用,需要同时放行 PerplexityBot(索引)和 Perplexity-User(用户实时查询)。但也要正视一个现实:robots.txt 只是君子协定,没有强制约束力。2025 年,Cloudflare 曾公开点名 Perplexity,称其在被 robots.txt 屏蔽后,改用未声明的 User-Agent,伪装成普通浏览器继续抓取;Bytespider 过去也因几乎不顾频率限制的高频抓取方式而闻名。这意味着两件事可能同时成立:想屏蔽的爬虫未必拦得住,想放行的来源也需要核验是否为官方爬虫。
Amazonbot、ClaudeBot,以及日志中还会遇到的其他名称
- ClaudeBot:Anthropic 的训练型爬虫。此外还有 Claude-User(用户触发型),以及较早使用的 anthropotic-ai 和 Claude-Web token,这些名称可能同时出现在日志中。
- Amazonbot:用于 Alexa 和 Amazon 的 AI 服务,User-Agent 中包含 "Amazonbot/0.1"。
- CCBot:Common Crawl 的爬虫。Common Crawl 本身不是 AI 公司,但其抓取的公共语料被大量模型使用,因此构成了一条间接训练渠道,也是管理训练用途时最容易遗漏的对象。
- 其他常见名称:Meta-ExternalAgent(Meta 训练)与 Meta-ExternalFetcher(用户触发)、YouBot(You.com)、DuckAssistBot(DuckDuckGo)、cohere-ai(Cohere)、MistralAI-User、Diffbot、Timpibot。

2026 年 robots.txt 应该怎么写
不存在适用于所有网站的统一答案。但对大多数希望开展 GEO(生成式引擎优化)的 B2B 网站而言,一个合理的默认策略是:放行搜索/索引型和用户触发型爬虫,让 AI 引擎能够读取并引用内容;训练型爬虫则根据内容价值和品牌策略逐一决定。下面是一套更侧重品牌曝光的示例。
- User-agent: OAI-SearchBot → Allow: /(保留在 ChatGPT 中的曝光机会)
- User-agent: PerplexityBot → Allow: /(进入 Perplexity 的引用来源池)
- User-agent: ChatGPT-User 和 Perplexity-User → Allow: /(不要拦截用户主动发起的核验)
- User-agent: Googlebot → Allow: /(AI Overviews 与常规搜索共用索引,务必放行)
- User-agent: GPTBot、CCBot、Google-Extended → 按策略决定(如果不希望内容用于训练,可设置 Disallow: /;这不会影响上述曝光)
不要把所有希望都押在 robots.txt 上
robots.txt 能拦住遵守规则的爬虫,却挡不住执意绕过限制的抓取行为。如果确实需要加强控制,就要进入下一层:通过反向 DNS 加正向确认,并对照各家公司官方公布的 IP 网段,核验爬虫身份;遇到伪装或高频抓取时,应使用 WAF、Cloudflare 的 AI 爬虫管理或速率限制,而不是只在 robots.txt 里多写一行。监控同样重要:定期检查服务器访问日志,确认哪些 AI 爬虫真正访问过网站,以及访问频率如何。这是判断 GEO 曝光情况的一手信号,比任何预测都更准确。
AI 爬虫清单几乎每个季度都在变化,新名称不断出现,token 也会调整。与其死记每一个名称,不如掌握分类逻辑:训练、检索和用户触发,三类爬虫分别对应不同的策略后果。如果你不确定当前有哪些 AI 引擎正在抓取网站,或哪些本应获得引用的页面仍未被收录,Tenten 的 GEO 审计可以一次梳理爬虫访问记录和引用状态。想先找出网站的缺口,可以预约一次 30 分钟的 GEO 诊断(/contact)。



