一键封禁所有 AI 爬虫听起来省事,实际却可能让你从 AI 答案中消失。原因在于,让 ChatGPT、Perplexity 引用你内容的爬虫,与抓取内容用于模型训练的爬虫,往往不是同一批机器人;而 Cloudflare 的“Block AI Bots”开关会把两类爬虫一起拦掉。
很多团队第一次意识到 AI 正在抓取自家网站,往往是因为服务器流量莫名上涨,或法务突然追问:“我们的内容是否被拿去训练模型了?”最直接的反应,就是打开 Cloudflare,寻找一键封禁所有 AI 爬虫的选项。Cloudflare 确实提供了这个开关,操作只需 3 秒。问题是,如果你经营的是 B2B SaaS,并希望获得 AI 引擎推荐,这样做无异于主动切断潜在获客入口。本文要解决的,正是如何精准拦截:挡住不需要的爬虫,放行能为你带来引用的爬虫。
先把一个基本概念说清楚:AI 爬虫分为三类,不能一概而论。
人们统称为“AI 爬虫”的机器人,实际承担着三种不同任务。只有分清这三类,才能判断哪些应该拦截,哪些绝不能误伤。
- 训练爬虫:抓取你的内容并用于模型训练。典型代表包括 OpenAI 的 GPTBot、Anthropic 的 ClaudeBot、字节跳动的 Bytespider,以及 Common Crawl 的 CCBot。拦截这类爬虫不会影响你的内容被引用。
- 检索爬虫:用户在 ChatGPT 或 Perplexity 中提问时,这类爬虫会即时抓取页面,将相关内容写入答案并附上来源。典型代表包括 OAI-SearchBot、ChatGPT-User、PerplexityBot、Perplexity-User 和 Claude-User。它们是进入 AI 答案的关键;一旦被拦截,你的内容就可能从答案中消失。
- 搜索索引爬虫:主要是 Googlebot 与 Bingbot。它们不只服务于传统搜索——Google AI Overviews 依赖 Googlebot,而 ChatGPT 和 Copilot 的部分结果依赖 Bing。误拦这类爬虫,会让 SEO 表现和 AI 可见度同时下滑。
这里最反直觉的一点是:拦截训练爬虫,并不会让你从 AI 答案中消失。模型是否引用你,取决于检索爬虫和搜索索引爬虫当前能否抓取你的内容,与几个月前模型训练时是否使用过你的内容是两回事。因此,你完全可以拒绝内容被用于训练,同时继续争取即时引用——前提是能准确识别不同爬虫。
第 1 步:先在 Cloudflare 中查清谁在抓取你的网站
动手拦截之前,先看数据。Cloudflare 后台的“AI Crawl Control”(原名 AI Audit)会列出各类 AI 爬虫近期的抓取次数、访问路径,以及当前是被允许还是被拦截。第一次打开时,结果通常会让人意外:Bytespider 或 GPTBot 的请求量甚至可能超过 Googlebot。这份清单是后续所有决策的基础。先确认哪些机器人确实在消耗服务器资源,再看哪些检索爬虫从未到访;后者意味着,你的网站可能尚未进入对应引擎的视野。

第 2 步:分类放行与拦截,不要依赖一键封禁
Cloudflare 提供了三种力度不同的工具,组合使用效果最好。最粗放的是安全设置中的“Block AI Bots”一键开关:操作方便,却像一次无差别轰炸,连检索爬虫也会一并拦截。除非你完全不在意 AI 可见度,否则不要轻易开启。力度适中的是托管式 robots.txt,适合应对愿意遵守规则的训练爬虫。控制最精准的则是 WAF 自定义规则,可以针对单个机器人执行放行或拦截,应当作为主要手段。
- 在 WAF 自定义规则中创建拦截规则,匹配 Bytespider、CCBot、GPTBot、ClaudeBot 等训练爬虫的用户代理,并将操作设置为阻止或返回 403。
- 再创建一条 Skip 规则,明确放行 OAI-SearchBot、PerplexityBot、Perplexity-User、ChatGPT-User、Googlebot 和 Bingbot,并将其排在拦截规则之前,确保检索与索引抓取始终畅通。
- 优先使用 Cloudflare 的“verified bot”字段进行匹配,不要只依赖用户代理字符串。用户代理可以伪造,任何人都可能冒充 Googlebot;Cloudflare 会结合反向 DNS 和签名验证已认证机器人,从而拦住冒充者。
- 如果希望再进一步,可以考虑 Cloudflare 的 Pay Per Crawl:向训练爬虫返回 HTTP 402,要求对方付费后再抓取,把无偿使用内容转化为收入或谈判筹码。
哪些爬虫应该放行,哪些应该拦截?
如果目标是获得 AI 引擎推荐——大多数 B2B SaaS 都有这个需求——默认策略很明确:放行所有检索爬虫和搜索索引爬虫,有选择地拦截训练爬虫。这里尤其要注意两个常见误区。第一,Google-Extended 与 Googlebot 不是一回事。前者只控制你的内容是否可用于 Gemini 训练和 grounding;拦截它不会让你从 AI Overviews 中消失,但如果连 Googlebot 也拦截,整个 Google 生态就真的看不到你了。第二,不要拦截 Bing,因为 ChatGPT 和 Copilot 的部分结果会使用 Bing 索引;拦截 Bingbot 同样会影响这些结果。
第 3 步:上线后验证,确保没有误伤
规则上线后,不要想当然地认为结果一定符合预期。回到 AI Crawl Control 和 WAF 事件日志,逐项确认:训练爬虫是否收到 403,检索爬虫和 Googlebot 是否仍能稳定获得 200。最常见的事故,是范围过宽的拦截规则误伤 Googlebot。你以为只是封禁 AI,结果 2 周后自然搜索排名开始下滑。可以用 Google Search Console 检查 URL,也可以直接查看服务器响应码;持续对比 1 周,确认放行名单中的爬虫都能顺利访问后,再结束验证。
拦截 AI 爬虫并不难,真正困难的是只挡住该挡的,同时为那些能把你带进答案的爬虫铺好红毯。— Tenten GEO
拦截爬虫只是防守,获得引用才是目的。
管理爬虫流量,是为了避免服务器资源被无偿占用,甚至因请求过多而宕机。但放行检索爬虫,并不代表 AI 一定会引用你。它们还需要能够抓取你的内容、理解内容含义,并判断这些内容值得引用。这才是 GEO(生成式引擎优化)的真正战场:内容结构、实体标记,以及跨平台一致的品牌信息。配置好 Cloudflare,只是把门打开;能否真正进入答案,还要打另一场仗。如果你想确认自己在六大 AI 引擎中未获引用的原因,或判断放行爬虫是否只是徒劳,可以预约一次 30 分钟的 GEO 诊断。我们会用与你业务相关的真实问题,现场展示差距在哪里。



