GEO
返回博客
技术 AEO 实施落地

用 Cloudflare 管理 AI 爬虫:拦截未授权抓取,同时放行能带来引用的机器人

想用 Cloudflare 拦截 AI 爬虫,又担心因此从 AI 答案中消失?本文拆解训练、检索和搜索索引三类爬虫的区别,并介绍如何通过 AI Crawl Control 与 WAF 自定义规则精准拦截不需要的机器人,同时保留被 ChatGPT 和 Perplexity 引用的机会。

Tenten GEO 团队发布于 2024-12-025 分钟阅读
Cloudflare 防护盾筛选 AI 爬虫流量并放行部分机器人的概念封面图

一键封禁所有 AI 爬虫听起来省事,实际却可能让你从 AI 答案中消失。原因在于,让 ChatGPT、Perplexity 引用你内容的爬虫,与抓取内容用于模型训练的爬虫,往往不是同一批机器人;而 Cloudflare 的“Block AI Bots”开关会把两类爬虫一起拦掉。

很多团队第一次意识到 AI 正在抓取自家网站,往往是因为服务器流量莫名上涨,或法务突然追问:“我们的内容是否被拿去训练模型了?”最直接的反应,就是打开 Cloudflare,寻找一键封禁所有 AI 爬虫的选项。Cloudflare 确实提供了这个开关,操作只需 3 秒。问题是,如果你经营的是 B2B SaaS,并希望获得 AI 引擎推荐,这样做无异于主动切断潜在获客入口。本文要解决的,正是如何精准拦截:挡住不需要的爬虫,放行能为你带来引用的爬虫。

先把一个基本概念说清楚:AI 爬虫分为三类,不能一概而论。

人们统称为“AI 爬虫”的机器人,实际承担着三种不同任务。只有分清这三类,才能判断哪些应该拦截,哪些绝不能误伤。

  • 训练爬虫:抓取你的内容并用于模型训练。典型代表包括 OpenAI 的 GPTBot、Anthropic 的 ClaudeBot、字节跳动的 Bytespider,以及 Common Crawl 的 CCBot。拦截这类爬虫不会影响你的内容被引用。
  • 检索爬虫:用户在 ChatGPT 或 Perplexity 中提问时,这类爬虫会即时抓取页面,将相关内容写入答案并附上来源。典型代表包括 OAI-SearchBot、ChatGPT-User、PerplexityBot、Perplexity-User 和 Claude-User。它们是进入 AI 答案的关键;一旦被拦截,你的内容就可能从答案中消失。
  • 搜索索引爬虫:主要是 Googlebot 与 Bingbot。它们不只服务于传统搜索——Google AI Overviews 依赖 Googlebot,而 ChatGPT 和 Copilot 的部分结果依赖 Bing。误拦这类爬虫,会让 SEO 表现和 AI 可见度同时下滑。

这里最反直觉的一点是:拦截训练爬虫,并不会让你从 AI 答案中消失。模型是否引用你,取决于检索爬虫和搜索索引爬虫当前能否抓取你的内容,与几个月前模型训练时是否使用过你的内容是两回事。因此,你完全可以拒绝内容被用于训练,同时继续争取即时引用——前提是能准确识别不同爬虫。

第 1 步:先在 Cloudflare 中查清谁在抓取你的网站

动手拦截之前,先看数据。Cloudflare 后台的“AI Crawl Control”(原名 AI Audit)会列出各类 AI 爬虫近期的抓取次数、访问路径,以及当前是被允许还是被拦截。第一次打开时,结果通常会让人意外:Bytespider 或 GPTBot 的请求量甚至可能超过 Googlebot。这份清单是后续所有决策的基础。先确认哪些机器人确实在消耗服务器资源,再看哪些检索爬虫从未到访;后者意味着,你的网站可能尚未进入对应引擎的视野。

三类 AI 爬虫及其对应放行或拦截策略的对比图
训练爬虫可以拦截,检索爬虫和搜索索引爬虫需要放行——分类是否准确,决定了你的内容能否被 AI 引用。

第 2 步:分类放行与拦截,不要依赖一键封禁

Cloudflare 提供了三种力度不同的工具,组合使用效果最好。最粗放的是安全设置中的“Block AI Bots”一键开关:操作方便,却像一次无差别轰炸,连检索爬虫也会一并拦截。除非你完全不在意 AI 可见度,否则不要轻易开启。力度适中的是托管式 robots.txt,适合应对愿意遵守规则的训练爬虫。控制最精准的则是 WAF 自定义规则,可以针对单个机器人执行放行或拦截,应当作为主要手段。

  1. 在 WAF 自定义规则中创建拦截规则,匹配 Bytespider、CCBot、GPTBot、ClaudeBot 等训练爬虫的用户代理,并将操作设置为阻止或返回 403。
  2. 再创建一条 Skip 规则,明确放行 OAI-SearchBot、PerplexityBot、Perplexity-User、ChatGPT-User、Googlebot 和 Bingbot,并将其排在拦截规则之前,确保检索与索引抓取始终畅通。
  3. 优先使用 Cloudflare 的“verified bot”字段进行匹配,不要只依赖用户代理字符串。用户代理可以伪造,任何人都可能冒充 Googlebot;Cloudflare 会结合反向 DNS 和签名验证已认证机器人,从而拦住冒充者。
  4. 如果希望再进一步,可以考虑 Cloudflare 的 Pay Per Crawl:向训练爬虫返回 HTTP 402,要求对方付费后再抓取,把无偿使用内容转化为收入或谈判筹码。

哪些爬虫应该放行,哪些应该拦截?

如果目标是获得 AI 引擎推荐——大多数 B2B SaaS 都有这个需求——默认策略很明确:放行所有检索爬虫和搜索索引爬虫,有选择地拦截训练爬虫。这里尤其要注意两个常见误区。第一,Google-Extended 与 Googlebot 不是一回事。前者只控制你的内容是否可用于 Gemini 训练和 grounding;拦截它不会让你从 AI Overviews 中消失,但如果连 Googlebot 也拦截,整个 Google 生态就真的看不到你了。第二,不要拦截 Bing,因为 ChatGPT 和 Copilot 的部分结果会使用 Bing 索引;拦截 Bingbot 同样会影响这些结果。

第 3 步:上线后验证,确保没有误伤

规则上线后,不要想当然地认为结果一定符合预期。回到 AI Crawl Control 和 WAF 事件日志,逐项确认:训练爬虫是否收到 403,检索爬虫和 Googlebot 是否仍能稳定获得 200。最常见的事故,是范围过宽的拦截规则误伤 Googlebot。你以为只是封禁 AI,结果 2 周后自然搜索排名开始下滑。可以用 Google Search Console 检查 URL,也可以直接查看服务器响应码;持续对比 1 周,确认放行名单中的爬虫都能顺利访问后,再结束验证。

拦截 AI 爬虫并不难,真正困难的是只挡住该挡的,同时为那些能把你带进答案的爬虫铺好红毯。Tenten GEO

拦截爬虫只是防守,获得引用才是目的。

管理爬虫流量,是为了避免服务器资源被无偿占用,甚至因请求过多而宕机。但放行检索爬虫,并不代表 AI 一定会引用你。它们还需要能够抓取你的内容、理解内容含义,并判断这些内容值得引用。这才是 GEO(生成式引擎优化)的真正战场:内容结构、实体标记,以及跨平台一致的品牌信息。配置好 Cloudflare,只是把门打开;能否真正进入答案,还要打另一场仗。如果你想确认自己在六大 AI 引擎中未获引用的原因,或判断放行爬虫是否只是徒劳,可以预约一次 30 分钟的 GEO 诊断。我们会用与你业务相关的真实问题,现场展示差距在哪里。

常见问题

用 Cloudflare 拦截 AI 爬虫,会让我从 ChatGPT 或 Perplexity 中消失吗?
这取决于你拦截的是哪一类。拦截 GPTBot、ClaudeBot 等训练爬虫不会影响内容被引用;但如果拦截 OAI-SearchBot、PerplexityBot 等检索爬虫,你的内容就可能从 AI 答案中消失。关键是分类处理,不要一键全部封禁。
使用 robots.txt 和 Cloudflare WAF 拦截 AI 爬虫,有什么区别?
robots.txt 是一项请求,依赖爬虫自律:守规矩的会遵守,恶意爬虫可能直接忽略。WAF 则是强制执行,无论对方是否守规矩,都能在 Cloudflare 边缘节点直接拦截请求。要真正挡住不遵守规则的爬虫,需要依靠 WAF。
为了获得 AI 引用,应该放行哪些爬虫?
至少应放行 OAI-SearchBot、ChatGPT-User、PerplexityBot、Perplexity-User、Claude-User,以及 Googlebot 和 Bingbot。前几类决定你的内容能否出现在 ChatGPT 和 Perplexity 的答案中,后两类则会影响 Google AI Overviews 和 Copilot。

准备好了吗

你的品牌在 AI 答案中有多高的可见度?

通过 30 分钟 GEO 诊断,了解品牌在主要 AI 引擎中的可见度缺口,以及应该优先解决的问题。

预约 30 分钟诊断