Tenten AIGEO
Voltar ao blog
AEO técnicoImplementação

Como gerenciar crawlers de IA com a Cloudflare: bloqueie acessos não autorizados sem abrir mão de ser citado

Quer bloquear crawlers de IA com a Cloudflare, mas teme desaparecer das respostas geradas por IA? Este artigo explica as diferenças entre crawlers de treinamento, recuperação e busca, além de mostrar como usar o AI Crawl Control e regras personalizadas do WAF para barrar bots indesejados sem impedir citações no ChatGPT e no Perplexity.

Equipe Tenten GEOPublicado em 2024-12-025 min de leitura
Imagem conceitual de um escudo da Cloudflare filtrando o tráfego de crawlers de IA e permitindo a passagem de alguns robôs

Bloquear todos os crawlers de IA com um único clique parece uma ótima ideia, mas pode tirar seu site das respostas geradas por IA. Isso acontece porque o crawler que faz seu conteúdo aparecer como fonte no ChatGPT ou no Perplexity nem sempre é o mesmo que o utiliza para treinar modelos — e a opção “Block AI Bots” da Cloudflare pode barrar os dois de uma só vez.

Muitas equipes só percebem que sistemas de IA estão rastreando seus sites quando o tráfego no servidor aumenta sem explicação ou quando o departamento jurídico pergunta: “Nosso conteúdo foi usado para treinamento?”. A reação imediata costuma ser abrir a Cloudflare e procurar uma opção que bloqueie todos os crawlers de IA. Essa opção existe e pode ser ativada em três segundos. O problema é que, para uma empresa B2B SaaS que quer ser recomendada por mecanismos de IA, esse bloqueio também pode fechar uma porta importante para geração de demanda e pipeline. A proposta deste artigo é mostrar como bloquear com precisão: barrar o que você não quer e liberar os bots capazes de citar sua marca.

Antes de tudo, é preciso separar bem as coisas: existem três tipos de crawler de IA, e eles não devem receber o mesmo tratamento.

Os robôs agrupados sob o rótulo de “crawlers de IA” desempenham, na prática, três funções diferentes. Entender essas categorias é essencial para decidir quais devem ser bloqueados e quais precisam continuar com acesso.

  • Crawler de treinamento: coleta seu conteúdo para alimentar o treinamento de modelos. Entre os principais exemplos estão o GPTBot, da OpenAI; o ClaudeBot, da Anthropic; o Bytespider, da ByteDance; e o CCBot, da Common Crawl. Bloqueá-los não afeta suas citações.
  • Crawler de recuperação: quando alguém faz uma pergunta no ChatGPT ou no Perplexity, esse tipo de robô acessa a página naquele momento, aproveita o conteúdo na resposta e inclui a fonte. Entre os exemplos estão OAI-SearchBot, ChatGPT-User, PerplexityBot, Perplexity-User e Claude-User. Essa categoria é decisiva para sua presença nas respostas de IA: se você a bloquear, seu conteúdo deixa de aparecer.
  • Crawler de indexação para busca: Googlebot e Bingbot. Eles não servem apenas à busca tradicional — o Google AI Overviews depende do Googlebot, enquanto ChatGPT e Copilot usam o Bing em parte de seus resultados. Um bloqueio acidental pode derrubar ao mesmo tempo o SEO e a visibilidade nos mecanismos de IA.

O ponto menos intuitivo é este: bloquear crawlers de treinamento não faz sua marca desaparecer das respostas de IA. A possibilidade de uma referência depende do conteúdo que os crawlers de recuperação e busca conseguem acessar agora, não de o modelo ter usado seu site para treinamento meses atrás. Portanto, é possível recusar o uso do conteúdo em treinamento e, ao mesmo tempo, buscar citações nas respostas atuais — desde que você saiba distinguir cada bot.

Etapa 1: descubra quem está acessando seu site pela Cloudflare

Antes de bloquear qualquer coisa, examine os dados. O “AI Crawl Control” — anteriormente chamado de AI Audit — no painel da Cloudflare mostra quantas vezes cada crawler de IA acessou o site recentemente, quais caminhos foram rastreados e se o acesso está liberado ou bloqueado. A primeira consulta costuma trazer surpresas: o volume de requisições do Bytespider ou do GPTBot pode superar até o do Googlebot. Essa relação deve orientar todas as decisões seguintes. Primeiro, identifique quais robôs realmente consomem recursos do servidor e quais crawlers de recuperação ainda nem visitaram o site — um sinal de que sua presença naquele mecanismo pode ser inexistente.

Diagrama comparativo dos três tipos de crawler de IA e das respectivas estratégias de liberação ou bloqueio
Crawlers de treinamento podem ser bloqueados; os de recuperação e busca precisam ser liberados. Essa classificação determina se a IA poderá citar seu conteúdo.

Etapa 2: libere ou bloqueie por categoria — não use a opção genérica

A Cloudflare oferece três ferramentas com níveis diferentes de controle, e a melhor abordagem é combiná-las. A opção mais ampla é o botão “Block AI Bots” nas configurações de segurança. Embora conveniente, ele funciona como uma medida indiscriminada e pode bloquear também os crawlers de recuperação. A menos que a visibilidade em IA não tenha nenhuma importância para o negócio, evite usá-lo. Em um nível intermediário está o robots.txt gerenciado, adequado para crawlers de treinamento que respeitam as regras. Para um controle mais preciso, use regras personalizadas do WAF, capazes de liberar ou bloquear bots individualmente. Esse deve ser o principal recurso da estratégia.

  1. Nas regras personalizadas do WAF, crie uma regra de bloqueio que identifique os user agents de crawlers de treinamento, como Bytespider, CCBot, GPTBot e ClaudeBot, e configure a ação para bloquear a requisição ou retornar 403.
  2. Crie também uma regra Skip que libere explicitamente OAI-SearchBot, PerplexityBot, Perplexity-User, ChatGPT-User, Googlebot e Bingbot. Posicione-a antes das regras de bloqueio para manter o acesso dos crawlers de recuperação e busca.
  3. Prefira comparar o campo “verified bot” da Cloudflare em vez de verificar apenas a string do user agent. Como user agents podem ser falsificados, qualquer pessoa pode se passar pelo Googlebot. A Cloudflare usa DNS reverso e assinaturas para validar bots e separar os legítimos dos impostores.
  4. Como evolução desse modelo, o Pay Per Crawl da Cloudflare poderá retornar HTTP 402 aos crawlers de treinamento e exigir pagamento antes da coleta. Assim, o uso do conteúdo deixa de ser gratuito e pode se transformar em receita ou poder de negociação.

Quais crawlers liberar e quais bloquear?

Se o objetivo é receber recomendações de mecanismos de IA — como ocorre com a maioria das empresas B2B SaaS —, a política padrão é simples: libere todos os crawlers de recuperação e busca e bloqueie seletivamente os de treinamento. Há duas armadilhas importantes. Primeiro, Google-Extended e Googlebot não são a mesma coisa. O primeiro controla apenas se o conteúdo pode ser usado no treinamento e no grounding do Gemini. Bloqueá-lo não elimina sua presença no AI Overviews; já bloquear o Googlebot impede que todo o ecossistema do Google enxergue o site. Segundo, não bloqueie o Bing: parte dos resultados do ChatGPT e do Copilot depende do índice do Bing, e barrar o Bingbot também pode afetar sua presença nesses produtos.

Etapa 3: valide as regras para evitar bloqueios acidentais

Depois de publicar uma regra, não presuma que ela funcionará exatamente como planejado. Volte ao AI Crawl Control e aos logs de eventos do WAF para verificar, bot por bot, se os crawlers de treinamento receberam 403 e se os crawlers de recuperação e o Googlebot continuam recebendo 200 de forma consistente. O erro mais comum é criar uma regra ampla demais e atingir o Googlebot. A equipe acredita ter bloqueado apenas a IA, mas a posição na busca orgânica começa a cair duas semanas depois. Inspecione a URL no Google Search Console ou consulte diretamente os códigos de resposta do servidor. Acompanhe os dados por uma semana e só encerre a validação quando tiver certeza de que todos os bots liberados continuam acessando o site normalmente.

Bloquear crawlers de IA é fácil. O desafio é barrar apenas os que devem ficar de fora e, ao mesmo tempo, abrir as portas para aqueles que podem levar sua marca às respostas.Tenten GEO

Bloquear crawlers é apenas defesa; o objetivo é conquistar citações.

Gerenciar bem o tráfego de crawlers evita que os recursos do servidor sejam consumidos sem retorno ou que o volume de acessos derrube o site. Mas liberar crawlers de recuperação não garante uma citação. Eles precisam encontrar seu conteúdo, compreendê-lo e considerá-lo relevante o bastante para usar como fonte. É aí que está a verdadeira disputa de GEO: estrutura de conteúdo, marcação de entidades, dados estruturados e consistência da marca entre plataformas. Configurar a Cloudflare corretamente abre a porta; entrar na resposta é outra batalha. Se você quer descobrir por que sua marca não é citada nos seis principais mecanismos de IA — ou se os crawlers liberados não estão gerando resultado —, agende um diagnóstico de GEO de 30 minutos. Usaremos perguntas reais do seu negócio para mostrar onde estão as lacunas.

Perguntas frequentes

Bloquear crawlers de IA com a Cloudflare fará meu site desaparecer do ChatGPT ou do Perplexity?
Depende de qual crawler você bloquear. Barrar bots de treinamento, como GPTBot e ClaudeBot, não afeta as citações. Já o bloqueio de crawlers de recuperação, como OAI-SearchBot e PerplexityBot, pode tirar seu conteúdo das respostas de IA. O essencial é tratar cada categoria separadamente, sem usar uma opção que bloqueie tudo de uma vez.
Qual é a diferença entre robots.txt e Cloudflare WAF no bloqueio de crawlers de IA?
O robots.txt é um pedido e depende de o crawler respeitar as regras. Bots bem-comportados obedecem; os mal-intencionados podem simplesmente ignorá-lo. O WAF impõe o bloqueio diretamente na borda da Cloudflare, independentemente da conduta do crawler. Para barrar de fato os bots que não seguem as regras, é necessário usar o WAF.
Quais crawlers de IA devem ser liberados para que meu conteúdo possa ser citado?
Libere pelo menos OAI-SearchBot, ChatGPT-User, PerplexityBot, Perplexity-User, Claude-User, Googlebot e Bingbot. Os primeiros determinam sua possibilidade de aparecer em respostas do ChatGPT e do Perplexity; os dois últimos afetam o Google AI Overviews e o Copilot.

PRÓXIMO PASSO

Qual é a visibilidade da sua marca nas respostas de IA?

Em um diagnóstico GEO de 30 minutos, identificamos lacunas de visibilidade e as ações que merecem prioridade.

Agendar diagnóstico