Tenten AIGEO
Voltar ao blog
AEO técnicoImplementação

Como controlar GPTBot, ClaudeBot e PerplexityBot com robots.txt: configurações completas para permitir ou bloquear crawlers de IA

Quer usar o robots.txt para controlar GPTBot, ClaudeBot e PerplexityBot? Este artigo explica a diferença entre crawlers de treinamento e de busca, apresenta duas configurações — “permitir citações e negar treinamento” e “bloqueio total” —, mostra como verificar se as regras funcionam e ajuda a evitar que seu site desapareça por engano das respostas de IA.

Equipe Tenten GEOPublicado em 2025-06-225 min de leitura
Cena conceitual em tons escuros: pontos de controle luminosos direcionam crawlers de IA, liberando alguns para a luz e bloqueando outros nas sombras.

Quando a maioria das pessoas bloqueia crawlers de IA no robots.txt, o resultado não é proteger o conteúdo, mas retirar o próprio site das respostas do ChatGPT, Perplexity e Claude. Isso acontece porque OpenAI, Anthropic e Perplexity não operam com um único crawler: cada empresa utiliza dois ou três. Um coleta conteúdo para treinar modelos; outro recupera páginas em tempo real e inclui o link da fonte na resposta. Em geral, você quer bloquear o primeiro e manter o segundo. Mas uma regra genérica com User-agent: * e Disallow: / fecha a porta para ambos.

Crawlers de treinamento e de recuperação têm funções diferentes

Na OpenAI, por exemplo, o GPTBot coleta conteúdo para compor o corpus usado no treinamento futuro dos modelos. O OAI-SearchBot inclui sua página no índice de busca do ChatGPT, permitindo que ela seja citada com link nas respostas em tempo real. Já o ChatGPT-User só é acionado quando o usuário solicita, durante a conversa, o acesso a uma URL específica. Portanto, bloquear o GPTBot afeta apenas o uso do conteúdo para treinamento; isso não impede o ChatGPT de citar sua página naquele momento. Anthropic e Perplexity adotam uma divisão de funções semelhante, embora usem nomes diferentes. Confundir essas categorias leva você a bloquear o que deveria liberar e a deixar passar justamente o que queria barrar.

  • “GPTBot” (OpenAI): coleta conteúdo para treinar modelos-base; bloqueá-lo não faz seu site desaparecer das buscas do ChatGPT.
  • “OAI-SearchBot” (OpenAI): indexa páginas para a busca e as respostas instantâneas do ChatGPT, incluindo citações das fontes; se você quer ser citado, precisa liberá-lo.
  • “ChatGPT-User” (OpenAI): é acionado quando o usuário pede ativamente, durante a conversa, que uma URL específica seja acessada.
  • “ClaudeBot” (Anthropic): coleta conteúdo para treinamento e uso pelos modelos.
  • “Claude-SearchBot” e “Claude-User” (Anthropic): cuidam, respectivamente, do índice de busca e da recuperação de conteúdo solicitada pelo usuário.
  • “PerplexityBot” (Perplexity): indexa conteúdo para o mecanismo de respostas da Perplexity; bloqueá-lo equivale a deixar de aparecer entre as fontes da plataforma.
  • “Perplexity-User” (Perplexity): recupera conteúdo imediatamente quando o usuário faz uma pergunta. O bot já foi acusado de não respeitar integralmente o robots.txt.
  • Outros agentes comuns: “Google-Extended” (não é um crawler propriamente dito, mas um controle que define se o conteúdo pode ser usado para treinamento e grounding do Gemini), “CCBot” (Common Crawl, fonte de corpus de treinamento para muitos modelos) e “Bytespider” (ByteDance, conhecido por rastrear sites de forma intensa).

Regras básicas do robots.txt: não publique a configuração ainda

O robots.txt deve ficar na raiz do domínio, sempre no endereço formado pelo domínio seguido de /robots.txt. Cada host precisa ter seu próprio arquivo: blog.example.com e www.example.com são hosts diferentes, e as regras de um não controlam o outro. http, https e portas diferentes também são tratados como origens distintas. A sintaxe se baseia em três palavras-chave: User-agent identifica o bot, Disallow bloqueia um caminho e Allow cria exceções. Quando Allow e Disallow entram em conflito, os principais mecanismos priorizam o caminho mais longo. Assim, você pode usar Allow para abrir uma pequena passagem dentro de um bloqueio amplo.

  • O robots.txt é uma “solicitação”, não um firewall: crawlers que seguem as regras, como GPTBot, ClaudeBot e Googlebot, vão respeitá-lo, mas bots maliciosos ou indisciplinados podem ignorá-lo. Para impor o bloqueio, é necessário recorrer a WAF, regras de firewall ou mecanismos de verificação no servidor.
  • Bloquear o rastreamento não apaga dados já existentes: o robots.txt só determina se o conteúdo poderá ser coletado dali em diante. Materiais já incluídos em dados de treinamento não desaparecem.
  • O nome do User-agent precisa estar correto: a comparação não diferencia maiúsculas de minúsculas, mas um erro de grafia — como GPT-Bot ou Perplexity Bot — torna a configuração inválida. Cada conjunto de regras só se aplica ao User-agent correspondente.

Cenário 1: permitir citações e recusar treinamento — configuração padrão para a maioria das empresas B2B SaaS

Se você quer aparecer nas respostas de IA com a devida indicação da fonte, mas não deseja ceder gratuitamente seu conteúdo para treinar a próxima geração de modelos, libere os crawlers de busca e bloqueie os de treinamento. Essa é a configuração padrão que adotamos para a maioria dos clientes B2B: visibilidade em primeiro lugar, autorização para treinamento como opção. Na prática, cada crawler deve ficar em um grupo User-agent separado, com regras próprias. Incluir um Allow: / explícito para os crawlers de busca deixa a intenção clara e pode substituir configurações antigas de bloqueio em todo o site.

  • User-agent: GPTBot → Disallow: / (crawler de treinamento; bloquear)
  • User-agent: ClaudeBot → Disallow: / (crawler de treinamento; bloquear)
  • User-agent: CCBot → Disallow: / (corpus de treinamento do Common Crawl; bloquear)
  • User-agent: OAI-SearchBot → Allow: / (citações na busca do ChatGPT; liberar)
  • User-agent: PerplexityBot → Allow: / (citações na Perplexity; liberar)
  • User-agent: Claude-SearchBot → Allow: / (busca e citações do Claude; liberar)
  • Se você não quiser participar do treinamento do Gemini, também pode adicionar User-agent: Google-Extended → Disallow: / (isso não afeta o posicionamento na busca do Google)
Diagrama de direcionamento via robots.txt: crawlers de treinamento são bloqueados, crawlers de busca são permitidos e a visibilidade nas citações de IA é preservada.
O mesmo robots.txt pode bloquear crawlers de treinamento e liberar os crawlers de busca responsáveis por citar seu conteúdo.

Cenário 2: bloquear totalmente o acesso da IA, inclusive para citações

Conteúdo protegido por paywall, informações sensíveis do ponto de vista de compliance ou materiais ainda em fase de negociação de licenciamento podem exigir o bloqueio até mesmo da recuperação. Nesse caso, liste todos os User-agents de IA conhecidos e aplique Disallow: / a cada um. Mas considere o custo: depois do bloqueio, suas citações nas respostas de IA cairão a zero. Na prática, isso significa abrir mão voluntariamente de uma fonte de tráfego em expansão. Em geral, trata-se de uma medida defensiva e temporária, não da configuração padrão para sites de marketing B2B.

  • OpenAI: aplique Disallow: / separadamente a GPTBot, OAI-SearchBot e ChatGPT-User.
  • Anthropic: aplique Disallow: / separadamente a ClaudeBot, Claude-SearchBot e Claude-User.
  • Perplexity: aplique Disallow: / separadamente a PerplexityBot e Perplexity-User.
  • Bloqueios adicionais opcionais: aplique Disallow: / separadamente a Google-Extended, Applebot-Extended, Bytespider e CCBot.

Não deixe um modelo pronto de “bloqueio de toda IA em um clique” prejudicar seu GEO

Há muitos modelos circulando na internet com a promessa de que basta “colar este trecho no robots.txt para bloquear a IA”. O problema é que eles costumam aplicar Disallow: / a todos os User-agents de IA, inclusive aos crawlers de busca responsáveis por citar seu site. Você pensa que está protegendo o conteúdo, mas, na prática, está retirando sua marca da busca do ChatGPT e das listas de fontes da Perplexity e do Claude. Para marcas B2B que desejam ser citadas por IA, isso quase sempre produz o efeito contrário ao pretendido. Antes de publicar qualquer modelo, confirme se ele bloqueia treinamento ou recuperação.

Como confirmar que a configuração realmente funcionou?

  • Verificação direta: abra seu domínio no navegador, acrescente /robots.txt e confirme se o arquivo existe, está na raiz e não contém erros nos nomes dos grupos.
  • Análise dos logs do servidor: procure GPTBot, ClaudeBot e PerplexityBot no campo User-agent. Verifique se os bots bloqueados recebem resposta 403 e se os liberados conseguem acessar a página normalmente.
  • Verificação de autenticidade: o User-agent de um crawler de IA pode ser falsificado. OpenAI e Anthropic publicam seus intervalos oficiais de IP; faça a confirmação cruzada por DNS reverso e DNS direto para evitar bots impostores.
  • Simulação de requisição: use curl para acessar a página com o User-agent correspondente e confira se as regras do robots.txt permitem ou bloqueiam o acesso como esperado.
  • Revisão periódica: as empresas podem criar ou renomear User-agents — como ocorreu quando o OAI-SearchBot foi separado do GPTBot. Revise a configuração a cada trimestre para evitar que ela fique desatualizada.
O robots.txt não é um cofre; é uma placa na porta. Ele define quais tipos de IA você recebe e quais ficam do lado de fora. No universo do GEO, impedir a entrada dos crawlers de busca equivale a fechar a porta para oportunidades de negócio.Tenten GEO Consulting Team

Configurar o robots.txt é apenas o primeiro passo da base técnica de GEO. A possibilidade de ser citado por IA depende também de dados estruturados, llms.txt, facilidade de extração do conteúdo e visibilidade real da marca nos diferentes mecanismos. Se você quer descobrir se sua empresa está sendo citada por IA ou bloqueada pelo próprio robots.txt, agende um diagnóstico de GEO de 30 minutos. Usaremos seu domínio real para verificar o acesso dos crawlers e o status das citações, mostrando na hora onde estão as lacunas.

Perguntas frequentes

Bloquear o GPTBot fará meu site desaparecer do ChatGPT?
Não. O GPTBot só coleta conteúdo para o treinamento dos modelos. A busca em tempo real e as citações do ChatGPT ficam a cargo do OAI-SearchBot e do ChatGPT-User. Desde que esses dois não estejam bloqueados, sua página ainda poderá ser citada pelo ChatGPT com um link para a fonte.
O robots.txt consegue impedir crawlers de IA que não respeitam as regras?
Não. O robots.txt é um aviso de adesão voluntária. GPTBot, ClaudeBot, Googlebot e outros crawlers que seguem o protocolo vão respeitá-lo, mas bots maliciosos ou indisciplinados podem simplesmente ignorá-lo. Para impor o bloqueio, use WAF, regras de firewall ou mecanismos de autenticação no servidor.
Como configurar o robots.txt para ser citado por IA sem permitir o uso do conteúdo em treinamento?
Bloqueie os crawlers de treinamento — GPTBot, ClaudeBot e CCBot — e libere os crawlers de busca — OAI-SearchBot, PerplexityBot e Claude-SearchBot. Os primeiros estão relacionados aos dados de treinamento; os segundos determinam se seu conteúdo poderá ser citado nas respostas de IA.

PRÓXIMO PASSO

Qual é a visibilidade da sua marca nas respostas de IA?

Em um diagnóstico GEO de 30 minutos, identificamos lacunas de visibilidade e as ações que merecem prioridade.

Agendar diagnóstico