Muita gente adiciona uma linha Disallow ao robots.txt para bloquear o GPTBot, acreditando que assim impedirá seu conteúdo de ser citado pelo ChatGPT. Na prática, isso não acontece. O GPTBot apenas coleta dados para treinar o modelo. Quem realmente determina se uma página pode aparecer nas respostas do ChatGPT é outro crawler: o OAI-SearchBot. Embora pertençam à mesma empresa, eles executam tarefas diferentes e usam User-Agents distintos. Antes de definir permissões e bloqueios no robots.txt, entenda a função de cada nome da lista para não configurar tudo ao contrário.
Primeiro, uma distinção fundamental: existem três categorias de crawlers de IA
- Crawler de treinamento: coleta seu conteúdo para incorporá-lo ao corpus de treinamento do modelo. Esse processamento costuma ocorrer offline e não tem relação direta com a resposta que o usuário está vendo naquele momento. Alguns exemplos são GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Meta-ExternalAgent e Bytespider (ByteDance).
- Crawler de busca/indexação: cria um índice pesquisável e atualizado para o mecanismo de respostas de IA, determinando diretamente se sua página poderá ser usada como fonte. Alguns exemplos são OAI-SearchBot (busca do ChatGPT), PerplexityBot, Googlebot (o AI Overviews usa o índice já existente) e Applebot (Siri e Apple Intelligence).
- Crawler acionado pelo usuário: entra em ação quando alguém cola sua URL em uma conversa ou solicita uma verificação imediata. Em geral, lê apenas uma página por vez e não envia o conteúdo para o conjunto de treinamento. Alguns exemplos são ChatGPT-User, Perplexity-User e Claude-User.
Se você quer que seu conteúdo seja citado por mecanismos de IA, não bloqueie as duas últimas categorias. Sem acesso para o crawler de busca, sua página nem entra na lista de fontes candidatas. Se o crawler acionado pelo usuário estiver bloqueado, a IA não conseguirá ler o conteúdo nem mesmo quando alguém enviar seu link diretamente. Já os crawlers de treinamento podem ser tratados conforme a estratégia da marca: bloqueie-os se não quiser que seu conteúdo seja usado gratuitamente no treinamento; libere-os se quiser aumentar a chance de integrar o corpus de base do modelo. Confundir essas três camadas é a principal causa de configurações de robots.txt feitas na direção errada.
OpenAI: GPTBot, OAI-SearchBot e ChatGPT-User
- GPTBot: usado para treinamento. O User-Agent contém "GPTBot/1.2" e o token no robots.txt é "GPTBot". A OpenAI também publica os blocos de IP do crawler em um arquivo JSON, o que permite verificar se a visita é legítima.
- OAI-SearchBot: responsável por incluir sua página nas fontes de busca e citação do ChatGPT. Seu token é "OAI-SearchBot". Bloqueá-lo equivale a abrir mão voluntariamente da visibilidade no ChatGPT — e, ainda assim, é justamente o crawler que muita gente bloqueia por engano.
- ChatGPT-User: acionado quando o usuário pede ao ChatGPT que acesse ou verifique sua URL durante uma conversa. O token é "ChatGPT-User". A leitura ocorre em tempo real, uma página por vez, e o conteúdo não é incluído no treinamento.
Google-Extended não é um crawler, mas um controle de uso
O Google-Extended costuma aparecer em “listas de crawlers de IA”, mas não é um crawler que você encontrará nos logs do servidor. Trata-se de um token de produto no robots.txt. Liberá-lo ou bloqueá-lo afeta apenas o uso do seu conteúdo pelo Google no treinamento do Gemini e em parte da geração de respostas; isso não interfere na indexação convencional feita pelo Googlebot. Portanto, bloquear o Google-Extended não retira seu site da busca do Google e, em geral, também não o remove do AI Overviews, que usa principalmente dados do índice já mantido pelo Googlebot. O Applebot-Extended segue a mesma lógica: controla o uso no treinamento do Apple Intelligence e é diferente do Applebot, responsável pela indexação convencional.
PerplexityBot e os crawlers que não respeitam as regras
Para que seu conteúdo possa ser citado pelo Perplexity, é preciso liberar tanto o PerplexityBot, responsável pelo índice, quanto o Perplexity-User, usado nas consultas do usuário em tempo real. Mas há uma ressalva importante: robots.txt é um acordo de cavalheiros, sem poder de imposição. Em 2025, a Cloudflare acusou publicamente a Perplexity de continuar rastreando sites bloqueados pelo robots.txt por meio de um User-Agent não declarado, disfarçado de navegador comum. O Bytespider também já era conhecido por rastrear em alta frequência, praticamente sem respeitar limites de velocidade. Assim, duas coisas podem ser verdade ao mesmo tempo: talvez você não consiga deter o crawler que deseja bloquear, e também precisa confirmar se o crawler que pretende liberar é realmente quem diz ser.
Amazonbot, ClaudeBot e outros nomes que aparecem nos logs
- ClaudeBot: crawler de treinamento da Anthropic. Também existem o Claude-User, acionado pelo usuário, e os tokens mais antigos anthropotic-ai e Claude-Web, que podem aparecer simultaneamente nos logs.
- Amazonbot: usado pela Alexa e pelos serviços de IA da Amazon. O User-Agent contém "Amazonbot/0.1".
- CCBot: crawler do Common Crawl. Embora o Common Crawl não seja uma empresa de IA, o corpus público que ele coleta é usado por muitos modelos. Por isso, funciona como um pipeline indireto de treinamento e costuma passar despercebido na definição das políticas de acesso.
- Outros nomes comuns: Meta-ExternalAgent (treinamento da Meta), Meta-ExternalFetcher (acionado pelo usuário), YouBot (You.com), DuckAssistBot (DuckDuckGo), cohere-ai (Cohere), MistralAI-User, Diffbot e Timpibot.

Como configurar o robots.txt em 2026
Não existe uma configuração universal. Para a maioria dos sites B2B que buscam resultados com GEO, porém, um bom ponto de partida é liberar os crawlers de busca e os acionados pelo usuário, permitindo que os mecanismos de IA leiam e citem o conteúdo. Já os crawlers de treinamento devem ser avaliados individualmente, conforme o valor do conteúdo e a estratégia da marca. A configuração abaixo prioriza visibilidade.
- User-agent: OAI-SearchBot → Allow: / (preserva a visibilidade no ChatGPT)
- User-agent: PerplexityBot → Allow: / (inclui o site no conjunto de fontes do Perplexity)
- User-agent: ChatGPT-User e Perplexity-User → Allow: / (não bloqueia verificações solicitadas pelo usuário)
- User-agent: Googlebot → Allow: / (o AI Overviews e a busca convencional usam o mesmo índice; mantenha o acesso liberado)
- User-agent: GPTBot, CCBot, Google-Extended → definir conforme a política adotada (use Disallow: / se não quiser que o conteúdo seja usado para treinamento; isso não afeta a visibilidade mencionada acima)
Não aposte tudo no robots.txt
O robots.txt pode deter crawlers que respeitam as regras, mas não impede quem está disposto a contorná-las. Para ter mais controle, é preciso avançar uma camada: use DNS reverso com confirmação direta e compare o IP com os blocos publicados oficialmente por cada empresa para verificar a autenticidade do crawler. Diante de acessos disfarçados ou rastreamento em alta frequência, recorra a um WAF, ao gerenciamento de crawlers de IA da Cloudflare ou a limites de requisições, em vez de apenas acrescentar mais uma linha ao robots.txt. O monitoramento é igualmente importante: consulte periodicamente os logs de acesso do servidor para saber quais crawlers de IA realmente visitaram o site e com que frequência. Esse é o sinal mais direto para avaliar sua exposição em GEO — e é mais preciso do que qualquer estimativa.
A lista de crawlers de IA muda a cada trimestre: surgem novos nomes e os tokens também mudam. Em vez de decorar todos eles, guarde a lógica de classificação: treinamento, busca e acionamento pelo usuário, cada qual com consequências estratégicas diferentes. Se você não sabe quais mecanismos de IA estão rastreando seu site atualmente nem quais páginas deveriam ser citadas, mas continuam de fora, a auditoria de GEO da Tenten reúne os registros de acesso dos crawlers e o status das citações em uma visão clara. Para identificar primeiro as lacunas, agende um diagnóstico de GEO de 30 minutos (/contact).



