Tenten AIGEO
Voltar ao blog
AEO técnicoAvaliação

Lista de User-Agents de crawlers de IA em 2026: entenda GPTBot, Google-Extended, PerplexityBot e Amazonbot de uma vez

GPTBot, OAI-SearchBot, Google-Extended, PerplexityBot, Amazonbot, ClaudeBot... Conheça os User-Agents e tokens de robots.txt dos principais crawlers de IA em 2026 e saiba quando liberar ou bloquear cada um, conforme sua função: treinamento, busca ou acionamento pelo usuário.

Equipe Tenten GEOPublicado em 2026-01-125 min de leitura
Representação abstrata de vários crawlers de IA chegando ao mesmo nó de um site por diferentes trajetórias luminosas.

Muita gente adiciona uma linha Disallow ao robots.txt para bloquear o GPTBot, acreditando que assim impedirá seu conteúdo de ser citado pelo ChatGPT. Na prática, isso não acontece. O GPTBot apenas coleta dados para treinar o modelo. Quem realmente determina se uma página pode aparecer nas respostas do ChatGPT é outro crawler: o OAI-SearchBot. Embora pertençam à mesma empresa, eles executam tarefas diferentes e usam User-Agents distintos. Antes de definir permissões e bloqueios no robots.txt, entenda a função de cada nome da lista para não configurar tudo ao contrário.

Primeiro, uma distinção fundamental: existem três categorias de crawlers de IA

  • Crawler de treinamento: coleta seu conteúdo para incorporá-lo ao corpus de treinamento do modelo. Esse processamento costuma ocorrer offline e não tem relação direta com a resposta que o usuário está vendo naquele momento. Alguns exemplos são GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Meta-ExternalAgent e Bytespider (ByteDance).
  • Crawler de busca/indexação: cria um índice pesquisável e atualizado para o mecanismo de respostas de IA, determinando diretamente se sua página poderá ser usada como fonte. Alguns exemplos são OAI-SearchBot (busca do ChatGPT), PerplexityBot, Googlebot (o AI Overviews usa o índice já existente) e Applebot (Siri e Apple Intelligence).
  • Crawler acionado pelo usuário: entra em ação quando alguém cola sua URL em uma conversa ou solicita uma verificação imediata. Em geral, lê apenas uma página por vez e não envia o conteúdo para o conjunto de treinamento. Alguns exemplos são ChatGPT-User, Perplexity-User e Claude-User.

Se você quer que seu conteúdo seja citado por mecanismos de IA, não bloqueie as duas últimas categorias. Sem acesso para o crawler de busca, sua página nem entra na lista de fontes candidatas. Se o crawler acionado pelo usuário estiver bloqueado, a IA não conseguirá ler o conteúdo nem mesmo quando alguém enviar seu link diretamente. Já os crawlers de treinamento podem ser tratados conforme a estratégia da marca: bloqueie-os se não quiser que seu conteúdo seja usado gratuitamente no treinamento; libere-os se quiser aumentar a chance de integrar o corpus de base do modelo. Confundir essas três camadas é a principal causa de configurações de robots.txt feitas na direção errada.

OpenAI: GPTBot, OAI-SearchBot e ChatGPT-User

  • GPTBot: usado para treinamento. O User-Agent contém "GPTBot/1.2" e o token no robots.txt é "GPTBot". A OpenAI também publica os blocos de IP do crawler em um arquivo JSON, o que permite verificar se a visita é legítima.
  • OAI-SearchBot: responsável por incluir sua página nas fontes de busca e citação do ChatGPT. Seu token é "OAI-SearchBot". Bloqueá-lo equivale a abrir mão voluntariamente da visibilidade no ChatGPT — e, ainda assim, é justamente o crawler que muita gente bloqueia por engano.
  • ChatGPT-User: acionado quando o usuário pede ao ChatGPT que acesse ou verifique sua URL durante uma conversa. O token é "ChatGPT-User". A leitura ocorre em tempo real, uma página por vez, e o conteúdo não é incluído no treinamento.

Google-Extended não é um crawler, mas um controle de uso

O Google-Extended costuma aparecer em “listas de crawlers de IA”, mas não é um crawler que você encontrará nos logs do servidor. Trata-se de um token de produto no robots.txt. Liberá-lo ou bloqueá-lo afeta apenas o uso do seu conteúdo pelo Google no treinamento do Gemini e em parte da geração de respostas; isso não interfere na indexação convencional feita pelo Googlebot. Portanto, bloquear o Google-Extended não retira seu site da busca do Google e, em geral, também não o remove do AI Overviews, que usa principalmente dados do índice já mantido pelo Googlebot. O Applebot-Extended segue a mesma lógica: controla o uso no treinamento do Apple Intelligence e é diferente do Applebot, responsável pela indexação convencional.

PerplexityBot e os crawlers que não respeitam as regras

Para que seu conteúdo possa ser citado pelo Perplexity, é preciso liberar tanto o PerplexityBot, responsável pelo índice, quanto o Perplexity-User, usado nas consultas do usuário em tempo real. Mas há uma ressalva importante: robots.txt é um acordo de cavalheiros, sem poder de imposição. Em 2025, a Cloudflare acusou publicamente a Perplexity de continuar rastreando sites bloqueados pelo robots.txt por meio de um User-Agent não declarado, disfarçado de navegador comum. O Bytespider também já era conhecido por rastrear em alta frequência, praticamente sem respeitar limites de velocidade. Assim, duas coisas podem ser verdade ao mesmo tempo: talvez você não consiga deter o crawler que deseja bloquear, e também precisa confirmar se o crawler que pretende liberar é realmente quem diz ser.

Amazonbot, ClaudeBot e outros nomes que aparecem nos logs

  • ClaudeBot: crawler de treinamento da Anthropic. Também existem o Claude-User, acionado pelo usuário, e os tokens mais antigos anthropotic-ai e Claude-Web, que podem aparecer simultaneamente nos logs.
  • Amazonbot: usado pela Alexa e pelos serviços de IA da Amazon. O User-Agent contém "Amazonbot/0.1".
  • CCBot: crawler do Common Crawl. Embora o Common Crawl não seja uma empresa de IA, o corpus público que ele coleta é usado por muitos modelos. Por isso, funciona como um pipeline indireto de treinamento e costuma passar despercebido na definição das políticas de acesso.
  • Outros nomes comuns: Meta-ExternalAgent (treinamento da Meta), Meta-ExternalFetcher (acionado pelo usuário), YouBot (You.com), DuckAssistBot (DuckDuckGo), cohere-ai (Cohere), MistralAI-User, Diffbot e Timpibot.
Diagrama das três principais categorias de crawlers de IA — treinamento, busca e acionamento pelo usuário — com seus respectivos exemplos.
Separar os crawlers de IA entre treinamento, busca e acionamento pelo usuário é essencial para decidir o que liberar ou bloquear no robots.txt.

Como configurar o robots.txt em 2026

Não existe uma configuração universal. Para a maioria dos sites B2B que buscam resultados com GEO, porém, um bom ponto de partida é liberar os crawlers de busca e os acionados pelo usuário, permitindo que os mecanismos de IA leiam e citem o conteúdo. Já os crawlers de treinamento devem ser avaliados individualmente, conforme o valor do conteúdo e a estratégia da marca. A configuração abaixo prioriza visibilidade.

  • User-agent: OAI-SearchBot → Allow: / (preserva a visibilidade no ChatGPT)
  • User-agent: PerplexityBot → Allow: / (inclui o site no conjunto de fontes do Perplexity)
  • User-agent: ChatGPT-User e Perplexity-User → Allow: / (não bloqueia verificações solicitadas pelo usuário)
  • User-agent: Googlebot → Allow: / (o AI Overviews e a busca convencional usam o mesmo índice; mantenha o acesso liberado)
  • User-agent: GPTBot, CCBot, Google-Extended → definir conforme a política adotada (use Disallow: / se não quiser que o conteúdo seja usado para treinamento; isso não afeta a visibilidade mencionada acima)

Não aposte tudo no robots.txt

O robots.txt pode deter crawlers que respeitam as regras, mas não impede quem está disposto a contorná-las. Para ter mais controle, é preciso avançar uma camada: use DNS reverso com confirmação direta e compare o IP com os blocos publicados oficialmente por cada empresa para verificar a autenticidade do crawler. Diante de acessos disfarçados ou rastreamento em alta frequência, recorra a um WAF, ao gerenciamento de crawlers de IA da Cloudflare ou a limites de requisições, em vez de apenas acrescentar mais uma linha ao robots.txt. O monitoramento é igualmente importante: consulte periodicamente os logs de acesso do servidor para saber quais crawlers de IA realmente visitaram o site e com que frequência. Esse é o sinal mais direto para avaliar sua exposição em GEO — e é mais preciso do que qualquer estimativa.

A lista de crawlers de IA muda a cada trimestre: surgem novos nomes e os tokens também mudam. Em vez de decorar todos eles, guarde a lógica de classificação: treinamento, busca e acionamento pelo usuário, cada qual com consequências estratégicas diferentes. Se você não sabe quais mecanismos de IA estão rastreando seu site atualmente nem quais páginas deveriam ser citadas, mas continuam de fora, a auditoria de GEO da Tenten reúne os registros de acesso dos crawlers e o status das citações em uma visão clara. Para identificar primeiro as lacunas, agende um diagnóstico de GEO de 30 minutos (/contact).

Perguntas frequentes

Bloquear o GPTBot fará meu site desaparecer do ChatGPT?
Não. O GPTBot apenas coleta dados para treinar o modelo. Quem determina se seu conteúdo pode aparecer nas respostas do ChatGPT é o OAI-SearchBot. Para preservar a visibilidade no ChatGPT, libere o OAI-SearchBot e o ChatGPT-User; a decisão sobre o GPTBot deve seguir sua política de treinamento.
O Google-Extended é um crawler?
Não. Ele é um token de produto no robots.txt que controla apenas se o Google pode usar seu conteúdo no treinamento do Gemini. Não interfere na indexação convencional do Googlebot nem fará seu site desaparecer da busca do Google ou da maioria dos resultados do AI Overviews.
O que fazer quando o robots.txt não consegue deter crawlers de IA que ignoram as regras?
O robots.txt é apenas um acordo de cavalheiros. Diante de crawlers disfarçados ou acessos em alta frequência, usar um WAF, o gerenciamento de crawlers de IA da Cloudflare e limites de requisições é mais eficaz do que simplesmente adicionar outra linha ao arquivo. Também vale confirmar a origem por DNS reverso e comparar o IP com os blocos publicados oficialmente.

PRÓXIMO PASSO

Qual é a visibilidade da sua marca nas respostas de IA?

Em um diagnóstico GEO de 30 minutos, identificamos lacunas de visibilidade e as ações que merecem prioridade.

Agendar diagnóstico