Quando a maioria das pessoas bloqueia crawlers de IA no robots.txt, o resultado não é proteger o conteúdo, mas retirar o próprio site das respostas do ChatGPT, Perplexity e Claude. Isso acontece porque OpenAI, Anthropic e Perplexity não operam com um único crawler: cada empresa utiliza dois ou três. Um coleta conteúdo para treinar modelos; outro recupera páginas em tempo real e inclui o link da fonte na resposta. Em geral, você quer bloquear o primeiro e manter o segundo. Mas uma regra genérica com User-agent: * e Disallow: / fecha a porta para ambos.
Crawlers de treinamento e de recuperação têm funções diferentes
Na OpenAI, por exemplo, o GPTBot coleta conteúdo para compor o corpus usado no treinamento futuro dos modelos. O OAI-SearchBot inclui sua página no índice de busca do ChatGPT, permitindo que ela seja citada com link nas respostas em tempo real. Já o ChatGPT-User só é acionado quando o usuário solicita, durante a conversa, o acesso a uma URL específica. Portanto, bloquear o GPTBot afeta apenas o uso do conteúdo para treinamento; isso não impede o ChatGPT de citar sua página naquele momento. Anthropic e Perplexity adotam uma divisão de funções semelhante, embora usem nomes diferentes. Confundir essas categorias leva você a bloquear o que deveria liberar e a deixar passar justamente o que queria barrar.
- “GPTBot” (OpenAI): coleta conteúdo para treinar modelos-base; bloqueá-lo não faz seu site desaparecer das buscas do ChatGPT.
- “OAI-SearchBot” (OpenAI): indexa páginas para a busca e as respostas instantâneas do ChatGPT, incluindo citações das fontes; se você quer ser citado, precisa liberá-lo.
- “ChatGPT-User” (OpenAI): é acionado quando o usuário pede ativamente, durante a conversa, que uma URL específica seja acessada.
- “ClaudeBot” (Anthropic): coleta conteúdo para treinamento e uso pelos modelos.
- “Claude-SearchBot” e “Claude-User” (Anthropic): cuidam, respectivamente, do índice de busca e da recuperação de conteúdo solicitada pelo usuário.
- “PerplexityBot” (Perplexity): indexa conteúdo para o mecanismo de respostas da Perplexity; bloqueá-lo equivale a deixar de aparecer entre as fontes da plataforma.
- “Perplexity-User” (Perplexity): recupera conteúdo imediatamente quando o usuário faz uma pergunta. O bot já foi acusado de não respeitar integralmente o robots.txt.
- Outros agentes comuns: “Google-Extended” (não é um crawler propriamente dito, mas um controle que define se o conteúdo pode ser usado para treinamento e grounding do Gemini), “CCBot” (Common Crawl, fonte de corpus de treinamento para muitos modelos) e “Bytespider” (ByteDance, conhecido por rastrear sites de forma intensa).
Regras básicas do robots.txt: não publique a configuração ainda
O robots.txt deve ficar na raiz do domínio, sempre no endereço formado pelo domínio seguido de /robots.txt. Cada host precisa ter seu próprio arquivo: blog.example.com e www.example.com são hosts diferentes, e as regras de um não controlam o outro. http, https e portas diferentes também são tratados como origens distintas. A sintaxe se baseia em três palavras-chave: User-agent identifica o bot, Disallow bloqueia um caminho e Allow cria exceções. Quando Allow e Disallow entram em conflito, os principais mecanismos priorizam o caminho mais longo. Assim, você pode usar Allow para abrir uma pequena passagem dentro de um bloqueio amplo.
- O robots.txt é uma “solicitação”, não um firewall: crawlers que seguem as regras, como GPTBot, ClaudeBot e Googlebot, vão respeitá-lo, mas bots maliciosos ou indisciplinados podem ignorá-lo. Para impor o bloqueio, é necessário recorrer a WAF, regras de firewall ou mecanismos de verificação no servidor.
- Bloquear o rastreamento não apaga dados já existentes: o robots.txt só determina se o conteúdo poderá ser coletado dali em diante. Materiais já incluídos em dados de treinamento não desaparecem.
- O nome do User-agent precisa estar correto: a comparação não diferencia maiúsculas de minúsculas, mas um erro de grafia — como GPT-Bot ou Perplexity Bot — torna a configuração inválida. Cada conjunto de regras só se aplica ao User-agent correspondente.
Cenário 1: permitir citações e recusar treinamento — configuração padrão para a maioria das empresas B2B SaaS
Se você quer aparecer nas respostas de IA com a devida indicação da fonte, mas não deseja ceder gratuitamente seu conteúdo para treinar a próxima geração de modelos, libere os crawlers de busca e bloqueie os de treinamento. Essa é a configuração padrão que adotamos para a maioria dos clientes B2B: visibilidade em primeiro lugar, autorização para treinamento como opção. Na prática, cada crawler deve ficar em um grupo User-agent separado, com regras próprias. Incluir um Allow: / explícito para os crawlers de busca deixa a intenção clara e pode substituir configurações antigas de bloqueio em todo o site.
- User-agent: GPTBot → Disallow: / (crawler de treinamento; bloquear)
- User-agent: ClaudeBot → Disallow: / (crawler de treinamento; bloquear)
- User-agent: CCBot → Disallow: / (corpus de treinamento do Common Crawl; bloquear)
- User-agent: OAI-SearchBot → Allow: / (citações na busca do ChatGPT; liberar)
- User-agent: PerplexityBot → Allow: / (citações na Perplexity; liberar)
- User-agent: Claude-SearchBot → Allow: / (busca e citações do Claude; liberar)
- Se você não quiser participar do treinamento do Gemini, também pode adicionar User-agent: Google-Extended → Disallow: / (isso não afeta o posicionamento na busca do Google)

Cenário 2: bloquear totalmente o acesso da IA, inclusive para citações
Conteúdo protegido por paywall, informações sensíveis do ponto de vista de compliance ou materiais ainda em fase de negociação de licenciamento podem exigir o bloqueio até mesmo da recuperação. Nesse caso, liste todos os User-agents de IA conhecidos e aplique Disallow: / a cada um. Mas considere o custo: depois do bloqueio, suas citações nas respostas de IA cairão a zero. Na prática, isso significa abrir mão voluntariamente de uma fonte de tráfego em expansão. Em geral, trata-se de uma medida defensiva e temporária, não da configuração padrão para sites de marketing B2B.
- OpenAI: aplique Disallow: / separadamente a GPTBot, OAI-SearchBot e ChatGPT-User.
- Anthropic: aplique Disallow: / separadamente a ClaudeBot, Claude-SearchBot e Claude-User.
- Perplexity: aplique Disallow: / separadamente a PerplexityBot e Perplexity-User.
- Bloqueios adicionais opcionais: aplique Disallow: / separadamente a Google-Extended, Applebot-Extended, Bytespider e CCBot.
Não deixe um modelo pronto de “bloqueio de toda IA em um clique” prejudicar seu GEO
Há muitos modelos circulando na internet com a promessa de que basta “colar este trecho no robots.txt para bloquear a IA”. O problema é que eles costumam aplicar Disallow: / a todos os User-agents de IA, inclusive aos crawlers de busca responsáveis por citar seu site. Você pensa que está protegendo o conteúdo, mas, na prática, está retirando sua marca da busca do ChatGPT e das listas de fontes da Perplexity e do Claude. Para marcas B2B que desejam ser citadas por IA, isso quase sempre produz o efeito contrário ao pretendido. Antes de publicar qualquer modelo, confirme se ele bloqueia treinamento ou recuperação.
Como confirmar que a configuração realmente funcionou?
- Verificação direta: abra seu domínio no navegador, acrescente /robots.txt e confirme se o arquivo existe, está na raiz e não contém erros nos nomes dos grupos.
- Análise dos logs do servidor: procure GPTBot, ClaudeBot e PerplexityBot no campo User-agent. Verifique se os bots bloqueados recebem resposta 403 e se os liberados conseguem acessar a página normalmente.
- Verificação de autenticidade: o User-agent de um crawler de IA pode ser falsificado. OpenAI e Anthropic publicam seus intervalos oficiais de IP; faça a confirmação cruzada por DNS reverso e DNS direto para evitar bots impostores.
- Simulação de requisição: use curl para acessar a página com o User-agent correspondente e confira se as regras do robots.txt permitem ou bloqueiam o acesso como esperado.
- Revisão periódica: as empresas podem criar ou renomear User-agents — como ocorreu quando o OAI-SearchBot foi separado do GPTBot. Revise a configuração a cada trimestre para evitar que ela fique desatualizada.
O robots.txt não é um cofre; é uma placa na porta. Ele define quais tipos de IA você recebe e quais ficam do lado de fora. No universo do GEO, impedir a entrada dos crawlers de busca equivale a fechar a porta para oportunidades de negócio.— Tenten GEO Consulting Team
Configurar o robots.txt é apenas o primeiro passo da base técnica de GEO. A possibilidade de ser citado por IA depende também de dados estruturados, llms.txt, facilidade de extração do conteúdo e visibilidade real da marca nos diferentes mecanismos. Se você quer descobrir se sua empresa está sendo citada por IA ou bloqueada pelo próprio robots.txt, agende um diagnóstico de GEO de 30 minutos. Usaremos seu domínio real para verificar o acesso dos crawlers e o status das citações, mostrando na hora onde estão as lacunas.



