Tenten AIGEO
Voltar ao blog
AEO técnicoImplementação

Diagnóstico rápido de rastreabilidade por IA: confira robots.txt, renderização e schema em 5 minutos

Se a busca por IA não encontra seu site, o problema muitas vezes não está no conteúdo, mas na dificuldade dos rastreadores para lê-lo. Neste diagnóstico de cinco minutos, você verá como conferir se o robots.txt bloqueia o GPTBot, se a exibição do conteúdo depende de JavaScript e se os dados estruturados do schema estão corretos. Assim, fica mais fácil identificar falhas de rastreabilidade por IA e definir a ordem das correções.

Equipe Tenten GEOPublicado em 2024-11-294 min de leitura
Um feixe de varredura atravessa um portão entreaberto, simbolizando a capacidade de um rastreador de IA de ler uma página da web.

Se sua marca não aparece na busca por IA, talvez o problema não seja a qualidade do conteúdo. Pode ser que os rastreadores simplesmente não consigam ler a página. Basta uma destas três condições: o robots.txt bloqueia o GPTBot, o texto fica oculto em um bloco que depende de JavaScript ou a página não tem dados estruturados. Nesse cenário, por melhor que seja o artigo, ele praticamente não existe para o mecanismo de IA. Você não precisa esperar uma auditoria completa de trinta dias para descobrir esse tipo de falha. Em cinco minutos e três etapas, dá para fazer uma primeira verificação por conta própria.

Antes de começar: rastreadores de IA não são o Googlebot

Cada mecanismo de IA usa rastreadores próprios para coletar dados, com user-agents e comportamentos diferentes dos adotados pelo Googlebot. A principal diferença é que o Googlebot aceita investir recursos para executar o JavaScript de uma página e classificá-la. Em busca de velocidade e menor custo, a maioria dos rastreadores de IA se limita ao HTML original e executa pouco ou nenhum JavaScript. Portanto, “o Google indexa normalmente” não significa que ChatGPT, Perplexity e Claude conseguem ler seu conteúdo. O diagnóstico precisa ser feito sob a perspectiva de um rastreador de IA, não apenas com o checklist tradicional de SEO.

Primeiro minuto: abra o robots.txt e veja se os rastreadores de IA estão bloqueados

Acrescente /robots.txt ao final do seu domínio e abra o arquivo diretamente. Use Ctrl+F para procurar os nomes abaixo e verificar se algum deles está bloqueado por uma regra Disallow ou nem sequer é mencionado — a ausência de menção normalmente significa que o acesso está liberado. Em muitos sites, os rastreadores de IA são bloqueados “sem querer”: regras padrão de fornecedores de segurança, CDNs ou plugins barram todos os bots que não sejam o Googlebot e acabam deixando os mecanismos de IA do lado de fora.

  • GPTBot: rastreador usado pela OpenAI para coletar dados destinados a treinamento e recuperação de informações. Se ele for bloqueado, o ChatGPT não conseguirá acessar seu conteúdo.
  • OAI-SearchBot e ChatGPT-User: correspondem à busca do ChatGPT e ao acesso imediato às páginas quando os usuários fazem perguntas.
  • ClaudeBot: rastreador usado pelo Claude, da Anthropic, para coletar e recuperar páginas da web.
  • PerplexityBot e Perplexity-User: usados pela Perplexity para criar seu índice e ler páginas em tempo real.
  • Google-Extended: controla se o conteúdo pode ser usado pelo Gemini. Bloqueá-lo não afeta o ranqueamento normal no Google, mas faz seu conteúdo desaparecer das respostas do Gemini.

Minutos 2 e 3: desative o JavaScript e confira se o conteúdo continua visível

Esta etapa responde a uma pergunta: seu texto está realmente presente no HTML ou depende do navegador para executar JavaScript? O caminho mais rápido é desativar o JavaScript no Chrome DevTools e recarregar a página. Outra opção ainda mais direta é acrescentar view-source: antes da URL, abrir o código-fonte e usar Ctrl+F para procurar uma frase completa do artigo. Se o título, o texto ou o preço não aparecerem, esses elementos são renderizados no front-end. Um rastreador de IA que lê apenas o HTML receberá uma estrutura vazia. Pense na página como se ela fosse aberta em um navegador de texto puro: a IA só pode citar aquilo que o rastreador consegue enxergar.

As três etapas do diagnóstico de rastreabilidade por IA em cinco minutos: robots.txt, renderização da página e schema.
O diagnóstico verifica apenas três pontos: se os rastreadores conseguem entrar, se o conteúdo pode ser capturado e se os dados estruturados estão corretos.

Minutos 4 e 5: verifique se o schema existe e está correto

Abra novamente o código-fonte com view-source:. Desta vez, procure por application/ld+json para saber se a página contém dados estruturados e se o tipo usado é o correto. Páginas de artigos devem usar Article; páginas institucionais, Organization; páginas de perguntas e respostas, FAQPage; e páginas de produtos, Product. O schema não melhora diretamente seu ranqueamento. Sua função é ajudar a IA a confirmar, com o menor esforço possível, três pontos: qual é o assunto da página, quem a escreveu e se ela é confiável. Há uma armadilha importante: um schema incorreto é pior do que não ter schema. Se a marcação declarar uma FAQPage, mas as perguntas e respostas correspondentes não estiverem na página, ou se autor, data e conteúdo marcado não coincidirem com o que está visível, a IA poderá considerar a informação pouco confiável e reduzir a probabilidade de citá-la.

Resumo em uma página: o que você deve encontrar em cinco minutos

  1. robots.txt: nenhum dos rastreadores de IA mencionados acima está bloqueado por Disallow, e não existe um bloqueio de todo o site com User-agent: * e Disallow: /.
  2. Renderização: mesmo com o JavaScript desativado, o título, o corpo do texto e os dados essenciais, como preço e especificações, continuam presentes no HTML original.
  3. Schema: a página contém o tipo adequado de JSON-LD, e os dados marcados correspondem ao conteúdo visível — sem informações falsas ou desatualizadas.
  4. Passou nos três testes: a base da rastreabilidade por IA está em ordem. O próximo passo é otimizar o conteúdo e sua estrutura para citações.
  5. Falhou em qualquer um dos testes: não tenha pressa para produzir mais conteúdo. Essa é a lacuna que precisa ser corrigida agora.
A rastreabilidade por IA é um requisito básico para que seu conteúdo possa ser citado, não um diferencial. Sem cumprir esse requisito, a IA não conseguirá ler nem citar o material, por melhor que ele seja.Tenten GEO Consulting Team

Encontrou um problema? Veja o que corrigir primeiro

A ordem de prioridade é clara. Primeiro, remova os bloqueios do robots.txt: uma única alteração na regra pode liberar o acesso, gerar o maior impacto e, em geral, produzir efeito no mesmo dia. Os problemas de renderização vêm em segundo lugar, pois normalmente exigem o apoio da equipe de engenharia para transferir o conteúdo essencial para a renderização no servidor ou, pelo menos, incluí-lo no HTML original. O custo é maior, mas essa mudança determina diretamente se a IA consegue ler o que você escreveu. Deixe o schema por último. Ele aprimora uma base que já funciona; não resolve o problema fundamental de acesso ao conteúdo. Seguindo essa ordem, você corrige primeiro as falhas mais graves com o menor esforço possível.

Este diagnóstico de cinco minutos identifica as vulnerabilidades mais evidentes, mas não revela problemas mais profundos. Entre eles estão diferenças entre o conteúdo entregue pelo servidor ao rastreador de IA e ao usuário comum, parágrafos com estrutura pouco adequada para citações e inconsistências entre entidades ou sinais de credibilidade em páginas diferentes. Para descobrir onde estão as lacunas nessas camadas, você pode agendar um diagnóstico de GEO de 30 minutos. Com a perspectiva de auditoria de GEO da Tenten, organizaremos suas falhas de rastreabilidade em uma lista de ações que pode ser colocada em prática imediatamente.

Perguntas frequentes

Rastreadores de IA e Googlebot são a mesma coisa? O que acontece ao bloquear um deles?
Não. GPTBot, ClaudeBot, PerplexityBot e Google-Extended são independentes, e o acesso de cada um precisa ser liberado separadamente no robots.txt. A indexação normal pelo Google não significa que ChatGPT ou Perplexity consigam ler sua página. As duas situações devem ser verificadas de forma independente.
Por que o conteúdo exibido com JavaScript prejudica o rastreamento por IA?
A maioria dos rastreadores de IA não executa JavaScript ou não o executa por completo, limitando-se ao HTML original. Se texto, título e preço dependerem da renderização no front-end, o rastreador receberá uma estrutura vazia e não encontrará conteúdo para citar.
Sem schema, meu conteúdo fica completamente invisível para a IA?
Não fica completamente invisível. No entanto, o schema ajuda a IA a confirmar rapidamente o assunto, o autor e a credibilidade da página, aumentando a possibilidade de citação. Vale lembrar que um schema incorreto ou falso causa mais prejuízo do que a ausência de marcação. Declarar uma FAQ sem exibir o conteúdo correspondente pode fazer a página parecer pouco confiável.

PRÓXIMO PASSO

Qual é a visibilidade da sua marca nas respostas de IA?

Em um diagnóstico GEO de 30 minutos, identificamos lacunas de visibilidade e as ações que merecem prioridade.

Agendar diagnóstico