Tenten AIGEO
Volver al blog
AEO técnicoImplementación

Revisión rápida de rastreabilidad para IA: comprueba robots, renderizado y schema en 5 minutos

Si no apareces en las búsquedas con IA, puede que el problema no sea el contenido, sino que los rastreadores no logran leerlo. Esta revisión de cinco minutos te permitirá comprobar si robots.txt bloquea GPTBot, si el contenido de la página depende de JavaScript para mostrarse y si los datos estructurados de schema están bien implementados. Así podrás detectar rápidamente las carencias de rastreabilidad para IA y establecer el orden de las correcciones.

Equipo de Tenten GEOPublicado 2024-11-294 min de lectura
Un haz de escaneo atraviesa una puerta entreabierta y simboliza la capacidad de un rastreador de IA para leer una página web.

Si no apareces en las búsquedas con IA, quizá no sea porque tu contenido carezca de calidad, sino porque los rastreadores no pueden leer la página. Puede que robots.txt bloquee GPTBot, que el texto esté oculto en un bloque dependiente de JavaScript o que la página no tenga datos estructurados. Basta con que se cumpla una de estas tres condiciones para que, por mucho cuidado que hayas puesto en el artículo, este resulte invisible para el motor de IA. No hace falta esperar a que una auditoría completa de treinta días saque a la luz el problema: puedes comprobarlo por tu cuenta en cinco minutos y tres pasos.

Primero, una aclaración: los rastreadores de IA no son Googlebot

Cada motor de IA utiliza sus propios rastreadores para recopilar datos. Cada uno tiene un user-agent específico y se comporta de forma distinta a Googlebot. La diferencia fundamental es esta: para clasificar páginas, Googlebot está dispuesto a dedicar recursos a ejecutar su JavaScript; por razones de velocidad y coste, la mayoría de los rastreadores de IA se limitan al HTML original y apenas ejecutan JavaScript, si es que llegan a hacerlo. Por eso, que «Google indexe la página con normalidad» nunca equivale a que «ChatGPT, Perplexity y Claude puedan leerla». La revisión debe realizarse desde la perspectiva específica de un rastreador de IA, no con la antigua lista de comprobación de SEO.

Primer minuto: abre robots.txt y comprueba si bloquea los rastreadores de IA

Añade /robots.txt al final de tu dominio y abre la dirección directamente. Usa Ctrl+F para buscar los nombres que aparecen a continuación y comprueba si alguna directiva Disallow los bloquea o si ni siquiera se mencionan; por lo general, que no aparezcan significa que tienen acceso. En muchos sitios web, los rastreadores de IA están bloqueados «sin querer»: las reglas predeterminadas de un proveedor de seguridad, una CDN o algún complemento impiden el acceso a cualquier rastreador que no sea Googlebot y dejan fuera también a los motores de IA.

  • GPTBot: rastreador que OpenAI utiliza para recopilar datos destinados al entrenamiento y la recuperación de información. Si lo bloqueas, ChatGPT no podrá acceder a tu contenido.
  • OAI-SearchBot y ChatGPT-User: se utilizan, respectivamente, en las búsquedas de ChatGPT y para acceder a páginas en el momento en que los usuarios hacen una consulta.
  • ClaudeBot: rastreador que Claude, de Anthropic, utiliza para recopilar y recuperar páginas web.
  • PerplexityBot y Perplexity-User: Perplexity los utiliza para crear sus índices y leer páginas en el momento de la consulta.
  • Google-Extended: controla si el contenido puede utilizarse en Gemini. Bloquearlo no afectará al posicionamiento general en Google, pero hará que desaparezcas de las respuestas de Gemini.

Minutos 2 y 3: desactiva JavaScript y comprueba si el contenido sigue ahí

Este paso responde a una sola pregunta: ¿el texto está realmente incluido en el HTML o depende del navegador para ejecutar JavaScript? La forma más rápida de averiguarlo es desactivar JavaScript en Chrome DevTools y volver a cargar la página. Otra opción aún más directa consiste en añadir view-source: delante de la URL, abrir el código fuente y usar Ctrl+F para buscar una frase completa del artículo. Si no encuentras el título, el texto o el precio, significa que ese contenido se renderiza en el front end y que un rastreador de IA limitado al HTML solo recibirá una estructura vacía. Piensa en la página como si se consultara únicamente en modo texto: la IA solo puede citar lo que ve el rastreador.

Tres niveles de una revisión de rastreabilidad para IA en cinco minutos: robots.txt, renderizado de la página y schema.
La revisión se centra en tres aspectos: si los rastreadores pueden acceder, si el contenido se puede capturar y si los datos estructurados son correctos.

Minutos 4 y 5: comprueba si existe schema y si está bien implementado

Vuelve a utilizar view-source:, pero esta vez busca application/ld+json para comprobar si la página incluye datos estructurados y si el tipo utilizado es el adecuado. Una página de artículo debería incluir Article; una página corporativa, Organization; una página de preguntas y respuestas, FAQPage; y una página de producto, Product. Schema no mejora directamente el posicionamiento. Su función es permitir que la IA confirme con el menor esfuerzo posible tres aspectos: de qué trata la página, quién la ha escrito y si resulta fiable. Aquí hay una trampa frecuente: un schema incorrecto es peor que no tener ninguno. Si una página declara FAQPage, pero no muestra las preguntas y respuestas correspondientes, o si el autor, la fecha y el contenido de la etiqueta no coinciden con la página, la IA considerará que la información no es fiable y tendrá menos disposición a citarla.

Resumen en una página: lo que deberías comprobar en cinco minutos

  1. robots.txt: ninguna directiva Disallow bloquea los rastreadores de IA anteriores y tampoco existe un bloqueo general del sitio mediante User-agent: * y Disallow: /.
  2. Renderizado: después de desactivar JavaScript, el título, el cuerpo del texto y los datos clave —como el precio o las especificaciones— siguen siendo legibles en el HTML original.
  3. Schema: la página incluye el tipo de JSON-LD correspondiente, y el contenido marcado coincide con lo que aparece en pantalla; no es falso ni está desactualizado.
  4. Si superas las tres comprobaciones: la base de la rastreabilidad para IA es correcta; el siguiente paso consiste en optimizar el contenido y su estructura para facilitar las citas.
  5. Si no superas alguna de las comprobaciones: no te apresures a producir más contenido. Esa carencia es la que debes corregir ahora.
La rastreabilidad para IA es un requisito para poder ser citado, no un valor añadido. Si no superas ese umbral, la IA no podrá leer ni citar el contenido, por bueno que sea.Tenten GEO Consulting Team

Si detectas varios problemas, ¿cuál debes corregir primero?

Las correcciones siguen un orden de prioridad claro. Primero debes retirar el bloqueo de robots.txt: modificar una sola línea puede restablecer el acceso, es el cambio de mayor impacto y normalmente surte efecto ese mismo día. En segundo lugar están los problemas de renderizado, porque suelen requerir la intervención del equipo de ingeniería para que el contenido clave se renderice en el servidor o, como mínimo, aparezca en el HTML original. El coste es mayor, pero determina directamente si la IA puede leer el texto. Schema se completa al final: sirve para rematar los fundamentos, no para pasar de cero a uno. Si sigues este orden, resolverás primero las carencias más graves con el menor esfuerzo posible.

Esta revisión de cinco minutos permite detectar la mayoría de las vulnerabilidades evidentes, pero no revela problemas más profundos: por ejemplo, que el servidor entregue al rastreador de IA un contenido distinto del que reciben los usuarios, que la estructura de los párrafos citables sea demasiado dispersa o que las entidades y señales de confianza no sean coherentes entre páginas. Si quieres saber dónde están las carencias en estas capas, puedes solicitar un diagnóstico GEO de 30 minutos. Aplicaremos el enfoque de auditoría GEO de Tenten para convertir tus problemas de rastreabilidad en una lista de acciones que puedas poner en marcha de inmediato.

Preguntas frecuentes

¿Los rastreadores de IA y Googlebot son lo mismo? ¿Qué ocurre si bloqueas alguno?
No. GPTBot, ClaudeBot, PerplexityBot y Google-Extended funcionan de forma independiente, y su acceso debe autorizarse por separado en robots.txt. Que Google indexe una página con normalidad no significa que ChatGPT o Perplexity puedan leerla. Hay que comprobar ambos casos por separado.
¿Por qué el contenido mostrado mediante JavaScript dificulta el rastreo para IA?
La mayoría de los rastreadores de IA no ejecutan JavaScript, o no lo ejecutan por completo, y se limitan a leer el HTML original. Si el texto, el título y el precio dependen del renderizado en el front end, el rastreador recibirá una estructura vacía y no tendrá contenido que citar.
Si no tengo schema, ¿la IA será completamente incapaz de encontrarme?
No necesariamente, pero schema ayuda a la IA a confirmar rápidamente el tema, la autoría y la credibilidad de la página, lo que aumenta las posibilidades de que la cite. Ten en cuenta que un schema incorrecto o falso resulta más perjudicial que no tener ninguno. Si declaras que existe una sección de preguntas frecuentes, pero el contenido correspondiente no aparece en la página, esta se considerará poco fiable.

DA EL SIGUIENTE PASO

¿Qué visibilidad tiene tu marca en las respuestas de la IA?

En un diagnóstico GEO de 30 minutos identificamos tus brechas de visibilidad y las acciones que conviene priorizar.

Reservar el diagnóstico