La mayoría de los sitios web no logra visibilidad en las búsquedas con IA. A menudo, el problema no es la calidad del contenido: los rastreadores de IA ni siquiera pueden acceder, extraerlo con claridad o reconocer quién lo publica. Si falla la base técnica, hasta el mejor artículo pierde su oportunidad. Este checklist convierte el objetivo de «hacer que la IA entienda tu sitio web» en 25 comprobaciones que puedes realizar por tu cuenta. Están organizadas en cuatro niveles; si avanzas de abajo arriba, detectarás la mayoría de las brechas evidentes.
El AEO (optimización para motores de respuesta) comparte fundamentos con el SEO tradicional, pero los motores de IA añaden otra capa de exigencia. Primero deben rastrear la página, dividir el contenido en fragmentos claros, entender de qué trata cada uno y, por último, decidir si lo citan en una respuesta generada. Un bloqueo en cualquier punto de ese recorrido puede dejarte fuera de ChatGPT, Perplexity y Google AI Overviews. Por eso, los siguientes 25 puntos siguen esa misma lógica y se agrupan en cuatro capas, desde la base: rastreo, estructura, semántica y confianza.
Capa de rastreo: ¿pueden entrar los rastreadores de IA? (puntos 1–6)
Es la capa más fácil de pasar por alto y también la más crítica. Muchos sitios tienen contenido valioso, pero bloquean por completo a los rastreadores de IA desde robots.txt o el firewall sin que sus responsables lo sepan.
- Configura robots.txt para permitir expresamente los principales rastreadores de IA (GPTBot, ClaudeBot, PerplexityBot y Google-Extended). No los bloquees junto con los bots maliciosos.
- Revisa las reglas de bloqueo de Cloudflare o del WAF. Muchas opciones predeterminadas del tipo «bloquear rastreadores de IA» también impiden el acceso de los motores en los que te interesa aparecer como fuente.
- Asegúrate de que el contenido principal figure en el HTML generado en el servidor. La mayoría de los rastreadores de IA no ejecuta JavaScript y no puede ver el contenido renderizado únicamente en el frontend.
- Comprueba que todas las páginas importantes devuelvan un código de estado 200. Detecta errores 404 ocultos, soft 404 y cadenas de redirecciones.
- Incluye en sitemap.xml todas las páginas que quieras indexar. El valor lastmod debe reflejar la fecha real de actualización; no asignes la fecha de hoy a todas las URL.
- Carga el contenido visible en el primer pantallazo dentro de la respuesta inicial. Evita que el rastreador encuentre una página vacía que todavía espera a que termine la carga.
Un problema habitual aparece al migrar el sitio a un framework de frontend y renderizar toda la página con JavaScript en el navegador. Para las personas, el contenido se muestra sin inconvenientes; para un rastreador que no ejecuta JS, la página está casi vacía. Empieza por seleccionar «Ver código fuente» en el navegador y comprueba si el contenido principal está presente en el HTML original. Esta sencilla revisión permite descartar buena parte de los problemas.
Capa estructural: ¿puede extraerse el contenido con claridad? (puntos 7–13)
Los motores de IA no procesan la página como un único bloque: la dividen en fragmentos y seleccionan los pasajes que mejor responden a cada pregunta. Cuanto más clara sea la estructura, más posibilidades tendrá el contenido de ser extraído.
- Utiliza un solo H1 por página y organiza los H2 y H3 en una jerarquía clara. No simules encabezados con texto de gran tamaño ni te saltes niveles.
- Usa más etiquetas semánticas (article, section, nav y title) y evita construir toda la página mediante capas de div. Así, las máquinas podrán interpretar mejor su estructura.
- Incluye la respuesta clave en la primera o segunda frase de cada párrafo. De este modo, la IA puede identificar la idea principal al extraer el fragmento sin tener que inferirla.
- Crea las listas con ul y ol, y presenta las comparaciones mediante tablas reales. No recurras a capturas de pantalla ni a composiciones puramente visuales: el texto incrustado en una imagen no puede extraerse.
- Estructura las preguntas frecuentes como pares de pregunta y respuesta. Cada respuesta debe ser autosuficiente y poder citarse de forma independiente.
- Añade atributos alt descriptivos a las imágenes y transcripciones literales o subtítulos a los videos. Así, el contenido no textual también queda al alcance de la IA.
- Reduce el ruido de los elementos repetitivos: la navegación recurrente, los anuncios laterales y las ventanas emergentes diluyen la señal del contenido principal.

Capa semántica: ¿entiende la máquina lo que estás diciendo? (puntos 14–19)
Una vez que la IA puede rastrear y segmentar el contenido correctamente, aún debe comprender de qué trata cada sección. Los datos estructurados y unas señales de entidad coherentes le ayudan a clasificarlo.
- Implementa datos estructurados de Schema.org según el tipo de página: Article para artículos, FAQPage para preguntas y respuestas, HowTo para tutoriales y Organization para empresas.
- Presenta los datos estructurados en formato JSON-LD y compruébalos con la prueba de resultados enriquecidos y validadores de schema. No permitas que un error de sintaxis los invalide sin dejar señales visibles.
- Haz que el título y la meta description de cada página reflejen fielmente su contenido. Siempre que sea posible, alínealos de forma directa con las preguntas que realmente plantean los usuarios.
- Mantén una nomenclatura coherente para las entidades en todo el ecosistema digital. Usa los mismos nombres para marcas, productos y personas tanto dentro del sitio como fuera de él (Wikipedia y LinkedIn), incluida la misma combinación de mayúsculas y minúsculas.
- Utiliza textos de anclaje descriptivos en los enlaces internos y conecta las páginas relacionadas en clústeres temáticos. Esto ayuda a los rastreadores a comprender cómo se relacionan entre sí.
- Aborda un único tema por página. No concentres cinco intenciones de búsqueda en una sola URL, porque dificultarás que la IA la clasifique y la cite.
Capa de confianza: ¿se atrevería la IA a citarte? (puntos 20–25)
Cuando una IA cita una fuente, en cierto modo está respaldándola. Por eso suele favorecer páginas con autoría, fuentes y entidades claramente identificadas. Esta capa determina si el contenido se limita a ser «leído» o llega a ser «seleccionado».
- Identifica en cada contenido el nombre y cargo del autor, e incluye un enlace a su página. Añade también datePublished y dateModified mediante schema.
- Enlaza las cifras y afirmaciones clave con fuentes verificables para que la IA pueda comprobarlas antes de citarlas.
- Utiliza HTTPS en todo el sitio, mantén certificados válidos y corrige las advertencias de contenido mixto para no perder señales básicas de confianza.
- Mantén exactamente los mismos datos de nombre, dirección y teléfono (NAP) en todo el sitio y en el schema Organization. Esta coherencia refuerza la credibilidad de la entidad.
- Prepara un archivo llms.txt o una página «Acerca de» que explique con claridad quién eres, qué haces y por qué lo haces. Así, la IA podrá formarse rápidamente una idea precisa sobre tu organización.
- Realiza cada mes consultas relacionadas con la marca en ChatGPT, Perplexity y Google AI Overviews. Registra si aparece citada y si la información presentada es correcta.
Después de la auditoría: cómo priorizar las correcciones
No intentes resolver los 25 puntos a la vez. Avanza de abajo arriba: primero deja toda la capa de rastreo en verde, después corrige la estructura y la semántica y, por último, completa las señales de confianza. El rastreo es binario: el acceso está permitido o está bloqueado. En las capas estructural y semántica, en cambio, las mejoras son progresivas y cada ajuste suma. Este checklist es, en esencia, una versión práctica y simplificada de los aspectos técnicos de la auditoría GEO de 30 días de Tenten. Si lo aplicas por tu cuenta, podrás detectar alrededor del 70 % de las brechas evidentes.
Al terminar, quizá queden dudas difíciles de resolver: si el rastreador está realmente bloqueado, si el schema funciona o si la marca se cita correctamente en pruebas reales. Si quieres despejar estas zonas grises de una vez y recibir una lista priorizada de correcciones, puedes solicitar un diagnóstico GEO de 30 minutos. Analizaremos tu URL real y te indicaremos directamente qué tres puntos conviene abordar primero.



