Tenten AIGEO
Volver al blog
Visibilidad en plataformas de IAImplementación

Haz que Perplexity te encuentre: configuración de robots.txt, llms.txt y sus rastreadores

Para que Perplexity cite tu contenido, primero debe poder encontrarlo. Esta guía práctica explica las diferencias entre PerplexityBot y Perplexity-User, cómo configurar correctamente robots.txt y llms.txt, y cómo estructurar el contenido para aumentar sus posibilidades de ser elegido como fuente. Incluye además una lista de comprobación para configurar los rastreadores de Perplexity antes de publicar un sitio.

Equipo de Tenten GEOPublicado 2024-09-075 min de lectura
Composición abstracta en la que una luz suave atraviesa varias capas translúcidas de protección hasta alcanzar un nodo luminoso, como símbolo del rastreo fluido y la citación de contenidos web por parte de Perplexity.

Para que Perplexity cite tu contenido deben cumplirse solo dos requisitos: su rastreador tiene que poder acceder a la página y entender de qué trata. Muchas empresas se quedan atascadas en el primero sin saberlo. Basta una regla con comodines en robots.txt, la protección predeterminada de una CDN o un agente de usuario no autorizado para desaparecer por completo de las respuestas de Perplexity. Permitir PerplexityBot es el requisito mínimo, no una garantía de citación; sin ese acceso, cualquier trabajo posterior de GEO carece de efecto.

Empecemos por lo esencial: Perplexity utiliza dos rastreadores con comportamientos completamente distintos.

Es frecuente asumir que Perplexity solo utiliza un rastreador y configurar el acceso bloqueando o permitiendo un único nombre. El resultado puede ser muy distinto del esperado. La documentación oficial de Perplexity enumera dos agentes: PerplexityBot crea el índice de búsqueda y determina si una página puede aparecer en los resultados; además, respeta robots.txt. Perplexity-User, en cambio, se activa cuando una persona formula una pregunta y el sistema necesita rastrear de inmediato una URL concreta. Como responde a una acción directa del usuario, normalmente no está sujeto a robots.txt. La diferencia es decisiva: una restricción en robots.txt puede impedir la indexación, pero no necesariamente el rastreo instantáneo.

  • PerplexityBot: crea y actualiza el índice de búsqueda de Perplexity, determina si una página puede entrar en el conjunto de fuentes candidatas y respeta las reglas de robots.txt.
  • Perplexity-User: visita al instante una página concreta cuando el usuario formula una pregunta. Al tratarse de una acción en respuesta al usuario, por lo general no se le aplican los bloqueos de robots.txt.
  • Comprueba su autenticidad: ambos pueden ser suplantados. No te fíes únicamente de la cadena del agente de usuario; verifica el segmento de IP publicado por Perplexity o realiza una consulta DNS inversa que resuelva en perplexity.ai.
  • Error habitual: permitir el acceso en robots.txt no garantiza que la página vaya a rastrearse ni a citarse; solo la habilita para entrar en el conjunto de fuentes candidatas.

robots.txt: una sola línea mal configurada puede dejarte fuera

En las auditorías de GEO que realizamos para clientes, robots.txt suele ser el primer punto crítico. Algunos sitios combinan User-agent: * con Disallow: / para bloquear todo el dominio durante el desarrollo y olvidan retirar la restricción al publicarlo. Otros bloquean directorios de contenido esenciales, como /blog/ o /resources/. Más difíciles de detectar son las reglas de gestión de bots o del firewall en plataformas como Cloudflare y Vercel: aunque robots.txt sea correcto, pueden devolver directamente un 403 a PerplexityBot desde la capa perimetral. El sitio no mostrará ningún aviso; simplemente dejará de aparecer en las respuestas de Perplexity. La configuración mínima viable es muy breve: autoriza expresamente a PerplexityBot en el archivo robots.txt del directorio raíz e indica la ubicación del sitemap.

  • Concede permiso de forma explícita: añade un bloque User-agent: PerplexityBot seguido de Allow: / para que no le afecten las reglas de bloqueo definidas para User-agent: *.
  • Indica el sitemap: añade Sitemap: https://yourdomain/sitemap.xml al final del archivo para que el rastreador pueda obtener de una vez la lista completa de URL.
  • Revisa la CDN y el WAF: confirma que Cloudflare, Vercel y AWS WAF no bloquean en la capa perimetral a todos los rastreadores de IA conocidos.
  • No combines noindex con la expectativa de recibir citas: si una página incluye noindex en la metaetiqueta robots, estás indicando tanto a los buscadores como a Perplexity que no deben incluirla.
  • Compruébalo en los registros: busca PerplexityBot en el registro de acceso del servidor y confirma que realmente ha visitado el sitio y ha recibido un 200, no un 403 ni un 429.

llms.txt: merece diez minutos de trabajo, pero no es una puerta de entrada al buscador

llms.txt es una propuesta presentada por Jeremy Howard, de Answer.AI, en 2024. Consiste en colocar un archivo Markdown en /llms.txt, dentro del directorio raíz del sitio, y enumerar en una estructura sencilla las páginas más importantes junto con sus descripciones. El objetivo es facilitar que los grandes modelos de lenguaje comprendan rápidamente los contenidos esenciales del sitio. La idea es válida, pero conviene ser precisos: por ahora, ningún motor relevante, incluidos Perplexity y Google, ha anunciado públicamente que procese realmente llms.txt. John Mueller, de Google, también afirmó públicamente que ningún buscador lo utiliza como criterio de rastreo o posicionamiento. ¿Merece la pena implementarlo? Sí, siempre que se entienda su función real. El coste es mínimo y un solo archivo permite reunir el contenido pilar, las descripciones de producto y la información de contacto. También ofrece un punto de acceso ordenado para los agentes que decidan leerlo o para motores que puedan admitirlo en el futuro. Su valor más práctico es que obliga a decidir con claridad cuáles son las páginas esenciales, un ejercicio útil por sí mismo para el GEO. No concentres en este archivo todo el presupuesto ni todas las expectativas. Lo que determina de verdad si Perplexity puede rastrear el sitio es robots.txt y un HTML limpio.

Infografía: los dos rastreadores de Perplexity siguen rutas distintas, una de indexación y otra de rastreo en tiempo real. robots.txt y llms.txt representan el umbral para conseguir una cita.
PerplexityBot se ocupa de la indexación, Perplexity-User rastrea en tiempo real y robots.txt es la primera puerta de acceso común.

Poder rastrearte es solo el primer paso; lo decisivo es que Perplexity te elija como fuente

Al responder una pregunta, Perplexity suele citar solo unas pocas fuentes. Da prioridad a los fragmentos que responden directamente a la consulta y pueden extraerse con facilidad. Si la respuesta está escondida en el octavo párrafo, precedida por varias líneas sobre «el auge de la IA», o si un mismo párrafo desarrolla tres ideas a la vez, al motor le resultará difícil aislarla y citarla. Presenta primero la conclusión, dedica cada párrafo a una sola idea y redacta el título como respuesta a una pregunta concreta. No son simples preferencias de estilo: influyen directamente en la selección de fuentes.

  • Empieza por la respuesta: ofrece la conclusión en la primera frase de cada sección y explica después el porqué y el procedimiento.
  • Convierte el título en la pregunta: redacta los H2 y H3 como consultas que una persona formularía realmente, para facilitar que el motor relacione el contenido con la búsqueda.
  • Crea párrafos autosuficientes: desarrolla una sola idea clave en cada párrafo y evita depender de lo explicado en el anterior, de modo que cada fragmento pueda citarse por separado.
  • Añade datos estructurados: asocia los artículos con Article y utiliza el esquema FAQPage en las secciones de preguntas y respuestas para ayudar al motor a identificar correctamente el tipo de contenido.
  • Aporta cifras y contexto: los hechos verificables tienen más posibilidades de ser citados que los adjetivos.

Actualidad: Perplexity prioriza el contenido recién actualizado

Perplexity se presenta como una herramienta para responder preguntas actuales y sensibles al paso del tiempo, por lo que muestra una clara preferencia por el contenido reciente. Esto tiene dos consecuencias. La primera es que la página debe indicar con exactitud dateModified, para evitar que un artículo actualizado el año pasado parezca tener tres años de antigüedad. La segunda es que las páginas esenciales necesitan un ritmo de actualización real, con nuevos datos y prácticas, no un simple cambio de fecha para engañar al motor. Cuando gestionamos motores de contenido para nuestros clientes, revisamos periódicamente las páginas de mayor valor e incorporamos la experiencia de ejecución más reciente. En la práctica, esto influye en la selección de fuentes de Perplexity.

La posibilidad de recibir una cita de Perplexity depende en un 90% de factores técnicos: que el contenido pueda rastrearse, sea legible y esté suficientemente actualizado. Por bueno que sea, no tendrá ninguna oportunidad si el rastreador no puede acceder a él.Tenten GEO Consulting Team

Comprobación de 30 minutos antes de publicar

  1. Abre «tudominio/robots.txt» en el navegador y comprueba que ninguna sección Disallow: / esté bloqueando por error todo el sitio y que PerplexityBot tenga permiso explícito.
  2. Busca PerplexityBot en los registros del servidor y confirma que haya realizado una visita reciente y recibido un 200.
  3. Revisa las reglas para bots de la CDN y el WAF, y confirma que los rastreadores de IA no estén bloqueados en la capa perimetral.
  4. Revisa al azar los tres artículos principales y comprueba si el primer párrafo comienza con la conclusión y si el título responde a una pregunta real.
  5. Confirma que el sitemap sea accesible, que dateModified sea correcto y que llms.txt funcione como mapa de contenidos.

La mayoría de estos puntos pueden corregirse en una tarde. Lo difícil es detectar cuáles has pasado por alto, sobre todo cuando el problema está oculto en las reglas de la CDN o en los bloqueos predeterminados de la plataforma. Solo aparecerá si lo buscas de forma deliberada. Si quieres saber si Perplexity puede rastrear tu sitio y qué oportunidades de citación estás perdiendo, visita /contact y solicita un diagnóstico GEO de 30 minutos. Revisaremos directamente el archivo robots, los registros y la estructura del contenido de tu sitio, y detallaremos cada carencia.

Preguntas frecuentes

¿Cómo se llaman los rastreadores de Perplexity y cómo se permite su acceso en robots.txt?
Perplexity utiliza dos rastreadores principales: PerplexityBot se encarga de la indexación para búsquedas y respeta robots.txt, mientras que Perplexity-User rastrea páginas en tiempo real cuando los usuarios formulan preguntas. Para autorizar el acceso, añade User-agent: PerplexityBot y Allow: / en robots.txt, e indica la ubicación del sitemap.
¿Sirve llms.txt para Perplexity? ¿Es necesario implementarlo?
Por ahora, Perplexity no ha anunciado públicamente que procese llms.txt. Se trata más bien de una propuesta de mapa de contenidos para sistemas de IA que de un estándar oficial. Su implementación es recomendable porque tiene un coste mínimo y ayuda a ordenar las páginas esenciales; aun así, robots.txt y un HTML limpio siguen siendo los factores decisivos para que el sitio pueda rastrearse.
Si robots.txt permite el acceso, ¿por qué Perplexity no puede rastrear mi sitio?
Lo más probable es que la CDN o el WAF estén bloqueando los rastreadores de IA en la capa perimetral, que la página tenga la directiva noindex o que el sitemap no sea accesible. Busca PerplexityBot en los registros del servidor y comprueba que reciba un 200 en lugar de un 403 o un 429 para identificar en qué capa se encuentra el problema.

DA EL SIGUIENTE PASO

¿Qué visibilidad tiene tu marca en las respuestas de la IA?

En un diagnóstico GEO de 30 minutos identificamos tus brechas de visibilidad y las acciones que conviene priorizar.

Reservar el diagnóstico