Para que Perplexity cite tu contenido deben cumplirse solo dos requisitos: su rastreador tiene que poder acceder a la página y entender de qué trata. Muchas empresas se quedan atascadas en el primero sin saberlo. Basta una regla con comodines en robots.txt, la protección predeterminada de una CDN o un agente de usuario no autorizado para desaparecer por completo de las respuestas de Perplexity. Permitir PerplexityBot es el requisito mínimo, no una garantía de citación; sin ese acceso, cualquier trabajo posterior de GEO carece de efecto.
Empecemos por lo esencial: Perplexity utiliza dos rastreadores con comportamientos completamente distintos.
Es frecuente asumir que Perplexity solo utiliza un rastreador y configurar el acceso bloqueando o permitiendo un único nombre. El resultado puede ser muy distinto del esperado. La documentación oficial de Perplexity enumera dos agentes: PerplexityBot crea el índice de búsqueda y determina si una página puede aparecer en los resultados; además, respeta robots.txt. Perplexity-User, en cambio, se activa cuando una persona formula una pregunta y el sistema necesita rastrear de inmediato una URL concreta. Como responde a una acción directa del usuario, normalmente no está sujeto a robots.txt. La diferencia es decisiva: una restricción en robots.txt puede impedir la indexación, pero no necesariamente el rastreo instantáneo.
- PerplexityBot: crea y actualiza el índice de búsqueda de Perplexity, determina si una página puede entrar en el conjunto de fuentes candidatas y respeta las reglas de robots.txt.
- Perplexity-User: visita al instante una página concreta cuando el usuario formula una pregunta. Al tratarse de una acción en respuesta al usuario, por lo general no se le aplican los bloqueos de robots.txt.
- Comprueba su autenticidad: ambos pueden ser suplantados. No te fíes únicamente de la cadena del agente de usuario; verifica el segmento de IP publicado por Perplexity o realiza una consulta DNS inversa que resuelva en perplexity.ai.
- Error habitual: permitir el acceso en robots.txt no garantiza que la página vaya a rastrearse ni a citarse; solo la habilita para entrar en el conjunto de fuentes candidatas.
robots.txt: una sola línea mal configurada puede dejarte fuera
En las auditorías de GEO que realizamos para clientes, robots.txt suele ser el primer punto crítico. Algunos sitios combinan User-agent: * con Disallow: / para bloquear todo el dominio durante el desarrollo y olvidan retirar la restricción al publicarlo. Otros bloquean directorios de contenido esenciales, como /blog/ o /resources/. Más difíciles de detectar son las reglas de gestión de bots o del firewall en plataformas como Cloudflare y Vercel: aunque robots.txt sea correcto, pueden devolver directamente un 403 a PerplexityBot desde la capa perimetral. El sitio no mostrará ningún aviso; simplemente dejará de aparecer en las respuestas de Perplexity. La configuración mínima viable es muy breve: autoriza expresamente a PerplexityBot en el archivo robots.txt del directorio raíz e indica la ubicación del sitemap.
- Concede permiso de forma explícita: añade un bloque User-agent: PerplexityBot seguido de Allow: / para que no le afecten las reglas de bloqueo definidas para User-agent: *.
- Indica el sitemap: añade Sitemap: https://yourdomain/sitemap.xml al final del archivo para que el rastreador pueda obtener de una vez la lista completa de URL.
- Revisa la CDN y el WAF: confirma que Cloudflare, Vercel y AWS WAF no bloquean en la capa perimetral a todos los rastreadores de IA conocidos.
- No combines noindex con la expectativa de recibir citas: si una página incluye noindex en la metaetiqueta robots, estás indicando tanto a los buscadores como a Perplexity que no deben incluirla.
- Compruébalo en los registros: busca PerplexityBot en el registro de acceso del servidor y confirma que realmente ha visitado el sitio y ha recibido un 200, no un 403 ni un 429.
llms.txt: merece diez minutos de trabajo, pero no es una puerta de entrada al buscador
llms.txt es una propuesta presentada por Jeremy Howard, de Answer.AI, en 2024. Consiste en colocar un archivo Markdown en /llms.txt, dentro del directorio raíz del sitio, y enumerar en una estructura sencilla las páginas más importantes junto con sus descripciones. El objetivo es facilitar que los grandes modelos de lenguaje comprendan rápidamente los contenidos esenciales del sitio. La idea es válida, pero conviene ser precisos: por ahora, ningún motor relevante, incluidos Perplexity y Google, ha anunciado públicamente que procese realmente llms.txt. John Mueller, de Google, también afirmó públicamente que ningún buscador lo utiliza como criterio de rastreo o posicionamiento. ¿Merece la pena implementarlo? Sí, siempre que se entienda su función real. El coste es mínimo y un solo archivo permite reunir el contenido pilar, las descripciones de producto y la información de contacto. También ofrece un punto de acceso ordenado para los agentes que decidan leerlo o para motores que puedan admitirlo en el futuro. Su valor más práctico es que obliga a decidir con claridad cuáles son las páginas esenciales, un ejercicio útil por sí mismo para el GEO. No concentres en este archivo todo el presupuesto ni todas las expectativas. Lo que determina de verdad si Perplexity puede rastrear el sitio es robots.txt y un HTML limpio.

Poder rastrearte es solo el primer paso; lo decisivo es que Perplexity te elija como fuente
Al responder una pregunta, Perplexity suele citar solo unas pocas fuentes. Da prioridad a los fragmentos que responden directamente a la consulta y pueden extraerse con facilidad. Si la respuesta está escondida en el octavo párrafo, precedida por varias líneas sobre «el auge de la IA», o si un mismo párrafo desarrolla tres ideas a la vez, al motor le resultará difícil aislarla y citarla. Presenta primero la conclusión, dedica cada párrafo a una sola idea y redacta el título como respuesta a una pregunta concreta. No son simples preferencias de estilo: influyen directamente en la selección de fuentes.
- Empieza por la respuesta: ofrece la conclusión en la primera frase de cada sección y explica después el porqué y el procedimiento.
- Convierte el título en la pregunta: redacta los H2 y H3 como consultas que una persona formularía realmente, para facilitar que el motor relacione el contenido con la búsqueda.
- Crea párrafos autosuficientes: desarrolla una sola idea clave en cada párrafo y evita depender de lo explicado en el anterior, de modo que cada fragmento pueda citarse por separado.
- Añade datos estructurados: asocia los artículos con Article y utiliza el esquema FAQPage en las secciones de preguntas y respuestas para ayudar al motor a identificar correctamente el tipo de contenido.
- Aporta cifras y contexto: los hechos verificables tienen más posibilidades de ser citados que los adjetivos.
Actualidad: Perplexity prioriza el contenido recién actualizado
Perplexity se presenta como una herramienta para responder preguntas actuales y sensibles al paso del tiempo, por lo que muestra una clara preferencia por el contenido reciente. Esto tiene dos consecuencias. La primera es que la página debe indicar con exactitud dateModified, para evitar que un artículo actualizado el año pasado parezca tener tres años de antigüedad. La segunda es que las páginas esenciales necesitan un ritmo de actualización real, con nuevos datos y prácticas, no un simple cambio de fecha para engañar al motor. Cuando gestionamos motores de contenido para nuestros clientes, revisamos periódicamente las páginas de mayor valor e incorporamos la experiencia de ejecución más reciente. En la práctica, esto influye en la selección de fuentes de Perplexity.
La posibilidad de recibir una cita de Perplexity depende en un 90% de factores técnicos: que el contenido pueda rastrearse, sea legible y esté suficientemente actualizado. Por bueno que sea, no tendrá ninguna oportunidad si el rastreador no puede acceder a él.— Tenten GEO Consulting Team
Comprobación de 30 minutos antes de publicar
- Abre «tudominio/robots.txt» en el navegador y comprueba que ninguna sección Disallow: / esté bloqueando por error todo el sitio y que PerplexityBot tenga permiso explícito.
- Busca PerplexityBot en los registros del servidor y confirma que haya realizado una visita reciente y recibido un 200.
- Revisa las reglas para bots de la CDN y el WAF, y confirma que los rastreadores de IA no estén bloqueados en la capa perimetral.
- Revisa al azar los tres artículos principales y comprueba si el primer párrafo comienza con la conclusión y si el título responde a una pregunta real.
- Confirma que el sitemap sea accesible, que dateModified sea correcto y que llms.txt funcione como mapa de contenidos.
La mayoría de estos puntos pueden corregirse en una tarde. Lo difícil es detectar cuáles has pasado por alto, sobre todo cuando el problema está oculto en las reglas de la CDN o en los bloqueos predeterminados de la plataforma. Solo aparecerá si lo buscas de forma deliberada. Si quieres saber si Perplexity puede rastrear tu sitio y qué oportunidades de citación estás perdiendo, visita /contact y solicita un diagnóstico GEO de 30 minutos. Revisaremos directamente el archivo robots, los registros y la estructura del contenido de tu sitio, y detallaremos cada carencia.



