Tenten AIGEO
Volver al blog
AEO técnicoImplementación

Guía práctica completa de llms.txt: sintaxis, ubicación y cómo lo leen los rastreadores de IA

Guía completa para implementar llms.txt: desde la sintaxis y su ubicación en la raíz del dominio hasta la forma en que los rastreadores de IA lo consultan durante la inferencia. Incluye una plantilla base, buenas prácticas para páginas espejo en .md, seis errores frecuentes de despliegue, pasos de verificación y una explicación clara de los límites reales de llms.txt en la actualidad.

Equipo de Tenten GEOPublicado 2026-07-025 min de lectura
Un haz de luz lavanda atraviesa una escena oscura y señala el archivo llms.txt en la raíz del sitio web, como símbolo de la ruta de lectura preparada para la IA.

Empecemos por la conclusión: llms.txt no hará que ChatGPT cite tu marca automáticamente. Es un mapa en Markdown alojado en la raíz del sitio que permite a los agentes de IA y a los sistemas de recuperación en tiempo real, durante la fase de inferencia, acceder directamente a contenido limpio sin tener que sortear menús de navegación, anuncios ni JavaScript. Bien implementado, reduce el coste de procesamiento para la IA; mal implementado, no es más que un archivo que nadie consulta. Esta guía reúne la sintaxis, la ubicación, los principios de lectura de los rastreadores y los límites reales de llms.txt en la actualidad.

Qué es llms.txt y en qué se diferencia de robots.txt

llms.txt es una propuesta de especificación presentada por Jeremy Howard, de Answer.AI, en septiembre de 2024. El archivo debe llamarse llms.txt, alojarse en la raíz del dominio y contener únicamente Markdown. Su función es seleccionar: reúne en una lista concisa las páginas del sitio que más conviene mostrar a una IA, cada una con su enlace y una breve descripción. No es un archivo de configuración ni controla qué rastreadores pueden entrar. Esta distinción es la base de toda la implementación posterior.

Cómo debe ser un llms.txt bien construido

La especificación impone muy pocos requisitos de formato, pero el orden sí importa. Todo el archivo se redacta en Markdown estándar, para que cualquier modelo de lenguaje pueda interpretarlo con un coste mínimo. Esta es la estructura recomendada, de principio a fin:

  1. Un título H1 con el nombre del sitio web o del proyecto. Es el único campo obligatorio de la especificación.
  2. A continuación, una cita en bloque —iniciada con >— que explique en una o dos frases a qué se dedica el sitio. Es el primer resumen que la IA encuentra al recorrer el archivo.
  3. Si hace falta, pueden añadirse algunos párrafos de texto para aportar contexto o instrucciones de uso, pero el archivo no debe contener un segundo H1.
  4. Varios bloques H2, cada uno seguido de una lista de enlaces en Markdown. El formato es [nombre de la página] (sitio web): descripción en una frase. Los H2 sirven para clasificar el contenido en categorías como «servicios», «documentación» y «recursos».
  5. Un bloque llamado ## Optional, que puede omitirse. Los enlaces incluidos aquí corresponden a contenido secundario y la IA puede ignorarlos por completo si dispone de poco espacio de contexto.

Dónde alojarlo y en qué formato ofrecerlo

La ubicación no admite variaciones: el archivo debe estar en la raíz del dominio, en la URL https://yourdomain/llms.txt. Si se coloca en un subdirectorio o subdominio, la IA no podrá localizarlo mediante esta convención. La codificación debe ser UTF-8 y se recomienda configurar la respuesta del servidor con Content-Type text/plain o text/markdown, sin forzar al navegador a descargar el archivo. Conviene acompañarlo de otras dos convenciones. La primera es el archivo opcional llms-full.txt, que reúne todo el contenido del sitio en un único documento de gran tamaño. Puede ser útil cuando se quiere facilitar una lectura completa de una sola vez, pero resulta pesado y difícil de mantener, por lo que los sitios pequeños y medianos suelen prescindir de él al principio. La segunda consiste en crear páginas espejo en .md: se añade .md a la URL original —por ejemplo, /pricing se corresponde con /pricing.md— para ofrecer una versión en Markdown puro. Así, los enlaces de llms.txt pueden dirigir a contenido limpio, en lugar de a HTML cargado de etiquetas de maquetación. Tenten GEO aplica este sistema en /pricing.md para ofrecer precios legibles por máquinas.

Diagrama de las funciones de llms.txt, robots.txt y sitemap.xml, y de la ruta de lectura de la IA
Cada archivo cumple una función: robots.txt gestiona el acceso, sitemap.xml facilita la indexación y llms.txt selecciona y organiza el contenido.

Cómo leen llms.txt los rastreadores de IA

Primero conviene separar dos procesos que suelen confundirse. La IA puede entrar en contacto con el contenido de tu sitio en dos momentos. El primero es la fase de entrenamiento, cuando rastreadores como GPTBot, ClaudeBot y Google-Extended recopilan páginas a gran escala para alimentar el modelo. El segundo es la fase de inferencia: ante una consulta, la IA necesita comprobar información en tiempo real y utiliza la función de navegación de PerplexityBot, ChatGPT o distintos agentes de IA para recuperarla del sitio. llms.txt está pensado principalmente para este segundo escenario. Las herramientas compatibles consultan primero el archivo llms.txt de la raíz, lo utilizan como mapa de navegación, deciden qué enlaces abrir y luego recuperan el Markdown correspondiente. De este modo evitan descargar todo el HTML, eliminar menús y scripts, y tratar de adivinar qué párrafo contiene el texto principal.

Hay, sin embargo, un límite que debe quedar claro: OpenAI, Anthropic, Perplexity y Google no se han comprometido públicamente a utilizar llms.txt como señal formal de entrenamiento o posicionamiento; Google, de hecho, ha mantenido una postura especialmente cauta. Por ahora, quienes lo consultan de forma activa son sobre todo herramientas para desarrolladores y frameworks de agentes, como determinados asistentes de programación, sistemas de recuperación de archivos y procesos RAG o de agentes creados internamente. Por eso, es más riguroso presentar llms.txt como una vía de acceso para agentes y sistemas de búsqueda propios que como un interruptor de posicionamiento para la IA.

Cómo verificar el despliegue y evitar seis errores frecuentes

  • Ubicación incorrecta: si lo colocas en /docs/llms.txt o en un subdominio, la IA no lo encontrará mediante esta convención. Debe estar en la raíz del dominio.
  • Tratarlo como si fuera robots.txt: escribir Disallow en llms.txt no bloqueará ningún rastreador, porque no es el formato adecuado. El control de acceso debe configurarse en robots.txt.
  • Enlazar a HTML recargado: si la lista dirige a páginas llenas de ventanas emergentes y barras laterales, no se reduce el coste de procesamiento. Siempre que sea posible, enlaza también la versión .md.
  • Incluir demasiados enlaces: volcar cientos de URL del sitio diluye las prioridades. llms.txt es una selección, no un sitemap. Incluye solo las páginas que más te interese que se citen.
  • Redactar las descripciones como mensajes publicitarios: el texto que acompaña a cada enlace debe ser una frase objetiva que ayude a la IA a decidir si debe abrirlo, no un eslogan.
  • Publicarlo y olvidarse: si no actualizas el archivo cuando revisas una página, cambias los precios o retiras una URL, la IA puede terminar leyendo información desactualizada.

La verificación es sencilla. Primero, abre https://yourdomain/llms.txt directamente en el navegador y comprueba que la respuesta sea texto plano, que no devuelva un error 404 y que no se descargue como archivo. Después, pega el contenido completo en ChatGPT o Claude y pídele: «Describe los servicios que ofrece este sitio web a partir de este llms.txt». Si puede explicarlos correctamente, la estructura es clara y comprensible para la IA. Por último, revisa si robots.txt bloquea alguno de los user-agents de IA a los que quieres permitir el acceso. Este último paso es el que más suele olvidarse y puede echar por tierra todo el trabajo anterior.

¿Conviene implementarlo y cuándo hacerlo?

La recomendación honesta es esta: llms.txt tiene un coste y un riesgo bajos, así que merece la pena implementarlo, pero no esperes que aumente las citas por sí solo. Es la capa más externa y económica de un proyecto de visibilidad en IA. Lo que realmente determina si una IA citará tu sitio es que el contenido pueda rastrearse sin obstáculos, que la entidad de marca resulte suficientemente fiable y que los párrafos clave puedan extraerse de forma directa. llms.txt solo prepara el camino por el que circulará ese contenido; su valor dependerá de lo que tengas para ofrecer.

llms.txt es una cortesía, no una garantía. Facilita la lectura a las IA dispuestas a consultar tu contenido, pero no obliga a hacerlo a las que no lo tienen previsto.Tenten GEO

Después de desplegar llms.txt siguiendo esta guía, la siguiente pregunta suele ser: ¿los seis principales motores de IA ya han leído y citado mi contenido? Para responder hace falta medir, no adivinar. Si quieres detectar las brechas de visibilidad de tu marca, visita /contact y solicita un diagnóstico GEO de 30 minutos. Durante la sesión te mostraremos una instantánea de tu visibilidad en los seis motores y comprobaremos si tu llms.txt se está leyendo realmente.

Preguntas frecuentes

¿En qué se diferencian llms.txt y robots.txt?
robots.txt controla si los rastreadores de IA pueden acceder a una página mediante Allow y Disallow. llms.txt es un mapa en Markdown alojado en la raíz del dominio que señala qué contenido es prioritario y facilita el acceso a versiones limpias. El primero gestiona el acceso; el segundo, la selección del contenido. No son intercambiables.
¿Dónde debe colocarse llms.txt?
Debe alojarse en la raíz del dominio, en la URL fija https://yourdomain/llms.txt. No debe colocarse en subdirectorios ni subdominios. La codificación debe ser UTF-8 y se recomienda configurar la respuesta del servidor con Content-Type text/plain o text/markdown para evitar que el navegador lo descargue como archivo.
¿Basta con desplegar llms.txt para que ChatGPT cite mi sitio?
No. Hasta ahora, las principales empresas de IA no se han comprometido públicamente a utilizar llms.txt como señal de entrenamiento o posicionamiento. Su función actual consiste sobre todo en facilitar a los agentes de IA y a los sistemas de recuperación en tiempo real el acceso a contenido limpio durante la inferencia. Las citas siguen dependiendo de que el contenido pueda rastrearse, de la credibilidad de la entidad de marca y de que los párrafos relevantes puedan extraerse con facilidad.

DA EL SIGUIENTE PASO

¿Qué visibilidad tiene tu marca en las respuestas de la IA?

En un diagnóstico GEO de 30 minutos identificamos tus brechas de visibilidad y las acciones que conviene priorizar.

Reservar el diagnóstico