Tenten AIGEO
Volver al blog
AEO técnicoImplementación

Ofrece contenido en Markdown a la IA: endpoint /md y respaldo en texto plano

Cuando un motor de IA lee HTML, primero elimina el ruido de maquetación y, en ese proceso, puede extraer párrafos equivocados. Este artículo explica cómo ofrecer endpoints de contenido en Markdown y una alternativa en texto plano para cada página: enrutamiento /md, negociación de contenido, arquitectura por capas con llms.txt y verificación mediante curl para confirmar que los rastreadores de IA realmente pueden leer el contenido.

Equipo de Tenten GEOPublicado 2026-06-185 min de lectura
Un documento luminoso se divide en dos flujos de datos —HTML saturado y Markdown limpio— que avanzan hacia un halo de IA a lo lejos.

Cuando un motor de IA lee una página web, su primer paso consiste en desmontar el HTML: descarta la barra de navegación, la barra lateral, los avisos de cookies y los scripts de seguimiento para conservar solo lo que identifica como contenido principal. Ese proceso puede fallar sin que resulte evidente dónde ocurrió el error. En vez de perfeccionar el marcado semántico y confiar en que el modelo interprete bien la maquetación en cada ocasión, es preferible entregarle una copia en Markdown ya preparada. Al eliminar el ruido visual del mismo contenido, el modelo deja de tener que adivinar y aumenta la consistencia de las citas que extrae.

Por qué la IA prefiere Markdown antes que HTML

La clave está en la proporción de ruido. El código HTML de una página típica de un producto SaaS puede contener entre seis y siete mil tokens, aunque el contenido real represente solo una pequeña parte. El resto son nombres de clases, estilos incrustados, trazados SVG y scripts de analítica. Antes de encontrar las frases que le sirven para responder preguntas, el modelo debe filtrar todo ese material. La versión en Markdown reduce el mismo contenido a una fracción del tamaño original: los títulos son títulos, las listas son listas y los puntos clave aparecen como tales. La propia estructura aporta significado semántico y deja mucho menos margen a la interpretación.

Esto cobra especial importancia en los motores de respuestas. Al generar una respuesta, ChatGPT, Perplexity y Google AI Overviews extraen fragmentos susceptibles de citarse de las páginas candidatas. Cuanto más limpia sea la página y más autónomos sean sus párrafos, mayores serán las probabilidades de que se citen completos. Hemos ayudado a clientes que se enfrentaban a una situación habitual: el artículo estaba bien escrito, pero quedaba enterrado bajo capas de divs y componentes renderizados en el cliente, por lo que el modelo solo capturaba media frase. Al incorporar el endpoint Markdown, el mismo párrafo pasó a estar disponible íntegramente y las referencias dejaron de cortarse en puntos arbitrarios.

Endpoint /md: una copia legible por máquinas para cada página

El planteamiento consiste en ofrecer una versión equivalente en Markdown de cada página pública mediante una estructura de URL predecible. Hay dos fórmulas habituales: añadir .md a la URL original —por ejemplo, /blog/aeo-basics tendría su equivalente en /blog/aeo-basics.md— o agregar /md al final de la ruta. Ambas son válidas; lo importante es mantener una regla coherente y fácil de deducir. Con el App Router de Next.js puede implementarse mediante un Route Handler: se crea un archivo de ruta, se leen los mismos datos de contenido que utiliza la página HTML y se devuelve Content-Type como text/markdown.

  1. Una única fuente de datos: la página HTML y el endpoint Markdown deben leer el mismo contenido, ya proceda de MDX, una base de datos o un objeto de contenido. No mantengas dos copias, porque tarde o temprano dejarán de estar sincronizadas.
  2. Incluye link rel=alternate type=text/markdown en el head del HTML para indicar claramente al rastreador dónde se encuentra la versión legible por máquinas.
  3. Conserva en Markdown solo el contenido principal: títulos, párrafos, listas, tablas, bloques de código y enlaces. Elimina la navegación, el pie de página, los artículos relacionados y los banners promocionales.
  4. Mantén la información de procedencia necesaria: utiliza el front matter al comienzo del archivo o un H1 en la primera línea para incluir el título, la URL original y la fecha de actualización, de modo que el modelo pueda identificar correctamente la fuente.
  5. Devuelve el encabezado de caché correcto para que la CDN también pueda servir este endpoint sin consultar el servidor de origen en cada solicitud.

Automatiza el cambio de formato mediante negociación de contenido

Además de utilizar URL específicas, una misma URL puede devolver formatos distintos según quién realice la solicitud. Hay dos criterios posibles: el encabezado Accept y el User-Agent. Si la solicitud incluye Accept: text/markdown o el User-Agent corresponde a un rastreador de IA conocido —GPTBot, ClaudeBot, PerplexityBot, Google-Extended, etc.—, la capa de middleware la reescribe hacia la ruta Markdown; los navegadores convencionales siguen recibiendo HTML. Las personas ven la página completa, el modelo obtiene texto limpio y la URL permanece igual durante todo el proceso.

Diagrama: una misma URL devuelve HTML o Markdown limpio según si quien realiza la solicitud es un navegador o un rastreador de IA.
Un mismo contenido, dos formatos: HTML para el navegador y Markdown limpio para el rastreador de IA.

Respaldo en texto plano: cuando incluso Markdown resulta excesivo

Algunos agentes y rastreadores no interpretan la sintaxis de Markdown y solo procesan texto plano. En otros casos, como los resúmenes de fuentes para asistentes de voz, basta con ofrecer la versión más concisa posible. Ahí resulta útil contar con un respaldo en texto plano. El método es el mismo que para el endpoint Markdown, pero la salida utiliza text/plain: el título y los párrafos se separan con saltos de línea, y los enlaces incluyen la URL entre paréntesis junto al texto. Esta arquitectura de respaldo por capas garantiza que siempre exista una versión legible, sea cual sea la capacidad de procesamiento de la herramienta que acceda al contenido.

  • llms.txt: coloca /llms.txt en el directorio raíz del sitio. Enumera en Markdown las páginas importantes junto con una breve descripción; funciona como un mapa de navegación para el modelo.
  • llms-full.txt: reúne todo el contenido esencial en un único archivo para que el modelo pueda leerlo de una vez, sin rastrear cada página por separado.
  • Endpoint .md por página: una copia legible por máquinas de cada artículo y página de producto.
  • Respaldo en texto plano: una versión mínima en text/plain para las herramientas que no interpretan Markdown.

Cómo comprobar que la IA realmente puede leer el contenido

Compruébalo después de publicarlo; no des por hecho que funcionará automáticamente. La forma más rápida es utilizar curl para simular la solicitud de un rastreador: incluye Accept: text/markdown o configura el User-Agent de un rastreador de IA y verifica que la respuesta contenga Markdown limpio, que el código de estado sea 200 y que el encabezado de caché sea correcto. Después, revisa los registros del servidor para confirmar que rastreadores como GPTBot y ClaudeBot están accediendo al endpoint Markdown en lugar de seguir descargando el HTML con todo su ruido. Herramientas como isitagentready también permiten evaluar rápidamente la legibilidad de una página para los agentes.

La posibilidad de que una IA cite tu contenido depende de que pueda leerlo con claridad. Ofrecerle una copia en Markdown equivale a eliminar por completo la fase de «adivinar la maquetación».Tenten GEO

Empieza por una página, no por rehacer todo el sitio de una vez

Selecciona primero las páginas con más tráfico y aquellas que más te interese posicionar como fuentes para la IA. Añade endpoints .md y un respaldo en texto plano, mide durante dos a cuatro semanas el comportamiento de los rastreadores de IA y, con esos datos, decide si conviene extender la implementación a todo el sitio. Así podrás controlar el riesgo y presentar al equipo registros reales. Si antes quieres saber hasta qué punto tus páginas son legibles para la IA y dónde están las carencias, la auditoría GEO de 30 días de Tenten GEO revisa página por página estos problemas de legibilidad por máquinas. Para analizar tu caso, visita /contact y solicita un diagnóstico GEO de 30 minutos.

Preguntas frecuentes

¿Qué es el endpoint /md y por qué conviene ofrecer contenido en Markdown a la IA?
El endpoint /md es una copia legible por máquinas de cada página que devuelve Markdown limpio. Cuando un motor de IA lee HTML, primero debe filtrar elementos como la navegación y los scripts, un proceso en el que puede extraer párrafos equivocados. Proporcionarle directamente Markdown elimina el ruido de maquetación y facilita que el contenido se cite de forma íntegra y precisa.
¿Google considera cloaking devolver un formato distinto a los rastreadores de IA según su User-Agent?
No existe una diferenciación oculta mientras el contenido sea el mismo y solo cambie el formato; es decir, mientras las versiones HTML y Markdown contengan el mismo texto. El cloaking consiste en devolver a los rastreadores un contenido sustancialmente distinto del que reciben las personas, una práctica prohibida. Cambiar el formato es seguro; cambiar el contenido, no.
¿Cómo puedo confirmar que el rastreador de IA ha leído mi endpoint Markdown?
Utiliza curl con Accept: text/markdown o con el User-Agent del rastreador de IA y comprueba que la respuesta sea Markdown limpio y que el código de estado sea 200. Después, revisa los registros del servidor para verificar que rastreadores como GPTBot y ClaudeBot han accedido al endpoint en lugar de seguir descargando el HTML.

DA EL SIGUIENTE PASO

¿Qué visibilidad tiene tu marca en las respuestas de la IA?

En un diagnóstico GEO de 30 minutos identificamos tus brechas de visibilidad y las acciones que conviene priorizar.

Reservar el diagnóstico