Cuando alguien bloquea los rastreadores de IA en robots.txt, a menudo no está protegiendo su contenido, sino eliminando su sitio de las respuestas de ChatGPT, Perplexity y Claude. La razón es que OpenAI, Anthropic y Perplexity no utilizan un único rastreador, sino dos o tres: uno recopila contenido para entrenar modelos y otro recupera páginas en tiempo real para incluirlas como fuentes enlazadas en las respuestas. Normalmente interesa bloquear el primero y mantener el acceso del segundo. Sin embargo, una regla general con User-agent: * y Disallow: / cierra la puerta a ambos.
Los rastreadores de entrenamiento y los de recuperación cumplen funciones distintas
Tomemos OpenAI como ejemplo. GPTBot recopila contenido para incorporarlo al corpus de futuros entrenamientos; OAI-SearchBot indexa páginas para la búsqueda de ChatGPT, lo que permite citarlas y enlazarlas en respuestas en tiempo real; y ChatGPT-User solo se activa cuando una persona solicita visitar una URL concreta durante una conversación. Por tanto, bloquear GPTBot afecta únicamente a la posibilidad de que el contenido se use para entrenamiento, no a que ChatGPT pueda citarlo en una consulta actual. Anthropic y Perplexity aplican una división de funciones similar, aunque con nombres distintos. Si no se distingue esta capa, es fácil bloquear lo que conviene permitir y dejar pasar precisamente lo que se quería impedir.
- "GPTBot" (OpenAI): recopila contenido para entrenar modelos base; bloquearlo no hace que desaparezcas de las búsquedas de ChatGPT.
- "OAI-SearchBot" (OpenAI): indexa contenido para la búsqueda y las respuestas inmediatas de ChatGPT e incorpora citas de las fuentes; si quieres que tu sitio pueda aparecer citado, debes permitirlo.
- "ChatGPT-User" (OpenAI): se activa cuando una persona solicita expresamente visitar una URL durante la conversación.
- "ClaudeBot" (Anthropic): recopila contenido para el entrenamiento y uso de modelos.
- "Claude-SearchBot" y "Claude-User" (Anthropic): se encargan, respectivamente, del índice de búsqueda y de la recuperación solicitada por el usuario.
- "PerplexityBot" (Perplexity): indexa contenido para el motor de respuestas de Perplexity; bloquearlo equivale a renunciar a aparecer entre sus fuentes.
- "Perplexity-User" (Perplexity): recupera contenido en el momento en que una persona formula una pregunta. Ha sido acusado de no respetar plenamente robots.txt.
- Otros agentes habituales: "Google-Extended" (no es un rastreador propiamente dicho, sino un mecanismo de control que determina si el contenido puede utilizarse para el entrenamiento y la fundamentación de Gemini), "CCBot" (Common Crawl, fuente de corpus de entrenamiento para numerosos modelos) y "Bytespider" (ByteDance, conocido por su rastreo intensivo).
Reglas básicas de robots.txt: no publiques la configuración todavía
El archivo robots.txt debe estar en la raíz del dominio y su URL siempre corresponde al dominio seguido de /robots.txt. Cada host necesita su propio archivo: blog.example.com y www.example.com son hosts distintos, por lo que las reglas del primero no controlan el segundo. http, https y los diferentes puertos también se consideran orígenes distintos. La sintaxis utiliza tres palabras clave: User-agent identifica el agente; Disallow bloquea una ruta; y Allow establece excepciones. Cuando Allow y Disallow entran en conflicto, los principales motores aplican el criterio de «la ruta más larga primero», lo que permite usar Allow para abrir una excepción concreta dentro de un bloqueo amplio.
- robots.txt es una «solicitud», no un cortafuegos: los rastreadores que respetan las normas, como GPTBot, ClaudeBot y Googlebot, la obedecen, pero los maliciosos o indisciplinados pueden ignorarla. Para imponer un bloqueo, hacen falta un WAF, reglas de cortafuegos o mecanismos de verificación en el servidor.
- Impedir el rastreo no elimina los datos existentes: robots.txt solo determina si el contenido podrá rastrearse en adelante; lo que ya forme parte de los datos de entrenamiento no desaparecerá.
- El nombre del User-agent debe ser exacto: la comparación no distingue entre mayúsculas y minúsculas, pero un nombre mal escrito —por ejemplo, GPT-Bot o Perplexity Bot— equivale a no haber configurado ninguna regla. Además, cada grupo solo se aplica al User-agent con el que coincida.
Escenario 1: permitir las citas y rechazar el entrenamiento (opción predeterminada para la mayoría de los SaaS B2B)
Si quieres aparecer como fuente en respuestas de IA, pero no deseas ceder gratuitamente el contenido para entrenar la siguiente generación de modelos, permite los rastreadores de búsqueda y bloquea los de entrenamiento. Esta es la configuración predeterminada que aplicamos con la mayoría de nuestros clientes B2B: primero la visibilidad; la autorización para entrenamiento queda como decisión opcional. En la práctica, conviene definir cada rastreador en un grupo User-agent independiente, con sus propias reglas. Añadir un Allow: / explícito a los rastreadores de búsqueda deja clara la intención y puede prevalecer sobre configuraciones antiguas de bloqueo general del sitio.
- User-agent: GPTBot → Disallow: / (rastreador de entrenamiento; bloquear)
- User-agent: ClaudeBot → Disallow: / (rastreador de entrenamiento; bloquear)
- User-agent: CCBot → Disallow: / (corpus de entrenamiento de Common Crawl; bloquear)
- User-agent: OAI-SearchBot → Allow: / (citas en la búsqueda de ChatGPT; permitir)
- User-agent: PerplexityBot → Allow: / (citas en Perplexity; permitir)
- User-agent: Claude-SearchBot → Allow: / (búsquedas y citas de Claude; permitir)
- Si no quieres que el contenido se utilice para entrenar Gemini, puedes añadir User-agent: Google-Extended → Disallow: / (no afecta al posicionamiento en la búsqueda de Google)

Escenario 2: bloquear por completo el acceso de la IA, incluidas las citas
El contenido tras un muro de pago, la información sujeta a requisitos de cumplimiento o los materiales cuya licencia aún se está negociando pueden requerir incluso el bloqueo de su recuperación. Para ello, hay que enumerar uno por uno todos los User-agents de IA conocidos y asignar Disallow: / a cada uno. El coste debe quedar claro: tras el bloqueo, las citas de tu sitio en respuestas de IA caerán a cero. En la práctica, estarás renunciando voluntariamente a una fuente de tráfico en crecimiento. Suele ser una medida defensiva y temporal, no la configuración predeterminada de un sitio de marketing B2B.
- OpenAI: configura Disallow: / por separado para GPTBot, OAI-SearchBot y ChatGPT-User.
- Anthropic: configura Disallow: / por separado para ClaudeBot, Claude-SearchBot y Claude-User.
- Perplexity: configura Disallow: / por separado para PerplexityBot y Perplexity-User.
- Bloqueos adicionales opcionales: configura Disallow: / por separado para Google-Extended, Applebot-Extended, Bytespider y CCBot.
No dejes que una plantilla para «bloquear toda la IA con un clic» perjudique tu GEO
En Internet circulan numerosas plantillas que prometen «bloquear la IA pegando este fragmento en robots.txt». El problema es que suelen aplicar Disallow: / a todos los User-agents de IA, incluidos los rastreadores de búsqueda responsables de citar tu sitio. Así, mientras crees estar protegiendo el contenido, en realidad estás excluyendo activamente tu marca de la búsqueda de ChatGPT y de las fuentes de Perplexity y Claude. Para las marcas B2B que buscan visibilidad en las respuestas de IA, casi siempre resulta contraproducente. Antes de publicar cualquier plantilla, comprueba si bloquea el entrenamiento o la recuperación.
Cómo comprobar que la configuración funciona
- Comprobación directa: abre tu dominio en el navegador y añade /robots.txt. Verifica que el archivo existe, está en el directorio raíz y no contiene errores en los nombres de los grupos.
- Revisión de los registros del servidor: busca GPTBot, ClaudeBot y PerplexityBot en el campo User-agent para comprobar si los agentes bloqueados reciben un 403 y los permitidos rastrean las páginas con normalidad.
- Verificación de autenticidad: el User-agent de un rastreador de IA puede falsificarse. OpenAI y Anthropic publican sus rangos de IP oficiales; contrasta además el DNS inverso con el DNS directo para no confundir un rastreador falso con uno legítimo.
- Simulación de solicitudes: utiliza curl para solicitar la página con el User-agent correspondiente y comprueba si las reglas de robots.txt permiten o bloquean el acceso según lo previsto.
- Revisión periódica: las empresas pueden añadir o cambiar el nombre de sus User-agents —como ocurrió cuando OAI-SearchBot se separó de GPTBot—. Revisa la configuración cada trimestre para evitar que quede obsoleta.
robots.txt no es una caja fuerte, sino un cartel en la puerta. Decide qué tipos de IA pueden entrar y cuáles deben quedarse fuera. En el ámbito del GEO, cerrar el paso a los rastreadores de búsqueda equivale a cerrar la puerta a oportunidades de negocio.— Tenten GEO Consulting Team
Configurar robots.txt es solo el primer paso de la base técnica del GEO. La posibilidad real de que una IA cite tu sitio también depende de los datos estructurados, de llms.txt, de que el contenido pueda extraerse limpiamente y de la visibilidad efectiva de la marca en los distintos motores. Si quieres saber si las herramientas de IA ya citan tu contenido o si tu propio robots.txt lo está bloqueando, puedes solicitar un diagnóstico GEO de 30 minutos. Analizaremos el acceso de los rastreadores y el estado de las citas con tu dominio real, y te indicaremos en la sesión dónde están las carencias.



