Muchas personas añaden una línea Disallow a robots.txt para bloquear GPTBot porque creen que así impedirán que ChatGPT cite su contenido. Sin embargo, esa medida no consigue lo que esperan. GPTBot solo recopila datos para entrenar el modelo; la presencia de una página en las respuestas de ChatGPT depende de otro rastreador: OAI-SearchBot. Aunque ambos pertenecen a la misma empresa, cumplen funciones distintas y utilizan User-Agents diferentes. Antes de configurar permisos y bloqueos en robots.txt, conviene entender qué hace cada nombre de la lista para no obtener el resultado opuesto al deseado.
Primero, una distinción fundamental: existen tres tipos de rastreadores de IA
- Rastreador de entrenamiento: recopila contenido para incorporarlo al corpus de entrenamiento del modelo. Por lo general, el procesamiento se realiza sin conexión y no guarda una relación directa con la respuesta que el usuario está viendo en ese momento. Algunos ejemplos son GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Meta-ExternalAgent y Bytespider (ByteDance).
- Rastreador de búsqueda o indexación: crea un índice consultable al instante para los motores de respuestas con IA y determina directamente si una página puede utilizarse como fuente de referencia. Entre ellos se encuentran OAI-SearchBot (búsqueda de ChatGPT), PerplexityBot, Googlebot (AI Overviews utiliza su índice existente) y Applebot (Siri y Apple Intelligence).
- Rastreador activado por el usuario: entra en acción cuando alguien pega una URL en una conversación o solicita una verificación inmediata. Normalmente consulta una sola página cada vez y no incorpora su contenido al conjunto de entrenamiento. Algunos ejemplos son ChatGPT-User, Perplexity-User y Claude-User.
Si quieres que los sistemas de IA citen tu contenido, no debes bloquear las dos últimas categorías. Si impides el acceso a los rastreadores de búsqueda, tu sitio no podrá entrar en la lista de fuentes candidatas. Si bloqueas los activados por el usuario, la IA no podrá leer tu contenido ni siquiera cuando alguien le facilite expresamente el enlace. Los rastreadores de entrenamiento, en cambio, pueden gestionarse según la estrategia de marca: bloquéalos si te preocupa que tu contenido se utilice gratuitamente para entrenar modelos, o permítelos si quieres aumentar las posibilidades de formar parte de su corpus subyacente. Confundir estas tres capas es la causa principal de muchas configuraciones de robots.txt planteadas en sentido contrario.
OpenAI: GPTBot, OAI-SearchBot y ChatGPT-User
- GPTBot: se utiliza con fines de entrenamiento. Su User-Agent contiene "GPTBot/1.2" y su token para robots.txt es "GPTBot". OpenAI también publica los rangos de IP del rastreador en un archivo JSON, lo que permite comprobar si una visita es auténtica.
- OAI-SearchBot: se encarga de incorporar las páginas a las fuentes de búsqueda y citación de ChatGPT. Su token es "OAI-SearchBot". Bloquearlo equivale a renunciar voluntariamente a la visibilidad en ChatGPT, pero es precisamente el rastreador que muchas personas bloquean por error.
- ChatGPT-User: se activa cuando un usuario pide consultar o verificar una URL durante una conversación. Su token es "ChatGPT-User". Realiza un rastreo en tiempo real de una sola página y no incorpora el contenido al entrenamiento.
Google-Extended no es un rastreador, sino un interruptor
Google-Extended suele figurar en las «listas de rastreadores de IA», pero en realidad no es un rastreador que vaya a aparecer en los registros del servidor, sino un token de producto para robots.txt. Permitirlo o bloquearlo solo determina si Google puede utilizar el contenido para entrenar Gemini y para determinadas funciones de generación; no afecta en absoluto a la indexación general de Googlebot. Por tanto, bloquear Google-Extended no elimina un sitio de los resultados de Google y, por lo general, tampoco de AI Overviews, ya que esta función se nutre principalmente del índice existente de Googlebot. Applebot-Extended responde al mismo diseño: controla el uso de contenido para entrenar Apple Intelligence y no es lo mismo que Applebot, encargado de la indexación general.
PerplexityBot y otros rastreadores que no siempre respetan las reglas
Para que Perplexity pueda utilizar una página como referencia, es necesario permitir tanto PerplexityBot, que se ocupa de la indexación, como Perplexity-User, que responde a las consultas del usuario en tiempo real. Pero hay una realidad que conviene recordar: robots.txt es un acuerdo voluntario, no una barrera técnica. En 2025, Cloudflare señaló públicamente a Perplexity y afirmó que, tras ser bloqueado mediante robots.txt, comenzó a utilizar un User-Agent no declarado que se hacía pasar por un navegador convencional para seguir rastreando. Bytespider también se ha caracterizado por rastrear con mucha frecuencia y prestar escasa atención a los límites de velocidad. Por tanto, pueden darse dos situaciones a la vez: quizá no consigas bloquear al rastreador que quieres detener y, además, necesites verificar que el rastreador al que has dado acceso sea realmente quien afirma ser.
Amazonbot, ClaudeBot y otros nombres que encontrarás en los registros
- ClaudeBot: rastreador de entrenamiento de Anthropic. También existen Claude-User, activado por el usuario, y los tokens anteriores anthropotic-ai y Claude-Web, que pueden aparecer simultáneamente en los registros.
- Amazonbot: lo utilizan Alexa y los servicios de IA de Amazon. Su User-Agent contiene "Amazonbot/0.1".
- CCBot: pertenece a Common Crawl. Aunque esta organización no es en sí misma una empresa de IA, numerosos modelos utilizan el corpus público que recopila. Por ello, constituye una vía indirecta de entrenamiento que suele pasarse por alto.
- Otros nombres habituales: Meta-ExternalAgent (entrenamiento de Meta), Meta-ExternalFetcher (activado por el usuario), YouBot (You.com), DuckAssistBot (DuckDuckGo), cohere-ai (Cohere), MistralAI-User, Diffbot y Timpibot.

Cómo configurar robots.txt en 2026
No existe una configuración válida para todos los casos. Sin embargo, para la mayoría de los sitios web B2B que buscan mejorar su GEO, un punto de partida razonable es permitir los rastreadores de búsqueda y los activados por el usuario, de modo que los motores de IA puedan leer y citar el contenido. Los rastreadores de entrenamiento deben evaluarse por separado según el valor del contenido y la estrategia de marca. El siguiente ejemplo prioriza la visibilidad.
- User-agent: OAI-SearchBot → Allow: / (mantiene la visibilidad en ChatGPT)
- User-agent: PerplexityBot → Allow: / (permite entrar en el conjunto de fuentes de Perplexity)
- User-agent: ChatGPT-User y Perplexity-User → Allow: / (no bloquea las verificaciones solicitadas por el usuario)
- User-agent: Googlebot → Allow: / (AI Overviews y la búsqueda general comparten el mismo índice, por lo que debe permitirse)
- User-agent: GPTBot, CCBot, Google-Extended → según la política definida (utiliza Disallow: / si no quieres que el contenido se emplee para entrenamiento; esto no afectará a la visibilidad anterior)
No confíes toda la estrategia a robots.txt
robots.txt puede detener a los rastreadores que respetan las reglas, pero no a quienes están decididos a eludirlas. Para ejercer un control real hay que avanzar al siguiente nivel: combinar DNS inverso con una comprobación directa y contrastar la IP con los rangos publicados oficialmente por cada empresa para verificar la identidad del rastreador. Ante User-Agents encubiertos o rastreos de alta frecuencia, conviene recurrir a un WAF, a la gestión de rastreadores de IA de Cloudflare o a límites de velocidad, en lugar de limitarse a añadir otra línea a robots.txt. La supervisión es igual de importante: revisa periódicamente los registros de acceso del servidor para saber qué rastreadores de IA han visitado realmente el sitio y con qué frecuencia. Es la señal directa más fiable para evaluar tu exposición GEO, por encima de cualquier estimación.
La lista de rastreadores de IA cambia cada temporada: aparecen nuevos nombres y se modifican los tokens. En lugar de memorizarlos uno por uno, conviene retener la lógica de clasificación —entrenamiento, búsqueda y activación por el usuario— porque cada categoría tiene consecuencias estratégicas diferentes. Si no sabes qué motores de IA rastrean actualmente tu sitio ni qué páginas que deberían citarse están quedando fuera, la auditoría GEO de Tenten permite consultar de una vez los registros de acceso de los rastreadores y el estado de las referencias. Para detectar primero las carencias, puedes solicitar un diagnóstico GEO de 30 minutos en /contact.



