Tenten AIGEO
Volver al blog
AEO técnicoEvaluación

Lista de User-Agents de rastreadores de IA en 2026: GPTBot, Google-Extended, PerplexityBot y Amazonbot, explicados de un vistazo

GPTBot, OAI-SearchBot, Google-Extended, PerplexityBot, Amazonbot, ClaudeBot... Una guía completa de los User-Agents y tokens de robots.txt de los principales rastreadores de IA en 2026, con criterios para permitirlos o bloquearlos según sean de entrenamiento, búsqueda o activados por el usuario.

Equipo de Tenten GEOPublicado 2026-01-125 min de lectura
Representación abstracta de varios rastreadores de IA que se aproximan al mismo nodo web por distintas trayectorias luminosas.

Muchas personas añaden una línea Disallow a robots.txt para bloquear GPTBot porque creen que así impedirán que ChatGPT cite su contenido. Sin embargo, esa medida no consigue lo que esperan. GPTBot solo recopila datos para entrenar el modelo; la presencia de una página en las respuestas de ChatGPT depende de otro rastreador: OAI-SearchBot. Aunque ambos pertenecen a la misma empresa, cumplen funciones distintas y utilizan User-Agents diferentes. Antes de configurar permisos y bloqueos en robots.txt, conviene entender qué hace cada nombre de la lista para no obtener el resultado opuesto al deseado.

Primero, una distinción fundamental: existen tres tipos de rastreadores de IA

  • Rastreador de entrenamiento: recopila contenido para incorporarlo al corpus de entrenamiento del modelo. Por lo general, el procesamiento se realiza sin conexión y no guarda una relación directa con la respuesta que el usuario está viendo en ese momento. Algunos ejemplos son GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl), Meta-ExternalAgent y Bytespider (ByteDance).
  • Rastreador de búsqueda o indexación: crea un índice consultable al instante para los motores de respuestas con IA y determina directamente si una página puede utilizarse como fuente de referencia. Entre ellos se encuentran OAI-SearchBot (búsqueda de ChatGPT), PerplexityBot, Googlebot (AI Overviews utiliza su índice existente) y Applebot (Siri y Apple Intelligence).
  • Rastreador activado por el usuario: entra en acción cuando alguien pega una URL en una conversación o solicita una verificación inmediata. Normalmente consulta una sola página cada vez y no incorpora su contenido al conjunto de entrenamiento. Algunos ejemplos son ChatGPT-User, Perplexity-User y Claude-User.

Si quieres que los sistemas de IA citen tu contenido, no debes bloquear las dos últimas categorías. Si impides el acceso a los rastreadores de búsqueda, tu sitio no podrá entrar en la lista de fuentes candidatas. Si bloqueas los activados por el usuario, la IA no podrá leer tu contenido ni siquiera cuando alguien le facilite expresamente el enlace. Los rastreadores de entrenamiento, en cambio, pueden gestionarse según la estrategia de marca: bloquéalos si te preocupa que tu contenido se utilice gratuitamente para entrenar modelos, o permítelos si quieres aumentar las posibilidades de formar parte de su corpus subyacente. Confundir estas tres capas es la causa principal de muchas configuraciones de robots.txt planteadas en sentido contrario.

OpenAI: GPTBot, OAI-SearchBot y ChatGPT-User

  • GPTBot: se utiliza con fines de entrenamiento. Su User-Agent contiene "GPTBot/1.2" y su token para robots.txt es "GPTBot". OpenAI también publica los rangos de IP del rastreador en un archivo JSON, lo que permite comprobar si una visita es auténtica.
  • OAI-SearchBot: se encarga de incorporar las páginas a las fuentes de búsqueda y citación de ChatGPT. Su token es "OAI-SearchBot". Bloquearlo equivale a renunciar voluntariamente a la visibilidad en ChatGPT, pero es precisamente el rastreador que muchas personas bloquean por error.
  • ChatGPT-User: se activa cuando un usuario pide consultar o verificar una URL durante una conversación. Su token es "ChatGPT-User". Realiza un rastreo en tiempo real de una sola página y no incorpora el contenido al entrenamiento.

Google-Extended no es un rastreador, sino un interruptor

Google-Extended suele figurar en las «listas de rastreadores de IA», pero en realidad no es un rastreador que vaya a aparecer en los registros del servidor, sino un token de producto para robots.txt. Permitirlo o bloquearlo solo determina si Google puede utilizar el contenido para entrenar Gemini y para determinadas funciones de generación; no afecta en absoluto a la indexación general de Googlebot. Por tanto, bloquear Google-Extended no elimina un sitio de los resultados de Google y, por lo general, tampoco de AI Overviews, ya que esta función se nutre principalmente del índice existente de Googlebot. Applebot-Extended responde al mismo diseño: controla el uso de contenido para entrenar Apple Intelligence y no es lo mismo que Applebot, encargado de la indexación general.

PerplexityBot y otros rastreadores que no siempre respetan las reglas

Para que Perplexity pueda utilizar una página como referencia, es necesario permitir tanto PerplexityBot, que se ocupa de la indexación, como Perplexity-User, que responde a las consultas del usuario en tiempo real. Pero hay una realidad que conviene recordar: robots.txt es un acuerdo voluntario, no una barrera técnica. En 2025, Cloudflare señaló públicamente a Perplexity y afirmó que, tras ser bloqueado mediante robots.txt, comenzó a utilizar un User-Agent no declarado que se hacía pasar por un navegador convencional para seguir rastreando. Bytespider también se ha caracterizado por rastrear con mucha frecuencia y prestar escasa atención a los límites de velocidad. Por tanto, pueden darse dos situaciones a la vez: quizá no consigas bloquear al rastreador que quieres detener y, además, necesites verificar que el rastreador al que has dado acceso sea realmente quien afirma ser.

Amazonbot, ClaudeBot y otros nombres que encontrarás en los registros

  • ClaudeBot: rastreador de entrenamiento de Anthropic. También existen Claude-User, activado por el usuario, y los tokens anteriores anthropotic-ai y Claude-Web, que pueden aparecer simultáneamente en los registros.
  • Amazonbot: lo utilizan Alexa y los servicios de IA de Amazon. Su User-Agent contiene "Amazonbot/0.1".
  • CCBot: pertenece a Common Crawl. Aunque esta organización no es en sí misma una empresa de IA, numerosos modelos utilizan el corpus público que recopila. Por ello, constituye una vía indirecta de entrenamiento que suele pasarse por alto.
  • Otros nombres habituales: Meta-ExternalAgent (entrenamiento de Meta), Meta-ExternalFetcher (activado por el usuario), YouBot (You.com), DuckAssistBot (DuckDuckGo), cohere-ai (Cohere), MistralAI-User, Diffbot y Timpibot.
Diagrama de los tres grandes tipos de rastreadores de IA —entrenamiento, búsqueda y activados por el usuario— con sus principales representantes.
Clasificar los rastreadores de IA en entrenamiento, búsqueda y activación por el usuario es la clave para decidir qué permitir o bloquear en robots.txt.

Cómo configurar robots.txt en 2026

No existe una configuración válida para todos los casos. Sin embargo, para la mayoría de los sitios web B2B que buscan mejorar su GEO, un punto de partida razonable es permitir los rastreadores de búsqueda y los activados por el usuario, de modo que los motores de IA puedan leer y citar el contenido. Los rastreadores de entrenamiento deben evaluarse por separado según el valor del contenido y la estrategia de marca. El siguiente ejemplo prioriza la visibilidad.

  • User-agent: OAI-SearchBot → Allow: / (mantiene la visibilidad en ChatGPT)
  • User-agent: PerplexityBot → Allow: / (permite entrar en el conjunto de fuentes de Perplexity)
  • User-agent: ChatGPT-User y Perplexity-User → Allow: / (no bloquea las verificaciones solicitadas por el usuario)
  • User-agent: Googlebot → Allow: / (AI Overviews y la búsqueda general comparten el mismo índice, por lo que debe permitirse)
  • User-agent: GPTBot, CCBot, Google-Extended → según la política definida (utiliza Disallow: / si no quieres que el contenido se emplee para entrenamiento; esto no afectará a la visibilidad anterior)

No confíes toda la estrategia a robots.txt

robots.txt puede detener a los rastreadores que respetan las reglas, pero no a quienes están decididos a eludirlas. Para ejercer un control real hay que avanzar al siguiente nivel: combinar DNS inverso con una comprobación directa y contrastar la IP con los rangos publicados oficialmente por cada empresa para verificar la identidad del rastreador. Ante User-Agents encubiertos o rastreos de alta frecuencia, conviene recurrir a un WAF, a la gestión de rastreadores de IA de Cloudflare o a límites de velocidad, en lugar de limitarse a añadir otra línea a robots.txt. La supervisión es igual de importante: revisa periódicamente los registros de acceso del servidor para saber qué rastreadores de IA han visitado realmente el sitio y con qué frecuencia. Es la señal directa más fiable para evaluar tu exposición GEO, por encima de cualquier estimación.

La lista de rastreadores de IA cambia cada temporada: aparecen nuevos nombres y se modifican los tokens. En lugar de memorizarlos uno por uno, conviene retener la lógica de clasificación —entrenamiento, búsqueda y activación por el usuario— porque cada categoría tiene consecuencias estratégicas diferentes. Si no sabes qué motores de IA rastrean actualmente tu sitio ni qué páginas que deberían citarse están quedando fuera, la auditoría GEO de Tenten permite consultar de una vez los registros de acceso de los rastreadores y el estado de las referencias. Para detectar primero las carencias, puedes solicitar un diagnóstico GEO de 30 minutos en /contact.

Preguntas frecuentes

¿Bloquear GPTBot hará que desaparezca de ChatGPT?
No. GPTBot solo recopila datos para entrenar el modelo. El rastreador que determina si una página puede aparecer en las respuestas de ChatGPT es OAI-SearchBot. Para mantener la visibilidad en ChatGPT, debes permitir OAI-SearchBot y ChatGPT-User; la decisión sobre GPTBot puede tomarse por separado.
¿Google-Extended es un rastreador?
No. Es un token de producto para robots.txt que solo controla si Google puede utilizar el contenido para entrenar Gemini. No afecta a la indexación general de Googlebot ni hará que una página desaparezca de los resultados de Google o de la mayoría de las AI Overviews.
¿Qué puedo hacer si robots.txt no detiene a los rastreadores de IA que ignoran las reglas?
robots.txt es únicamente un acuerdo voluntario. Frente a User-Agents encubiertos o rastreos de alta frecuencia, resulta más eficaz utilizar un WAF, la gestión de rastreadores de IA de Cloudflare y límites de velocidad. También conviene verificar el origen mediante DNS inverso y contrastarlo con los rangos de IP publicados oficialmente, en lugar de limitarse a añadir otra línea a robots.txt.

DA EL SIGUIENTE PASO

¿Qué visibilidad tiene tu marca en las respuestas de la IA?

En un diagnóstico GEO de 30 minutos identificamos tus brechas de visibilidad y las acciones que conviene priorizar.

Reservar el diagnóstico