Tenten AIGEO
Volver al blog
AEO técnicoImplementación

Cómo gestionar los rastreadores de IA con Cloudflare: bloquea los no autorizados y permite los que pueden citarte

¿Quieres bloquear rastreadores de IA con Cloudflare, pero te preocupa desaparecer de las respuestas generadas por IA? En este artículo explicamos las diferencias entre los rastreadores de entrenamiento, recuperación y búsqueda, y mostramos cómo usar AI Crawl Control y las reglas personalizadas del WAF para bloquear con precisión los bots que no quieres y permitir que ChatGPT y Perplexity consulten y citen tu contenido.

Equipo de Tenten GEOPublicado 2024-12-025 min de lectura
Ilustración conceptual del escudo de Cloudflare filtrando el tráfico de rastreadores de IA y permitiendo el acceso a determinados robots

Bloquear todos los rastreadores de IA con un solo clic parece una buena idea, pero también puede expulsarte de sus respuestas. El robot que permite a ChatGPT o Perplexity citarte no suele ser el mismo que recopila tu contenido para entrenar modelos. Sin embargo, el interruptor «Block AI Bots» de Cloudflare puede bloquearlos a ambos.

Muchos equipos descubren que las plataformas de IA rastrean su sitio cuando detectan un aumento inexplicable del tráfico del servidor o cuando el equipo jurídico pregunta: «¿Se ha utilizado nuestro contenido para entrenar modelos?». La reacción inmediata suele ser abrir Cloudflare y buscar una opción que bloquee todos los rastreadores de IA. Cloudflare ofrece ese interruptor y activarlo apenas lleva tres segundos. El problema es que, para una empresa B2B SaaS que quiere aparecer entre las recomendaciones de los motores de IA, ese bloqueo puede cerrar una nueva vía de captación. En este artículo veremos cómo aplicar una política selectiva: bloquear lo que no te interesa y permitir el acceso a los rastreadores que pueden citarte.

Empecemos por una distinción esencial: existen tres tipos de rastreadores de IA y no conviene tratarlos de la misma manera.

Bajo la etiqueta genérica de «rastreador de IA» se agrupan robots que cumplen tres funciones distintas. Entender cada categoría permite decidir cuáles bloquear y cuáles deben conservar el acceso.

  • Rastreadores de entrenamiento: recopilan tu contenido para incorporarlo al entrenamiento de modelos. Entre ellos están GPTBot de OpenAI, ClaudeBot de Anthropic, Bytespider de ByteDance y CCBot de Common Crawl. Bloquearlos no afecta a la posibilidad de que te citen.
  • Rastreadores de recuperación: cuando alguien formula una pregunta en ChatGPT o Perplexity, consultan la página en ese momento para incorporar información a la respuesta y enlazar la fuente. Algunos ejemplos son OAI-SearchBot, ChatGPT-User, PerplexityBot, Perplexity-User y Claude-User. Son fundamentales para aparecer en las respuestas de IA: si los bloqueas, dejas de ser visible para esos sistemas.
  • Rastreadores de índices de búsqueda: Googlebot y Bingbot. Su función no se limita a la búsqueda tradicional: Google AI Overviews depende de Googlebot, mientras que ChatGPT y Copilot recurren a Bing para parte de sus resultados. Si los bloqueas por error, perderás tanto posicionamiento orgánico como visibilidad en IA.

Este es el punto menos intuitivo: bloquear los rastreadores de entrenamiento no hace que desaparezcas de las respuestas de IA. Que un sistema te cite depende del contenido al que puedan acceder en ese momento sus rastreadores de recuperación y búsqueda, no de si utilizó tu sitio para entrenar un modelo meses atrás. Por tanto, puedes rechazar el uso de tu contenido para entrenamiento y, al mismo tiempo, mantener tus posibilidades de ser citado; siempre que sepas distinguir unos robots de otros.

Paso 1: identifica qué rastreadores visitan tu sitio en Cloudflare

Antes de bloquear nada, revisa los datos. «AI Crawl Control» —antes denominado AI Audit— muestra en el panel de Cloudflare cuántas solicitudes recientes ha realizado cada rastreador de IA, qué rutas ha visitado y si su acceso está permitido o bloqueado. La primera revisión suele deparar sorpresas: Bytespider o GPTBot pueden generar incluso más solicitudes que Googlebot. Esta información debe servir de base para las decisiones posteriores. Primero identifica qué robots consumen realmente recursos del servidor y qué rastreadores de recuperación todavía no han visitado el sitio, lo que indica que ese motor aún no ha podido descubrir tu contenido.

Diagrama comparativo de los tres tipos de rastreadores de IA y las estrategias para permitirlos o bloquearlos
Los rastreadores de entrenamiento pueden bloquearse; los de recuperación y búsqueda deben tener acceso. Esta clasificación determina si una IA podrá citarte.

Paso 2: permite o bloquea cada categoría; evita el interruptor universal

Cloudflare ofrece tres herramientas con distintos niveles de control, y lo más eficaz suele ser combinarlas. La opción más drástica es el interruptor «Block AI Bots» de la configuración de seguridad: resulta práctico, pero también puede bloquear los rastreadores de recuperación. No lo actives salvo que la visibilidad en IA no sea una prioridad. En un nivel intermedio está el robots.txt gestionado, útil para los rastreadores de entrenamiento que respetan sus directivas. La opción más precisa son las reglas personalizadas del WAF, que permiten autorizar o bloquear robots concretos y deberían constituir el núcleo de la configuración.

  1. Crea una regla de bloqueo en las reglas personalizadas del WAF, identifica los agentes de usuario de rastreadores de entrenamiento como Bytespider, CCBot, GPTBot y ClaudeBot, y configura la acción para bloquear la solicitud o devolver un código 403.
  2. Crea otra regla de tipo Skip que autorice expresamente a OAI-SearchBot, PerplexityBot, Perplexity-User, ChatGPT-User, Googlebot y Bingbot. Colócala antes de las reglas de bloqueo para mantener abierto el acceso de los rastreadores de recuperación y búsqueda.
  3. Utiliza el campo «verified bot» de Cloudflare para establecer las coincidencias, en lugar de depender únicamente de la cadena del agente de usuario. Esa cadena puede falsificarse y cualquier actor podría hacerse pasar por Googlebot. Cloudflare verifica los bots mediante DNS inverso y firmas, lo que ayuda a bloquear a los impostores.
  4. Si tu cuenta dispone de Pay Per Crawl, también puedes devolver un código HTTP 402 a los rastreadores de entrenamiento y exigir un pago antes de concederles acceso. Así, el uso de tu contenido puede convertirse en una fuente de ingresos o en una herramienta de negociación.

¿Qué rastreadores conviene permitir y cuáles bloquear?

Si quieres que los motores de IA recomienden tu empresa —como ocurre con la mayoría de las compañías B2B SaaS—, la política predeterminada es clara: permite todos los rastreadores de recuperación y búsqueda, y bloquea de forma selectiva los de entrenamiento. Hay dos errores especialmente frecuentes. Primero, Google-Extended y Googlebot no son lo mismo. Google-Extended controla si tu contenido puede utilizarse para el entrenamiento y el grounding de Gemini. Bloquearlo no hará que desaparezcas de AI Overviews; en cambio, si bloqueas Googlebot, todo el ecosistema de Google dejará de ver tu sitio. Segundo, no bloquees Bing: ChatGPT y Copilot obtienen parte de sus resultados del índice de Bing, por lo que bloquear Bingbot también puede afectar a tu presencia en esas plataformas.

Paso 3: verifica que las reglas no bloqueen tráfico necesario

Cuando una regla entre en funcionamiento, no des por hecho que se comportará como esperabas. Vuelve a AI Crawl Control y a los registros de eventos del WAF para comprobar, uno por uno, que los rastreadores de entrenamiento reciben un código 403 y que los de recuperación, junto con Googlebot, siguen obteniendo respuestas 200 de forma estable. El fallo más habitual es crear una regla demasiado amplia que también alcance a Googlebot. El equipo cree haber bloqueado únicamente tráfico de IA, pero dos semanas después comienza a caer el posicionamiento orgánico. Inspecciona las URLs con Google Search Console o revisa directamente los códigos de respuesta del servidor. Compara los datos durante una semana y no des por finalizada la configuración hasta confirmar que todos los robots autorizados acceden sin problemas.

Bloquear rastreadores de IA es fácil. Lo difícil es detener solo los que conviene bloquear y, al mismo tiempo, facilitar el acceso a los que pueden llevar tu contenido hasta las respuestas.Tenten GEO

Bloquear rastreadores es solo la defensa; el verdadero objetivo es conseguir citas.

Gestionar bien el tráfico de los rastreadores evita que consuman recursos del servidor sin aportar valor o que lleguen a saturarlo. Sin embargo, permitir el acceso a los rastreadores de recuperación no garantiza que una IA vaya a citarte. Primero deben encontrar tu contenido, entenderlo y considerarlo una fuente relevante. Ahí se libra la verdadera batalla del GEO: estructura del contenido, marcado de entidades y coherencia de marca entre plataformas. Configurar Cloudflare correctamente abre la puerta; conseguir que tu marca forme parte de la respuesta exige un trabajo adicional. Si quieres saber por qué no apareces citado en los seis principales motores de IA, o si estás permitiendo rastreadores que no aportan resultados, puedes solicitar un diagnóstico GEO de 30 minutos. Utilizaremos preguntas reales sobre tu negocio para mostrarte dónde están las brechas.

Preguntas frecuentes

¿Bloquear rastreadores de IA con Cloudflare hará que desaparezca de ChatGPT o Perplexity?
Depende del rastreador que bloquees. Impedir el acceso a bots de entrenamiento como GPTBot y ClaudeBot no afecta a las citas. En cambio, si bloqueas rastreadores de recuperación como OAI-SearchBot y PerplexityBot, dejarás de aparecer en las respuestas de IA. La clave es aplicar reglas por categoría, no bloquearlo todo con un solo clic.
¿En qué se diferencian robots.txt y el WAF de Cloudflare al bloquear rastreadores de IA?
robots.txt formula una petición cuyo cumplimiento depende del propio rastreador: los bots que respetan las normas la atenderán, mientras que los maliciosos pueden ignorarla. El WAF, en cambio, aplica el bloqueo directamente en el perímetro de Cloudflare, con independencia del comportamiento del robot. Para detener de verdad a los rastreadores que no respetan tus directivas, necesitas recurrir al WAF.
¿Qué rastreadores de IA debo permitir para que mi contenido pueda ser citado?
Como mínimo, permite OAI-SearchBot, ChatGPT-User, PerplexityBot, Perplexity-User, Claude-User, Googlebot y Bingbot. Los primeros determinan si puedes aparecer en las respuestas de ChatGPT y Perplexity; los dos últimos influyen en tu visibilidad en Google AI Overviews y Copilot.

DA EL SIGUIENTE PASO

¿Qué visibilidad tiene tu marca en las respuestas de la IA?

En un diagnóstico GEO de 30 minutos identificamos tus brechas de visibilidad y las acciones que conviene priorizar.

Reservar el diagnóstico