La capacidad de los rastreadores de IA no es ilimitada y, con más frecuencia de la que parece, termina consumiéndose en las páginas equivocadas. En un sitio mediano o grande, es posible que más de la mitad de las solicitudes diarias de GPTBot, ClaudeBot o PerplexityBot se dirijan a URLs que nunca se utilizarán como referencia: paginaciones, parámetros de filtros o páginas de campañas antiguas. El resultado es que las páginas de producto y los artículos comparativos que sí interesa que la IA cite son precisamente los que menos se rastrean y más tardan en actualizarse. Optimizar el presupuesto de rastreo consiste en reconducir ese caudal hacia el destino correcto.
Más rastreo por parte de la IA no siempre significa mejores resultados
El concepto de presupuesto de rastreo (crawl budget) solía asociarse sobre todo con Google. Se refiere al volumen de recursos que un motor de búsqueda está dispuesto a dedicar al rastreo de un sitio web y depende de dos factores: cuánto puede soportar el servidor (crawl rate limit) y cuánto considera el motor que merece la pena rastrear (crawl demand). Con la llegada de la GEO, se ha pasado de un actor principal a una docena de rastreadores, cada uno con distinto nivel de consumo y diferentes normas de cortesía. Según los registros de servidor de algunos sitios, el volumen de rastreo de ClaudeBot y GPTBot ya se acerca al de Googlebot tradicional o incluso lo supera. La mayoría no ejecuta JavaScript, es sensible a la velocidad de respuesta y no aprende por sí sola a ignorar grandes cantidades de URLs de escaso valor: rastrea lo que se le ofrece.
Primero, identifica quién consume el presupuesto
Antes de optimizar, hay que saber quién genera el consumo. Los rastreadores de IA no persiguen todos el mismo objetivo: algunos se utilizan para entrenar modelos, otros para recuperar información en tiempo real —solo rastrean cuando el usuario formula una pregunta durante la conversación— y otros cumplen ambas funciones. Esta diferencia determina cuáles conviene autorizar y qué contenidos interesa que rastreen primero. Estos son los agentes más habituales en los registros de la mayoría de los sitios B2B. Conviene recordar sus nombres de agente de usuario, ya que serán necesarios después para analizar los registros y configurar robots.txt.
- GPTBot (entrenamiento de OpenAI) y OAI-SearchBot (búsqueda en tiempo real de ChatGPT)
- ClaudeBot/Claude-User (entrenamiento y recuperación en tiempo real de Anthropic)
- PerplexityBot/Perplexity-User (indexación y rastreo inmediato de Perplexity)
- Google-Extended (controla si Gemini puede utilizar el contenido; no afecta al posicionamiento en la búsqueda general)
- Amazonbot, Bytespider y Meta-ExternalAgent (fuentes de rastreo de gran consumo que suelen subestimarse)
Tres señales de que el presupuesto de rastreo se está desperdiciando
- Más de la mitad de las solicitudes de los rastreadores registradas se dirige a URLs con parámetros tras un signo de interrogación, opciones de ordenación o filtros, en lugar de llegar a las páginas de contenido esenciales.
- Han pasado más de dos o tres semanas desde el último rastreo por parte de la IA de páginas importantes, como artículos comparativos recién publicados, páginas de precios o casos de éxito.
- Los rastreadores encuentran con frecuencia errores 404, redirecciones 301 o páginas que tardan tres o cuatro segundos en responder. Cada solicitud de este tipo consume presupuesto.
Cuanto mayor es el sitio, más evidente resulta el problema. Una web con apenas 30 páginas casi nunca necesita preocuparse por el presupuesto de rastreo. Sin embargo, basta con tener categorías de comercio electrónico, paginación en el blog, versiones en varios idiomas o una navegación por filtros que genere numerosas combinaciones de parámetros para que la cantidad de URLs rastreables multiplique por decenas el número de páginas con contenido real. El presupuesto disponible es limitado: esas URLs adicionales no amplían la capacidad de rastreo, sino que reducen las probabilidades de que los rastreadores lleguen a las páginas importantes.

Localiza las fugas mediante los registros del servidor
No sirve de nada hacer suposiciones: hay que revisar los registros. El registro de acceso del servidor es la fuente más fiable para analizar el presupuesto de rastreo. Al filtrar los agentes de usuario correspondientes a rastreadores de IA, se pueden calcular tres datos: cuántas solicitudes realiza cada rastreador, entre qué tipos de URL se distribuyen y qué proporción recibe cada código de estado (200, 301, 404 y 5xx). La mayor parte del desperdicio suele concentrarse en unos pocos patrones: combinaciones de parámetros generadas por filtros facetados, páginas de resultados del buscador interno, paginaciones interminables y páginas de campañas antiguas que deberían haberse retirado hace tiempo. Primero hay que medir para saber qué tramo conviene cerrar y dónde se obtendrá el mayor ahorro. El seguimiento de la visibilidad en IA indica si el contenido ha sido citado; los registros muestran en qué emplean su tiempo los rastreadores. Ambos datos deben compararse.
Seis medidas para redirigir el presupuesto hacia las páginas importantes
- Utiliza Disallow en robots.txt para bloquear búsquedas internas, parámetros de filtros, carritos de compra y otras rutas que nunca necesitan rastrearse. Así se evita el consumo desde el origen.
- Configura la etiqueta canonical en las páginas duplicadas o casi idénticas para que el rastreador concentre el presupuesto en la versión canónica, en lugar de recorrer cada variante de ordenación.
- Elimina las cadenas de redirecciones 301 y corrige los enlaces internos que conducen a errores 404. Cada redirección innecesaria que sigue el rastreador equivale a una página real menos que puede visitar.
- Mantén un sitemap XML limpio que incluya únicamente URLs indexables y asegúrate de que lastmod refleje fielmente la fecha de actualización. Esto ayuda a los rastreadores a decidir qué páginas deben volver a visitar.
- Utiliza el enlazado interno para dirigir la autoridad y las rutas de rastreo hacia las páginas esenciales. La mayoría de los rastreadores de IA no ejecuta JavaScript, por lo que los menús y artículos relacionados deben utilizar enlaces HTML reales, sin depender de su generación dinámica en el front-end.
- Reduce el tiempo hasta el primer byte (TTFB) y el tamaño de las páginas. Cuanto más rápida sea la respuesta, más páginas podrá recorrer el rastreador con el mismo presupuesto.
Da prioridad a las páginas que ofrecen respuestas directas
El presupuesto recuperado debe emplearse donde aporte valor. Desde la perspectiva de la GEO, conviene priorizar y rastrear con frecuencia las páginas que responden directamente a una pregunta, presentan una estructura clara y permiten extraer la información con facilidad: páginas con definiciones precisas, artículos comparativos con cifras concretas, tutoriales paso a paso y páginas de producto con preguntas frecuentes. Son las fuentes que los motores de IA tienen más probabilidades de utilizar al generar sus respuestas. Colocarlas al principio del sitemap, reforzarlas con varios enlaces internos y mantener su contenido actualizado transmite una señal inequívoca a los rastreadores: este contenido merece visitas frecuentes. En cambio, las páginas de agradecimiento e inicio de sesión, así como los archivos de etiquetas con desplazamiento infinito, deben quedar fuera.
El objetivo de optimizar el presupuesto de rastreo nunca ha sido conseguir que los rastreadores visiten más páginas, sino aumentar la probabilidad de que cada visita llegue a una página que interesa que la IA utilice como referencia.— Tenten GEO Consulting Team
Este trabajo no se resuelve una sola vez. El sitio generará nuevos parámetros, el equipo de marketing lanzará nuevas páginas de campañas y cada rediseño creará nuevas redirecciones. Las fugas de presupuesto seguirán apareciendo, por lo que el análisis de registros debe incorporarse a las tareas trimestrales, con atención tanto a la tasa de visitas de los rastreadores como al intervalo de rastreo de las páginas importantes. Si no sabes con certeza dónde emplean actualmente su tiempo los rastreadores de IA dentro de tu sitio ni qué páginas que deberían servir como referencia están quedando fuera, puedes solicitar un diagnóstico GEO de 30 minutos. Analizaremos los registros de tu servidor para señalar las fugas.



