Tenten AIGEO
Retour au blog
AEO techniqueMise en œuvre

Audit express de l’explorabilité par les IA : vérifiez robots.txt, le rendu et les données structurées en 5 minutes

Si les moteurs de recherche IA ne vous trouvent pas, le problème ne vient pas toujours du contenu : leurs robots d’exploration ne parviennent peut-être pas à le lire. Cet audit de cinq minutes vous permet de vérifier si robots.txt bloque GPTBot, si l’affichage du contenu dépend de JavaScript et si les données structurées Schema sont correctes. Vous identifierez rapidement les failles d’explorabilité par les IA et saurez dans quel ordre les corriger.

L’équipe Tenten GEOPublié le 2024-11-294 min de lecture
Un faisceau lumineux traverse une porte entrouverte, symbolisant la capacité d’un robot d’exploration IA à lire une page web.

Si vous n’apparaissez pas dans les moteurs de recherche IA, votre contenu n’est pas forcément en cause : les robots ne parviennent peut-être tout simplement pas à lire la page. Il suffit que robots.txt bloque GPTBot, que le texte soit dissimulé dans un composant dépendant de JavaScript ou que la page ne contienne aucune donnée structurée pour que votre article, même particulièrement soigné, reste invisible aux moteurs IA. Inutile d’attendre les conclusions d’un audit complet sur trente jours pour détecter ce type de problème. Vous pouvez effectuer vous-même trois vérifications en cinq minutes.

Commençons par un point essentiel : les robots d’exploration IA ne sont pas Googlebot

Chaque moteur IA utilise ses propres robots pour collecter des données. Chacun possède son propre user-agent et se comporte différemment de Googlebot. La différence la plus importante est la suivante : pour établir son classement, Googlebot consacre des ressources à l’exécution du JavaScript des pages. La plupart des robots IA, en revanche, privilégient la vitesse et la maîtrise des coûts ; ils se limitent au HTML initial et exécutent peu, voire pas du tout, JavaScript. Une indexation normale par Google ne signifie donc jamais que ChatGPT, Perplexity et Claude peuvent lire votre contenu. Cet audit doit adopter le point de vue d’un robot IA, et non reprendre une ancienne check-list de référencement naturel.

Première minute : ouvrez robots.txt et vérifiez qu’aucun robot IA n’est bloqué

Ajoutez /robots.txt à la fin de votre nom de domaine, puis ouvrez directement le fichier. Avec Ctrl+F, recherchez les noms ci-dessous et vérifiez s’ils sont bloqués par une directive Disallow ou s’ils ne sont pas mentionnés — une absence de mention signifie généralement que l’accès est autorisé. Sur de nombreux sites, les robots IA sont bloqués « par accident » : les règles par défaut d’un prestataire de sécurité, d’un CDN ou d’une extension refusent tous les robots autres que Googlebot, laissant aussi les moteurs IA à la porte.

  • GPTBot : robot utilisé par OpenAI pour collecter des données destinées à l’entraînement et à la recherche d’informations. Si vous le bloquez, ChatGPT ne pourra pas accéder à votre contenu.
  • OAI-SearchBot et ChatGPT-User : ils correspondent respectivement à la recherche dans ChatGPT et à l’accès instantané aux pages lorsqu’un utilisateur pose une question.
  • ClaudeBot : robot utilisé par Claude d’Anthropic pour collecter et retrouver des pages web.
  • PerplexityBot et Perplexity-User : Perplexity les utilise respectivement pour constituer son index et lire immédiatement les pages.
  • Google-Extended : cette directive détermine si le contenu peut être utilisé par Gemini. La bloquer n’a aucune incidence sur le classement général dans Google, mais fait disparaître votre contenu des réponses de Gemini.

Minutes 2 et 3 : désactivez JavaScript et vérifiez si le contenu reste visible

Cette étape répond à une seule question : votre texte est-il réellement présent dans le HTML, ou dépend-il de l’exécution de JavaScript par le navigateur ? La méthode la plus rapide consiste à désactiver JavaScript dans les outils de développement de Chrome, puis à recharger la page. Plus directement encore, ajoutez view-source: devant l’URL pour afficher le code source, puis utilisez Ctrl+F afin d’y rechercher une phrase complète de votre article. Si vous ne trouvez ni le titre, ni le texte, ni le prix, ces contenus sont rendus côté client. Un robot IA limité au HTML ne recevra alors qu’une coquille vide. Raisonnez comme si vous consultiez la page en texte brut : l’IA ne peut citer que ce que son robot voit.

Les trois niveaux d’un audit de l’explorabilité par les IA en cinq minutes : robots.txt, rendu de la page et données structurées Schema.
L’audit porte sur trois points : les robots peuvent-ils accéder au site, le contenu peut-il être récupéré et les données structurées sont-elles correctes ?

Minutes 4 et 5 : vérifiez la présence et la validité des données structurées Schema

Toujours dans view-source, recherchez cette fois application/ld+json pour vérifier si la page contient des données structurées et si le type déclaré est le bon. Une page d’article doit utiliser Article, une page d’entreprise Organization, une page de questions-réponses FAQPage et une page produit Product. Les données structurées Schema n’améliorent pas directement votre classement. Elles permettent surtout à l’IA de confirmer à moindre coût trois éléments : le sujet de la page, son auteur et sa fiabilité. Attention à un piège courant : des données structurées erronées sont pires que leur absence. Si une page se déclare comme FAQPage sans présenter les questions et réponses correspondantes, ou si l’auteur, la date et le contenu indiqués dans le balisage ne concordent pas avec la page, l’IA jugera ces informations peu fiables et sera moins encline à les citer.

La check-list récapitulative : ce que vous devez constater en cinq minutes

  1. robots.txt : aucun des robots IA mentionnés plus haut n’est bloqué par Disallow, et aucune interdiction générale ne combine User-agent: * et Disallow: /.
  2. Rendu : après la désactivation de JavaScript, le titre, le corps du texte et les données clés — comme le prix ou les caractéristiques techniques — restent lisibles dans le HTML initial.
  3. Données structurées Schema : la page contient le type JSON-LD approprié, et les informations balisées correspondent à celles qui s’affichent à l’écran ; elles ne sont ni fictives ni obsolètes.
  4. Les trois contrôles sont validés : les bases de l’explorabilité par les IA sont saines. Vous pouvez maintenant optimiser le contenu et sa structure afin de favoriser les citations.
  5. Un seul contrôle échoue : ne vous précipitez pas pour produire davantage de contenu. La priorité est de combler cette faille.
L’explorabilité par les IA est une condition préalable pour pouvoir être cité, pas un avantage facultatif. Si vous ne franchissez pas ce seuil, même un excellent contenu restera illisible et impossible à citer pour l’IA.Tenten GEO Consulting Team

Si vous détectez un problème, par quoi commencer ?

L’ordre des priorités est clair. Commencez par lever les blocages dans robots.txt : la modification d’une seule ligne peut rétablir l’accès, avec un impact maximal et, le plus souvent, un effet le jour même. Corrigez ensuite les problèmes de rendu. Ils nécessitent généralement l’intervention de l’équipe technique pour faire passer les contenus essentiels en rendu côté serveur ou, au minimum, intégrer le texte au HTML initial. L’effort est plus important, mais il détermine directement si l’IA peut lire vos contenus. Complétez enfin les données structurées Schema : elles parachèvent les fondations, mais ne font pas passer votre visibilité de zéro à un. En respectant cet ordre, vous corrigez d’abord les failles les plus critiques avec le moins d’effort possible.

Cet audit de cinq minutes permet de repérer la plupart des failles évidentes, mais pas les problèmes plus profonds : un serveur qui renvoie au robot IA un contenu différent de celui présenté aux utilisateurs, des paragraphes trop peu structurés pour être cités, ou encore des entités et des signaux de confiance incohérents d’une page à l’autre. Pour savoir où se situent vos lacunes à ces différents niveaux, vous pouvez réserver un diagnostic GEO de 30 minutes. En appliquant la méthode d’audit GEO de Tenten, nous dresserons une liste de vos problèmes d’explorabilité et des actions que vous pourrez engager immédiatement.

Questions fréquentes

Les robots d’exploration IA et Googlebot sont-ils identiques ? Que se passe-t-il si vous en bloquez un ?
Non. GPTBot, ClaudeBot, PerplexityBot et Google-Extended sont indépendants et doivent être autorisés séparément dans robots.txt. Une indexation normale par Google ne garantit pas que ChatGPT ou Perplexity puisse lire votre page. Les deux accès doivent être vérifiés séparément.
Pourquoi un contenu affiché avec JavaScript pose-t-il problème aux robots IA ?
La plupart des robots IA n’exécutent pas JavaScript, ou ne l’exécutent que partiellement, et se contentent du HTML initial. Si le texte, le titre et le prix dépendent d’un rendu côté client, le robot ne reçoit qu’une coquille vide et ne dispose d’aucun contenu à citer.
Sans données structurées Schema, serai-je totalement invisible pour les IA ?
Pas nécessairement. Les données structurées Schema aident néanmoins l’IA à identifier rapidement le sujet de la page, son auteur et sa fiabilité, ce qui augmente ses chances d’être citée. Attention : des données structurées erronées ou fictives sont plus préjudiciables que leur absence. Une page qui se déclare comme FAQ sans afficher les contenus correspondants sera considérée comme peu fiable.

PASSEZ À L’ÉTAPE SUIVANTE

Votre marque apparaît-elle dans les réponses des IA ?

En 30 minutes, nous identifions vos écarts de visibilité sur les principaux moteurs IA et les actions à traiter en priorité.

Réserver le diagnostic