GEO

POLITIQUE ROBOTS · MATRICE OFFICIELLE

Décidez quels robots IA votre robots.txt doit encadrer.

Distinguez découverte par la recherche, entraînement des modèles et récupération à la demande. Seuls les groupes que la documentation actuelle déclare contrôlables sont générés.

Partez d’une posture opérationnelle

Un préréglage remplit tous les tokens contrôlables ; chaque directive reste modifiable.

MATRICE DE CONTRÔLE

Une décision explicite par token

Seules les lignes « contrôlables » alimentent le brouillon. Les lignes informatives expliquent les requêtes utilisateur sans créer de fausses règles.

OpenAIOAI-SearchBot
DécouverteContrôlable

Robot OpenAI qui référence et relie les sites dans la recherche ChatGPT.

Indépendant de GPTBot : l’autoriser n’autorise pas l’entraînement.

OAI-SearchBot: Votre directive
OpenAIGPTBot
EntraînementContrôlable

Robot OpenAI pour des contenus susceptibles d’entraîner les modèles de fondation.

Le refus signale le traitement futur ; il est distinct de la présence dans la recherche ChatGPT.

GPTBot: Votre directive
OpenAIChatGPT-User
Requête utilisateurInformation seulement

Agent OpenAI déclenché par l’utilisateur, et non robot d’exploration automatique.

OpenAI indique que robots.txt peut ne pas s’appliquer ; aucune règle n’est donc générée.

Information seulement
AnthropicClaudeBot
EntraînementContrôlable

Robot Anthropic pour des contenus pouvant contribuer à l’entraînement.

Anthropic indique actuellement que ses bots respectent robots.txt.

ClaudeBot: Votre directive
AnthropicClaude-SearchBot
DécouverteContrôlable

Robot de recherche Anthropic destiné à améliorer la qualité des résultats.

Décision à séparer de l’accès d’entraînement ClaudeBot.

Claude-SearchBot: Votre directive
AnthropicClaude-User
Requête utilisateurContrôlable

Agent Anthropic déclenché par une demande utilisateur.

Anthropic documente le contrôle robots.txt ; le bloquer peut réduire la récupération demandée.

Claude-User: Votre directive
GoogleGoogle-ExtendedToken de contrôle, pas un User-Agent HTTP
Entraînement + groundingContrôlable

Token Google contrôlant l’entraînement Gemini et le grounding avec Google Search.

Il n’a pas d’User-Agent HTTP propre et n’affecte ni inclusion ni classement Google Search.

Google-Extended: Votre directive
PerplexityPerplexityBot
DécouverteContrôlable

Robot de recherche Perplexity qui référence et relie les sites.

Perplexity précise qu’il ne sert pas à l’entraînement des modèles de fondation.

PerplexityBot: Votre directive
PerplexityPerplexity-User
Requête utilisateurInformation seulement

Agent Perplexity déclenché par l’utilisateur, sans rôle de crawl ou d’entraînement.

Perplexity indique qu’il ignore généralement robots.txt ; aucune règle n’est générée.

Information seulement

Limites de déploiement

Le texte généré est volontairement restreint : utilisez-le comme support de revue, pas comme fichier de remplacement.

  1. 01Fusionnez-le dans le robots.txt actuel ; un remplacement peut effacer des directives de recherche existantes.
  2. 02Revérifiez les sources avant publication. Noms, finalités et comportement robots peuvent changer.
  3. 03Un WAF, CDN, hébergeur ou blocage IP peut refuser un robot pourtant autorisé par robots.txt.
  4. 04robots.txt ne garantit ni accès, ni indexation, ni visibilité, ni mention, ni citation. Les agents déclenchés par l’utilisateur diffèrent.

Avant publication

Allow garantit-il l’accès ou une citation par une IA ?

Non. robots.txt exprime une préférence de crawl. Le réseau, les systèmes du fournisseur, la pertinence et le produit restent indépendants.

Pourquoi ChatGPT-User et Perplexity-User ne sont-ils pas générés ?

Leur documentation décrit des requêtes utilisateur auxquelles robots.txt peut ne pas s’appliquer ou est généralement ignoré. Une règle exagérerait le contrôle.

Puis-je remplacer mon robots.txt actuel par ce résultat ?

Non. Fusionnez uniquement les groupes validés, conservez les règles de recherche et de ressources, puis testez la réponse déployée.