Tenten AIGEO
Retour au blog
Visibilité sur les plateformes IAMise en œuvre

Aidez Perplexity à vous trouver : configuration des robots, de llms.txt et de ses robots d’exploration

Pour être cité par Perplexity, vous devez d’abord lui permettre d’accéder à votre contenu. Ce guide pratique explique les différences entre PerplexityBot et Perplexity-User, la bonne manière de configurer robots.txt et llms.txt, ainsi qu’une méthode structurée pour rendre vos contenus plus susceptibles d’être retenus comme sources. Vous y trouverez également une checklist de configuration à suivre avant la mise en ligne.

L’équipe Tenten GEOPublié le 2024-09-075 min de lecture
Illustration abstraite : une lumière douce traverse plusieurs couches de protection translucides pour atteindre un nœud lumineux, symbolisant l’exploration fluide d’un site par Perplexity et la citation de ses contenus.

Pour que Perplexity vous cite, deux conditions doivent être réunies : son robot doit pouvoir accéder à votre page et comprendre son contenu. Or, beaucoup de sites échouent dès la première étape sans le savoir. Une règle robots.txt contenant un caractère générique, la protection par défaut d’un CDN ou un user-agent non autorisé suffit à les faire disparaître entièrement des réponses de Perplexity. Autoriser PerplexityBot est un prérequis, pas une garantie d’être cité. Sans cette autorisation, toutefois, tous les autres efforts de GEO resteront sans effet.

Commençons par un point essentiel : Perplexity utilise deux robots dont les comportements sont très différents.

Beaucoup pensent que Perplexity ne dispose que d’un seul robot. Ils n’autorisent ou ne bloquent donc qu’un seul nom, en supposant avoir entièrement ouvert ou fermé l’accès. Le résultat peut être tout autre. La documentation officielle de Perplexity répertorie deux agents : PerplexityBot construit l’index de recherche et détermine si votre page peut figurer parmi les résultats. Il respecte robots.txt. Perplexity-User, lui, est déclenché lorsqu’un utilisateur pose une question et que le système doit consulter immédiatement une URL précise. Comme cette visite répond directement à l’action de l’utilisateur, elle n’est généralement pas soumise à robots.txt. Cette distinction est déterminante : bloquer les robots dans robots.txt peut empêcher l’indexation, sans nécessairement empêcher l’exploration instantanée.

  • PerplexityBot : il construit et actualise l’index de recherche de Perplexity, détermine si votre contenu peut devenir une source candidate et respecte les règles de robots.txt.
  • Perplexity-User : il consulte immédiatement une page précise lorsqu’un utilisateur pose une question. Cette visite répond à une action de l’utilisateur et n’est généralement pas bloquée par robots.txt.
  • Vérifiez l’authenticité : ces deux agents peuvent être usurpés. Ne vous fiez pas uniquement à la chaîne du user-agent ; contrôlez également la plage d’adresses IP publiée par Perplexity ou effectuez une résolution DNS inverse vers perplexity.ai.
  • Erreur fréquente : autoriser un robot dans robots.txt ne signifie pas que votre contenu sera exploré ou cité. Vous devenez simplement éligible au groupe des sources candidates.

robots.txt : une seule ligne mal configurée peut rendre tout votre site invisible

Lors de nos audits GEO, robots.txt est le premier point de blocage critique que nous rencontrons chez nos clients. Certains sites associent User-agent: * à Disallow: / pour bloquer l’ensemble du domaine, puis oublient de retirer la règle lors de la mise en ligne. D’autres interdisent des répertoires essentiels comme /blog/ ou /resources/. Plus difficiles à détecter encore, les règles de gestion des robots ou de pare-feu de plateformes comme Cloudflare et Vercel peuvent renvoyer directement un code 403 à PerplexityBot au niveau de la périphérie, sans même modifier robots.txt. Aucun message d’erreur ne vous avertira : votre site sera simplement absent des réponses de Perplexity. La configuration minimale est pourtant très courte : autorisez explicitement PerplexityBot dans le fichier robots.txt placé à la racine, puis indiquez l’emplacement de votre sitemap.

  • Accordez une autorisation explicite : ajoutez un bloc User-agent: PerplexityBot suivi de Allow: / afin que les règles de blocage associées à User-agent: * ne s’appliquent pas à ce robot.
  • Indiquez le sitemap : ajoutez Sitemap: https://yourdomain/sitemap.xml à la fin du fichier pour permettre au robot de récupérer immédiatement la liste complète des URL.
  • Contrôlez le CDN et le WAF : vérifiez que Cloudflare, Vercel et AWS WAF ne bloquent pas tous les robots d’exploration IA connus au niveau de la périphérie.
  • N’utilisez pas noindex si vous souhaitez être cité : une page comportant une directive noindex dans la balise meta robots demande à la fois aux moteurs de recherche et à Perplexity de ne pas l’inclure.
  • Vérifiez les journaux : recherchez PerplexityBot dans les journaux d’accès du serveur et confirmez qu’il a effectivement visité le site avec une réponse 200, et non 403 ou 429.

llms.txt : dix minutes bien investies, mais pas une porte d’entrée officielle vers les moteurs

llms.txt est une proposition formulée en 2024 par Jeremy Howard, d’Answer.AI. Elle consiste à placer un fichier Markdown nommé /llms.txt à la racine du site et à y répertorier, dans une structure concise, les pages les plus importantes accompagnées de leur description. L’objectif est d’aider les grands modèles de langage à saisir rapidement l’essentiel du site. L’intention est pertinente, mais soyons précis : à ce jour, aucun moteur majeur, y compris Perplexity et Google, n’a annoncé publiquement exploiter réellement llms.txt. John Mueller, de Google, a également déclaré publiquement qu’aucun moteur de recherche ne s’en servait comme base d’exploration ou de classement. Faut-il malgré tout le créer ? Oui, à condition de rester lucide sur son rôle. Son coût de mise en œuvre est extrêmement faible, et un seul fichier permet de présenter vos contenus piliers, vos offres et vos coordonnées. Il offre un point d’entrée propre aux agents susceptibles de le lire et aux moteurs qui pourraient le prendre en charge à l’avenir. Plus concrètement, sa rédaction vous oblige à déterminer quelles pages constituent réellement le cœur de votre site, un exercice utile en soi pour le GEO. N’y consacrez toutefois ni tout votre budget ni toutes vos attentes. Ce qui permet véritablement à Perplexity de vous trouver reste une configuration correcte de robots.txt et un HTML propre.

Infographie : les deux robots de Perplexity suivent respectivement un parcours d’indexation et un parcours d’exploration en temps réel. robots.txt et llms.txt constituent les premiers seuils à franchir pour être cité.
PerplexityBot assure l’indexation, Perplexity-User intervient en temps réel et robots.txt constitue la première porte d’entrée commune.

Être accessible ne vous donne qu’un ticket d’entrée : encore faut-il que Perplexity vous retienne comme source

Lorsqu’il répond à une question, Perplexity ne cite souvent qu’un petit nombre de sources. Il privilégie les passages qui répondent directement à la requête et peuvent être extraits proprement. Si votre réponse n’apparaît qu’au huitième paragraphe après une longue introduction sur « l’essor de l’IA », ou si un même paragraphe traite de trois sujets à la fois, le moteur aura du mal à isoler un extrait exploitable. Commencez par la conclusion, consacrez chaque paragraphe à une seule idée et formulez vos titres comme des réponses aux questions recherchées. Ces principes éditoriaux ne relèvent pas d’un simple effet de mode : ils influencent directement la sélection de vos contenus.

  • Répondez d’emblée : donnez la conclusion dans la première phrase de chaque section, puis développez les raisons et la méthode.
  • Transformez la question en titre : utilisez les H2 et H3 pour formuler les requêtes que les utilisateurs posent réellement, afin de faciliter leur mise en correspondance par le moteur.
  • Rendez chaque paragraphe autonome : traitez une seule idée principale et ne supposez pas que le lecteur a lu le paragraphe précédent. Le passage pourra ainsi être cité indépendamment.
  • Ajoutez des données structurées : associez les articles au schéma Article et utilisez FAQPage dans les sections de questions-réponses pour aider le moteur à identifier correctement la nature du contenu.
  • Fournissez des chiffres et leur contexte : les faits vérifiables se citent plus facilement que les adjectifs.

Fraîcheur des contenus : Perplexity privilégie les mises à jour récentes

Perplexity se positionne comme un outil capable de répondre à des questions actuelles et sensibles au facteur temps, avec une préférence nette pour les contenus récents. Deux conséquences en découlent. D’abord, la page doit renseigner honnêtement dateModified, afin qu’un article actualisé l’année dernière ne paraisse pas dater de trois ans. Ensuite, vos pages stratégiques doivent suivre un véritable rythme de mise à jour, avec de nouveaux chiffres et de nouvelles pratiques, et non une simple modification de date destinée à tromper le moteur. Lorsque nous gérons les moteurs de contenu de nos clients, nous revenons régulièrement sur les pages à forte valeur pour les enrichir des dernières expériences opérationnelles. Cette démarche a un effet concret sur la sélection des sources par Perplexity.

Votre capacité à être cité par Perplexity dépend à 90 % de critères techniques : le contenu doit être accessible, lisible et suffisamment récent. Même un excellent article n’a aucune chance si le robot ne peut pas y accéder.Tenten GEO Consulting Team

Checklist de 30 minutes avant la mise en ligne

  1. Ouvrez « votredomaine/robots.txt » dans votre navigateur. Vérifiez qu’une règle Disallow: / ne bloque pas tout le site par erreur et que PerplexityBot est explicitement autorisé.
  2. Recherchez PerplexityBot dans les journaux du serveur, puis confirmez qu’il a effectué une visite récente ayant reçu une réponse 200.
  3. Contrôlez les règles appliquées aux robots par le CDN et le WAF, afin de vérifier que les robots d’exploration IA ne sont pas bloqués au niveau de la périphérie.
  4. Examinez trois articles stratégiques au hasard : la conclusion apparaît-elle dès le premier paragraphe et le titre correspond-il à une question réellement posée ?
  5. Vérifiez que le sitemap est accessible, que dateModified est exact et que llms.txt sert de carte des contenus.

La plupart des points de cette liste peuvent être corrigés en un après-midi. Le plus difficile est d’identifier ce qui vous a échappé, notamment les problèmes dissimulés dans les règles du CDN ou les blocages appliqués par défaut par les plateformes. Sans vérification volontaire, ils resteront invisibles. Pour savoir si Perplexity peut actuellement explorer votre site et quelles occasions d’être cité vous échappent, rendez-vous sur /contact afin de prendre rendez-vous pour un diagnostic GEO de 30 minutes. Nous examinerons directement votre fichier robots.txt, vos journaux et la structure de vos contenus, puis nous dresserons la liste précise des écarts à corriger.

Questions fréquentes

Comment s’appellent les robots de Perplexity et comment autoriser leur accès dans robots.txt ?
Perplexity utilise deux robots principaux : PerplexityBot assure l’indexation pour la recherche et respecte robots.txt, tandis que Perplexity-User explore des pages en temps réel lorsque les utilisateurs posent des questions. Pour autoriser PerplexityBot, ajoutez User-agent: PerplexityBot puis Allow: / dans robots.txt, et indiquez l’emplacement du sitemap.
llms.txt est-il utile pour Perplexity et faut-il en créer un ?
À ce jour, Perplexity n’a pas annoncé publiquement exploiter llms.txt. Il s’agit davantage d’une proposition de carte de contenus destinée aux IA que d’une norme officielle. Sa création reste recommandée, car son coût est extrêmement faible et elle aide à organiser les pages stratégiques. Toutefois, la capacité du robot à explorer votre site dépend avant tout de robots.txt et d’un HTML propre.
robots.txt autorise PerplexityBot : pourquoi Perplexity ne trouve-t-il toujours pas mon site ?
Le CDN ou le WAF bloque probablement les robots d’exploration IA au niveau de la périphérie, la page comporte peut-être une directive noindex, ou le sitemap est inaccessible. Recherchez PerplexityBot dans les journaux du serveur et vérifiez qu’il reçoit une réponse 200, et non 403 ou 429, afin d’identifier la couche où se situe le blocage.

PASSEZ À L’ÉTAPE SUIVANTE

Votre marque apparaît-elle dans les réponses des IA ?

En 30 minutes, nous identifions vos écarts de visibilité sur les principaux moteurs IA et les actions à traiter en priorité.

Réserver le diagnostic