Tenten AIGEO
Retour au blog
Fondamentaux du GEO et de l’AEOÉvaluation

Comment un LLM choisit-il les sources qu’il cite ? Les signaux clés qui influencent les citations par l’IA

Comment un LLM choisit-il ses sources ? Cet article décrypte les deux niveaux d’un moteur génératif : la recherche, qui évalue la pertinence sémantique et la segmentation des paragraphes, puis la génération, qui détermine si la réponse est facile à extraire, corroborée et digne de confiance. Vous découvrirez les principaux signaux qui influencent les citations par l’IA, ainsi que trois actions que les entreprises B2B taïwanaises peuvent mettre en œuvre immédiatement.

L’équipe Tenten GEOPublié le 2025-11-234 min de lecture
Illustration abstraite : une douce lumière lavande sélectionne un paragraphe parmi des passages en suspension et le relie à un nœud de marque lumineux, symbolisant la manière dont un LLM choisit des citations parmi de nombreuses sources.

Un LLM ne commence pas par « trouver la meilleure page web » avant de la citer. Il repère d’abord un ensemble de passages suffisamment proches de la question sur le plan sémantique, puis choisit celui qui se prête le mieux à la formulation de la réponse. Votre probabilité d’être cité dépend donc souvent moins de la qualité globale de l’article que de la capacité d’un passage précis à être extrait proprement et à répondre seul à la question. Pour savoir quoi optimiser, il faut comprendre ces deux niveaux.

Une citation se joue à deux niveaux, pas sur un score unique.

À l’heure actuelle, les moteurs génératifs comme ChatGPT search, Perplexity, Gemini et Google AI Overviews suivent généralement une logique de génération augmentée par la recherche (RAG). Lorsqu’un utilisateur pose une question, le moteur recherche ou récupère immédiatement dans son index des dizaines de contenus candidats. Le modèle les lit ensuite, reformule les informations en une réponse et en indique les sources. Pour que votre contenu soit cité, il doit d’abord ressortir au niveau de la « recherche », puis être jugé suffisamment pertinent pour intégrer la réponse au niveau de la « génération ».

Ces deux niveaux n’évaluent pas les mêmes critères, et c’est là que de nombreuses démarches GEO s’enlisent. La recherche s’intéresse à la pertinence sémantique du passage ; la génération vérifie s’il répond directement à la question, s’il est crédible et s’il concorde avec les autres sources. Un article bourré de mots-clés mais confus risque de ne même pas franchir la recherche. À l’inverse, un article bien récupéré mais dont la réponse n’apparaît qu’au huitième paragraphe sera souvent écarté lors de la génération. En confondant les deux niveaux, vous optimisez au mauvais endroit.

Niveau recherche : le modèle peut-il d’abord vous « trouver » ?

La recherche repose sur une comparaison vectorielle. Le moteur convertit la question et chacun de vos paragraphes en ensembles de nombres, appelés embeddings, puis mesure quels passages sont sémantiquement les plus proches de la question. Le point essentiel : il compare la proximité du sens, et non la présence des mêmes mots. Inutile, donc, de multiplier artificiellement les mots-clés sur la page. Veillez plutôt à ce que chaque paragraphe expose une idée de manière claire et complète, avec un sens assez précis pour être facilement comparé.

  • Pertinence sémantique : le passage doit répondre sans détour à une question précise, et non aborder vaguement un sujet général. Un paragraphe au propos flou produit un vecteur peu distinctif et sera facilement devancé par des passages concurrents plus précis.
  • Segmentation des paragraphes (chunking) : le moteur extrait les passages un par un, pas la page entière. Utilisez des sous-titres explicites, des paragraphes courts et des structures en questions-réponses afin que chaque passage puisse être isolé tout en restant compréhensible.
  • Couverture de l’index : le contenu doit pouvoir être exploré et indexé. Un texte bloqué par JavaScript, masqué derrière une page nécessitant une connexion ou intégré dans une image restera totalement invisible pour le modèle.
  • Fraîcheur : pour les sujets sensibles à l’actualité, le moteur privilégie les sources récemment mises à jour. Dans ce type de requête, les pages qui n’ont pas évolué depuis longtemps seront reléguées.

Niveau génération : « Le modèle ose-t-il vous citer ? »

Être retenu par la recherche ne constitue qu’une présélection. Le modèle reçoit une série de passages candidats, mais n’en cite que quelques-uns. Comment tranche-t-il ? Nous avons analysé, pour nos clients, les sources citées dans un grand nombre de réponses générées par l’IA. Les passages régulièrement sélectionnés cumulent presque toujours plusieurs caractéristiques. Plus la question exige précision et maîtrise du risque, plus ces critères deviennent déterminants.

  • La réponse arrive d’emblée : placez la conclusion, la définition ou les chiffres dès la première phrase du paragraphe. Le modèle privilégie les formulations directement réutilisables, plutôt que les idées qu’il doit reconstituer à partir de trois phrases.
  • L’affirmation est corroborée par plusieurs sources : lorsqu’une même information revient dans plusieurs sources crédibles, le modèle est plus enclin à la citer. Une déclaration publiée par un site à son propre sujet pèse bien moins qu’une affirmation confirmée par un tiers.
  • Les signaux de confiance sont explicites : auteur identifié, sources, dates de publication et de mise à jour, liens externes… Tous ces éléments aident le modèle à évaluer la fiabilité du contenu. Un texte anonyme et non daté sera moins bien considéré.
  • Le contenu est cohérent : les chiffres et les affirmations d’un même contenu ne doivent ni se contredire ni entrer manifestement en conflit avec des faits communément admis. Dans le cas contraire, le modèle choisira une source jugée plus « sûre ».
Infographie : un LLM commence par rechercher des passages candidats à l’aide de vecteurs, puis filtre les sources à citer selon la facilité d’extraction, la corroboration et la crédibilité.
Pour être cité, un contenu doit franchir deux niveaux : la recherche, qui évalue la pertinence sémantique et la segmentation des paragraphes, puis la génération, qui vérifie si la réponse est facile à extraire, corroborée et digne de confiance.

Pourquoi être cité et être bien classé sont deux choses différentes

En référencement naturel traditionnel, vous cherchez à améliorer le classement d’une page entière dans les résultats. En GEO, vous optimisez la probabilité qu’un « passage précis » de cette page soit extrait. D’où un résultat contre-intuitif : un article classé cinquième sur Google peut être cité par l’IA plus souvent qu’une page en première position, simplement parce que son deuxième paragraphe apporte une réponse immédiate et limpide, tandis que l’autre dissimule l’essentiel au milieu du texte. Le modèle ne s’arrête pas à votre position parmi les liens bleus. Il cherche, parmi les passages récupérés, celui qui s’intègre le mieux à sa réponse.

Le classement met les pages en concurrence pour obtenir des clics ; les citations les mettent en concurrence pour devenir les mots repris dans la réponse. Les mêmes contenus ne s’optimisent donc pas pour le même objectif final.Tenten GEO

En pratique, trois actions à engager en priorité

Une fois le mécanisme compris, les priorités d’optimisation deviennent assez claires. Il n’est pas nécessaire de réécrire l’ensemble du site. Commencez par sélectionner quelques questions étroitement liées à votre trafic ou à vos opportunités commerciales, puis concentrez vos efforts sur les pages correspondantes.

  1. Consacrez à chaque question clé un paragraphe autonome : formulez le sous-titre comme la question que posera l’utilisateur, donnez la réponse dès la première phrase, puis apportez le contexte.
  2. Ajoutez des signaux de confiance : auteur, dates de publication et de mise à jour, sources des informations et liens externes. Le moteur de génération aura ainsi de bonnes raisons de vous sélectionner.
  3. Suivez les citations, pas seulement le trafic : posez régulièrement ces questions clés aux moteurs d’IA et consignez les sources citées ainsi que les mentions de votre marque. C’est précisément le rôle d’un outil de suivi de la visibilité comme Brand Radar. Sans ces données, vous ne pouvez pas savoir que votre marque est absente des réponses de l’IA.

Obtenir une citation n’a rien de mystérieux : cela dépend d’une série de signaux que vous pouvez analyser et optimiser. Le contenu doit être accessible, répondre rapidement, être corroboré et inspirer confiance. La plupart des sites B2B ne manquent pas forcément de contenu ; leurs paragraphes et leurs réponses sont simplement structurés d’une manière qui ne convient ni aux lecteurs ni aux machines. Si vous souhaitez identifier le niveau auquel vos contenus sont bloqués, vous pouvez prendre rendez-vous pour un diagnostic GEO de 30 minutes. Nous testerons quelques questions réellement importantes pour votre activité afin d’observer les sources actuellement citées par l’IA.

Questions fréquentes

Sur quels critères un LLM choisit-il ses sources ?
Le choix s’effectue à deux niveaux. La recherche utilise une comparaison vectorielle pour repérer les passages dont le sens est le plus proche de la question et qui se segmentent facilement. La génération retient ensuite ceux qui répondent directement à la question, sont corroborés par plusieurs sources et présentent des signaux de crédibilité, comme un auteur et une date.
Faut-il être classé premier sur Google pour être cité par l’IA ?
Non. Le modèle cherche, parmi les passages récupérés, celui qui se prête le mieux à la formulation de sa réponse ; il ne se fonde pas uniquement sur le classement de la page. Un article classé cinquième, mais qui apporte une réponse claire dès la première phrase, peut être cité plus souvent qu’une page classée numéro 1 dont la réponse est enfouie au milieu du contenu.
Comment rendre un contenu plus facile à citer par un LLM ?
Prévoyez un paragraphe autonome pour chaque question clé. Formulez le sous-titre comme la question de l’utilisateur et donnez la réponse dès la première phrase. Ajoutez le nom de l’auteur, les dates de publication et de mise à jour ainsi que les sources des données. Enfin, suivez régulièrement les sources citées par l’IA, et pas seulement le trafic de votre site.

PASSEZ À L’ÉTAPE SUIVANTE

Votre marque apparaît-elle dans les réponses des IA ?

En 30 minutes, nous identifions vos écarts de visibilité sur les principaux moteurs IA et les actions à traiter en priorité.

Réserver le diagnostic