Comment un LLM choisit ses sources

Mise à jour : 2026-09-21 · 592 mots · 3 min

Définition

Un LLM connecté au web choisit ses sources en deux temps : il récupère quelques centaines de pages dans un index de recherche, puis ne cite que celles dont un passage répond seul à la question et vient d’un émetteur qu’il juge crédible et à jour.

À quoi ça sert

  • Savoir ce qui se travaille : quatre critères reviennent d’un moteur à l’autre — l’autonomie du passage, la crédibilité de l’émetteur, la fraîcheur, la densité de faits vérifiables.
  • Relativiser le classement : en première position sur Google, une page a environ une chance sur trois d’être citée ; en dixième, encore une sur huit. Le choix final se fait passage par passage, pas page par page.
  • Ne pas en faire une science exacte : aucun moteur ne publie ses critères. Ce que l’on en sait vient d’un papier académique, d’études tierces et de rétro-ingénierie — des tendances, pas des règles.

Comment faire

  1. Entrez dans les deux index. ChatGPT et Copilot passent par Bing, les AI Overviews par Google, Perplexity par son propre robot. Hors de l’index, vous n’êtes même pas candidat.
  2. Rendez chaque passage autonome. Il s’ouvre sur la réponse, nomme son sujet, se comprend sans le reste de la page.
  3. Mettez des preuves dans le texte. Citations d’experts et statistiques sourcées sont les deux stratégies les plus efficaces des neuf testées par le papier fondateur du GEO.
  4. Citez vos propres sources. Un texte qui référence ce qu’il avance signale sa rigueur. L’effet profite surtout aux sites qui ne sont pas premiers : +115 % de visibilité pour un site en cinquième position (Aggarwal et al., KDD 2024).
  5. Datez et tenez à jour. Date de mise à jour visible dans la page, dateModified dans les données structurées, révision trimestrielle des pages qui comptent.
  6. Faites exister l’émetteur. Auteur nommé avec ses titres, page « À propos » détaillée, mentions cohérentes de la marque ailleurs sur le web. Le moteur cherche qui parle avant de citer.
Des pages récupérées aux sources citéesEntonnoir à cinq étages : de 200 à 500 pages récupérées, puis celles qui sont proches du sujet, celles que leur autorité fait retenir, celles dont un passage est autonome, et enfin les 5 à 15 sources citées.Pages récupérées200 à 500Proches du sujettri sémantiqueJugées crédiblestri d’autoritéPassages autonomestri par passageSources citées5 à 15
À chaque étage, un critère différent élimine

Les 3 erreurs

  • Compter sur l’autorité du domaine. Elle aide à entrer parmi les candidats ; elle ne décide pas du choix final. Un site modeste, précis et sourcé passe devant un grand nom resté vague.
  • Bourrer de mots-clés. C’est la seule des neuf stratégies testées qui fait baisser la visibilité : −8,7 % (Aggarwal et al., KDD 2024). Le modèle évalue la substance, pas la répétition.
  • Prendre une estimation pour une spécification. « 134 à 167 mots » ou « 15 entités » sont des hypothèses de rétro-ingénierie. Utiles comme direction, absurdes comme cible au mot près.

Repères

Critère Ce que l’on en sait Source et niveau de preuve
Entonnoir 200 à 500 pages candidates, 5 à 15 citées ZipTie.dev, rétro-ingénierie des AI Overviews
Taille du passage évalué environ 134 à 167 mots ZipTie.dev, estimation
Densité d’entités 15 entités reconnues ou plus : sélection 4,8 fois plus probable ZipTie.dev, non confirmé par Google
Preuves dans le texte citations d’experts +42,6 %, statistiques +32,8 % de visibilité Aggarwal et al., KDD 2024
Fraîcheur sans mise à jour trimestrielle, trois fois plus de risque de perdre ses citations Otterly.AI, étude d’éditeur
Classement organique 33,1 % de chances d’être cité en position 1, 13,0 % en position 10 The Digital Bloom

Critère de réussite : chaque page que vous voulez voir citée contient au moins un passage autonome, daté, qui porte un chiffre sourcé et dont l’auteur est nommé.

Voir aussi