---
title: Comment ChatGPT et Perplexity choisissent leurs sources
description: Comment fonctionne la recherche augmentée d'un moteur génératif, ce qui décide qu'une page est citée plutôt qu'une autre, et ce qui se vérifie côté site.
url: https://www.agence-de-communication-pau.fr/guides/comment-les-moteurs-generatifs-choisissent/
sources: Volumes Google Ads (relevé du 29/08/2026), SERP Google organique live
licence: Chiffres réutilisables en citant la source et la date de relevé.
---

Comment ChatGPT et Perplexity choisissent leurs sources 

 Aller au contenu 

 Accueil / Guides / Comment les moteurs génératifs choisissent leurs sources

 geo 
# Comment les moteurs génératifs choisissent leurs sources
 J'ai posé la même question à trois assistants. Deux ont cité la même page, un troisième une page que je ne connaissais pas. Aucune des trois n'était la mieux classée dans Google. 

## Parlons de votre projet

 Un rappel sous 24 h ouvrées. Sans engagement.

 Par Aurélie Ducasteaux · 3 septembre 2026

## Le mécanisme, en clair
 Quand un assistant répond avec des sources, il ne fouille pas dans sa mémoire. Il fait une recherche, lit quelques pages, et rédige à partir de ce qu'il a lu. Ce mécanisme s'appelle la génération augmentée par la recherche.
 Il se décompose en quatre temps, et chacun est un endroit où votre page peut être retenue ou écartée.
 La reformulation. Le modèle transforme votre question en une ou plusieurs requêtes de recherche. Une question longue produit souvent trois ou quatre requêtes différentes. Ce ne sont plus vos mots.
 La récupération. Un moteur de recherche renvoie des résultats pour ces requêtes. Selon l'assistant, c'est un moteur commercial partenaire ou un index maison. C'est l'étape où votre présence dans un index classique compte encore beaucoup.
 La sélection. Le système ne lit pas tout. Il retient quelques pages, souvent moins de dix, et souvent des extraits de ces pages plutôt que la page entière. C'est l'étape la plus déterminante et la moins visible.
 La rédaction. Le modèle écrit une réponse à partir de ces extraits, en citant tout ou partie des sources. Le choix de ce qui est cité dépend de ce qui a servi à formuler la réponse.

## Ce qui décide à l'étape de sélection
 Il n'existe pas de documentation publique détaillée sur ces mécanismes, et il faut le dire plutôt que de fabriquer des certitudes. Ce qui suit vient d'observations répétées, pas d'un document officiel.
 L'extractibilité. Un passage qui répond à la question dans un bloc court, autonome, compréhensible sans le reste de la page, est bien plus souvent retenu qu'une réponse dispersée sur quatre paragraphes. La structure importe autant que le contenu.
 La correspondance avec la requête reformulée. Comme la question a été reformulée, une page qui traite littéralement la formulation d'origine n'est pas forcément retenue. Traiter plusieurs formulations d'une même question, dans la page, augmente les chances.
 La fraîcheur, sur les sujets qui bougent. Sur une question dont la réponse a changé récemment, les pages récentes sont favorisées, souvent au détriment de pages plus complètes mais anciennes.
 La spécificité. Une page qui donne un chiffre, une date, une valeur précise est plus utile à un modèle qui doit rédiger une réponse factuelle qu'une page qui décrit un principe général. C'est le renversement le plus intéressant par rapport au référencement classique : ici, le détail vérifiable vaut mieux que le tour d'horizon.
 La convergence. Quand plusieurs sources indépendantes disent la même chose, cette information est retenue avec plus de confiance. Une information que vous êtes seul à publier est reprise avec plus de réserve, ou attribuée explicitement.

## Ce qui ne décide pas, ou beaucoup moins
 La position dans les résultats classiques. Elle compte pour entrer dans le lot récupéré, elle ne décide pas de la citation. J'ai vu à plusieurs reprises des pages en huitième position citées quand la première ne l'était pas.
 Le volume de la page. Un texte de cinq mille mots n'est pas mieux traité qu'un texte de mille mots qui répond directement. L'extrait retenu fait quelques phrases.
 Les optimisations de forme. La densité de mots-clés, les balises de titre, les mots en gras : rien de tout cela ne pèse à l'étape de sélection, qui travaille sur du texte.

## Les différences entre assistants
 Elles sont réelles et elles changent la façon dont on est cité.
 Certains assistants cherchent systématiquement et citent abondamment, avec des liens numérotés dans la réponse. Ils se comportent comme des moteurs de recherche qui rédigent, et le trafic qu'ils envoient est mesurable.
 D'autres ne cherchent que lorsque la question l'appelle : sur une question générale, ils répondent de mémoire, sans source. La citation est alors rare et le trafic quasi nul.
 Les résumés générés intégrés aux moteurs de recherche classiques constituent un troisième cas. Ils citent des sources, souvent en retrait visuel, et leur effet sur les clics fait débat. Ce qui est observable sur des sites que je suis : les impressions restent, les clics baissent sur les requêtes purement informationnelles. Je n'ai pas de mesure généralisable, et je me méfie des chiffres qui circulent sur ce point.

## Ce qui se vérifie, côté site
 Quatre choses, et elles sont toutes gratuites.
 Le contenu est-il lisible sans exécuter de script ? Beaucoup de robots de collecte lisent le HTML brut. Un texte produit par du JavaScript côté navigateur peut n'être vu par personne. Le test : désactiver JavaScript et regarder si la page est vide.
 Les robots sont-ils autorisés ? Le fichier de directives à la racine du site peut bloquer les robots des assistants, qui portent des noms distincts de ceux des moteurs classiques. C'est une décision, dans un sens ou dans l'autre, et beaucoup de sites la subissent sans l'avoir prise.
 Les réponses sont-elles extractibles ? Une question posée en intertitre, une réponse dans le paragraphe qui suit, autonome et compréhensible seule. C'est la forme qui se prête le mieux à l'extraction, et elle est aussi celle qui se lit le mieux.
 Les faits sont-ils datés et sourcés ? Une phrase qui dit « selon telle source, relevé à telle date » se cite proprement. Une affirmation sans source se cite mal, ou se cite avec une réserve.

## Ce qu'on ne peut pas mesurer, et qu'il faut assumer
 C'est la partie inconfortable, et elle mérite d'être écrite plutôt qu'esquivée.
 Les assistants ne fournissent pas de tableau de bord aux éditeurs. On ne sait pas combien de fois une page a été lue par un modèle, ni combien de réponses elle a alimentées. Le trafic référent est partiellement identifiable dans les journaux du serveur, et il est faible en volume.
 Ce qui se mesure, en le faisant à la main : poser régulièrement les dix questions qui comptent pour votre activité aux principaux assistants, et noter qui est cité. C'est artisanal, cela prend une heure par trimestre, et c'est aujourd'hui la seule observation directe disponible.
 Ce que j'en conclus pour l'instant : ce chantier ne justifie pas un budget séparé. Il justifie que le travail éditorial soit fait d'une certaine façon, qui se trouve être aussi celle qui sert les lecteurs.

## Le cas des requêtes locales, qui se comporte à part
 C'est l'observation qui m'a le plus surprise en refaisant l'exercice sur des questions du Béarn.
 Sur une question du type « où faire imprimer des cartes de visite à Pau », les assistants ne se comportent pas comme sur une question générale. Deux d'entre eux basculent sur des sources d'annuaire, de cartographie ou de plateforme d'avis, exactement comme le bloc local d'un moteur classique. Les sites d'entreprise, eux, apparaissent peu, et quand ils apparaissent c'est en général par une page qui traite le sujet et non par la page d'accueil.
 Trois conséquences pratiques pour une activité locale.
 La fiche d'établissement compte ici comme ailleurs, et probablement plus : c'est une source structurée, à jour, avec des horaires et une adresse, exactement ce dont un modèle a besoin pour composer une réponse factuelle.
 Les annuaires professionnels et sectoriels ne sont pas morts. Ils sont même surreprésentés dans ce que remontent les assistants sur les questions locales, parce que ce sont des pages qui listent, comparent et situent, ce qui correspond à la forme d'une réponse attendue.
 La page qui traite le sujet l'emporte sur la page qui vend. Une page « imprimeur à Pau » qui explique ce qu'un atelier local fait, quels délais il tient et ce qu'il faut lui fournir a plus de chances d'alimenter une réponse qu'une page de présentation d'entreprise.

## Ce qui se passe quand plusieurs sources se contredisent
 Le cas est fréquent sur les sujets techniques, et il est instructif.
 Quand deux pages retenues disent des choses différentes, les assistants ne tranchent pas toujours de la même façon. Certains présentent les deux versions en attribuant chacune à sa source, ce qui est le comportement le plus honnête. D'autres retiennent la version majoritaire sans signaler qu'une autre existe. D'autres encore fusionnent, ce qui produit parfois une phrase qu'aucune des deux sources ne contient.
 Ce dernier cas est celui qui pose le plus de problèmes, et il explique une partie des affirmations étranges qu'on lit dans ces réponses. Il explique aussi pourquoi une source qui date et qualifie ses affirmations est mieux traitée : une phrase du type « selon telle source relevée à telle date, la valeur est de tant » se recopie difficilement de travers, alors qu'une affirmation nue se fond dans n'importe quoi.
 C'est un argument de plus pour une pratique qui n'a rien de nouveau : écrire d'où vient ce qu'on affirme.

## Questions fréquentes
 Faut-il optimiser son site pour les moteurs génératifs ?
 Il n'y a pas de technique distincte à appliquer aujourd'hui. Ce qui semble compter, c'est la structure des réponses, leur autonomie, la présence de faits datés et sourcés, et l'accessibilité du contenu sans exécution de script. Toutes ces choses servent aussi les lecteurs et le référencement classique.
 Les assistants envoient-ils du trafic ?
 Peu, et cela dépend beaucoup de l'assistant : ceux qui citent abondamment avec des liens en envoient de façon mesurable, ceux qui répondent de mémoire n'en envoient presque pas. Sur les sites que je suis, ce trafic reste marginal en volume, avec un taux d'engagement souvent supérieur à la moyenne.
 Comment savoir si mon site est cité ?
 En posant vous-même les questions qui comptent pour votre activité aux principaux assistants, et en notant qui est cité. Il n'existe pas de tableau de bord fourni aux éditeurs. Une heure par trimestre suffit pour suivre l'évolution sur une dizaine de questions.
 Faut-il bloquer les robots des IA ?
 C'est une décision d'entreprise, pas une évidence technique. Les bloquer protège le contenu d'un usage d'entraînement et supprime toute chance d'être cité comme source. Les autoriser fait l'inverse. Le point important est que ce soit une décision prise, et non un réglage par défaut hérité d'un modèle de site.
 Une page ancienne peut-elle encore être citée ?
 Oui, et c'est même fréquent sur les sujets stables : une page de référence de 2019 sur une notion technique reste une bonne source. La fraîcheur pèse surtout quand la question porte sur quelque chose qui a changé récemment, une réglementation, un prix, une version d'outil. Sur ces sujets-là, une date de mise à jour visible et exacte compte davantage que l'ancienneté du texte.
 Faut-il écrire des pages spécialement pour les assistants ?
 Non. Les pages qui alimentent le mieux ces réponses sont celles qui traitent une question précise, avec des faits datés, dans une structure où chaque réponse se suffit à elle-même. Ce sont aussi les meilleures pages pour un lecteur pressé et pour un moteur classique. Créer un second corpus destiné aux machines reviendrait à écrire deux fois la même chose, moins bien.

## À lire ensuite
 Sur le même axe éditorial.
 geo Ce qu'un modèle de langage lit vraiment de votre site geo Être cité par une IA : ce qui se vérifie et ce qui ne se promet pas geo Un logo fait par une IA : ce qui se passe quand il faut le poser sur une façade geo Des visuels faits par IA envoyés à l'imprimeur : ce que la machine en fait
