---
title: Référencement IA : comment ChatGPT, Perplexity et Copilot trouvent leurs sources
description: Référencement IA assistant par assistant : les robots de ChatGPT, Perplexity, Copilot et Gemini, ce qu'ils lisent, ce que bloque le robots.txt, et ce qu'on peut régler soi-même.
url: https://www.agence-de-communication-pau.fr/geo/referencement-ia/
sources: Volumes Google Ads (relevé du 29/08/2026), SERP Google organique live
licence: Chiffres réutilisables en citant la source et la date de relevé.
---

Référencement IA : comment ChatGPT, Perplexity et Copilot trouvent leurs sources 

 Aller au contenu 

 Accueil / GEO et visibilité dans les IA / Le référencement IA, assistant par assistant

 GEO et visibilité dans les IA 
# Le référencement IA, assistant par assistant
 On parle des « IA » comme d'un bloc. En pratique, chaque assistant a ses robots, ses règles d'accès et ses sources de recherche. Un réglage oublié dans un fichier de quelques lignes peut rendre un site invisible pour l'un et pas pour l'autre. 
 
 Vallée pyrénéenne verte semée de rochers, sous les crêtes 

## Parlons de votre projet

 Un rappel sous 24 h ouvrées. Sans engagement.

 Par Florian Bourret Gérant de Happiness, consultant SEO mis à jour le 3 octobre 2026 

## Deux façons de connaître votre site
 Un assistant peut savoir des choses sur votre entreprise de deux manières.
 La première, c'est l' entraînement . Le modèle a lu une grande quantité de textes à une date donnée, et il en a retenu des régularités. Ce qu'il en restitue n'est pas daté, rarement sourcé, et ne se corrige pas de l'extérieur.
 La seconde, c'est la recherche en direct . Quand la question l'exige, l'assistant lance des recherches, ouvre des pages, et rédige sa réponse en s'appuyant sur ce qu'il a lu, souvent avec des liens. C'est cette seconde voie qui concerne le référencement IA, parce qu'elle dépend de l'accès à votre site et de sa présence dans des index.
 Les éditeurs séparent d'ailleurs ces deux usages dans leurs robots. C'est le point le plus utile de cette page, et le premier à vérifier dans toute démarche de GEO .

## ChatGPT
 OpenAI documente plusieurs robots, chacun avec un rôle distinct.
 OAI-SearchBot sert à faire apparaître des sites dans les fonctions de recherche de ChatGPT. Selon OpenAI, un site qui le bloque n'apparaîtra pas dans les réponses de recherche.
 GPTBot collecte des contenus susceptibles de servir à l'entraînement des modèles. Le bloquer indique que vos pages ne doivent pas servir à cet entraînement.
 ChatGPT-User intervient quand un utilisateur demande à ChatGPT de consulter une page. OpenAI précise que les règles du robots.txt peuvent ne pas s'appliquer à ces visites, puisqu'elles sont déclenchées par une personne.
 La conséquence pratique est simple : on peut refuser l'entraînement (GPTBot) tout en restant visible dans la recherche (OAI-SearchBot). Les deux réglages sont indépendants.
 La FAQ d'OpenAI destinée aux éditeurs ajoute deux précisions. ChatGPT peut afficher des liens et des titres de pages obtenus auprès de fournisseurs de recherche tiers, même si ces pages sont interdites à son robot ; pour l'éviter, OpenAI renvoie à la balise noindex, à condition que le robot puisse lire la page. Et ChatGPT ajoute automatiquement le paramètre utm_source=chatgpt.com aux liens qu'il envoie, ce qui permet de repérer ces visites dans un outil de mesure d'audience.
 Ce que la FAQ ne dit pas, en revanche : comment améliorer son classement dans les réponses de ChatGPT. OpenAI ne publie aucune règle de ce type.

## Perplexity
 Perplexity documente deux robots.
 PerplexityBot sert à faire apparaître et à lier des sites dans les résultats de Perplexity. Perplexity écrit qu'il n'est pas utilisé pour collecter des contenus destinés à entraîner des modèles de fondation. Pour apparaître dans Perplexity, il doit être autorisé dans le robots.txt.
 Perplexity-User visite une page quand un utilisateur pose une question qui le demande. Perplexity indique que ce robot ignore en général les règles du robots.txt, pour la même raison que chez OpenAI : la visite est déclenchée par une personne.
 Perplexity a la particularité d'afficher ses sources de façon très visible, en tête de réponse. C'est l'assistant où l'on voit le plus facilement si l'on est cité, et c'est souvent par lui que je commence un relevé manuel.

## Copilot et Bing
 Copilot, l'assistant de Microsoft, s'appuie sur Bing. Pour un site, la porte d'entrée est donc Bingbot et l'index de Bing, avec un outil gratuit que beaucoup de PME n'ont jamais ouvert : Bing Webmaster Tools.
 Microsoft y a lancé le 10 février 2026, en version bêta, un rapport appelé « AI Performance ». D'après Search Engine Land, il montre combien de fois les pages d'un site sont citées dans Copilot, dans les résumés IA de Bing et chez certains partenaires, avec la liste des pages citées et des exemples de requêtes utilisées par l'IA pour aller chercher le contenu. Microsoft précise que ces chiffres n'indiquent ni un classement ni la part d'une page dans une réponse.
 C'est aujourd'hui le seul rapport, chez un grand acteur, qui montre des citations et un échantillon de requêtes. Rien que pour cela, l'inscription d'un site à Bing Webmaster Tools vaut l'heure qu'elle prend.

## Gemini et Google
 Côté Google, la situation est plus simple et plus contraignante à la fois. Les AI Overviews et le mode IA utilisent l'index de Google Search, donc Googlebot. Il n'existe pas de robot séparé à autoriser.
 Google propose un jeton à part, Google-Extended , à placer dans le robots.txt. Sa documentation précise qu'il sert à limiter l'utilisation des contenus pour l'entraînement de l'IA et pour l'ancrage ( grounding ) dans certains autres systèmes de Google. Il n'agit pas sur la recherche. Pour sortir des aperçus IA et du mode IA, Google a créé un réglage spécifique dans la Search Console, décrit sur la page AI Overviews et mode IA .

## Le robots.txt, en pratique
 Le fichier robots.txt est un petit fichier texte placé à la racine du site. Il dit aux robots ce qu'ils peuvent explorer. Il ne se voit pas, personne ne le relit, et c'est là que se cachent les mauvaises surprises.
 Ce que j'ai rencontré le plus souvent en regardant des sites de petites structures :
 une ligne « Disallow: / » héritée de la période de développement, jamais retiré ;
 des règles copiées d'un modèle trouvé en ligne, qui bloquent « tous les robots d'IA » sans distinguer entraînement et recherche ;
 un fichier correct, mais un pare-feu ou un service d'hébergement qui bloque les robots en amont, sans que le robots.txt n'y soit pour rien.
 Ce dernier cas est plus fréquent depuis que Cloudflare, l'un des principaux fournisseurs de protection de sites, a annoncé bloquer par défaut les robots d'IA sur les nouveaux domaines de ses clients, à partir du 1er juillet 2025 (MIT Technology Review). Le choix peut être légitime. Il mérite simplement d'être fait en connaissance de cause, robot par robot.
 Un fichier qui refuse l'entraînement mais reste ouvert à la recherche contient, robot par robot, les règles suivantes :

| Robot | Ce qu'il fait | Règle dans ce cas |
|---|---|---|
| GPTBot | Collecte pour l'entraînement des modèles d'OpenAI | Disallow: / |
| Google-Extended | Entraînement et ancrage dans certains systèmes de Google, hors recherche | Disallow: / |
| OAI-SearchBot | Apparition dans la recherche de ChatGPT | Allow: / |
| PerplexityBot | Apparition dans les résultats de Perplexity | Allow: / |
| Googlebot et Bingbot | Recherche Google, aperçus IA, Bing et Copilot | Allow: / |

 Ce tableau illustre un choix possible, à ne pas recopier sans réfléchir. Refuser l'entraînement peut avoir un coût que personne ne sait mesurer aujourd'hui : un modèle qui n'a jamais lu votre site en sait moins sur vous. Je n'ai pas de recommandation universelle, seulement une exigence : que la décision soit prise par quelqu'un qui sait ce qu'il bloque.

## Ce qui ne se règle pas
 Une fois l'accès ouvert, l'essentiel échappe au propriétaire du site. Aucun des éditeurs cités ne publie de règle de classement pour ses réponses. Les réponses varient d'une exécution à l'autre, selon le compte, la localisation et la formulation.
 Ce qui reste entre vos mains, c'est ce que les robots trouvent quand ils arrivent : un texte lisible sans JavaScript, des pages présentes dans les index de Google et de Bing, des informations cohérentes sur l'entreprise, et des contenus qui répondent nettement. Les deux pages suivantes de cette section traitent de la cohérence des informations, avec les données structurées et les entités , et de la forme des contenus, avec écrire une page citable .

## Ce que je vérifie en une heure
 Ouvrir l'adresse votresite.fr/robots.txt et lire chaque bloc, en cherchant les noms GPTBot, OAI-SearchBot, PerplexityBot, Google-Extended, Bingbot.
 Demander à l'hébergeur ou au prestataire si un pare-feu filtre les robots d'IA, et lesquels.
 Vérifier que le site est inscrit dans la Search Console et dans Bing Webmaster Tools, avec un plan de site déclaré dans les deux.
 Afficher une page importante avec JavaScript désactivé : le texte principal est-il là ?
 Poser à ChatGPT, Perplexity et Copilot trois questions où l'entreprise devrait logiquement apparaître, et noter les sources citées.
 Rien de tout cela ne demande de budget. Ça demande d'y penser.

## Sources
 Robots OAI-SearchBot, GPTBot et ChatGPT-User : documentation officielle d'OpenAI sur ses robots, consultée le 3 octobre 2026.
 Paramètre utm_source=chatgpt.com, fournisseurs de recherche tiers et noindex : OpenAI, FAQ « Publishers and developers », consultée le 3 octobre 2026.
 Robots PerplexityBot et Perplexity-User : documentation officielle de Perplexity, consultée le 3 octobre 2026.
 Rapport « AI Performance » de Bing Webmaster Tools : annonce de Microsoft du 10 février 2026, relayée par Search Engine Land.
 Google-Extended et réglage de la Search Console : Google Search Central, « AI features and your website », mise à jour du 10 décembre 2025, et aide officielle Google Search Console.
 Blocage par défaut des robots d'IA par Cloudflare : MIT Technology Review, 1er juillet 2025.
 Volumes de recherche (« référencement ia » environ 390 recherches mensuelles, « chatgpt search » 480) : mesure propre au projet, DataForSEO, France, 3 octobre 2026.

## Dans le même cocon
 On remonte à la page mère, puis on passe à la page sœur suivante. Aucun lien direct vers un autre cocon.
 page mère Le GEO à Pau, ou la visibilité dans les IA page sœur Les AI Overviews et le mode IA de Google page sœur Données structurées et entités 

## Questions fréquentes
 Comment référencer son site sur ChatGPT ?
 Il n'existe pas d'inscription. Le site doit être accessible au robot OAI-SearchBot, que la documentation d'OpenAI relie à l'apparition dans la recherche de ChatGPT, et être présent dans les index de recherche. Ensuite, les contenus doivent répondre nettement aux questions posées. Personne ne peut garantir une citation.
 Bloquer GPTBot fait-il disparaître de ChatGPT ?
 Non, d'après la documentation d'OpenAI : GPTBot concerne l'entraînement des modèles, OAI-SearchBot l'apparition dans la recherche de ChatGPT. Les deux se règlent séparément dans le robots.txt.
 Perplexity respecte-t-il le robots.txt ?
 Perplexity indique que PerplexityBot, son robot d'indexation, doit être autorisé pour qu'un site apparaisse dans ses résultats. Son second robot, Perplexity-User, qui agit à la demande d'un utilisateur, ignore en général le robots.txt selon la documentation de Perplexity.
 Comment apparaître dans Copilot ?
 Copilot s'appuie sur Bing. Le site doit donc être exploré et indexé par Bing. Bing Webmaster Tools propose depuis février 2026, en bêta, un rapport qui montre les citations d'un site dans Copilot et dans les résumés IA de Bing.
 Google-Extended retire-t-il un site des AI Overviews ?
 Non. Selon Google, Google-Extended limite l'usage des contenus pour l'entraînement et l'ancrage dans certains autres systèmes de Google, pas dans la recherche. Pour les aperçus IA et le mode IA, il existe un réglage dédié dans la Search Console.

 × Offre site spécial IA
 Votre site de 20 à 30 pages, plus 25 articles programmés
 Rédigé et illustré par IA, optimisé SEO et GEO, hébergé en HTML sur Cloudflare, sans base de données. Le site vous appartient.
 1 200 € HT, nom de domaine en plus
 Voir l’offre
