Comment ChatGPT et Perplexity sélectionnent leurs sources : le fonctionnement du retrieval RAG
Comprendre pourquoi une IA cite un concurrent plutôt que vous nécessite de comprendre comment elle sélectionne ses sources. Ce n'est pas aléatoire — c'est algorithmique. Et c'est optimisable.
Deux mécanismes de citation distincts
Les LLM utilisent deux mécanismes fondamentalement différents pour générer une réponse :
1. La mémoire paramétrique (training data)
C'est ce que le modèle a appris pendant son entraînement. Des milliards de pages web, d'articles, de forums ont été ingérés et compressés dans les paramètres du modèle.
Quand ChatGPT répond sans accès internet, il puise dans cette mémoire. Une marque bien représentée dans les données d'entraînement — parce qu'elle a été souvent mentionnée sur le web avant la date de coupure du modèle — sera naturellement citée plus souvent.
Délai pour intégrer la mémoire paramétrique : 6-12 mois (temps entre la publication d'un contenu et le prochain cycle d'entraînement du modèle).
2. Le retrieval augmenté (RAG)
RAG = Retrieval Augmented Generation. Le modèle interroge des sources en temps réel avant de générer sa réponse.
C'est le mécanisme utilisé par :
- Perplexity (par défaut)
- ChatGPT avec la navigation web activée
- Gemini avec Google Search intégré
- Claude avec la recherche web
Délai pour être cité via RAG : 6,8 jours en médiane (Profound, relayé par Leptidigital, mai 2026 [ENTREPRISE]).
Comment le RAG sélectionne ses sources
Le processus RAG se décompose en 4 étapes :
Étape 1 — Reformulation de la requête
Le modèle transforme la question de l'utilisateur en requête(s) de recherche. "Quel cabinet cybersécurité pour ma PME ?" devient plusieurs requêtes précises interrogeant différentes sources.
Étape 2 — Récupération des documents
Le moteur de recherche intégré récupère les N documents les plus pertinents. L'indexation Bing joue un rôle important ici — ChatGPT utilise Bing pour le retrieval web.
Étape 3 — Scoring de pertinence et d'autorité
Parmi les documents récupérés, le modèle évalue :
- Pertinence sémantique : le document répond-il vraiment à la question ?
- Autorité de la source : est-ce une publication reconnue, un annuaire officiel, une étude citée ?
- Fraîcheur : le contenu est-il récent ?
- Cohérence : plusieurs sources disent-elles la même chose ?
Étape 4 — Génération avec attribution
Le modèle génère la réponse en s'appuyant sur les documents sélectionnés, en citant les sources utilisées (sur Perplexity) ou en les intégrant sans citation explicite (sur ChatGPT standard).
Pourquoi 82 % des citations viennent de sources tierces
Un chiffre contre-intuitif : 82 % des citations IA proviennent de sources tierces, pas du site officiel de la marque (omnibound.ai 2026 [BENCHMARK]).
L'explication est logique une fois qu'on comprend le RAG :
Le modèle cherche à donner une réponse vérifiable et multi-sourcée. Une information qui apparaît uniquement sur votre site est moins "certaine" qu'une information confirmée par plusieurs sources indépendantes.
Un annuaire professionnel qui vous liste, un article de presse qui vous cite, une étude sectorielle qui vous mentionne — ces sources tierces sont exactement ce que le RAG valorise.
Implication pratique : optimiser votre site est nécessaire mais insuffisant. La stratégie de digital PR — obtenir des mentions dans des sources tierces autoritaires — est le levier principal de la visibilité RAG.
Reddit et Stack Exchange : 18-40 % des citations
Un autre chiffre surprenant : Reddit, Stack Exchange et les forums de discussion représentent 18 à 40 % des citations selon les moteurs (AI Citation Source Index 2026 [BENCHMARK]).
Pourquoi ? Ces plateformes sont perçues comme des sources d'expérience réelle — des utilisateurs qui ont effectivement utilisé un produit ou un service, pas du contenu promotionnel.
Pour un prestataire B2B, être mentionné positivement dans des discussions Reddit ou sur des forums professionnels (Slack communities sectorielles, Discord, forums Agoria...) génère des citations LLM disproportionnées par rapport à l'effort investi.
Ce que vous pouvez contrôler
| Levier | Impact RAG | Délai | Effort | |---|---|---|---| | Indexation Bing (robots.txt) | Élevé | Immédiat | Faible | | Fichier llms.txt | Modéré | Immédiat | Faible | | Schema.org structuré | Élevé | 2-4 semaines | Moyen | | Contenu FAQ sur le site | Élevé | 2-8 semaines | Moyen | | Mentions dans annuaires pros | Très élevé | 1-4 semaines | Faible | | Articles dans médias sectoriels | Très élevé | 1-4 semaines | Élevé | | Présence forums/communautés | Élevé | Variable | Moyen |
Ce que vous ne pouvez pas contrôler directement
- La date de mise à jour des données d'entraînement du modèle
- L'algorithme de ranking interne du RAG (non documenté)
- Les hallucinations (le modèle peut citer votre concurrent avec de fausses informations)
C'est pourquoi le monitoring continu est indispensable : pas seulement pour mesurer si vous êtes cité, mais pour vérifier ce qui est dit de vous.
Vous voulez savoir ce que ChatGPT et Perplexity disent aujourd'hui de votre entreprise ? Obtenez votre Snapshot gratuit — 30 prompts testés, résultats en 48h.

