Pour la majorité des gens qui utilisent ChatGPT, les comptes gratuits, ce n’est ni Google ni votre position qui décide si vous entrez dans la réponse.
C’est Labrador, l’index propriétaire d’OpenAI. Une sorte d’index de recherche qu’OpenAI a travaillé en secret depuis quelques années.
En mode « Think » gratuit, ChatGPT va chercher près des trois quarts de ses sources dans cet index maison, et 3 % seulement dans Google, selon l’étude Resoneo (août 2026). Vous pouvez être premier sur Google et absent de la conversation.
Et ce que Labrador retient de vous tient dans un titre et environ 200 caractères, prélevés au début de votre page au moment du crawl, figés pendant des semaines, parfois servis à un autre utilisateur avant vous.
Ce n’est pas votre meta description. Ce n’est pas votre page. C’est un extrait fabriqué ailleurs, à un autre moment, et c’est sur lui, et lui seul, que le modèle décide de vous citer.
C’est le maillon que presque personne ne regarde. Voici ce qu’on en sait, et ce que ça doit changer dans votre stratégie GEO.
Sur quoi repose cet article. L’essentiel du reverse engineering vient de l’étude Resoneo (juillet-août 2026, 1 249 réponses ChatGPT capturées), complétée par les travaux de Peec AI sur la nature de l’index. J’y ajoute les données de nos propres études Qwairy, notamment l’étude Sources by Intent, pour en tirer la lecture stratégique. Les chiffres exacts bougent vite (voir la dernière section) : traitez-les comme une photographie datée, pas comme une constante.
Table des matières
Labrador, c’est quoi exactement ?

Labrador est l’index de recherche maison d’OpenAI. Pas du Bing rebadgé, pas un catalogue d’éditeurs sous licence : un index que ChatGPT interroge sans payer un tiers et sans attendre un scrape.
Pendant deux mois, ChatGPT l’a dit lui-même. Entre le 21 mai et le 21 juillet 2026, un champ result_source apparaissait dans les événements serveur de ChatGPT, avec quatre valeurs seulement : labrador, bright, oxylabs, serp, d’après Peec AI et l’étude Resoneo. Trois sont des fournisseurs de scraping externes : bright et oxylabs servent essentiellement du Google scrapé. Le premier, labrador, est l’index propre d’OpenAI. Le 21 juillet, le champ a disparu du flux du jour au lendemain : la fenêtre s’est refermée, mais elle avait déjà tout dit.
Deux preuves écartent les lectures faciles. Bing coupe les titres qu’il affiche à 75 caractères, jamais un de plus, or un quart des titres Labrador dépassent ce plafond (le plus long observé : 977 caractères). Ce ne peut pas être un scrape de Bing. Et l’existence d’un accord de licence ne change rien au traitement : des centaines de médias hors accord reçoivent exactement le même format que les partenaires. Labrador n’est donc ni du Bing déguisé, ni un club d’éditeurs payés : c’est un dépôt d’accès immédiats, selon l’étude Resoneo.
Deuxième chose à savoir : Labrador n’est pas un index, c’en est une famille. Peec AI en recense plusieurs, verticaux : web général, PDF, YouTube, actualités, arXiv, Wikipedia, local, finance, juridique, médical, shopping, images, chacun réglé pour un type de contenu.
C’est l’architecture que Google a mis vingt ans à construire : un index généraliste, plus des index spécialisés par-dessus. L’existence de Labrador est confirmée de deux côtés extérieurs à OpenAI : des témoignages dans le procès antitrust et des offres d’emploi OpenAI (DesignRush, Peec AI, septembre 2026).
La direction est claire. La stratégie d’OpenAI a toujours été la même : démarrer sur des fournisseurs externes comme Google, puis basculer chaque année davantage vers son propre index. Sur le shopping, on le voit en direct : une expérience A/B nommée prefer-index-over-serp-v3 touchait environ 8 % des conversations mi-août 2026, sur des tranches de trafic allant jusqu’à 20 % (Peec AI). Traduction : OpenAI teste activement le remplacement de Google par Labrador.
C’est votre question qui choisit le moteur
Voici le point qui devrait réorganiser votre stratégie. Sur un compte gratuit en mode instant, la famille de votre question décide seule du moteur consulté, selon l’étude Resoneo :
| Ce que l’utilisateur demande | Part Labrador | Part Google |
|---|---|---|
| Une information stable | ~100 % | 0 % |
| Un commerce, un lieu | ~100 % | 0 % |
| Un produit à acheter | ~100 % | 0 % |
| Une info « live » (score, résultat du jour) | ~50 % | ~50 % |
Le détail chiffré de l’étude Resoneo, pour situer : information stable 99,9 % Labrador (sur 2 136 snippets), produit 97,6 % (sur 1 392), info live 52,6 % Labrador et 46,1 % Google (sur 1 407). Attention à la portée : ces parts valent pour le mode instant d’un compte gratuit. En thinking payant, le rapport s’inverse et c’est Google scrapé qui domine sur les quatre familles. Autrement dit, seules les questions dont la réponse change dans la journée ouvrent la porte à Google sur le parcours grand public. Tout le reste, la plus grande part de ce qu’on demande à ChatGPT, ne sort jamais de l’index maison.
Et c’est là que nos propres données prolongent le reverse engineering de Resoneo. L’étude Resoneo décrit la plomberie : quel moteur répond à quelle question. Notre étude Sources by Intent (Qwairy, Q2 2026 : 150 requêtes françaises non brandées, 4 171 URLs citées, 1 819 domaines) décrit la conséquence stratégique : le mix de sources bascule complètement selon l’intention.
- Question tutoriel (« comment créer une SASU ? ») : 28 % de portails officiels (
.gouv.fr, CNIL…), 0 % d’agrégateurs. - Question recommandation (« meilleure banque en ligne pour un freelance ? ») : 0 % de sources officielles, 14 % d’agrégateurs, 7 % de forums.
- Question comparaison / alternatives ou locale : le contenu éditorial de marque domine presque seul (86 % et 89 %).
Même sujet, intentions différentes, mix de sources opposé. Plus frappant : sur un même sujet, une formulation critique (« pourquoi se méfier de X ? ») fait chuter les sources officielles de 11 % à 0,6 % (divisées par 18), pendant que forums et agrégateurs doublent.
Les deux études pointent la même vérité par deux bouts. Il n’y a pas une stratégie GEO. La verticale de Labrador qui vous concerne, et le mix de sources de votre intention, définissent un terrain de jeu différent pour chaque type de question. Un playbook généraliste laisse des portes fermées.
Ce que le modèle voit de vous : un titre et 200 caractères
Une fois ses recherches lancées, ChatGPT ne lit pas votre page. Il reçoit, pour chaque résultat, un titre, une URL et un snippet, exactement ce que vous obtenez en tapant une requête dans un moteur. C’est sur ce grounding, et sur lui seul, qu’il rédige et décide qui citer. La page n’est ouverte qu’à peine plus d’une fois sur 80, et uniquement en mode thinking, selon l’étude Resoneo.
Toujours selon l’étude Resoneo, le snippet Labrador suit des régularités précises :
- Il est coupé net un peu au-delà de 200 caractères.
- Il est pris au début du corps rendu de votre page, pas dans vos métadonnées. Votre meta description est ignorée par Labrador (elle reste utile pour les résultats Google scrapés, qui la reprennent une fois sur trois).
- Il est ancré sur votre H1 : quand la page en a un, le snippet le contient 8 fois sur 10 (83,6 % précisément), et le H1 en est le tout premier caractère 77 % du temps.
Décomposé, votre budget de représentation ressemble à ça : ~7 caractères qui traînent avant le H1, ~51 caractères de H1, puis ~146 caractères de contenu réel pour convaincre (valeurs médianes, étude Resoneo). Ce qui mange le début n’est pas ce qu’on croit : le surtitre de rubrique et surtout le texte alternatif de la première image (celle qui suit immédiatement le titre) peuvent consommer 50 caractères à eux seuls.
Et le premier problème est en amont : une page sur sept n’a aucun H1 balisé. Dans ce cas, l’ancrage devient aléatoire, le snippet démarre sur un intertitre choisi au hasard du gabarit, et vous ne contrôlez plus rien.
Ce que ça change pour votre écriture. Ce que je répète depuis des mois sous forme de bonnes pratiques (répondre directement dès les premières lignes, écrire en briques autonomes) cesse d’être un conseil de confort. C’est désormais mécanique : votre budget de grounding en mode instant, c’est votre titre entier plus environ 150 caractères utiles à partir de votre H1. Ça rejoint les données de Kevin Indig : 44,2 % des citations ChatGPT proviennent des 30 premiers pour cent du contenu (Search Engine Land, 2026). Le milieu de vos articles n’existe pas pour le modèle.
Trouvable, lisible, à jour : trois choses différentes
OpenAI garde vos pages dans deux stocks distincts, écrits par deux robots différents, selon l’étude Resoneo (mesures croisées avec Jérôme Salomon, Oncrawl) :
- L’index : un snippet court, figé au crawl, qui sert à vous trouver. Écrit par OAI-SearchBot.
- Le cache de lecture : la page entière, convertie en Markdown, qui sert à vous lire quand le modèle ouvre vraiment une page. Écrit par ChatGPT-User (et aussi SearchBot).
Trois conséquences que peu de monde a intégrées :
- Être crawlé n’est pas être disponible. Le robot d’entraînement (GPTBot) n’alimente ni l’index ni le cache de lecture. L’absence de ChatGPT dans vos logs ne signifie pas l’absence de ChatGPT dans les réponses, et l’inverse est vrai aussi.
noindexetno-storesont ignorés. Des pages enmeta robots: noindexvisitées par les robots d’OpenAI se retrouvent quand même dans le cache. Des pages envoyantCache-Control: no-storesont mises en cache quand même.- Le cache est mutualisé entre utilisateurs et vieillit. Une copie créée par un compte français est resservie à un compte américain, sans qu’aucune visite n’atteigne votre serveur. La clé du cache, c’est l’URL, pas l’utilisateur. Fenêtre de fraîcheur estimée à ~30 minutes, rétention observée à plus de 90 jours sur log serveur. Quand vous voyez passer ChatGPT-User dans vos logs, ce n’est pas une lecture pour l’utilisateur en cours : c’est un rafraîchissement dont bénéficiera le prochain visiteur.
Autre implication de fond, qui recoupe ce que je décris comme la « voie mémoire » du GEO : la découverte chez OpenAI passe par le lien, pas par le sitemap. Dans les tests de l’étude Resoneo, GPTBot télécharge le sitemap mais ne suit pas les URLs qui n’y figurent que par là ; il crawle en revanche les pages atteignables par un lien. Le maillage interne reste un levier d’entrée.
Cinq verticales, cinq stratégies
Un seul des systèmes de ChatGPT est relié au search classique. Les quatre autres sont alimentés par des flux et des index dédiés, selon l’étude Resoneo :
- Recherche web : un titre et 200 caractères. La seule surface où le travail sur votre page compte directement.
- Actualités : votre article est réécrit en un résumé d’environ 1 100 caractères, plafonné à 200 mots, jamais retrouvable mot pour mot. La valeur est captée à l’ingestion, pas restituée à l’affichage : l’article n’est cité qu’environ une fois sur huit.
- Local / cartes : la copie ne vient pas de votre site mais de flux (Yelp, TripAdvisor, Google Maps). Ici, c’est le SEO local et la fiche Google Business qui jouent.
- Achat : le carrousel produits ne partage aucune adresse avec la recherche web. Être bien cité n’aide en rien à apparaître dans les cartes produit. Deux métiers séparés, et Amazon en est absent.
- Images : vos images sont ré-hébergées chez OpenAI ; elles s’affichent sans qu’aucune requête n’atteigne votre serveur.
C’est la version « infrastructure » de ma thèse Sources by Intent : une stratégie de visibilité dans ChatGPT qui ne traite que la recherche web laisse quatre portes fermées. À chaque verticale, ses techniques : SEO image, SEO local, flux shopping.
Ce que ça change concrètement pour votre GEO
Rien de ce qui précède n’invalide les fondamentaux. Ça les rend plus mécaniques et plus exigeants :
- Balisez un H1 unique et net, et dégagez la piste juste après. C’est votre point d’ancrage de snippet. Surveillez le
altde la première image sous le titre : il mange votre budget. - Mettez la réponse dans les 40-60 premiers mots, et faites commencer chaque section par sa conclusion. Vos ~150 caractères utiles se jouent là.
- Arrêtez de compter sur votre meta description pour ChatGPT. Labrador l’ignore. Écrivez le début de corps comme si c’était votre snippet, parce que c’en est un.
- Cartographiez vos intentions avant vos pages. Pour chaque question clé de votre secteur, regardez qui est cité et quel type de source domine (officiel, comparateur, forum, éditorial de marque). Alignez le format sur le mix réel, pas sur un playbook générique.
- Traitez chaque verticale séparément. Local, shopping, actualités et images ne se gagnent pas avec du contenu web.
- Gardez vos logs serveur, ce sont un excellent indicateur, à condition de savoir ce qu’ils mesurent. Ils datent chaque passage de robot (GPTBot, OAI-SearchBot, ChatGPT-User), révèlent les rythmes de crawl et, quand ChatGPT-User passe, un rafraîchissement de cache : c’est toute la valeur du travail d’Oncrawl sur le sujet. Ce qu’ils ne disent pas : crawlé ne veut pas dire cité. Croisez donc les logs (côté infrastructure) avec l’observation directe des réponses, multi-moteurs et par intention (côté visibilité).
- Renforcez les signaux qui traversent tous les moteurs. Statistiques nommées, citations d’experts, sources datées : l’étude fondatrice GEO (Princeton, KDD 2024) montre jusqu’à +40 % de visibilité pour un effort de réécriture minime. Ce sont aussi les signaux les moins dépendants de l’humeur d’un index précis.
La nuance qui compte
Maintenant que la gravité est posée, la prudence. Ce travail est un reverse engineering daté, pas une doc officielle. OpenAI ne communique que sur des « fournisseurs de recherche tiers » et n’a jamais confirmé Labrador. Le champ qui nommait les moteurs a disparu le 21 juillet ; les signatures de format qui permettent d’en déduire l’origine peuvent être retirées demain.
Et ça bouge vite. Entre juillet et août 2026, le thinking payant a divisé son budget de recherche par deux, et le bouton « Think » est arrivé sur le gratuit, changeant à lui seul les parts de moteurs. Personne hors d’OpenAI ne connaît la part exacte des réponses réellement servies par Labrador face à Google, Bing et les autres. (Cette part est à considérer comme non vérifiable, pas comme un chiffre stable.)
La conclusion n’est donc pas « optimisez pour Labrador ». C’est : le socle robuste reste le contenu extractible, sourcé, frais, et l’autorité hors-site adaptée à votre secteur, parce qu’il tient quel que soit l’index qui décide. Labrador ne change pas la nature du travail. Il en durcit les règles, et il retire la dernière illusion confortable : celle que votre position Google suffit.
Sources principales : Resoneo, Ce que ChatGPT récupère, ce qu’il montre, ce qu’il cite (juillet-août 2026) · Peec AI, ChatGPT built its own search index · Qwairy, Sources by Intent, Q2 2026 · Kevin Indig / Search Engine Land · Étude GEO Princeton, KDD 2024.
