Sommaire de l'article
ChatGPT Search s'appuie sur un index de recherche, pas seulement sur la mémoire du modèle
ChatGPT répond de deux manières. Soit le modèle juge qu'il peut répondre de mémoire, à partir de ce qu'il a appris pendant son entraînement, et il ne cite alors aucune source. Soit il décide de chercher, ou l'utilisateur le lui impose en activant la recherche, et la réponse s'appuie sur des pages web qu'il cite. Pour une marque, ces deux régimes correspondent à deux visibilités différentes : ce que le modèle « sait » de vous, qui ne se corrige que lentement, et ce que l'index contient, qui se travaille.
Ce qu'OpenAI a documenté tient en quelques points. La recherche est assurée par un modèle adapté à cet usage ; elle s'appuie sur un index constitué par le robot OAI-SearchBot, sur des fournisseurs de recherche tiers, et sur les contenus fournis directement par des partenaires, notamment des éditeurs de presse avec lesquels OpenAI a signé des accords. La réponse présente des liens dans le texte et une liste de sources. Le reste, en particulier la façon dont les résultats des différents index sont combinés et reclassés, n'est pas public ; ce que nous en disons vient de nos mesures et doit être lu comme tel.
- 01DécisionLe modèle choisit de répondre de mémoire ou de chercher ; l'utilisateur peut forcer la recherche.
- 02RequêtesUne ou plusieurs recherches sont émises, visibles dans l'interface.
- 03IndexLes résultats viennent de l'index OAI-SearchBot, de fournisseurs tiers et des contenus partenaires. Une page absente de ces index n'est jamais candidate.
- 04LectureSi nécessaire,
ChatGPT-Userouvre une page à la demande pour en lire le contenu complet. - 05RéponseTexte rédigé, liens dans les phrases, liste de sources en fin de réponse.
La première étape mérite qu'on s'y arrête. Sur une question de définition ou de culture générale, ChatGPT cherche rarement ; sur une question d'actualité, de prix, de comparaison ou de prestataire, il cherche presque toujours. Ce sont donc les questions à valeur commerciale qui passent par l'index, et c'est là que la préparation du site porte ses fruits.
Trois robots, trois décisions
OpenAI exploite trois agents, et la confusion entre eux est la cause d'absence la plus fréquente que nous rencontrons sur ChatGPT. Chacun se contrôle séparément dans le fichier robots.txt, et chacun répond à une question différente.
- 1GPTBotCollecte des contenus pour l'entraînement des modèles. Décision éditoriale et juridique, sans lien avec la recherche.Sinon : aucun effet sur votre présence dans ChatGPT Search.
- 2OAI-SearchBotConstitue l'index de la recherche ChatGPT. D'après OpenAI, il n'est pas utilisé pour l'entraînement.Sinon : vos pages disparaissent des réponses cherchées.
- 3ChatGPT-UserOuvre une page à la demande d'un utilisateur ou d'un GPT personnalisé, pour la lire en entier.Sinon : ChatGPT annonce qu'il ne peut pas accéder à votre page.
La politique que nous recommandons le plus souvent sépare les deux décisions : autoriser explicitement les robots de recherche sur tout le site, et réserver le refus d'entraînement à GPTBot, en totalité ou sur les seules sections que vous souhaitez protéger. OpenAI indique qu'un changement de robots.txt peut demander de l'ordre d'une journée pour être pris en compte, et publie les plages d'adresses de ses robots, ce qui permet de vérifier dans les journaux serveur qu'un passage annoncé comme OAI-SearchBot vient bien d'OpenAI.
# Recherche ChatGPT : autorisée sur tout le site
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
Allow: /
# Entraînement : refusé sur les contenus premium uniquement
User-agent: GPTBot
Disallow: /premium/
Allow: /
Le blocage n'est pas toujours écrit dans robots.txt. Les règles « bloquer les robots IA » proposées par les CDN et les pare-feu traitent souvent les trois agents de la même façon ; le résultat est un site conforme sur le papier et absent dans les faits. Le guide complet des agents et de leur syntaxe fait l'objet d'un article dédié, le guide des robots IA et du robots.txt.
Le rôle des index tiers : pourquoi Bing compte à nouveau
OpenAI a indiqué que sa recherche s'appuie sur des fournisseurs tiers, et Microsoft a été cité publiquement comme partenaire. Nous ne connaissons pas la part exacte de chaque source dans les résultats, et elle a pu varier. Ce que nous constatons est plus simple : les sites absents ou mal couverts dans l'index Bing sont rarement cités par ChatGPT, même lorsqu'ils sont bien indexés par Google et accessibles à OAI-SearchBot.
La conséquence pratique est de traiter Bing comme un index à part entière. Vérifier que le site est inscrit dans Bing Webmaster Tools, que les pages importantes y sont indexées, que le plan de site y est soumis et que les changements sont poussés via IndexNow. Beaucoup de sites français n'ont jamais fait ce travail, parce que la part de trafic de Bing ne le justifiait pas ; la visibilité dans ChatGPT le justifie désormais.
Quels types de pages ChatGPT cite le plus souvent
Sur nos panels de questions B2B, la nature des sources citées dépend d'abord du type de question. Sur une question factuelle concernant une entreprise, ses tarifs, ses fonctionnalités, ses conditions, ChatGPT cite volontiers le site de l'entreprise, à condition que la page réponde clairement. Sur une question de choix ou de comparaison, il cite majoritairement des tiers : presse spécialisée, comparatifs, annuaires, forums, et des pages de référence comme Wikipédia.
Données illustratives. Ce qu'il faut y lire : votre site est une source légitime pour parler de vous, mais la recommandation se joue sur des pages que vous n'écrivez pas ; les deux chantiers sont distincts.
Trois traits reviennent parmi les pages de marque effectivement citées. Elles répondent à une question précise en tête de section ; elles portent des chiffres, des conditions ou des dates que le modèle peut reprendre ; et elles existent en HTML complet, sans rendu différé. Les pages d'accueil, les pages « à propos » et les argumentaires commerciaux sont presque absents des citations, quelle que soit la notoriété de l'entreprise.
La fraîcheur : quand ChatGPT préfère le récent
ChatGPT Search a été conçu en partie pour l'actualité, et les accords signés avec des éditeurs de presse alimentent cette dimension. Sur une question qui contient une date, un événement ou une notion de « dernier », « actuel », « en 2026 », les sources citées sont récentes, et une page qui traite le sujet sans date visible part avec un handicap net. Sur une question de définition ou de méthode, la fraîcheur pèse moins, mais une page mise à jour reste préférée à une page identique plus ancienne.
La fraîcheur se lit dans la page elle-même, dans les données structurées (datePublished, dateModified) et dans le plan de site. Elle se démontre par le contenu : une page « mise à jour » dont rien n'a changé ne trompe pas un moteur qui conserve des versions successives. Nous conseillons une règle simple : dater sincèrement, mettre à jour les pages qui portent des chiffres ou des règles chaque fois qu'ils changent, et laisser vieillir celles qui n'ont pas de raison de bouger.
Les signaux de marque : ce que ChatGPT sait de vous avant de chercher
Avant même d'ouvrir une page, le modèle a une idée de votre marque, formée pendant son entraînement à partir de tout ce qui a été écrit sur vous : votre site, la presse, les annuaires, les forums, Wikipédia si vous y figurez. Cette connaissance préalable influence deux choses : la manière dont il formule ses requêtes, et la confiance qu'il accorde aux résultats qui vous concernent. Une marque décrite de manière cohérente partout est retrouvée et citée plus facilement qu'une marque dont le nom, la spécialité ou la localisation varient d'une source à l'autre.
Ces signaux ne se corrigent pas par une balise. Ils se construisent par la répétition, sur des sources indépendantes, des mêmes éléments : un nom stable, une description en une phrase, un domaine d'expertise nommé, des dirigeants identifiés. Dans nos audits, le test le plus révélateur consiste à demander à ChatGPT, sans recherche, « que sais-tu de [marque] ? ». Une réponse vague ou erronée signale un travail d'entité à faire avant tout le reste ; c'est la troisième des quatre conditions décrites dans Comment être cité par ChatGPT, Claude et Perplexity.
Un cas particulier concerne les requêtes où l'utilisateur nomme votre marque. ChatGPT cherche alors souvent sur votre site et sur les sources qui parlent de vous ; si une page tierce contient une information fausse ou périmée, elle peut être reprise devant la vôtre. La surveillance de ce que les sources tierces disent de vous fait partie du programme, au même titre que la rédaction de vos pages.
Se préparer : la liste de contrôle propre à ChatGPT
Les contrôles ci-dessous sont ceux que nous appliquons spécifiquement à ChatGPT, en complément des quatre conditions générales. Chacun se vérifie en moins d'une demi-journée.
| Point de contrôle | Comment vérifier | Correctif si nécessaire |
|---|---|---|
OAI-SearchBot autorisé | Lire robots.txt, tester une URL avec l'agent, chercher l'agent dans les journaux | Règle explicite d'autorisation ; exception dans le CDN et le pare-feu |
ChatGPT-User autorisé | Demander à ChatGPT d'ouvrir une page précise du site | Même traitement que ci-dessus |
| Indexation Bing | Bing Webmaster Tools, rapport d'indexation | Soumettre le plan de site, activer IndexNow, corriger les erreurs |
| Contenu dans le HTML initial | Comparer la source servie et le rendu navigateur | Rendu côté serveur ou pré-rendu des pages importantes |
| Dates sincères | Page, données structurées, plan de site cohérents | Politique de mise à jour par type de page |
| Connaissance de la marque | « Que sais-tu de [marque] ? » sans recherche, dans plusieurs sessions | Harmonisation des présences externes, données structurées Organization |
| Part de citation | Panel de questions, relevé hebdomadaire | Réécriture des pages absentes, mentions tierces sur les questions de choix |
Tableau : faites défiler horizontalement.
Pour lire une réponse de ChatGPT comme un auditeur, il faut savoir où regarder. Les liens dans le texte signalent les passages effectivement utilisés ; la liste finale des sources inclut aussi des pages consultées mais peu reprises. Une marque peut figurer dans la seconde sans apparaître dans la première, ce qui ne compte pas comme une citation utile.
ChatGPT n'est pas le seul moteur à distinguer ainsi les sources consultées des sources reprises, mais il est celui où l'écart est le plus visible. Perplexity, à l'inverse, numérote chaque source et l'appelle dans le texte ; nous en détaillons l'anatomie dans Perplexity : anatomie d'une réponse et leviers pour y figurer. Et pour comparer avec la mécanique de Google, voir AI Overviews et AI Mode : comment votre site y entre (ou en sort).
Ce qu'il faut retenir
- ChatGPT répond de mémoire ou cherche ; seules les réponses cherchées citent des sources, et ce sont les questions à valeur commerciale qui déclenchent la recherche.
- Trois robots, trois décisions : GPTBot pour l'entraînement, OAI-SearchBot pour l'index de recherche, ChatGPT-User pour la lecture à la demande. Bloquer les deux derniers vous efface.
- La recherche s'appuie aussi sur des index tiers ; l'indexation Bing redevient un prérequis.
- Votre site est cité sur les faits qui vous concernent ; les recommandations se jouent sur la presse, les comparatifs et les forums.
- Dates sincères et entité cohérente partout : ce que le modèle sait de vous avant de chercher conditionne ce qu'il cite après.
Questions fréquentes
Quelle est la différence entre GPTBot et OAI-SearchBot ?
GPTBot collecte des contenus pour l'entraînement des modèles d'OpenAI ; OAI-SearchBot constitue l'index de la recherche ChatGPT et, d'après OpenAI, n'est pas utilisé pour l'entraînement. Les deux se contrôlent séparément dans robots.txt. Refuser GPTBot n'a aucun effet sur votre présence dans ChatGPT Search ; refuser OAI-SearchBot vous retire des réponses cherchées. La plupart des sites peuvent donc autoriser l'un et refuser l'autre.
Faut-il être indexé par Bing pour être cité par ChatGPT ?
C'est fortement recommandé. OpenAI indique que sa recherche s'appuie sur son propre index et sur des fournisseurs tiers, et Microsoft a été cité comme partenaire. Dans nos mesures, les sites mal couverts par Bing sont rarement cités par ChatGPT, même bien indexés par Google. Inscrire le site dans Bing Webmaster Tools, soumettre le plan de site et activer IndexNow sont des étapes peu coûteuses et utiles.
Pourquoi ChatGPT cite-t-il des tiers plutôt que mon site sur les questions de choix ?
Parce qu'une recommandation demande un consensus, et qu'un site ne peut pas se recommander lui-même. Sur « quel prestataire », « meilleur logiciel » ou « X ou Y », ChatGPT cite majoritairement la presse spécialisée, les comparatifs, les annuaires et les forums. Votre site reste cité sur les faits qui vous concernent, tarifs, fonctionnalités, conditions. Les deux chantiers sont distincts : rédiger vos pages, et exister sur les sources tierces.
Comment savoir si ChatGPT a réellement utilisé ma page ?
Regardez les liens insérés dans le texte de la réponse, pas seulement la liste de sources en fin de réponse. Les citations en ligne signalent les passages effectivement repris ; la liste finale inclut aussi des pages consultées mais peu utilisées. Une marque présente dans la liste sans lien dans le texte n'a pas été citée au sens utile. C'est la présence en ligne que l'on compte dans la part de citation.
ChatGPT tient-il compte de la date de mes pages ?
Oui, surtout sur les questions qui contiennent une notion de temps ou qui portent sur des sujets évolutifs. Les sources citées y sont récentes, et une page sans date visible part avec un handicap. La date se lit dans la page, dans les données structurées et dans le plan de site ; elle doit être sincère, car une date rafraîchie sans changement de contenu n'améliore rien et peut nuire à la confiance.


