Sommaire de l'article
Les moteurs génératifs ne classent pas des pages, ils choisissent des sources
Un moteur de recherche classique produit une liste ordonnée : dix résultats, un rang pour chacun, et une compétition pour les trois premières positions. Un moteur génératif produit un texte. Pour l'écrire, il doit d'abord réunir des matériaux, et c'est là que tout se joue : il ne retient que quelques sources, en extrait des passages, puis rédige une réponse en les citant.
Le mécanisme, appelé génération augmentée par récupération (RAG), suit toujours la même séquence. La question de l'utilisateur est reformulée en plusieurs sous-requêtes, souvent trois à dix, qui couvrent les angles implicites de la demande. Chaque sous-requête interroge un index : celui de Google pour AI Overviews et AI Mode, un index propre ou partenaire pour ChatGPT, Claude et Perplexity. Le moteur récupère des passages, pas des pages entières, puis le modèle les synthétise et attribue les affirmations à leurs sources.
- 01QuestionL'utilisateur formule une demande en langage naturel, souvent longue et contextualisée.
- 02Sous-requêtesLe moteur la décompose en 3 à 10 recherches qui couvrent les angles implicites.
- 03RécupérationChaque sous-requête ramène des passages, pas des pages, depuis un index.
- 04Sélection3 à 8 sources sont retenues : accessibles, précises, identifiées, corroborées. Tout se décide ici.
- 05Réponse citéeLe modèle rédige et attribue chaque affirmation à sa source.
Trois conséquences pratiques découlent de ce fonctionnement. La première : être septième sur Google ne vous protège pas, et être premier ne vous garantit rien, parce que la sélection s'opère au niveau du passage et non de l'URL. La deuxième : une page très précise sur une question étroite peut être citée devant un site plus puissant mais plus vague. La troisième : le nombre de places est petit. Une réponse cite en général entre trois et huit sources ; vous ne vous battez plus pour une position, mais pour une place dans une liste courte.
Quatre conditions, dans cet ordre
Dans les audits de visibilité générative que nous menons, les pages citées partagent quatre propriétés, et les pages absentes en manquent presque toujours au moins une. Ces conditions s'enchaînent : si la première n'est pas remplie, les trois autres ne comptent pas, quelle que soit la qualité du contenu.
- 1AccessibleLes robots de recherche IA peuvent lire le HTML complet de la page, sans blocage ni rendu différé.Sinon : la page n'existe pas pour le moteur.
- 2CitableChaque section répond seule à une question, avec une preuve, en quarante à quatre-vingts mots.Sinon : aucun passage n'est extrait.
- 3IdentifiéeL'entité qui parle est décrite, balisée et cohérente partout où elle apparaît.Sinon : la source est jugée peu fiable.
- 4CorroboréeDes sources indépendantes disent la même chose de vous, avec les mêmes mots.Sinon : votre affirmation reste une opinion.
Le reste de cet article détaille chaque condition, avec les vérifications à faire et les corrections à apporter, puis la méthode de mesure qui permet de savoir si le travail paie.
Condition 1 : être accessible aux robots des moteurs génératifs
Chaque éditeur de modèle exploite plusieurs robots, et ils n'ont pas le même rôle. Certains collectent des données d'entraînement, d'autres alimentent l'index de recherche, d'autres encore consultent une page à la demande d'un utilisateur. Bloquer le mauvais robot revient à se retirer soi-même des réponses.
| Éditeur | Agent | Rôle | Effet d'un blocage |
|---|---|---|---|
| OpenAI | GPTBot | Entraînement des modèles | Aucun sur la recherche ChatGPT |
| OpenAI | OAI-SearchBot | Index de la recherche ChatGPT | Disparition des réponses ChatGPT |
| OpenAI | ChatGPT-User | Consultation à la demande d'un utilisateur | Page illisible quand un utilisateur la demande |
| Anthropic | ClaudeBot | Entraînement des modèles | Aucun sur la recherche Claude |
| Anthropic | Claude-SearchBot | Index de la recherche Claude | Disparition des réponses Claude |
| Anthropic | Claude-User | Consultation à la demande d'un utilisateur | Page illisible quand un utilisateur la demande |
| Perplexity | PerplexityBot | Index de Perplexity | Disparition des réponses Perplexity |
| Perplexity | Perplexity-User | Consultation à la demande d'un utilisateur | Page illisible quand un utilisateur la demande |
Googlebot | Index classique, AI Overviews, AI Mode | Disparition de Google, réponses IA comprises | |
Google-Extended | Entraînement de Gemini uniquement | Aucun sur AI Overviews ni sur AI Mode | |
| Microsoft | Bingbot | Index Bing, Copilot et partenaires | Disparition de Copilot et des moteurs qui s'appuient sur Bing |
Tableau : faites défiler horizontalement.
La confusion la plus fréquente concerne Google. Le jeton Google-Extended ne contrôle que l'utilisation de vos contenus pour l'entraînement de Gemini ; il n'a aucun effet sur votre présence dans AI Overviews ou AI Mode, qui reposent sur Googlebot et sur l'index classique. À l'inverse, bloquer OAI-SearchBot ou PerplexityBot vous retire de la recherche ChatGPT et de Perplexity, même si vos pages restent parfaitement indexées par Google.
Le blocage n'est pas toujours volontaire. Beaucoup de sites ont activé, sur leur CDN ou leur pare-feu, une règle « bloquer les robots IA » qui traite tous ces agents de la même manière. D'autres renvoient une erreur 403 aux requêtes sans en-têtes de navigateur, ou masquent le contenu derrière une bannière de consentement rendue côté serveur. Dans nos audits, ce blocage involontaire est la première cause d'absence des réponses génératives sur des sites par ailleurs bien référencés.
Les vérifications à faire
- Lire le fichier
robots.txtet distinguer explicitement les robots d'entraînement des robots de recherche. L'exemple ci-dessous autorise la recherche et refuse l'entraînement ; adaptez-le à votre politique. - Consulter les règles du CDN, du pare-feu et de l'hébergeur : listes d'agents bloqués, limitation de débit, défi JavaScript imposé aux requêtes non humaines.
- Chercher dans les journaux serveur les agents du tableau. Aucun passage sur trente jours signifie un blocage en amont, ou une absence de découverte.
- Vérifier que le contenu principal figure dans le HTML renvoyé par le serveur. Les robots de recherche IA exécutent peu ou pas de JavaScript : une page dont le texte n'apparaît qu'après rendu côté client est, pour eux, une page vide.
# Robots de recherche : autorisés
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
Allow: /
# Robots d'entraînement : décision séparée (ici, refus)
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
Disallow: /
Condition 2 : écrire des pages qu'un modèle peut citer
Une fois la page accessible, le moteur y cherche des passages capables de répondre seuls à une sous-requête. Un passage citable a une forme reconnaissable : il tient en quarante à quatre-vingts mots, il commence par la réponse, il contient au moins un élément vérifiable (un chiffre, une date, un nom, une condition) et il reste compréhensible sorti de son contexte.
Concrètement, cette forme change la façon d'écrire une page.
- Les titres prennent la forme des questions réellement posées. « Combien de temps faut-il pour être cité par ChatGPT ? » sera aligné sur une sous-requête ; « Nos délais » ne le sera jamais.
- Le premier paragraphe sous chaque titre répond directement. Le contexte, l'historique et la nuance viennent ensuite. Un modèle qui doit lire trois paragraphes avant de trouver la réponse passe à la source suivante.
- Chaque affirmation importante porte une preuve. Une donnée datée, une source nommée, une méthode décrite. Les formulations vagues (« des résultats rapides », « une expertise reconnue ») ne sont jamais extraites, parce qu'elles ne répondent à rien.
- Les tableaux, listes et définitions sont privilégiés. Ces formats sont repris presque tels quels, et ils réduisent le risque que le modèle reformule votre propos de manière inexacte.
- La date de mise à jour est visible et sincère. Pour les sujets qui évoluent, les moteurs génératifs favorisent les sources récentes ; une page sans date, ou datée de 2022, part avec un handicap.
La seconde formulation est citable : elle répond à une question précise, elle contient un délai et deux conditions, et elle reste vraie hors de son contexte. La première ne dit rien qu'un moteur puisse reprendre.
Condition 3 : rendre votre entité lisible
Un moteur génératif ne cite pas seulement un texte, il cite quelqu'un. Avant de retenir une source, il cherche à savoir qui parle, à quel titre, et si cette identité est cohérente avec ce qu'il trouve ailleurs. Cette lecture passe d'abord par les données structurées, puis par la cohérence des informations sur votre entreprise partout où elles apparaissent.
- Organization : nom légal et nom commercial, adresse, identifiants, et surtout la propriété
sameAs, qui relie votre site à vos profils officiels (LinkedIn, registre du commerce, Wikidata, annuaires sectoriels). - Person pour chaque auteur : fonction, affiliation, publications, profils. Une page auteur qui documente une expertise vérifiable pèse davantage qu'une signature anonyme.
- Article ou BlogPosting : auteur, dates de publication et de modification, éditeur, image principale.
- FAQPage pour les sections de questions-réponses : le format le plus directement aligné sur le fonctionnement question-réponse des moteurs génératifs.
{
"@context": "https://schema.org",
"@type": "Organization",
"name": "SEO360",
"legalName": "SEO 360 ALICANTE S.L.",
"url": "https://seo360.tech",
"sameAs": [
"https://www.linkedin.com/company/…",
"https://www.wikidata.org/wiki/…"
],
"founder": {
"@type": "Person",
"name": "Kamel Malek"
}
}
La cohérence compte autant que le balisage. Si votre site dit « SEO360 », votre page LinkedIn « SEO 360 Alicante » et un annuaire « Seo360 Agency », le modèle reconstruit trois entités faibles au lieu d'une entité forte. Harmoniser les noms, les descriptions et les coordonnées sur l'ensemble de vos présences externes est souvent le levier le moins coûteux de tout le programme.
Le fichier llms.txt, proposé comme un résumé de site destiné aux modèles, relève d'une autre logique. Il coûte une heure à produire et ne nuit pas, mais aucun éditeur de moteur n'a documenté son utilisation dans la sélection des sources. Traitez-le comme un complément, pas comme un levier.
Condition 4 : être corroboré ailleurs que chez vous
Un modèle qui doit recommander un prestataire, un produit ou une méthode cherche un consensus. Une affirmation présente sur votre seul site est une opinion ; la même affirmation reprise par un média, un annuaire sectoriel, un comparatif, un forum ou une publication devient une information. C'est pourquoi les réponses aux requêtes de type « meilleur », « comparatif » ou « lequel choisir » citent massivement des pages tierces plutôt que les sites des marques concernées.
La corroboration se construit comme une présence, pas comme une campagne de liens. Les sources que les moteurs génératifs mobilisent le plus souvent sont :
- les articles de presse et les publications professionnelles qui décrivent votre entreprise avec les mêmes termes que votre site ;
- les comparatifs et annuaires spécialisés de votre secteur, y compris ceux qui vous placent parmi d'autres ;
- les discussions de forums et de communautés, où une réponse utile signée par un expert de votre équipe vaut davantage qu'une mention promotionnelle ;
- les avis clients détaillés, sur des plateformes que le moteur peut lire ;
- les contenus audio et vidéo dont la transcription est accessible, ainsi que les interventions d'auteurs identifiés.
Le mot-clé est « mention », pas « lien ». Un lien reste utile pour Google ; pour un moteur génératif, c'est la répétition cohérente de votre nom, de votre spécialité et de vos preuves à travers des sources indépendantes qui fait la différence.
Mesurer votre part de citation
La visibilité générative ne se lit pas dans un rapport de positions. L'indicateur qui la remplace est la part de citation : sur un panel de questions que vos acheteurs posent réellement, la proportion de réponses dans lesquelles votre marque ou votre domaine apparaît, moteur par moteur. La méthode tient en quatre étapes.
- Constituer un panel de trente à cent questions, réparties entre questions informationnelles (« comment… »), comparatives (« X ou Y ») et transactionnelles (« quel prestataire pour… »), dans chaque langue où vous vendez.
- Exécuter le panel chaque semaine sur ChatGPT, Perplexity, Gemini et Claude, en relevant les sources citées et les marques nommées. Les réponses varient d'une exécution à l'autre ; chaque question est lancée plusieurs fois et l'on suit une moyenne.
- Calculer la part de citation pour vous et pour vos trois concurrents directs, par moteur et par type d'intention.
- Relier au chiffre d'affaires : trafic référent depuis les domaines des moteurs dans votre outil d'analyse, évolution des recherches sur votre marque, conversions assistées sur la période.
Données illustratives. La lecture utile : cette marque est compétitive sur Perplexity, absente de Google AI Overviews, et son concurrent domine ChatGPT ; le plan d'action se déduit moteur par moteur.
Deux précautions. Une mesure ponctuelle ne veut rien dire, parce que les réponses fluctuent ; c'est la tendance sur plusieurs semaines qui compte. Et la part de citation doit être lue par intention : être cité sur les questions de définition ne rapporte rien si vous êtes absent des questions de choix de prestataire.
Les erreurs qui coûtent des citations
Les causes d'absence que nous rencontrons le plus souvent tiennent en sept points. Chacun se vérifie en moins d'une heure.
- Une règle anti-robots globale qui bloque
OAI-SearchBot,PerplexityBotouClaude-SearchBoten même temps que les robots d'entraînement. - Un contenu principal injecté en JavaScript, invisible dans le HTML initial.
- Des pages sans date, ou dont la date de mise à jour est rafraîchie artificiellement sans changement de contenu.
- Des textes de présentation génériques, sans chiffre, sans nom et sans méthode.
- Une entité incohérente d'une plateforme à l'autre : noms, descriptions et coordonnées qui divergent.
- Aucune présence sur les sources tierces que le moteur consulte pour votre secteur.
- Un pilotage limité aux positions Google, qui ne montre ni le problème ni le progrès.
Un plan d'action sur quatre-vingt-dix jours
Le programme ci-dessous est celui que nous déroulons sur un mandat type. Il commence par l'accès et la mesure, parce qu'il est inutile de réécrire des pages que les moteurs ne peuvent pas lire, ni d'agir sans point de départ chiffré.
- Semaines 1 à 2Accès et mesure
- Audit robots.txt, CDN, pare-feu, rendu HTML
- Panel de 30 à 100 questions par langue
- Première mesure de la part de citation, par moteur
- Semaines 3 à 6Pages et entité
- Réécriture des dix pages prioritaires en réponses directes
- Données structurées Organization, Person, Article, FAQPage
- Pages auteur et harmonisation des présences externes
- Semaines 7 à 12Corroboration et itération
- Mentions tierces : presse, annuaires, comparatifs, communautés
- Deuxième mesure et lecture par intention
- Arbitrage des pages suivantes selon les écarts constatés
À l'issue des douze semaines, l'objectif n'est pas d'avoir « fini », mais d'avoir installé une boucle : mesure hebdomadaire, réécriture des pages absentes, corroboration continue. Les moteurs génératifs changent vite ; une organisation qui mesure chaque semaine voit les décrochages avant qu'ils ne coûtent, et les gains avant ses concurrents.
Ce qu'il faut retenir
- Un moteur génératif sélectionne trois à huit sources par réponse, au niveau du passage, pas de la page.
- Quatre conditions, dans l'ordre : accessible aux robots de recherche IA, citable, identifiée, corroborée.
- Distinguez les robots d'entraînement des robots de recherche : bloquer les seconds vous efface des réponses.
- Un passage citable tient en quarante à quatre-vingts mots, commence par la réponse et contient une preuve.
- L'indicateur de pilotage est la part de citation, mesurée chaque semaine, par moteur et par intention.
Questions fréquentes
Faut-il bloquer GPTBot pour protéger ses contenus ?
C'est un choix éditorial qui n'a pas d'effet sur votre visibilité dans la recherche ChatGPT. GPTBot sert à l'entraînement des modèles ; la recherche s'appuie sur OAI-SearchBot et sur ChatGPT-User. Vous pouvez refuser le premier et autoriser les deux autres. La seule erreur est de tout bloquer avec une règle unique.
Combien de temps faut-il pour apparaître dans les réponses des IA ?
Sur nos mandats, les premières citations apparaissent généralement six à dix semaines après la mise en place des données structurées et la réécriture des pages principales, à condition que les robots de recherche IA aient accès au site. Les sujets dominés par des sources tierces demandent davantage de temps, parce qu'il faut d'abord rejoindre ces sources.
Le référencement classique suffit-il pour être cité par les moteurs génératifs ?
Non, mais il en est la base. Qualité technique, autorité et clarté sémantique restent nécessaires. Les moteurs génératifs exigent en plus des réponses directes et autonomes, une entité clairement identifiée par des données structurées, et une corroboration par des sources indépendantes. Une page bien classée sur Google mais rédigée en discours promotionnel n'est presque jamais citée.
Le fichier llms.txt est-il nécessaire ?
Non. Aucun éditeur de moteur n'a documenté son usage dans la sélection des sources. Il ne nuit pas, coûte peu, et peut servir de résumé structuré de votre site ; mais il ne remplace ni l'accès des robots, ni des pages citables, ni des données structurées correctes.


