Audit gratuit 48 h
Technique13 min de lecture

Bloquer l'entraînement sans perdre la citation : la stratégie robots.txt en deux niveaux.

Refuser que vos contenus servent à entraîner des modèles est une décision légitime, souvent prise par la direction juridique. La mettre en œuvre avec une règle unique retire aussi le site des réponses de ChatGPT, Claude et Perplexity, sans que personne ne l'ait voulu. La solution tient en deux niveaux : décider par agent, selon sa finalité, puis par chemin, selon le type de contenu. Voici la méthode, le fichier et ses limites.

Sommaire de l'article

« Faut-il bloquer les IA ? » est une question mal posée

La question qui remonte à la direction est presque toujours formulée ainsi : bloquons-nous les robots IA, oui ou non ? Elle mélange deux décisions qui n'ont ni le même objet, ni le même horizon, ni les mêmes interlocuteurs. La première porte sur l'entraînement : acceptez-vous que vos textes entrent dans les corpus qui servent à construire les prochains modèles ? C'est une décision patrimoniale et juridique, à effet différé et diffus. La seconde porte sur la citation : voulez-vous que les moteurs génératifs puissent lire vos pages pour les retenir comme sources dans leurs réponses ? C'est une décision commerciale, à effet immédiat et mesurable.

Le cadre européen rend la première décision concrète. La directive de 2019 sur le droit d'auteur autorise la fouille de textes et de données sauf réserve exprimée par le titulaire, notamment par des moyens lisibles par machine pour les contenus en ligne ; le règlement européen sur l'IA demande aux fournisseurs de modèles à usage général de se doter d'une politique pour identifier et respecter ces réserves. Le robots.txt est aujourd'hui le moyen que les éditeurs de modèles reconnaissent le plus largement, même si la forme exacte d'une réserve valable reste discutée. Ceci n'est pas un avis juridique ; c'est le constat qu'une entreprise peut vouloir exercer cette réserve, et qu'elle peut le faire sans se priver de la recherche générative.

Les éditeurs eux-mêmes ont séparé les deux usages en publiant des agents distincts : OpenAI indique que OAI-SearchBot sert à la recherche ChatGPT et n'alimente pas l'entraînement ; Anthropic réserve la collecte à ClaudeBot ; Google exprime la décision d'entraînement par le jeton Google-Extended, sans effet sur AI Overviews ni sur AI Mode. Le détail des agents et de la syntaxe figure dans notre guide des robots IA ; cet article traite de la politique.

Schéma 1La construction d'une politique en deux niveaux, de l'inventaire des contenus au contrôle. La décision de recherche est celle qui fait la citation.
  1. 01InventorierLister les familles de contenus et vérifier que chacune vit dans un répertoire d'URL distinct.
  2. 02Décider l'entraînementFamille par famille : refus, autorisation, ou autorisation sur une sélection.
  3. 03Décider la rechercheTout ce qui doit vendre ou convaincre reste ouvert aux robots de recherche IA. C'est la décision qui fait la citation.
  4. 04TraduireUn groupe par finalité, des chemins par famille, les exclusions répétées dans chaque groupe.
  5. 05ContrôlerAnalyseur conforme, journaux serveur, part de citation par moteur.

Niveau 1 : l'agent, ou à qui l'on répond

Le premier niveau répond à la question « qui demande ? ». Un fichier robots.txt en deux niveaux comporte au moins trois groupes : le groupe général, qui s'applique à tout robot sans groupe à son nom, dont Googlebot et Bingbot ; le groupe des robots de recherche IA, OAI-SearchBot, Claude-SearchBot et PerplexityBot ; et le groupe des robots d'entraînement, GPTBot, ClaudeBot, Google-Extended, auxquels on ajoute selon les cas Applebot-Extended, Meta-ExternalAgent et CCBot.

Ce dernier mérite une explication. CCBot est le robot de Common Crawl, une fondation qui publie des corpus du web librement réutilisables ; de nombreux laboratoires y puisent pour l'entraînement. Un site qui refuse GPTBot mais laisse passer CCBot refuse la porte principale et laisse la porte de service ouverte. La cohérence du niveau 1 se juge à la finalité, pas au nom de l'éditeur.

Les agents de consultation à la demande, ChatGPT-User, Claude-User et Perplexity-User, ne reçoivent pas de groupe. Ils agissent pour un utilisateur qui vient de poser une question, et Perplexity documente que le sien ignore en général le fichier. Les traiter comme des robots d'exploration n'a pas de sens : un lecteur humain est derrière chaque requête, et la page qu'il demande est exactement celle que vous voudriez lui montrer.

Niveau 2 : le chemin, ou ce que l'on montre

Le second niveau répond à la question « quoi ? ». Décider pour tout le site est la facilité qui coûte le plus cher : les pages d'offre, les guides d'expertise, la documentation et les contenus réservés n'ont pas la même valeur, ni le même risque, ni le même intérêt à être connus des modèles. La politique se décide famille par famille, et se traduit en répertoires d'URL.

Schéma 2Quatre familles de contenus, et le régime que nous recommandons le plus souvent pour chacune. La colonne de droite est la seule où le robots.txt ne suffit pas.
  1. 1Vitrine et offrePages d'offre, tarifs, fiches produit, pages locales. Entraînement le plus souvent autorisé ; recherche ouverte.Sinon : le modèle ne sait pas ce que vous vendez.
  2. 2ExpertiseBlog, guides, études, livres blancs. Entraînement refusé si vous protégez votre valeur ; recherche ouverte.Sinon : vos passages citables ne sont jamais extraits.
  3. 3Documentation et supportNotices, FAQ, centres d'aide. Entraînement à votre choix ; recherche ouverte.Sinon : les réponses sur votre produit viennent des forums.
  4. 4Payant et privéContenus réservés aux abonnés, espaces clients. Entraînement refusé ; recherche sur une page d'aperçu seulement.Sinon : le contenu payant circule gratuitement.

La première famille surprend souvent. Pourquoi laisser l'entraînement lire vos pages d'offre alors que vous le refusez sur vos guides ? Parce qu'un modèle répond aussi sans chercher. Quand un utilisateur pose une question sans que le moteur déclenche une recherche, la réponse vient de ce que le modèle a retenu lors de son entraînement. Une marque absente des corpus est absente de ces réponses-là. Les pages d'offre, courtes et factuelles, sont celles dont vous souhaitez qu'un modèle se souvienne ; les guides, eux, constituent votre valeur et se protègent. La nuance : l'essentiel de ce qu'un modèle sait d'une marque vient de sources tierces, presse, annuaires, comparatifs, que votre fichier ne gouverne pas.

Famille de contenuRobots d'entraînementRobots de recherche IAAgents de consultationComplément
Vitrine, offres, tarifs, fiches produitAutorisés (recommandé)AutorisésAutorisésDonnées structurées Organization, Product, Offer
Expertise : blog, guides, études, PDFRefusésAutorisésAutorisésDates visibles, passages citables
Documentation, support, FAQAu choixAutorisésAutorisésBalisage FAQPage
Contenus payants, réservés aux abonnésRefusésPage d'aperçu seulementSelon l'authentificationAuthentification, jamais le seul robots.txt
Espace client, panier, recherche interne, filtresRefusésRefusésSans objetBalise noindex

Tableau : faites défiler horizontalement.

Ce tableau suppose une condition que beaucoup de sites ne remplissent pas : des URL qui reflètent les familles de contenus. Un site où les guides, les offres et les actualités vivent tous à la racine, sous /nom-de-la-page, ne peut pas être gouverné par chemin. Le premier chantier est alors une réorganisation des URL, avec redirections, ou à défaut un contrôle page par page par les en-têtes HTTP décrits plus bas.

Le fichier en deux niveaux, écrit et commenté

Le fichier ci-dessous met en œuvre la matrice pour un site dont les répertoires sont propres. Chaque groupe est autonome, parce qu'un robot qui trouve un groupe à son nom n'applique que celui-là ; les exclusions du privé sont donc répétées trois fois.

# Groupe général : Googlebot, Bingbot et tout robot sans groupe
User-agent: *
Disallow: /espace-client/
Disallow: /panier/
Disallow: /recherche
Disallow: /*?filtre=

# Robots de recherche IA : tout, sauf le privé et le réservé
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /
Disallow: /espace-client/
Disallow: /panier/
Disallow: /recherche
Disallow: /*?filtre=
Disallow: /abonnes/

# Robots d'entraînement : l'offre reste lisible,
# l'expertise et le réservé sont fermés, le glossaire fait exception
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
User-agent: CCBot
Allow: /
Disallow: /blog/
Disallow: /guides/
Disallow: /etudes/
Disallow: /*.pdf$
Disallow: /abonnes/
Disallow: /espace-client/
Disallow: /panier/
Allow: /blog/glossaire/

Sitemap: https://www.exemple.fr/sitemap.xml
Schéma 3Lecture du fichier : les deux niveaux se croisent, et c'est à l'intersection que se prend la décision utile.
Niveau 1 : l'agent
Qui demande ? Un groupe par finalité : général, recherche, entraînement.
Niveau 2 : le chemin
Quoi ? Des répertoires qui reflètent les familles : /offres/, /blog/, /guides/, /abonnes/, /espace-client/.
Intersection
L'entraînement est refusé sur /blog/, /guides/ et /etudes/ mais lit les offres ; la recherche lit tout sauf le privé et le réservé. Deux décisions, un seul fichier.
Exception
Allow: /blog/glossaire/ dans un groupe qui refuse /blog/ : la règle la plus longue l'emporte, le glossaire reste ouvert à l'entraînement.
Contrôle
Un analyseur conforme à la RFC 9309, puis les journaux, confirment que chaque robot lit ce que la matrice prévoit.

Deux détails font la différence entre un fichier qui marche et un fichier qui rassure. La ligne Allow: / du groupe d'entraînement n'est pas décorative : elle dit qu'en dehors des exclusions, tout est lisible, ce qui est bien la politique choisie. Et la règle Disallow: /*.pdf$ ferme les livres blancs à l'entraînement tout en les laissant aux robots de recherche, qui ne sont pas dans ce groupe ; le caractère $ évite de bloquer une URL qui contiendrait « .pdf » au milieu de son chemin.

Les compléments HTTP que le robots.txt ne remplace pas

Le robots.txt gouverne l'accès, par agent et par chemin. Il ne dit rien de l'usage qui sera fait d'une page lue, et il ne sait pas agir page par page quand les URL ne s'y prêtent pas. Plusieurs instruments le complètent ; aucun ne le remplace, et chacun n'a d'effet que chez les éditeurs qui le reconnaissent.

InstrumentCe qu'il gouverneReconnaissance documentée
robots.txtL'accès, par agent et par cheminTous les éditeurs cités déclarent le respecter, sauf pour les agents de consultation
noindex (balise ou en-tête X-Robots-Tag)Le retrait d'une page de l'index, réponses IA comprisesGoogle, Bing
nosnippet, max-snippet, data-nosnippetLa longueur des extraits, y compris dans AI Overviews et AI ModeGoogle
nocache, noarchiveL'usage du contenu dans Copilot, d'après la documentation de BingMicrosoft
Réserve de fouille (TDMRep, signaux de contenu)Une déclaration de réserve lisible par machineAdoption non documentée par les éditeurs de modèles, à notre connaissance
AuthentificationL'accès réel, quel que soit l'agentSans objet : le contenu n'est pas servi

Tableau : faites défiler horizontalement.

L'en-tête X-Robots-Tag est le plus utile des compléments, parce qu'il s'applique à des fichiers qui n'ont pas de balise meta : PDF, documents bureautiques, images. Un site qui refuse l'entraînement sur ses livres blancs mais les laisse indexer par Google peut, à l'inverse, vouloir sortir de tous les index les documents internes publiés par erreur. La configuration tient en quelques lignes côté serveur.

# Apache : documents bureautiques hors de tout index
<FilesMatch "\.(docx|xlsx|pptx)$">
  Header set X-Robots-Tag "noindex, noarchive"
</FilesMatch>

# Nginx : même règle
location ~* \.(docx|xlsx|pptx)$ {
  add_header X-Robots-Tag "noindex, noarchive";
}

Pour les contenus payants, le seul instrument fiable est l'authentification. Un article réservé aux abonnés mais servi en clair à quiconque envoie une requête n'est protégé par rien ; le robots.txt demande poliment, un mur de connexion refuse. La bonne pratique consiste à publier une page d'aperçu, ouverte aux robots de recherche et balisée comme telle, et à servir le texte complet après connexion seulement.

Ce que la politique ne fera pas

Une direction qui décide de refuser l'entraînement doit entendre trois limites avant de signer, faute de quoi elle mesurera la politique à l'aune de promesses qu'elle ne peut pas tenir.

  • Elle n'est pas rétroactive. Ce qui a été collecté avant la mise en place du fichier reste dans les corpus existants, et un modèle déjà entraîné ne désapprend pas. La réserve vaut pour l'avenir.
  • Elle ne s'applique qu'aux robots qui la lisent. Les éditeurs cités déclarent respecter le fichier ; un extracteur anonyme, ou un agent qui imite la chaîne d'un navigateur, ne le lit pas. Le pare-feu et le CDN prennent le relais, avec leurs propres risques d'excès.
  • Elle ne couvre pas vos contenus republiés. Un article syndiqué chez un partenaire, un communiqué repris par un média, une fiche produit copiée par un revendeur sont lus chez eux, sous leur politique. Plus votre contenu circule, moins votre fichier gouverne.
Schéma 4Deux politiques comparées sur un même site : la règle unique protège le même périmètre que la politique en deux niveaux, mais supprime la citation.
Pages lisibles par les robots de recherche IA
0 %
94 %
Pages exposées aux robots d'entraînement
0 %
28 %
Réponses citant la marque, huit semaines après
3 %
19 %
Règle unique « bloquer les IA »Politique en deux niveaux

Données illustratives. Ce qu'il faut y lire : l'expertise est protégée dans les deux cas ; seule la seconde politique laisse les moteurs lire ce qui doit être cité, et n'expose à l'entraînement que les pages choisies pour l'être.

Une quatrième limite est plus subtile. Refuser l'entraînement sur l'ensemble du site, y compris les pages d'offre, revient à demander aux futurs modèles d'ignorer votre marque. Les réponses données sans recherche, qui restent nombreuses, s'en ressentiront. C'est un choix défendable ; il doit être fait en connaissance de cause, et c'est la raison pour laquelle le niveau 2 existe.

Déployer, mesurer, réviser

Le déploiement suit l'ordre du schéma 1, et deux étapes concentrent l'essentiel du travail. L'inventaire, d'abord : il faut recenser les familles de contenus avec les équipes qui les produisent, décider pour chacune, et vérifier que les URL permettent d'appliquer la décision. Quand ce n'est pas le cas, le choix se fait entre une réorganisation des URL, qui règle le problème durablement, et un contrôle page par page par en-têtes, qui le contourne. Le test, ensuite : avant la mise en ligne, le fichier passe dans un analyseur conforme à la RFC 9309 avec une liste d'URL représentatives et, pour chaque agent, le résultat attendu.

La mesure commence le jour de la mise en ligne. Les journaux serveur montrent, agent par agent, les URL demandées et les codes de réponse : un robot d'entraînement qui continue de lire /guides/ après une semaine signale un fichier mal servi, un cache, ou un agent qui n'applique pas la règle. La part de citation, mesurée chaque semaine sur un panel de questions comme le décrit notre méthode pour être cité, confirme que la décision de recherche n'a pas été touchée. Si elle baisse, la cause est ailleurs : un pare-feu, ou un contenu que les robots ne peuvent pas lire, ce que traite notre article sur le rendu JavaScript.

La révision est trimestrielle. Les éditeurs ajoutent des agents, en retirent, changent leurs finalités ; un fichier écrit il y a un an ne connaît ni Claude-SearchBot ni OAI-SearchBot, tous deux plus récents que GPTBot et ClaudeBot. Une veille sur les pages de documentation des éditeurs, une relecture du fichier et une vérification des journaux suffisent, à condition que quelqu'un en ait la charge.

Point de vigilance

La politique doit être écrite, datée et signée en dehors du fichier : quelle famille, quelle décision, pour quelle raison. Un robots.txt sans document de politique est réécrit au premier changement d'agence ou de CMS, et personne ne sait plus pourquoi telle ligne existe.

Ce qu'il faut retenir

L'essentiel
  • Refuser l'entraînement et rester cité sont deux décisions distinctes ; une règle unique « bloquer les IA » les confond et retire le site des réponses.
  • Niveau 1 : un groupe par finalité (général, recherche, entraînement), la cohérence se jugeant à la finalité, Common Crawl compris.
  • Niveau 2 : une décision par famille de contenu, traduite en répertoires ; l'offre reste souvent lisible par l'entraînement, l'expertise se protège.
  • Le robots.txt gouverne l'accès, pas l'usage : noindex, nosnippet, X-Robots-Tag et surtout l'authentification complètent la politique.
  • La politique n'est ni rétroactive, ni opposable aux imitateurs, ni applicable à vos contenus republiés ; elle se mesure dans les journaux et dans la part de citation.

Questions fréquentes

Bloquer GPTBot fait-il disparaître mon site de ChatGPT ?

Non. GPTBot collecte des données pour l'entraînement des modèles ; la recherche ChatGPT s'appuie sur OAI-SearchBot, et les consultations à la demande d'un utilisateur passent par ChatGPT-User. D'après la documentation d'OpenAI, ces deux derniers agents ne servent pas à l'entraînement. Vous pouvez donc refuser GPTBot et rester une source de la recherche, à condition d'écrire des groupes séparés dans le robots.txt et de ne pas les confondre dans une règle unique.

Faut-il autoriser l'entraînement sur certaines pages ?

C'est souvent pertinent pour les pages d'offre, de tarifs et de présentation. Un modèle répond fréquemment sans lancer de recherche, à partir de ce qu'il a retenu de son entraînement ; une marque absente des corpus est absente de ces réponses. Réserver le refus aux contenus d'expertise, qui constituent votre valeur, et laisser lisibles les pages factuelles qui décrivent ce que vous vendez est le compromis que nous recommandons le plus souvent.

Comment protéger un contenu payant des robots IA ?

Par l'authentification, pas par le robots.txt. Le fichier exprime une demande que seuls les robots déclarés respectent ; un contenu réservé mais servi en clair à toute requête n'est protégé par rien. Servez le texte complet après connexion seulement, publiez une page d'aperçu publique ouverte aux robots de recherche IA, et fermez le répertoire réservé dans tous les groupes du fichier.

Le robots.txt vaut-il réserve de droits au sens du droit européen ?

C'est le moyen lisible par machine que les éditeurs de modèles reconnaissent le plus largement pour exprimer un refus de fouille, et le règlement européen sur l'IA demande aux fournisseurs de modèles à usage général de respecter ces réserves. La forme exacte d'une réserve valable reste toutefois discutée, et d'autres signaux existent, comme le protocole TDMRep. Faites valider votre politique par votre conseil juridique ; l'article ne constitue pas un avis en droit.

À quelle fréquence faut-il revoir cette politique ?

Chaque trimestre, et à chaque annonce d'un éditeur. Les agents changent : OAI-SearchBot et Claude-SearchBot sont plus récents que GPTBot et ClaudeBot, et un fichier écrit avant leur apparition ne les connaît pas. La revue consiste à relire la documentation des éditeurs, à vérifier dans les journaux que chaque agent lit ce que la matrice prévoit, et à confirmer que la part de citation n'a pas bougé.

Portrait de Kamel Malek
Kamel Malek
Fondateur & directeur de l'agence

Praticien du référencement depuis 2001, Kamel Malek dirige SEO360 (Alicante, Valence, Madrid, Paris). Il a publié trois ouvrages sur la visibilité dans les moteurs génératifs, dont Generative Engine Optimization et Rétablir les faits.