Sommaire de l'article
« Faut-il bloquer les IA ? » est une question mal posée
La question qui remonte à la direction est presque toujours formulée ainsi : bloquons-nous les robots IA, oui ou non ? Elle mélange deux décisions qui n'ont ni le même objet, ni le même horizon, ni les mêmes interlocuteurs. La première porte sur l'entraînement : acceptez-vous que vos textes entrent dans les corpus qui servent à construire les prochains modèles ? C'est une décision patrimoniale et juridique, à effet différé et diffus. La seconde porte sur la citation : voulez-vous que les moteurs génératifs puissent lire vos pages pour les retenir comme sources dans leurs réponses ? C'est une décision commerciale, à effet immédiat et mesurable.
Le cadre européen rend la première décision concrète. La directive de 2019 sur le droit d'auteur autorise la fouille de textes et de données sauf réserve exprimée par le titulaire, notamment par des moyens lisibles par machine pour les contenus en ligne ; le règlement européen sur l'IA demande aux fournisseurs de modèles à usage général de se doter d'une politique pour identifier et respecter ces réserves. Le robots.txt est aujourd'hui le moyen que les éditeurs de modèles reconnaissent le plus largement, même si la forme exacte d'une réserve valable reste discutée. Ceci n'est pas un avis juridique ; c'est le constat qu'une entreprise peut vouloir exercer cette réserve, et qu'elle peut le faire sans se priver de la recherche générative.
Les éditeurs eux-mêmes ont séparé les deux usages en publiant des agents distincts : OpenAI indique que OAI-SearchBot sert à la recherche ChatGPT et n'alimente pas l'entraînement ; Anthropic réserve la collecte à ClaudeBot ; Google exprime la décision d'entraînement par le jeton Google-Extended, sans effet sur AI Overviews ni sur AI Mode. Le détail des agents et de la syntaxe figure dans notre guide des robots IA ; cet article traite de la politique.
- 01InventorierLister les familles de contenus et vérifier que chacune vit dans un répertoire d'URL distinct.
- 02Décider l'entraînementFamille par famille : refus, autorisation, ou autorisation sur une sélection.
- 03Décider la rechercheTout ce qui doit vendre ou convaincre reste ouvert aux robots de recherche IA. C'est la décision qui fait la citation.
- 04TraduireUn groupe par finalité, des chemins par famille, les exclusions répétées dans chaque groupe.
- 05ContrôlerAnalyseur conforme, journaux serveur, part de citation par moteur.
Niveau 1 : l'agent, ou à qui l'on répond
Le premier niveau répond à la question « qui demande ? ». Un fichier robots.txt en deux niveaux comporte au moins trois groupes : le groupe général, qui s'applique à tout robot sans groupe à son nom, dont Googlebot et Bingbot ; le groupe des robots de recherche IA, OAI-SearchBot, Claude-SearchBot et PerplexityBot ; et le groupe des robots d'entraînement, GPTBot, ClaudeBot, Google-Extended, auxquels on ajoute selon les cas Applebot-Extended, Meta-ExternalAgent et CCBot.
Ce dernier mérite une explication. CCBot est le robot de Common Crawl, une fondation qui publie des corpus du web librement réutilisables ; de nombreux laboratoires y puisent pour l'entraînement. Un site qui refuse GPTBot mais laisse passer CCBot refuse la porte principale et laisse la porte de service ouverte. La cohérence du niveau 1 se juge à la finalité, pas au nom de l'éditeur.
Les agents de consultation à la demande, ChatGPT-User, Claude-User et Perplexity-User, ne reçoivent pas de groupe. Ils agissent pour un utilisateur qui vient de poser une question, et Perplexity documente que le sien ignore en général le fichier. Les traiter comme des robots d'exploration n'a pas de sens : un lecteur humain est derrière chaque requête, et la page qu'il demande est exactement celle que vous voudriez lui montrer.
Niveau 2 : le chemin, ou ce que l'on montre
Le second niveau répond à la question « quoi ? ». Décider pour tout le site est la facilité qui coûte le plus cher : les pages d'offre, les guides d'expertise, la documentation et les contenus réservés n'ont pas la même valeur, ni le même risque, ni le même intérêt à être connus des modèles. La politique se décide famille par famille, et se traduit en répertoires d'URL.
- 1Vitrine et offrePages d'offre, tarifs, fiches produit, pages locales. Entraînement le plus souvent autorisé ; recherche ouverte.Sinon : le modèle ne sait pas ce que vous vendez.
- 2ExpertiseBlog, guides, études, livres blancs. Entraînement refusé si vous protégez votre valeur ; recherche ouverte.Sinon : vos passages citables ne sont jamais extraits.
- 3Documentation et supportNotices, FAQ, centres d'aide. Entraînement à votre choix ; recherche ouverte.Sinon : les réponses sur votre produit viennent des forums.
- 4Payant et privéContenus réservés aux abonnés, espaces clients. Entraînement refusé ; recherche sur une page d'aperçu seulement.Sinon : le contenu payant circule gratuitement.
La première famille surprend souvent. Pourquoi laisser l'entraînement lire vos pages d'offre alors que vous le refusez sur vos guides ? Parce qu'un modèle répond aussi sans chercher. Quand un utilisateur pose une question sans que le moteur déclenche une recherche, la réponse vient de ce que le modèle a retenu lors de son entraînement. Une marque absente des corpus est absente de ces réponses-là. Les pages d'offre, courtes et factuelles, sont celles dont vous souhaitez qu'un modèle se souvienne ; les guides, eux, constituent votre valeur et se protègent. La nuance : l'essentiel de ce qu'un modèle sait d'une marque vient de sources tierces, presse, annuaires, comparatifs, que votre fichier ne gouverne pas.
| Famille de contenu | Robots d'entraînement | Robots de recherche IA | Agents de consultation | Complément |
|---|---|---|---|---|
| Vitrine, offres, tarifs, fiches produit | Autorisés (recommandé) | Autorisés | Autorisés | Données structurées Organization, Product, Offer |
| Expertise : blog, guides, études, PDF | Refusés | Autorisés | Autorisés | Dates visibles, passages citables |
| Documentation, support, FAQ | Au choix | Autorisés | Autorisés | Balisage FAQPage |
| Contenus payants, réservés aux abonnés | Refusés | Page d'aperçu seulement | Selon l'authentification | Authentification, jamais le seul robots.txt |
| Espace client, panier, recherche interne, filtres | Refusés | Refusés | Sans objet | Balise noindex |
Tableau : faites défiler horizontalement.
Ce tableau suppose une condition que beaucoup de sites ne remplissent pas : des URL qui reflètent les familles de contenus. Un site où les guides, les offres et les actualités vivent tous à la racine, sous /nom-de-la-page, ne peut pas être gouverné par chemin. Le premier chantier est alors une réorganisation des URL, avec redirections, ou à défaut un contrôle page par page par les en-têtes HTTP décrits plus bas.
Le fichier en deux niveaux, écrit et commenté
Le fichier ci-dessous met en œuvre la matrice pour un site dont les répertoires sont propres. Chaque groupe est autonome, parce qu'un robot qui trouve un groupe à son nom n'applique que celui-là ; les exclusions du privé sont donc répétées trois fois.
# Groupe général : Googlebot, Bingbot et tout robot sans groupe
User-agent: *
Disallow: /espace-client/
Disallow: /panier/
Disallow: /recherche
Disallow: /*?filtre=
# Robots de recherche IA : tout, sauf le privé et le réservé
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /
Disallow: /espace-client/
Disallow: /panier/
Disallow: /recherche
Disallow: /*?filtre=
Disallow: /abonnes/
# Robots d'entraînement : l'offre reste lisible,
# l'expertise et le réservé sont fermés, le glossaire fait exception
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
User-agent: CCBot
Allow: /
Disallow: /blog/
Disallow: /guides/
Disallow: /etudes/
Disallow: /*.pdf$
Disallow: /abonnes/
Disallow: /espace-client/
Disallow: /panier/
Allow: /blog/glossaire/
Sitemap: https://www.exemple.fr/sitemap.xml
Deux détails font la différence entre un fichier qui marche et un fichier qui rassure. La ligne Allow: / du groupe d'entraînement n'est pas décorative : elle dit qu'en dehors des exclusions, tout est lisible, ce qui est bien la politique choisie. Et la règle Disallow: /*.pdf$ ferme les livres blancs à l'entraînement tout en les laissant aux robots de recherche, qui ne sont pas dans ce groupe ; le caractère $ évite de bloquer une URL qui contiendrait « .pdf » au milieu de son chemin.
Les compléments HTTP que le robots.txt ne remplace pas
Le robots.txt gouverne l'accès, par agent et par chemin. Il ne dit rien de l'usage qui sera fait d'une page lue, et il ne sait pas agir page par page quand les URL ne s'y prêtent pas. Plusieurs instruments le complètent ; aucun ne le remplace, et chacun n'a d'effet que chez les éditeurs qui le reconnaissent.
| Instrument | Ce qu'il gouverne | Reconnaissance documentée |
|---|---|---|
robots.txt | L'accès, par agent et par chemin | Tous les éditeurs cités déclarent le respecter, sauf pour les agents de consultation |
noindex (balise ou en-tête X-Robots-Tag) | Le retrait d'une page de l'index, réponses IA comprises | Google, Bing |
nosnippet, max-snippet, data-nosnippet | La longueur des extraits, y compris dans AI Overviews et AI Mode | |
nocache, noarchive | L'usage du contenu dans Copilot, d'après la documentation de Bing | Microsoft |
| Réserve de fouille (TDMRep, signaux de contenu) | Une déclaration de réserve lisible par machine | Adoption non documentée par les éditeurs de modèles, à notre connaissance |
| Authentification | L'accès réel, quel que soit l'agent | Sans objet : le contenu n'est pas servi |
Tableau : faites défiler horizontalement.
L'en-tête X-Robots-Tag est le plus utile des compléments, parce qu'il s'applique à des fichiers qui n'ont pas de balise meta : PDF, documents bureautiques, images. Un site qui refuse l'entraînement sur ses livres blancs mais les laisse indexer par Google peut, à l'inverse, vouloir sortir de tous les index les documents internes publiés par erreur. La configuration tient en quelques lignes côté serveur.
# Apache : documents bureautiques hors de tout index
<FilesMatch "\.(docx|xlsx|pptx)$">
Header set X-Robots-Tag "noindex, noarchive"
</FilesMatch>
# Nginx : même règle
location ~* \.(docx|xlsx|pptx)$ {
add_header X-Robots-Tag "noindex, noarchive";
}
Pour les contenus payants, le seul instrument fiable est l'authentification. Un article réservé aux abonnés mais servi en clair à quiconque envoie une requête n'est protégé par rien ; le robots.txt demande poliment, un mur de connexion refuse. La bonne pratique consiste à publier une page d'aperçu, ouverte aux robots de recherche et balisée comme telle, et à servir le texte complet après connexion seulement.
Ce que la politique ne fera pas
Une direction qui décide de refuser l'entraînement doit entendre trois limites avant de signer, faute de quoi elle mesurera la politique à l'aune de promesses qu'elle ne peut pas tenir.
- Elle n'est pas rétroactive. Ce qui a été collecté avant la mise en place du fichier reste dans les corpus existants, et un modèle déjà entraîné ne désapprend pas. La réserve vaut pour l'avenir.
- Elle ne s'applique qu'aux robots qui la lisent. Les éditeurs cités déclarent respecter le fichier ; un extracteur anonyme, ou un agent qui imite la chaîne d'un navigateur, ne le lit pas. Le pare-feu et le CDN prennent le relais, avec leurs propres risques d'excès.
- Elle ne couvre pas vos contenus republiés. Un article syndiqué chez un partenaire, un communiqué repris par un média, une fiche produit copiée par un revendeur sont lus chez eux, sous leur politique. Plus votre contenu circule, moins votre fichier gouverne.
Données illustratives. Ce qu'il faut y lire : l'expertise est protégée dans les deux cas ; seule la seconde politique laisse les moteurs lire ce qui doit être cité, et n'expose à l'entraînement que les pages choisies pour l'être.
Une quatrième limite est plus subtile. Refuser l'entraînement sur l'ensemble du site, y compris les pages d'offre, revient à demander aux futurs modèles d'ignorer votre marque. Les réponses données sans recherche, qui restent nombreuses, s'en ressentiront. C'est un choix défendable ; il doit être fait en connaissance de cause, et c'est la raison pour laquelle le niveau 2 existe.
Déployer, mesurer, réviser
Le déploiement suit l'ordre du schéma 1, et deux étapes concentrent l'essentiel du travail. L'inventaire, d'abord : il faut recenser les familles de contenus avec les équipes qui les produisent, décider pour chacune, et vérifier que les URL permettent d'appliquer la décision. Quand ce n'est pas le cas, le choix se fait entre une réorganisation des URL, qui règle le problème durablement, et un contrôle page par page par en-têtes, qui le contourne. Le test, ensuite : avant la mise en ligne, le fichier passe dans un analyseur conforme à la RFC 9309 avec une liste d'URL représentatives et, pour chaque agent, le résultat attendu.
La mesure commence le jour de la mise en ligne. Les journaux serveur montrent, agent par agent, les URL demandées et les codes de réponse : un robot d'entraînement qui continue de lire /guides/ après une semaine signale un fichier mal servi, un cache, ou un agent qui n'applique pas la règle. La part de citation, mesurée chaque semaine sur un panel de questions comme le décrit notre méthode pour être cité, confirme que la décision de recherche n'a pas été touchée. Si elle baisse, la cause est ailleurs : un pare-feu, ou un contenu que les robots ne peuvent pas lire, ce que traite notre article sur le rendu JavaScript.
La révision est trimestrielle. Les éditeurs ajoutent des agents, en retirent, changent leurs finalités ; un fichier écrit il y a un an ne connaît ni Claude-SearchBot ni OAI-SearchBot, tous deux plus récents que GPTBot et ClaudeBot. Une veille sur les pages de documentation des éditeurs, une relecture du fichier et une vérification des journaux suffisent, à condition que quelqu'un en ait la charge.
La politique doit être écrite, datée et signée en dehors du fichier : quelle famille, quelle décision, pour quelle raison. Un robots.txt sans document de politique est réécrit au premier changement d'agence ou de CMS, et personne ne sait plus pourquoi telle ligne existe.
Ce qu'il faut retenir
- Refuser l'entraînement et rester cité sont deux décisions distinctes ; une règle unique « bloquer les IA » les confond et retire le site des réponses.
- Niveau 1 : un groupe par finalité (général, recherche, entraînement), la cohérence se jugeant à la finalité, Common Crawl compris.
- Niveau 2 : une décision par famille de contenu, traduite en répertoires ; l'offre reste souvent lisible par l'entraînement, l'expertise se protège.
- Le robots.txt gouverne l'accès, pas l'usage : noindex, nosnippet, X-Robots-Tag et surtout l'authentification complètent la politique.
- La politique n'est ni rétroactive, ni opposable aux imitateurs, ni applicable à vos contenus republiés ; elle se mesure dans les journaux et dans la part de citation.
Questions fréquentes
Bloquer GPTBot fait-il disparaître mon site de ChatGPT ?
Non. GPTBot collecte des données pour l'entraînement des modèles ; la recherche ChatGPT s'appuie sur OAI-SearchBot, et les consultations à la demande d'un utilisateur passent par ChatGPT-User. D'après la documentation d'OpenAI, ces deux derniers agents ne servent pas à l'entraînement. Vous pouvez donc refuser GPTBot et rester une source de la recherche, à condition d'écrire des groupes séparés dans le robots.txt et de ne pas les confondre dans une règle unique.
Faut-il autoriser l'entraînement sur certaines pages ?
C'est souvent pertinent pour les pages d'offre, de tarifs et de présentation. Un modèle répond fréquemment sans lancer de recherche, à partir de ce qu'il a retenu de son entraînement ; une marque absente des corpus est absente de ces réponses. Réserver le refus aux contenus d'expertise, qui constituent votre valeur, et laisser lisibles les pages factuelles qui décrivent ce que vous vendez est le compromis que nous recommandons le plus souvent.
Comment protéger un contenu payant des robots IA ?
Par l'authentification, pas par le robots.txt. Le fichier exprime une demande que seuls les robots déclarés respectent ; un contenu réservé mais servi en clair à toute requête n'est protégé par rien. Servez le texte complet après connexion seulement, publiez une page d'aperçu publique ouverte aux robots de recherche IA, et fermez le répertoire réservé dans tous les groupes du fichier.
Le robots.txt vaut-il réserve de droits au sens du droit européen ?
C'est le moyen lisible par machine que les éditeurs de modèles reconnaissent le plus largement pour exprimer un refus de fouille, et le règlement européen sur l'IA demande aux fournisseurs de modèles à usage général de respecter ces réserves. La forme exacte d'une réserve valable reste toutefois discutée, et d'autres signaux existent, comme le protocole TDMRep. Faites valider votre politique par votre conseil juridique ; l'article ne constitue pas un avis en droit.
À quelle fréquence faut-il revoir cette politique ?
Chaque trimestre, et à chaque annonce d'un éditeur. Les agents changent : OAI-SearchBot et Claude-SearchBot sont plus récents que GPTBot et ClaudeBot, et un fichier écrit avant leur apparition ne les connaît pas. La revue consiste à relire la documentation des éditeurs, à vérifier dans les journaux que chaque agent lit ce que la matrice prévoit, et à confirmer que la part de citation n'a pas bougé.


