Sommaire de l'article
llms.txt est une proposition communautaire, pas une norme reconnue par les moteurs
Le fichier llms.txt est une proposition publiée en septembre 2024 sur le site llmstxt.org par un chercheur en apprentissage automatique, sans l'appui d'aucun éditeur de moteur. L'idée est simple : placer à la racine d'un site un fichier texte au format Markdown qui décrit le site en quelques lignes et liste ses pages les plus utiles, avec une phrase par lien, afin qu'un modèle de langage disposant d'une fenêtre de contexte limitée sache où aller sans parcourir tout le site.
La proposition a été adoptée rapidement par les outils de documentation technique, qui génèrent le fichier automatiquement, et par des éditeurs de logiciels pour développeurs, dont Anthropic pour sa propre documentation. Cette adoption a créé une confusion : parce que des sites liés à l'IA publient un llms.txt, beaucoup en ont déduit que les moteurs génératifs le lisent pour sélectionner leurs sources. Rien, dans la documentation publique de ces moteurs, ne l'indique.
Il faut donc tenir deux idées à la fois. Le fichier est peu coûteux, inoffensif et parfois utile dans des cas précis que nous détaillons plus bas. Et il ne figure pas parmi les quatre conditions d'une citation : une page accessible, citable, identifiée et corroborée l'est avec ou sans llms.txt, et une page qui ne l'est pas ne le devient pas grâce à lui. Cet article vous permet de l'écrire correctement, puis de le ranger à sa juste place.
Ce que dit la spécification, et rien de plus
La spécification tient en une page et impose très peu de choses. Le fichier se nomme llms.txt, se place à la racine du site (/llms.txt) et s'écrit en Markdown. Une seule partie est obligatoire : un titre de premier niveau portant le nom du site ou du projet. Tout le reste est facultatif et suit un ordre fixe, décrit dans le schéma ci-dessous. Une convention voisine, llms-full.txt, issue des outils de documentation, concatène le contenu intégral des pages dans un seul fichier ; elle ne fait pas partie de la proposition initiale.
La proposition suggère aussi, sans l'imposer, de servir une version Markdown de chaque page importante en ajoutant .md à son URL, afin qu'un modèle obtienne le texte sans le balisage HTML. C'est la partie la plus lourde à mettre en œuvre, et la moins justifiée tant qu'aucun agent documenté ne la demande.
Un exemple complet pour un site d'entreprise
L'exemple ci-dessous décrit un cabinet d'expertise comptable fictif. Il respecte la structure imposée et applique une règle que la spécification ne formule pas mais que le bon sens impose : chaque note de lien contient un élément concret, un périmètre, un chiffre ou une date, plutôt qu'un slogan. Un fichier de dix à quarante liens suffit ; un fichier qui reprend tout le sitemap n'apporte rien de plus qu'un sitemap.
# Cabinet Exemple, expertise comptable
> Cabinet d'expertise comptable à Lyon, spécialisé dans les TPE du bâtiment
> et les professions libérales. Trois associés, douze collaborateurs,
> honoraires publiés. Site en français uniquement.
Les pages listées ci-dessous sont maintenues par le cabinet et datées.
Les actualités et les pages légales sont secondaires.
## Services
- [Tenue comptable pour artisans du bâtiment](https://www.exemple.fr/services/artisans-batiment): périmètre, livrables mensuels, honoraires à partir de 180 € HT par mois
- [Déclarations fiscales des professions libérales](https://www.exemple.fr/services/professions-liberales): BNC, TVA, CFE, calendrier annuel des échéances
- [Création d'entreprise](https://www.exemple.fr/services/creation): choix du statut, formalités, délais constatés
## Guides
- [Guide fiscal 2026](https://www.exemple.fr/guides/fiscal-2026): seuils, taux et dates limites, mis à jour le 15 janvier 2026
- [TVA dans le bâtiment](https://www.exemple.fr/guides/tva-batiment): taux réduit, autoliquidation, attestations à fournir
## Cabinet
- [Les associés](https://www.exemple.fr/cabinet/associes): parcours, inscription à l'Ordre, spécialités
- [Honoraires](https://www.exemple.fr/honoraires): grille complète, sans devis préalable
## Optional
- [Actualités](https://www.exemple.fr/actualites): articles courts
- [Mentions légales](https://www.exemple.fr/mentions-legales)
Trois détails comptent. Les URL sont absolues, pour qu'un fichier lu hors contexte reste exploitable. Les notes reprennent le vocabulaire des pages elles-mêmes, ce qui évite qu'un modèle trouve dans le fichier une promesse absente de la page. Enfin, la section Optional reçoit ce qui ne répond à aucune question d'acheteur.
Ce que les éditeurs de moteurs en disent
Rien, ou presque, et c'est l'information la plus importante de cet article. La documentation d'OpenAI sur ses robots décrit le rôle de GPTBot, d'OAI-SearchBot et de ChatGPT-User, et le contrôle par robots.txt ; elle ne mentionne pas llms.txt. Il en va de même pour la documentation d'Anthropic sur ClaudeBot, Claude-SearchBot et Claude-User, pour celle de Perplexity sur PerplexityBot et Perplexity-User, et pour la documentation de Google sur ses fonctionnalités de recherche IA. Un représentant de Google a même indiqué publiquement, au printemps 2025, qu'à sa connaissance aucun système d'IA n'utilisait ce fichier, en le comparant à l'ancienne balise meta keywords.
Le fait qu'Anthropic publie un llms.txt pour sa documentation destinée aux développeurs ne dit rien de la manière dont Claude sélectionne ses sources ; il dit seulement que l'outil qui génère cette documentation produit le fichier. Confondre les deux revient à croire qu'un éditeur applique à son moteur les conventions de son service de documentation.
- 1robots.txtStandard formalisé (RFC 9309), lu par tous les agents documentés des éditeurs. C'est le seul levier d'accès reconnu : autoriser la recherche, refuser l'entraînement.Sinon : aucun contrôle sur qui lit quoi.
- 2sitemap.xmlProtocole sitemaps.org, dont Google et Bing documentent l'usage pour la découverte des URL et les dates de modification. L'index Bing alimente Copilot.Sinon : découverte plus lente des pages nouvelles ou mises à jour.
- 3llms.txtProposition communautaire de 2024. Aucun éditeur de moteur n'a documenté sa lecture, ni son rôle dans la sélection des sources.Sinon : rien de mesurable, à ce jour.
Les journaux serveur confirment ce statut. Dans ceux que nous examinons, les requêtes vers /llms.txt proviennent surtout d'outils d'audit et de scripts divers, rarement des agents listés ci-dessus. La méthode pour le vérifier chez vous est décrite dans l'article sur la détection des robots IA dans les journaux serveur : une commande suffit pour savoir qui demande ce fichier, et à quelle fréquence.
Ce qu'il ne fera pas
Les attentes placées dans ce fichier sont souvent celles que l'on devrait placer ailleurs. Le tableau ci-dessous reprend les cinq que nous entendons le plus souvent en audit, et ce qui se passe réellement.
| Attente fréquente | Ce qui se passe réellement |
|---|---|
| « Il empêche l'entraînement des modèles sur mes contenus. » | Aucun robot d'entraînement n'a documenté sa lecture. Le seul contrôle reconnu est le robots.txt, avec les jetons GPTBot, ClaudeBot et Google-Extended. |
| « Il remplace le sitemap. » | Google et Bing lisent le sitemap XML, pas llms.txt, et leurs index alimentent AI Overviews, AI Mode et Copilot. Le sitemap reste le canal de découverte documenté. |
| « Il fait citer mes pages. » | La sélection s'opère au niveau du passage, sur des pages lues directement. Un résumé externe ne rend pas un paragraphe plus citable. |
| « Il corrige un contenu rendu en JavaScript. » | L'agent qui lit une page lit son HTML. Si le texte n'y figure pas, le fichier n'y change rien ; la solution est le rendu côté serveur. |
| « ChatGPT le consulte quand on lui pose une question. » | ChatGPT-User lit l'URL demandée ou trouvée par la recherche. Rien n'indique qu'il consulte llms.txt au préalable. |
Tableau : faites défiler horizontalement.
Le risque n'est pas que le fichier nuise, mais qu'il rassure. Une direction qui a « fait le llms.txt » considère souvent l'accès technique comme réglé, alors que son CDN bloque encore OAI-SearchBot ou que ses pages produit n'existent que dans le rendu JavaScript. L'article sur le rendu JavaScript face aux moteurs génératifs décrit ce second cas, bien plus fréquent que ne le laissent penser les discussions sur llms.txt.
Où il rend service malgré tout
Trois usages justifient l'heure qu'il demande. Le premier concerne les assistants et agents dotés d'un outil de navigation : lorsqu'un utilisateur pointe explicitement un tel outil vers votre site, un fichier qui hiérarchise vos pages et les décrit en une ligne lui fait gagner du temps et réduit les erreurs de lecture. Ce cas est fréquent pour la documentation technique, les grilles tarifaires et les catalogues, moins pour un site vitrine.
Le deuxième usage est interne. Un fichier qui liste vos pages de référence, avec une description exacte de chacune, sert de base à votre propre assistant, à vos intégrations avec des partenaires et à toute personne qui doit comprendre votre site rapidement. Le troisième est éditorial, et c'est le plus sous-estimé : écrire ce fichier oblige à choisir les vingt pages qui comptent et à formuler, pour chacune, ce qu'elle apporte de vérifiable. Cet inventaire est exactement celui qu'exige un programme GEO, et il révèle souvent que la page que l'on croyait centrale ne répond à aucune question précise.
- 01InventaireLister les pages qui répondent à une question d'acheteur, avec leur date de dernière mise à jour.
- 02SélectionRetenir dix à quarante URL ; renvoyer le reste vers la section Optional ou l'écarter.
- 03Rédaction des notesUne ligne par URL, avec un périmètre, un chiffre ou une date, dans les mots de la page elle-même.
- 04PublicationFichier à la racine, encodage UTF-8, type de contenu texte, référence dans la documentation interne.
- 05VérificationSuivre dans les journaux qui demande le fichier ; ajuster ou abandonner selon les faits.
Un fichier qui ment est pire qu'une absence de fichier. Si une note annonce des honoraires « à partir de 180 € » et que la page indique un autre montant, tout outil qui lit les deux relèvera l'incohérence, et vous perdrez sur la crédibilité ce que vous espériez gagner sur la lisibilité. La règle est la même que pour les données structurées : le fichier décrit la page, il ne la remplace ni ne l'embellit.
Sa place réelle dans une stratégie GEO
Dans un programme de visibilité générative, llms.txt arrive après tout ce qui a un effet documenté. L'accès des robots de recherche IA, vérifié dans les journaux, passe d'abord. Viennent ensuite les pages réécrites en réponses directes, les données structurées qui identifient l'entité, puis la corroboration par des sources tierces. Le fichier s'ajoute en fin de liste, dans la même catégorie que les compléments peu coûteux dont on n'attend rien de mesurable mais que l'on ne regrette pas.
Nous le recommandons donc, à trois conditions : qu'il soit écrit à partir de l'inventaire éditorial et non généré mécaniquement depuis le sitemap ; qu'il soit maintenu, parce qu'un fichier qui liste une page supprimée ou un tarif ancien dessert le site ; et qu'il ne soit jamais présenté à une direction comme un levier de citation. Le calendrier ci-dessous résume ce que la maintenance exige, et elle est modeste.
- À la créationInventaire et rédaction
- Dix à quarante URL absolues, une note concrète par lien
- Section Optional pour le secondaire
- Contrôle de cohérence avec les pages et les données structurées
- À chaque publicationMise à jour ciblée
- Ajouter ou retirer la page concernée
- Corriger la note si un chiffre ou une date change
- Vérifier que l'URL renvoie un code 200
- Chaque trimestreRevue et décision
- Relever dans les journaux qui demande le fichier
- Comparer avec les URL citées dans le panel de questions
- Maintenir, alléger ou abandonner selon les faits
Si, dans un an, un éditeur de moteur documente l'usage de ce fichier dans la sélection de ses sources, vous serez prêt et le fichier sera juste. Si aucun ne le fait, vous aurez consacré une heure à un inventaire que votre programme GEO exigeait de toute façon. Dans les deux cas, la décision est la bonne, à condition d'avoir traité l'accès, le contenu, l'entité et la corroboration avant.
Ce qu'il faut retenir
- llms.txt est une proposition communautaire de 2024 : un plan de site en Markdown à la racine, avec un titre obligatoire et des listes de liens annotés.
- Aucun éditeur de moteur (OpenAI, Anthropic, Google, Perplexity, Microsoft) n'a documenté sa lecture ni son rôle dans la sélection des sources.
- Il ne contrôle pas l'accès, ne remplace ni le robots.txt ni le sitemap, et ne rend pas un passage plus citable.
- Il sert aux agents qu'un utilisateur pointe vers votre site, à vos usages internes, et surtout comme inventaire éditorial de vos pages de référence.
- Écrivez-le en une heure, avec des notes exactes, maintenez-le, et placez-le après les quatre conditions d'une citation.
Questions fréquentes
Les moteurs génératifs lisent-ils le fichier llms.txt ?
Aucun éditeur de moteur n'a documenté sa lecture. Les documentations d'OpenAI, d'Anthropic, de Perplexity et de Google décrivent leurs robots et le contrôle par robots.txt sans mentionner llms.txt, et un représentant de Google a indiqué publiquement en 2025 qu'aucun système d'IA ne l'utilisait à sa connaissance. Vos journaux serveur vous diront si un agent le demande chez vous ; le plus souvent, ce sont des outils d'audit.
llms.txt permet-il de bloquer l'entraînement des modèles sur mon site ?
Non. Le fichier n'a aucune fonction de contrôle d'accès et aucun robot d'entraînement n'a documenté sa lecture. Le seul mécanisme reconnu par les éditeurs est le fichier robots.txt, avec les jetons GPTBot, ClaudeBot et Google-Extended pour l'entraînement, distincts des robots de recherche comme OAI-SearchBot, Claude-SearchBot et PerplexityBot, qu'il faut laisser passer pour rester cité.
Que doit contenir un fichier llms.txt bien écrit ?
Un titre de premier niveau avec le nom du site, seule partie obligatoire ; un résumé en citation Markdown ; éventuellement quelques lignes de contexte ; puis des sections de second niveau listant dix à quarante liens absolus, chacun suivi d'une note concrète avec un périmètre, un chiffre ou une date. Une section « Optional » accueille le secondaire. Les notes reprennent le vocabulaire des pages, sans promesse absente de celles-ci.
Faut-il aussi publier un fichier llms-full.txt ?
Rarement. Cette variante, issue des outils de documentation technique, concatène le texte intégral des pages dans un seul fichier. Elle a un sens pour une documentation de produit que des développeurs chargent dans un assistant, beaucoup moins pour un site d'entreprise, où elle duplique le contenu sans que les moteurs de recherche IA aient documenté son usage. Commencez par un llms.txt court et exact.
À quel moment d'un programme GEO faut-il créer le llms.txt ?
En dernier, après avoir vérifié l'accès des robots de recherche IA dans les journaux, réécrit les pages principales en réponses directes, mis en place les données structurées d'entité et engagé la corroboration externe. Il coûte une heure et son principal bénéfice est l'inventaire éditorial qu'il impose ; le placer avant les chantiers à effet documenté revient à inverser les priorités.


