Sommaire de l'article
Un moteur génératif ne cite pas ce qu'il aurait pu écrire lui-même
Le paradoxe tient en une phrase : un texte produit par un modèle de langage sans apport extérieur contient, par construction, ce que le modèle savait déjà. Quand un moteur génératif cherche des sources pour répondre, il cherche précisément ce qu'il ne sait pas ou ne peut pas affirmer seul : un chiffre daté, un cas observé, une méthode décrite, une position argumentée par quelqu'un d'identifié. Une page qui n'apporte rien de cela n'est pas retenue, non parce qu'elle a été générée, mais parce qu'elle n'apporte rien. Le mode de production n'est pas le problème ; l'absence d'information l'est.
Dans nos audits, les sites qui ont industrialisé la production de pages entre 2023 et 2025 présentent presque toujours le même profil : un volume de pages en forte hausse, une part de citation stable ou en baisse, et des pages qui se ressemblent toutes. Elles répondent aux mêmes questions avec les mêmes formulations que des milliers d'autres sites, produites par les mêmes outils à partir des mêmes consignes. Le moteur, qui cherche à corroborer une affirmation par des sources indépendantes, y voit un écho, pas une source.
Cet article ne plaide ni pour ni contre l'usage des modèles en rédaction. Il décrit ce qui rend un texte générique aux yeux d'un moteur, où l'assistance par IA fait gagner du temps sans coûter de citations, où elle en coûte, et le protocole de relecture experte qui fait la différence. Il s'inscrit dans la méthode complète : le contenu généré échoue en général sur les conditions « citable » et « identifiée », rarement sur les deux autres.
Ce qui rend un texte « générique » aux yeux d'un modèle
Un moteur génératif ne détecte pas l'origine d'un texte ; il évalue ce que le texte lui apporte pour répondre à une sous-requête. Quatre absences reviennent dans les pages jamais citées, et elles sont indépendantes de l'outil qui a écrit la page. Un rédacteur humain pressé produit les mêmes absences ; un modèle les produit plus vite et en plus grand nombre.
- 1Une donnée de terrainUn chiffre que vous avez mesuré, une fourchette constatée sur vos dossiers, une date précise.Sinon : le passage n'a rien à citer.
- 2Un cas observéUne situation réelle, anonymisée, avec son contexte, la décision prise et son issue.Sinon : le texte reste une généralité.
- 3Une position argumentéeUn avis tranché, signé, avec ses conditions de validité.Sinon : le moteur préfère une source qui prend parti.
- 4Une méthode vérifiableComment vous procédez, dans quel ordre, avec quels critères de décision.Sinon : rien ne distingue votre page de la synthèse du moteur.
Le test le plus simple consiste à retirer le nom de l'entreprise d'une page et à se demander qui aurait pu l'écrire. Si la réponse est « n'importe qui dans le secteur », la page est générique, quelle que soit sa longueur et quelle que soit sa note dans un outil de qualité rédactionnelle. Si la réponse est « seulement quelqu'un qui a traité ces dossiers », la page a une chance d'être retenue.
La seconde version a été relue par quelqu'un qui connaît les dossiers. Elle fixe un seuil, trente véhicules, un critère, le mode d'installation, une conséquence observée et sa cause. Un modèle qui doit répondre à « quel logiciel de gestion de flotte pour une petite entreprise » peut la citer ; il n'a rien à faire de la première, qui reformule la question sans y répondre.
Où l'IA aide réellement à produire un contenu citable
L'assistance par un modèle fait gagner du temps partout où l'information existe déjà et doit être mise en forme. Elle en fait perdre partout où l'information doit être produite. La frontière est nette, et elle définit la chaîne de production que nous recommandons.
- Extraire la matière d'un entretien avec un expert interne. Trente minutes d'échange enregistrées contiennent en général plus d'éléments citables qu'une journée de rédaction à partir de rien.
- Structurer. Transformer une réponse orale en bloc « question, réponse, preuve, nuance », proposer un tableau à partir de données brutes, découper un texte long en passages autonomes.
- Reformuler sans perdre. Raccourcir un premier paragraphe, mettre la réponse en tête, supprimer les tournures creuses ; la forme du passage citable s'y prête bien.
- Contrôler la cohérence. Repérer qu'un chiffre diffère entre deux pages, qu'une date manque, qu'un terme est employé dans deux sens.
- Préparer un premier jet de traduction, à condition qu'un locuteur natif qui connaît le métier le relise.
- 01Source propriétaireEntretien d'expert, données internes, dossiers anonymisés : la matière que le moteur ne possède pas.
- 02Extraction assistéeLe modèle transcrit, liste les questions traitées, isole les chiffres et les cas.
- 03Rédaction assistéeMise en forme en passages autonomes, tableaux, définitions ; le texte reste fidèle à la source.
- 04Relecture experteUn professionnel du sujet vérifie chaque affirmation, ajoute ce qui manque, retire ce qui ne tient pas. Sans cette étape, rien n'est publié.
- 05Publication signéeAuteur identifié, dates sincères, sources nommées, balisage Person et Article.
Le point décisif est l'ordre. La source propriétaire vient en premier ; le modèle travaille à partir d'elle. La chaîne inverse, où le modèle rédige à partir d'une consigne et où l'expert « valide » en fin de course, produit des textes que l'expert corrige à la marge sans les enrichir, parce que la structure est déjà celle de la généralité et qu'il est plus coûteux de la défaire que de repartir de l'entretien.
Où elle nuit : cinq dérives observées dans les audits
Les dérives ci-dessous ne sont pas des hypothèses ; ce sont celles que nous rencontrons le plus souvent quand un site a industrialisé la production sans protocole. Chacune atteint directement l'une des quatre conditions d'une citation.
| Dérive | Symptôme sur la page | Condition atteinte | Correctif |
|---|---|---|---|
| Chiffres approximatifs ou inventés | Statistique sans source, pourcentage rond, « étude récente » non identifiable | Citable (aucune preuve) et corroborée (contredit par les sources tierces) | Chaque chiffre tracé jusqu'à son origine, ou supprimé |
| Références invérifiables | Norme, organisme ou publication cités sous une forme qui n'existe pas | Corroborée | Vérification de chaque référence, lien vers la source réelle |
| Uniformité entre pages | Mêmes plans, mêmes transitions, mêmes conclusions d'une page à l'autre | Citable | Un apport propriétaire distinct par page, ou fusion des pages |
| Volume sans intention | Des dizaines de pages sur des variantes de la même question | Citable (dilution) | Carte des sous-requêtes, une page propriétaire par angle |
| Contradictions internes | Deux pages qui donnent des délais ou des prix différents | Corroborée | Centralisation des chiffres, relecture croisée |
Tableau : faites défiler horizontalement.
La première dérive est la plus coûteuse, parce qu'elle est la plus difficile à rattraper. Un moteur qui a trouvé sur votre site un chiffre contredit par trois sources indépendantes n'a aucune raison de vous faire confiance sur le suivant. La règle que nous appliquons : un chiffre sans origine identifiable est supprimé avant publication, pas « à vérifier plus tard ». Le détail de cette discipline figure dans l'article sur les chiffres, dates et sources.
La relecture experte : six contrôles avant publication
La relecture experte n'est pas une correction de style. C'est un contrôle de fond, mené par quelqu'un qui connaît le sujet et engage son nom. Sur nos mandats, elle suit six contrôles, dans cet ordre, et un texte qui échoue à l'un d'eux retourne en production plutôt que d'être corrigé à la marge.
- Chaque chiffre a une origine : mesure interne datée, document public identifié, ou suppression.
- Chaque affirmation générale devient conditionnelle : « en général » devient « pour les entreprises de moins de cinquante salariés », « souvent » devient « dans les dossiers où le bail est commercial ».
- Chaque section contient au moins un élément que seul l'auteur pouvait écrire : un cas, une observation, une méthode, une position.
- Les phrases qui n'apportent rien sont supprimées, pas réécrites. « Il est important de bien choisir » disparaît.
- Chaque passage est testé sorti de son contexte : lu seul, répond-il à une question précise, avec une preuve ?
- L'auteur signe : son nom, sa fonction, sa page auteur. S'il hésite à signer, le texte n'est pas prêt.
Données illustratives. Ce qu'il faut y lire : la relecture ne corrige pas un style, elle ajoute l'information qui manquait ; c'est cette information, pas la réécriture, qui fait progresser la part de citation.
Les moteurs pénalisent-ils le contenu généré ? Ce qui est documenté
À notre connaissance, aucun éditeur de moteur génératif n'a documenté de pénalité visant le contenu généré en tant que tel. Google a publié en 2023 des consignes indiquant que le mode de production n'est pas en soi un critère et que c'est l'utilité du contenu pour l'utilisateur qui compte ; ses règles visent la production en masse destinée à manipuler le classement, quel que soit l'outil employé. OpenAI, Anthropic et Perplexity n'ont, à notre connaissance, rien publié de spécifique sur ce point concernant la sélection des sources.
L'effet est donc indirect, et il est plus sévère qu'une pénalité. Une pénalité se lève ; une absence d'apport ne se corrige qu'en ajoutant l'apport. Un site de deux cents pages génériques ne remontera pas en les supprimant ni en les faisant réécrire par un autre outil. Il remontera en identifiant les vingt pages qui correspondent à des sous-requêtes à valeur, en les enrichissant d'informations propriétaires, et en regroupant ou en laissant les autres.
Un second effet, moins visible, concerne la corroboration. Quand des dizaines de sites d'un même secteur publient les mêmes affirmations générées, le moteur y voit un consensus faible : beaucoup de sources, aucune indépendante. Une affirmation différente, précise et signée se détache de ce bruit. Le contenu générique de vos concurrents est, paradoxalement, une occasion pour une page qui apporte quelque chose.
Signer, dater, assumer : l'entité derrière le texte
La condition « identifiée » est celle où le contenu généré échoue le plus discrètement. Une page sans auteur, ou signée « l'équipe », n'engage personne, et le moteur n'a rien à vérifier sur l'expertise de la source. À l'inverse, un texte signé par un professionnel identifiable, dont la page auteur documente le parcours, donne au moteur ce qu'il cherche pour classer la source comme fiable.
- Un auteur nommé par page, avec sa fonction et une page auteur balisée en
Person; ce que cette page doit contenir est décrit dans l'article sur les pages auteur. - Des dates sincères de publication et de mise à jour, cohérentes entre le texte visible et le balisage.
- Une politique éditoriale publique qui dit comment les textes sont produits et relus, y compris l'usage d'outils d'assistance. Cette transparence ne coûte rien et évite le soupçon.
- Une mention des sources internes mobilisées : « d'après les dossiers traités par notre cabinet au premier semestre », plutôt qu'une affirmation sans origine.
- Semaines 1 à 2Cadrage
- Charte d'usage des modèles : ce qu'ils font, ce qu'ils ne font pas
- Inventaire des sources propriétaires disponibles
- Liste des experts internes et de leur périmètre
- Semaines 3 à 6Pilote
- Dix pages produites selon la chaîne, à partir d'entretiens
- Six contrôles appliqués, textes renvoyés si nécessaire
- Auteurs identifiés, pages auteur en ligne
- Semaines 7 à 12Mesure et généralisation
- Panel de prompts sur les sous-requêtes des dix pages
- Lecture de la part de citation, ajustement du protocole
- Extension aux pages suivantes, tri des pages génériques existantes
Les signes qui trahissent un texte sans apport
Les indices ci-dessous se repèrent à la lecture d'une seule page, sans outil. Quand trois d'entre eux sont présents, la page n'est presque jamais citée.
- Des pourcentages ronds sans source, ou une « étude récente » sans nom ni date.
- Des paragraphes qui commencent par « Il est essentiel de » ou « Dans un monde en constante évolution ».
- Un plan identique sur toutes les pages du site : introduction, avantages, inconvénients, conclusion.
- Aucun cas, aucun nom, aucune date : le texte pourrait avoir été écrit par n'importe quel concurrent.
- Une signature collective ou absente, sans page auteur.
- Des affirmations qui contredisent d'autres pages du même site.
Ce qu'il faut retenir
- Un moteur génératif cherche ce qu'il ne sait pas : un texte généré sans apport propriétaire ne lui apporte rien et n'est pas retenu.
- Le problème n'est pas l'outil, c'est l'absence de donnée, de cas, de position ou de méthode.
- L'IA aide à extraire, structurer et contrôler ; elle nuit quand elle produit l'information à la place de l'expert.
- La relecture experte est un contrôle de fond en six points, et une condition de publication.
- Signer, dater et documenter la production remplit la condition « identifiée » que le contenu généré néglige.
Questions fréquentes
Un moteur génératif peut-il détecter qu'un texte a été généré par IA ?
À notre connaissance, aucun éditeur n'a documenté une telle détection dans la sélection des sources, et les outils de détection disponibles sont peu fiables. La question n'est pas là : le moteur évalue ce qu'un passage lui apporte pour répondre. Un texte généré sans donnée, sans cas et sans position n'apporte rien, et c'est pour cette raison qu'il n'est pas cité.
Faut-il déclarer l'usage de l'IA dans la production d'un contenu ?
Une politique éditoriale publique qui décrit comment les textes sont produits et relus est une bonne pratique, et certaines réglementations sectorielles ou nationales peuvent l'exiger. Elle protège la confiance sans coûter de citations. L'essentiel reste qu'un auteur identifié signe le texte et en assume les affirmations, quel que soit l'outil qui a servi à le mettre en forme.
Un contenu généré puis relu par un expert est-il aussi citable qu'un contenu écrit à la main ?
Oui, si la relecture est un contrôle de fond et non une correction de style. Ce qui rend un passage citable est la présence d'une donnée, d'un cas, d'une méthode ou d'une position signée. Si l'expert les a ajoutés et a supprimé ce qui ne tenait pas, l'origine du premier jet n'a plus d'importance. Si la relecture s'est limitée à la forme, le texte reste générique.
Faut-il supprimer les pages génériques publiées ces dernières années ?
Pas en bloc. Commencez par repérer celles qui correspondent à des sous-requêtes à valeur pour vos acheteurs, et enrichissez-les d'informations propriétaires. Regroupez celles qui se répètent en une page propriétaire par angle, avec redirection. Supprimez seulement celles qui ne correspondent à aucune question réelle. La suppression seule ne fait pas gagner de citations ; l'ajout d'apport, si.
Quelle part d'information propriétaire faut-il dans une page ?
La règle que nous appliquons est qualitative : au moins un élément que seul l'auteur pouvait écrire par section, une donnée, un cas, une méthode ou une position. Une page de six sections en contient donc au moins six. En dessous, le moteur trouve ailleurs des passages équivalents ; au-delà, la page devient une source à part entière, que les moteurs reprennent et que les tiers citent à leur tour.


