Illustration d'un texte généré par IA estampillé d'un filigrane

La récente révélation selon laquelle Anthropic applique des filigranes aux textes produits par ses modèles d'IA a déclenché une tempête de débats sur les réseaux sociaux. Bien que la méthodologie exacte ne soit pas explicitement détaillée dans leur documentation, elle repose vraisemblablement sur des biais statistiques dans le choix des mots, conçus pour survivre au copier-coller et même à une relecture ultérieure par une IA. Anthropic concède elle-même que cette méthode « n'est pas totalement concluante ». Nous y reviendrons plus loin.

Si la réaction des réseaux sociaux a été rapide et virulente, plusieurs implications cruciales passent inaperçues dans le débat grand public. Voici notre point de vue sur les raisons pour lesquelles le filigrane de texte est un paradigme fondamentalement vicié.

Anthropic n'est pas la seule

Bien qu'Anthropic absorbe actuellement l'essentiel de la mauvaise publicité, l'entreprise est loin d'être pionnière en la matière. Google applique des filigranes à ses textes générés depuis au moins mai 2024 (article sur SynthID et annonce de Google concernant son utilisation dans Gemini). OpenAI a également déclaré avoir pleinement l'intention d'ajouter des signaux de provenance aux textes générés par IA, et ce dès le 2 août 2026 (centre d'aide d'OpenAI).

L'indignation disproportionnée dirigée contre Anthropic, alors que Google a mis cela en œuvre il y a plus de deux ans et qu'OpenAI a annoncé il y a tout juste 12 jours son intention d'en faire autant, est une étude de cas fascinante en relations publiques, mais elle passe à côté de l'essentiel : le filigrane de texte est désormais une pratique répandue dans toute l'industrie. Nous devons l'évaluer comme un changement systémique, et non au cas par cas selon l'entreprise. Le problème est bien plus vaste que la vague d'hostilité que subit actuellement Anthropic sur cette question.

Implications pour le droit d'auteur

Aux États-Unis, un contenu entièrement généré par IA ne peut pas faire l'objet d'un droit d'auteur, une position réaffirmée par le Bureau américain du droit d'auteur au cours des dernières années. Cependant, le seuil d'implication humaine requis pour qu'une œuvre soit protégeable demeure une frontière juridique floue. Le filigrane introduit une variable dangereuse dans cette équation déjà fragile.

Considérons les paradoxes juridiques potentiels :

  • Le dilemme du correcteur : Si vous écrivez un livre entièrement original, mais que vous utilisez une IA pour relire et resserrer la prose, un détecteur de filigranes pourrait signaler l'ensemble du manuscrit comme généré par IA. Cela vous prive-t-il de votre droit d'auteur ?
  • Le piège du traducteur : Et si vous écrivez un roman à la main, mais que vous utilisez une IA pour le traduire en anglais ? Le filigrane du texte traduit pourrait théoriquement indiquer que le contenu est généré à 100 % par IA. La version anglaise perd-elle alors la protection de la propriété intellectuelle ?
  • La toile du développeur : Imaginez passer des jours à concevoir l'architecture d'une application, à prendre des décisions de conception de haut niveau, à rédiger des invites, à itérer et à tester. Vous avez investi votre créativité humaine dans la logique, mais une IA a écrit la syntaxe proprement dite. Si le code est signalé comme généré à 100 % par IA, votre logiciel devient-il inprotégeable, malgré l'énorme travail humain fourni ?

Le filigrane menace d'invalider juridiquement les œuvres collaboratives entre humains et IA en les peignant d'un pinceau grossier et binaire.

Le danger des faux positifs

Google et Anthropic admettent tous deux que leurs filigranes de texte ne sont pas précis à 100 %. Si une œuvre entièrement humaine est faussement classée comme générée par IA, la charge de la preuve retombe injustement sur le créateur.

Comment prouver une négation ? Les écrivains doivent-ils désormais enregistrer leur écran et leurs frappes au clavier, voire se filmer pendant qu'ils travaillent, pour valider leur paternité ? Ou doivent-ils s'en remettre à de vagues affirmations du type « croyez-moi, c'est moi qui l'ai écrit » ?

Les faux positifs sont particulièrement dangereux parce qu'ils peuvent être transformés en outils de censure ou de sabotage professionnel. Si un acteur malveillant souhaite discréditer un journaliste, un rival ou un collègue, il lui suffit de passer les écrits de sa cible à travers une série de détecteurs de filigranes différents — celui d'Anthropic, de Google, d'OpenAI, etc. — jusqu'à obtenir inévitablement, à force d'« essayer les détecteurs », un faux positif. Il peut alors humilier publiquement l'auteur, l'accuser de fraude académique ou professionnelle, et laisser la fausse autorité de l'algorithme faire les dégâts. Chaque détecteur d'IA a une probabilité de faux positif, et s'ils utilisent tous des méthodes différentes, chaque passage du même texte dans un détecteur différent augmente la probabilité d'un faux positif.

Les entreprises qui mettent en œuvre le filigrane des textes ont elles-mêmes déclaré que cette méthode n'est pas fiable à 100 % ; le filigrane n'a donc absolument pas à infliger des conséquences concrètes aux personnes qu'il signale.

Une porte dérobée pour le pistage individuel des utilisateurs

Il n'existe actuellement aucune limitation technique empêchant les fournisseurs d'IA d'appliquer des filigranes par utilisateur. Au lieu d'un filigrane universel pour Anthropic ou Gemini, un modèle pourrait être ajusté pour biaiser les choix de mots selon un motif spécifique, cryptographiquement unique, lié à votre compte utilisateur.

Pourquoi est-ce un problème ? Cela transformerait la génération de texte par IA en un appareil de surveillance de masse. Tout texte que vous publiez sur internet — un billet de blog anonyme, une alerte de lanceur d'alerte, un courriel sensible — pourrait être récupéré, analysé et mathématiquement rattaché à votre compte d'IA spécifique. Cela prive les utilisateurs de leur droit à l'anonymat et à la vie privée, en offrant aux géants de la tech une empreinte permanente et invisible, cachée dans la structure même de nos phrases.

Les fournisseurs d'IA n'ont pas hésité par le passé à procéder à des lancements différenciés — un pour le monde et un pour l'UE — allant jusqu'à restreindre l'accès de l'UE jusqu'à ce qu'elle se conforme à ses lois. Le fait que le déploiement actuel ait déjà été lancé à l'échelle mondiale, et pas seulement dans l'UE, indique que les fournisseurs d'IA y voient eux-mêmes un bénéfice. On est en droit de se demander pour quelle raison ils voient un intérêt à ajouter des filigranes aux textes.

Dégradation de la qualité des réponses de l'IA

La logique statistique élémentaire veut que forcer un modèle à respecter un filigrane dégrade ses performances. En biaisant artificiellement les choix de mots pour créer une signature statistiquement significative, on limite le vocabulaire naturel du modèle, sa palette expressive et le nombre d'options parmi lesquelles il peut choisir. Tout cela doit nécessairement avoir un impact négatif sur la qualité des réponses du modèle. Selon nous, la créativité et la qualité des réponses n'ont jamais augmenté lorsque la manière précise de répondre se trouve restreinte.

Cela impose inévitablement un arbitrage : qualité du modèle contre détectabilité du filigrane. Cela restreint les nuances. De plus, si un modèle est fortement contraint par des algorithmes de filigrane, ignorera-t-il les invites stylistiques complexes (par exemple, « écris ceci dans le style d'un pirate du XVIIIe siècle ») parce qu'adopter ce personnage exigerait d'abandonner ses biais statistiques de choix de mots obligatoires ?

Certaines recherches soutiennent déjà l'idée que le filigrane affecte la qualité des modèles (OpenReview, ACL Anthology, OpenReview, arXiv).

L'illusion de l'intégrité académique

Les enseignants sont légitimement inquiets de voir des étudiants utiliser l'IA pour tricher dans leurs dissertations et leurs examens. Les partisans soutiennent que le filigrane est la solution. Nous sommes en profond désaccord : parce que la méthode est probabiliste et non absolue, elle n'a pas sa place dans un cadre académique punitif.

Une seule expulsion injustifiée annule tout le bien théorique que cette technologie pourrait apporter. Elle crée en outre un cauchemar kafkaïen pour les étudiants, caractérisé par un énorme déséquilibre de pouvoir institutionnel. Une université passe une dissertation dans une API opaque et propriétaire ; l'ordinateur répond « généré par IA ». L'étudiant n'a aucun recours, aucun moyen d'auditer l'algorithme boîte noire et aucune façon de se défendre, si ce n'est supplier l'institution de « le repasser ». Cela remplace la confiance éducative par un dogme algorithmique.

Combattre la désinformation : un argument sans objet

L'argument selon lequel le filigrane combat le spam, l'astroturfing et l'hameçonnage ignore une réalité fondamentale : utiliser l'IA comme partenaire d'écriture est en train de devenir rapidement la norme mondiale. De nombreux professionnels et étudiants utilisent déjà l'IA pour le remue-méninges, la traduction et la rédaction de brouillons ; d'ici quelques années, écrire sans aucune forme d'assistance par IA pourrait bien être l'exception plutôt que la règle.

Si la quasi-totalité des textes publiés comporte un certain niveau de collaboration avec l'IA, la détection d'un filigrane d'IA devient totalement sans objet. Cela rappelle la panique historique face aux correcteurs orthographiques et aux calculatrices censés « abêtir » la société — un argument discrédité depuis longtemps. La véritable bataille contre la désinformation consiste à vérifier si un humain réel ou une ferme de bots automatisée publie le texte, et non à s'angoisser sur le fait que le texte lui-même ait été partiellement généré par une IA.

Le sophisme de l'« effondrement du modèle »

Certains affirment que le filigrane est nécessaire pour que les entreprises d'IA puissent filtrer les textes synthétiques lors de l'entraînement des futurs modèles, afin d'éviter un « effondrement du modèle ».

Cette approche manque cependant de nuance. Un texte produit grâce à une collaboration étroite entre un humain et une IA constitue une donnée nouvelle et de haute qualité qui devrait être utilisée pour l'entraînement. En filtrant aveuglément tout ce qui porte un filigrane, les entreprises d'IA priveront leurs modèles de nouvelle génération de contenus précieux orientés par des humains. Les entreprises d'entraînement d'IA devraient plutôt évaluer les œuvres selon leur nouveauté et l'utilité réelle du texte, plutôt que de s'en remettre à un filigrane grossier pour savoir si une IA a touché le texte à un moment quelconque.

Une course aux armements est lancée — et les honnêtes gens en feront les frais

Voici le mode d'échec central qui fait de tout cet exercice un théâtre de la sécurité : la suppression d'un filigrane est un problème antagoniste soluble, et les personnes les plus motivées pour le résoudre sont exactement celles que le système cherche à attraper.

Un filigrane de texte statistique fonctionne en modifiant les probabilités de choix des mots. Il peut donc être testé, comme n'importe quel autre classifieur. Quiconque a un motif pour supprimer un filigrane — une usine à plagiat, une ferme de désinformation ou un spammeur — peut passer sa production à travers les détecteurs publics, ajuster la formulation, la paraphraser via un LLM open source sans filigrane, et itérer jusqu'à ce que le texte apparaisse comme « propre ».

Ce n'est pas de la spéculation ; c'est exactement la dynamique du chat et de la souris que nous avons observée avec les détecteurs de plagiat et les filtres anti-spam. Une lucrative industrie artisanale d'outils « humanisateurs d'IA » existe déjà à cette seule fin.

En conséquence, les personnes que ces détecteurs attrapent réellement ne sont pas les mauvais acteurs. Ils attrapent les utilisateurs honnêtes : l'étudiant qui a utilisé l'IA uniquement pour corriger sa grammaire, l'auteure qui a demandé un avis à une IA puis réécrit le passage, ou quelqu'un qui s'est appuyé sur l'IA pour traduire en raison de difficultés linguistiques. Ces utilisateurs ne font pas passer leur travail à travers cinq outils de contournement différents, parce qu'ils ne cherchent rien à cacher.

Un système de détection dont la population de faux négatifs est « quiconque a activement tenté de le contourner » et dont la population de faux positifs est « quiconque n'a pas pris la peine de se cacher » est structurellement brisé. Il filtre l'honnêteté tout en offrant un laissez-passer à la malhonnêteté.

Conclusion

Le filigrane des textes d'IA est un pansement grossier et superficiel appliqué à un changement sociologique complexe. Sous sa forme actuelle, il menace de dégrader la qualité des réponses de l'IA, de brouiller les eaux du droit d'auteur, de créer des vulnérabilités massives en matière de pistage des utilisateurs et de nuire substantiellement aux personnes dont le travail est faussement signalé comme généré par IA. Pire encore, il tend un piège aux utilisateurs honnêtes et transparents, tout en échouant totalement à arrêter les acteurs malveillants qu'il était censé déjouer. Pis encore, il accélère un phénomène déjà en marche : la société entre dans une nouvelle ère de chasse aux sorcières autour de l'usage de l'IA, où ne pas aimer le travail de quelqu'un revient de plus en plus à brandir « C'est une sorcière généré par IA » au lieu d'évaluer le texte sur ses mérites. Nous devons dépasser les outils primitifs comme le filigrane avant qu'ils ne cimentent davantage cette mentalité.