La fronde contre le marquage des textes de Claude s’organise : ces outils traquent déjà les failles du filigrane
Le 11 août 2026, Anthropic annonçait que les textes produits par les modèles de Claude lancés après le 2 août porteraient un « watermark » invisible. Et ce, que le texte soit collé dans un mail, un document Word ou tout autre support de destination.
Au moment de l’annonce, la mesure interroge et l’entreprise américaine ne détaille pas le mécanisme employé pour appliquer cette marque indélébile. Une zone d’ombre comblée par Anthropic le 14 août 2026, dans une publication sur son site officiel . Mais les précisions apportées n’ont fait qu’accroître la grogne d’une partie des utilisateurs.
Anthropic explique que le mécanisme repose sur une légère modification du principe aléatoire avec lequel les chatbots choisissent les mots qu’ils ajoutent à une phrase. Les grands modèles de langage génèrent le texte mot par mot ( token ). Chaque token se voit attribuer une probabilité d’apparaître ensuite.
Surfshark One à partir de 2,49€ / Mois ! Jusqu’au 7 septembre, Surfshark surclasse tous ses nouveaux clients ! La suite de cybersécurité complète + VPN débarque au prix de la formule de base, soit 2,49€ par mois seulement. VPN, antivirus, bloqueur de pub à prix mini ! Sponsorisé En profiter ! Prenant l’exemple d’un passage évoquant un ciel « couvert » ou « nuageux », l’entreprise explique que, dans une utilisation sans watermark, le ciel a autant de chances d’être décrit comme « couvert » que « nuageux ».
Désormais, le filigrane ajoute un pilotage déterminé par une clé cryptographique propre à Anthropic. Le mot choisi reste toujours plausible et naturel, mais la séquence de choix, une fois analysée avec la bonne clé, révèle une signature statistique.
En réalité, la technologie n’est pas nouvelle : il s’agit d’une version personnalisée de SynthID-Text, un tatouage numérique similaire dévoilé par Google DeepMind en 2024.
Mais si la technologie existe déjà, elle n’a pas pour autant évité la grogne d’une partie des utilisateurs, qui y voient une multitude de limites, parfois assumées par Anthropic. Parmi elles, le fait que la marque ne révèle rien sur la nature de l’intervention. Un texte simplement corrigé ou légèrement reformulé par Claude peut porter la même trace qu’un texte entièrement généré par IA . À l’inverse, un texte fortement réécrit ou trop court peut échapper à la détection.
Une défiance qui a rapidement pris la forme d’une course aux outils de contournement. Un dépôt GitHub baptisé watermarks-remover, compte déjà 12, 4k étoiles sur la plateforme. Il propose de neutraliser les marques attribuées à l’IA, qu’elles proviennent de Claude, Gemini ou d’autres modèles. Sa méthode combine trois approches : supprimer les caractères Unicode invisibles déjà présents dans un texte, retirer les métadonnées C2PA des fichiers, et tenter d’affaiblir les filigranes statistiques en faisant réécrire le texte par un second modèle, sans garantie d’efficacité sur ce dernier point.
Une autre initiative prend le problème à l’envers.
5News a agrégé ce résumé depuis le flux public du média. L'article complet, avec tout le contexte, est sur www.numerama.com — le contenu appartient à Numerama.