Illustrazione di un testo generato dall'IA timbrato con una filigrana

La recente rivelazione che Anthropic sta applicando filigrane ai testi prodotti dai suoi modelli di IA ha scatenato un vespaio di dibattiti sui social media. Sebbene la metodologia esatta non sia dettagliata esplicitamente nella loro documentazione, presumibilmente si basa su bias statistici nella scelta delle parole, progettati per sopravvivere al copia-incolla e persino a una successiva revisione da parte di un'IA. La stessa Anthropic ammette che questo metodo «non è pienamente conclusivo». Ne parleremo più avanti.

Sebbene la reazione dei social sia stata rapida e spietata, diverse implicazioni critiche vengono trascurate nel dibattito mainstream. Ecco il nostro punto di vista sul perché il watermarking del testo è un paradigma fondamentalmente difettoso.

Anthropic non è la sola

Sebbene Anthropic stia attualmente assorbendo il grosso della cattiva pubblicità, è ben lontana dall'essere una pioniera in questo campo. Google applica filigrane ai suoi testi generati almeno da maggio 2024 (paper su SynthID e annuncio di Google sul suo utilizzo in Gemini). OpenAI ha similmente dichiarato di avere piena intenzione di aggiungere segnali di provenienza ai testi generati dall'IA, e lo ha fatto di recente, il 2 agosto 2026 (Centro assistenza di OpenAI).

L'indignazione sproporzionata rivolta ad Anthropic — mentre Google ha implementato tutto questo più di 2 anni fa e OpenAI ha annunciato appena 12 giorni fa l'intenzione di fare lo stesso — è un affascinante caso di studio di pubbliche relazioni, ma perde di vista il punto più ampio: il watermarking del testo è ormai una pratica diffusa nell'intero settore. Dobbiamo valutarlo come un cambiamento sistemico, non azienda per azienda. La questione è molto più grande dell'odio che Anthropic sta ricevendo in questo momento.

Implicazioni per il copyright

Negli Stati Uniti, i contenuti interamente generati dall'IA non possono essere protetti da copyright, una posizione ribadita dallo US Copyright Office negli ultimi anni. Tuttavia, la soglia di coinvolgimento umano necessaria per rendere un'opera tutelabile resta una frontiera giuridica nebulosa. Il watermarking introduce una variabile pericolosa in questa equazione già fragile.

Consideriamo i potenziali paradossi legali:

  • Il dilemma del correttore di bozze: Se scrivi un libro del tutto originale ma usi l'IA per correggere e asciugare la prosa, un rilevatore di filigrane potrebbe segnalare l'intero manoscritto come generato dall'IA. Questo ti priva del copyright?
  • La trappola del traduttore: E se scrivi un romanzo a mano, ma usi l'IA per tradurlo in inglese? La filigrana del testo tradotto potrebbe teoricamente indicare il contenuto come generato al 100% dall'IA. La versione inglese perde la tutela della proprietà intellettuale?
  • La tela del programmatore: Immagina di passare giorni a progettare l'architettura di un'applicazione, prendendo decisioni di alto livello, scrivendo prompt, iterando e testando. Hai riversato creatività umana nella logica, ma un'IA ha scritto la sintassi vera e propria. Se il codice viene segnalato come generato al 100% dall'IA, il tuo software è intutelabile, nonostante l'enorme lavoro umano impiegato?

Il watermarking minaccia di invalidare legalmente le opere collaborative uomo-IA, dipingendole con un pennello ampio e binario.

Il pericolo dei falsi positivi

Sia Google che Anthropic ammettono che le loro filigrane testuali non sono accurate al 100%. Se un'opera completamente umana viene classificata erroneamente come generata dall'IA, l'onere della prova si sposta ingiustamente sul creatore.

Come si dimostra una negazione? Gli scrittori devono ora registrare schermo e battute sulla tastiera, o addirittura farsi riprendere da una telecamera mentre lavorano, per convalidare la propria paternità? Oppure devono affidarsi a vaghe affermazioni del tipo «fidati, l'ho scritto io»?

I falsi positivi sono particolarmente pericolosi perché possono essere usati come strumenti di censura o di sabotaggio professionale. Se un attore malintenzionato vuole screditare un giornalista, un rivale o un collega, gli basta far passare gli scritti del bersaglio attraverso una sfilza di rilevatori di filigrane diversi — quello di Anthropic, di Google, di OpenAI, ecc. — finché, «facendo la spola tra i rilevatori», non ottiene inevitabilmente un falso positivo. Può quindi svergognare pubblicamente l'autore, accusarlo di frode accademica o professionale e lasciare che la falsa autorità dell'algoritmo faccia danni. Ogni rilevatore di IA ha una probabilità di falso positivo e, se usano tutti metodi diversi, ogni volta che si testa lo stesso testo con un rilevatore diverso la probabilità di un falso positivo aumenta.

Le stesse aziende che implementano il watermarking dei testi hanno dichiarato che questo metodo non è accurato al 100%; il watermarking non ha quindi alcun motivo di infliggere conseguenze reali alle persone che segnala.

Una backdoor per il tracciamento individuale degli utenti

Attualmente non esiste alcuna limitazione tecnica che impedisca ai fornitori di IA di applicare filigrane su base individuale. Invece di una filigrana universale di Anthropic o Gemini, un modello potrebbe essere calibrato per deviare le scelte lessicali secondo uno schema specifico e crittograficamente unico, legato al tuo account utente.

Perché è un male? Trasformerebbe la generazione di testo con IA in un apparato di sorveglianza di massa. Qualsiasi testo tu pubblichi su internet — un post anonimo su un blog, una segnalazione di un whistleblower, un'email delicata — potrebbe essere raccolto, analizzato e ricondotto matematicamente al tuo specifico account di IA. Priva gli utenti del diritto all'anonimato e alla privacy, consegnando ai giganti tecnologici un'impronta digitale permanente e invisibile, nascosta nella struttura stessa delle nostre frasi.

I fornitori di IA non si sono fatti scrupoli in passato a effettuare rilasci differenziati — uno per il mondo e uno per l'UE — arrivando persino a limitare l'accesso dell'UE finché non fosse conforme alle sue leggi. Il fatto che il lancio attuale sia già avvenuto a livello globale e non solo nell'UE indica che i fornitori di IA stessi ne traggono beneficio. Bisogna chiedersi per quale motivo vedano un vantaggio nell'aggiungere filigrane ai testi.

Degradazione della qualità delle risposte dell'IA

La logica statistica di base impone che forzare un modello ad aderire a una filigrana ne degradi le prestazioni. Deviazioni artificiali nella scelta delle parole, necessarie per creare una firma statisticamente rilevante, limitano il vocabolario naturale del modello, la sua gamma espressiva e il numero di opzioni tra cui può scegliere. Tutto ciò deve avere un impatto negativo sulla qualità delle risposte del modello. È nostra opinione che la creatività e la qualità delle risposte non siano mai aumentate quando il modo specifico in cui si deve rispondere viene limitato.

Questo impone inevitabilmente un compromesso: qualità del modello contro rilevabilità della filigrana. Limita le sfumature. Inoltre, se un modello è fortemente vincolato dagli algoritmi di watermarking, ignorerà i prompt stilistici complessi (ad esempio, «scrivi questo nello stile di un pirata del XVIII secolo») perché adottare quel personaggio richiederebbe di abbandonare i bias statistici obbligatori nella scelta delle parole?

Alcune ricerche supportano già l'idea che il watermarking incida sulla qualità del modello (OpenReview, ACL Anthology, OpenReview, arXiv).

L'illusione dell'integrità accademica

Gli educatori sono comprensibilmente preoccupati che gli studenti usino l'IA per copiare in saggi ed esami. I sostenitori sostengono che il watermarking sia la soluzione. Non siamo affatto d'accordo: poiché il metodo è probabilistico e non assoluto, non ha posto in un contesto accademico punitivo.

Una sola espulsione ingiusta annulla qualsiasi bene teorico che questa tecnologia possa offrire. Inoltre, crea per gli studenti un incubo kafkiano, caratterizzato da un enorme squilibrio di potere istituzionale. Un'università passa un saggio attraverso un'API opaca e proprietaria; il computer dice «generato dall'IA». Lo studente non ha alcun ricorso, alcun modo di verificare l'algoritmo scatola-nera e alcun modo di difendersi, se non supplicando l'istituzione di «farlo girare di nuovo». Sostituisce la fiducia educativa con il dogma algoritmico.

Combattere la disinformazione: una questione irrilevante

L'argomento secondo cui il watermarking combatte spam, astroturfing e phishing ignora una realtà fondamentale: usare l'IA come partner di scrittura sta rapidamente diventando lo standard globale. Molti professionisti e studenti usano già l'IA per brainstorming, traduzione e bozze; entro pochi anni, scrivere senza qualche forma di assistenza dell'IA potrebbe benissimo essere l'eccezione, non la regola.

Se quasi tutti i testi pubblicati presentano un qualche livello di collaborazione con l'IA, rilevare una filigrana di IA diventa del tutto irrilevante. Ricorda il panico storico per i correttori ortografici e le calcolatrici che avrebbero «rimbambito» la società — un argomento da tempo screditato. La vera battaglia contro la disinformazione consiste nel verificare se un essere umano reale o una bot farm automatizzata sta pubblicando il testo, non nell'angosciarsi sul fatto che il testo stesso sia stato parzialmente generato dall'IA.

La fallacia del «collasso del modello»

Alcuni sostengono che il watermarking sia necessario affinché le aziende di IA possano filtrare i testi sintetici durante l'addestramento dei modelli futuri, prevenendo il «collasso del modello».

Tuttavia, questo approccio manca di sfumature. Un testo generato attraverso una profonda collaborazione uomo-IA è un dato nuovo e di alta qualità che dovrebbe essere usato per l'addestramento. Filtrando ciecamente tutto ciò che ha una filigrana, le aziende di IA priveranno i loro modelli di prossima generazione di contenuti preziosi diretti dall'uomo. Le aziende di addestramento di IA dovrebbero invece valutare le opere in base alla novità e all'utilità effettiva del testo, anziché affidarsi a una filigrana grossolana per capire se l'IA ha toccato il testo in qualche momento.

È iniziata una corsa agli armamenti e le persone oneste ci rimetteranno

Ecco il fallimento strutturale che rende tutto questo esercizio un teatro della sicurezza: la rimozione della filigrana è un problema avversariale risolvibile, e le persone più motivate a risolverlo sono esattamente quelle che il sistema cerca di catturare.

Una filigrana testuale statistica funziona spingendo le probabilità nella scelta delle parole. Può quindi essere testata, come qualsiasi altro classificatore. Chiunque abbia un motivo per rimuovere una filigrana — una fabbrica di plagi, una fattoria di disinformazione o uno spammer — può far passare il proprio output attraverso rilevatori pubblici, ritoccare la formulazione, parafrasarlo tramite un LLM open source senza filigrana e iterare finché il testo non risulta «pulito».

Non è speculazione; è esattamente la dinamica del gatto e del topo che abbiamo visto con i rilevatori di plagio e i filtri antispam delle email. Esiste già una lucrosa industria artigianale di strumenti «umanizzatori di IA» dedicati a questo unico scopo.

Di conseguenza, le persone che questi rilevatori catturano davvero non sono i malintenzionati. Catturano gli utenti onesti: lo studente che ha usato l'IA solo per correggere la grammatica, l'autrice che ha chiesto un parere a un'IA e poi ha riscritto il passaggio, o chi si è affidato all'IA per tradurre a causa di difficoltà linguistiche. Questi utenti non fanno passare il loro lavoro attraverso cinque strumenti di elusione diversi, perché non stanno cercando di nascondere nulla.

Un sistema di rilevamento la cui popolazione di falsi negativi è «chiunque abbia attivamente cercato di eluderlo» e la cui popolazione di falsi positivi è «chiunque non si sia preso la briga di nascondersi» è strutturalmente rotto. Filtra l'onestà mentre offre un lasciapassare alla disonestà.

Conclusione

Il watermarking dei testi IA è un cerotto grezzo e superficiale applicato a un complesso cambiamento sociologico. Nella sua forma attuale, minaccia di degradare la qualità delle risposte dell'IA, intorbidire le acque del diritto d'autore, creare enormi vulnerabilità per il tracciamento degli utenti e danneggiare sostanzialmente le persone il cui lavoro viene falsamente segnalato come generato dall'IA. Cosa peggiore di tutte, funziona come una trappola per gli utenti onesti e trasparenti, fallendo completamente nel fermare gli attori malintenzionati che avrebbe dovuto contrastare. Peggio ancora, sta accelerando qualcosa già in corso: la società sta entrando in una nuova era di caccia alle streghe attorno all'uso dell'IA, in cui non apprezzare il lavoro di qualcuno significa sempre più spesso ricorrere a «È una strega generato dall'IA» invece di valutare il testo nel suo merito. Dobbiamo superare strumenti primitivi come il watermarking prima che cementino ulteriormente questa mentalità.