OpenAI prevede di integrare filigrane invisibili nei testi generati da ChatGPT e Codex per gli utenti idonei dell’Unione europea nelle prossime settimane. L’azienda ha presentato la misura come parte della sua risposta ai requisiti di trasparenza connessi alla normativa europea sull’intelligenza artificiale, anche se il segnale tecnico, da solo, non equivale a una prova conclusiva del fatto che un testo sia stato scritto da una persona o da un modello.
La tecnologia si chiama textGrain. Invece di aggiungere caratteri visibili o elementi nascosti alla formattazione, incorpora un segnale statistico nella selezione delle parole del modello. Un rilevatore può cercare questo schema nel testo e stimare se contiene una filigrana di OpenAI.
La distribuzione sarà diversa nei prodotti e nell’API
In ChatGPT e Codex, la filigrana sarà aggiunta agli output degli utenti idonei dell’UE, secondo l’annuncio di OpenAI. L’azienda non ha specificato nelle informazioni disponibili quali criteri determinino tale idoneità.
Per alcuni modelli della sua API, invece, i clienti di tutto il mondo potranno attivare volontariamente la filigrana. La funzione rimarrà disattivata per impostazione predefinita. OpenAI ha inoltre indicato che sta lavorando per offrire la filigrana tramite fornitori di servizi cloud, ma non ha specificato qui la portata di tale disponibilità.
Inizialmente, l’accesso al rilevatore sarà limitato: potranno richiederlo ricercatori e organizzazioni esperte approvati. Pertanto, il fatto che un output sia contrassegnato non significa che qualsiasi destinatario possa verificarlo direttamente con uno strumento pubblico.
Il rilevamento dipende dal testo e da come è stato modificato
OpenAI descrive textGrain come una tecnologia ancora agli inizi e avverte che può produrre falsi positivi — rilevare una filigrana dove non c’è — e falsi negativi — non rilevare una filigrana presente. Le prestazioni variano anche in base alla lunghezza e al tipo di contenuto. I testi brevi e tecnici possono offrire meno margine al modello per incorporare uno schema statistico riconoscibile.
Nelle valutazioni comunicate dall’azienda, il rilevatore ha identificato circa l’80% dei frammenti di 200 token e il 95% dei frammenti di 400 token nei test con contenuti di psicologia, con un tasso obiettivo di falsi positivi dell’1%. Si tratta di risultati ottenuti in condizioni specifiche, non di una garanzia di precisione per qualsiasi testo o uso quotidiano.
Le modifiche possono indebolire notevolmente il segnale. In un test citato da OpenAI, la sostituzione con sinonimi del 25% delle parole di frammenti di 400 token ha ridotto il rilevamento dal 92% al 17%. Il risultato mostra un limite del sistema di fronte alle modifiche del testo; non permette di concludere che ogni tipo di modifica produca lo stesso calo.
Cosa può indicare — e cosa no — una filigrana
Un rilevamento positivo può indicare che il testo presenta lo schema associato a una filigrana di OpenAI. Non identifica l’utente, non rivela le sue istruzioni, non determina quanto lavoro umano sia stato svolto né certifica chi possieda i diritti sul contenuto. Inoltre, non verifica che le informazioni siano corrette.
Viceversa, il fatto che il rilevatore non individui il segnale non dimostra che il testo sia stato scritto da una persona. Potrebbe non rilevarlo a causa della brevità o del tipo di contenuto, di modifiche successive o perché è stato generato con un modello che non integra textGrain.
OpenAI colloca la distribuzione nel contesto degli obblighi di trasparenza previsti dalla legge UE sull’IA. Questo collegamento va inteso come il quadro invocato dall’azienda per spiegare la propria decisione: le informazioni disponibili non consentono di affermare che la normativa imponga di contrassegnare ogni testo generato proprio in questo modo. La filigrana è uno strumento tecnico di identificazione, con limiti riconosciuti dalla stessa azienda, e non sostituisce altri modi per valutare l’origine, la responsabilità o l’affidabilità di una pubblicazione.