Cerchi «rilevatore IA» e ne trovi dieci, tutti gratuiti, tutti sicuri di sé. Incolli un testo e ottieni una percentuale. Quella percentuale non dice chi ha scritto il testo: dice quanto quel testo somiglia allo stile che il rilevatore considera «da macchina». Sono due cose diverse, e la differenza ha conseguenze concrete — su studenti, traduttori e chi scrive di mestiere.
Qui trovi come funzionano davvero questi strumenti, i numeri misurati da chi li ha testati, perché sbagliano e cosa si può fare al loro posto. C'è anche la parte che serve a chi è stato accusato ingiustamente, che è più frequente di quanto si pensi.
In una frase: i rilevatori di testo IA non sono affidabili e i numeri lo dimostrano — in uno studio del 2023 su sette rilevatori, il 61,22% dei temi scritti da persone (studenti non madrelingua inglese) è stato classificato come «generato dall'IA». Il classificatore di testo AI di OpenAI individuava come generato solo il 26% dei testi scritti dall'IA e segnalava il 9% dei testi umani; è stato ritirato il 20 luglio 2023 per la bassa accuratezza. Al posto del rilevatore servono le fonti e le prove: la sostanza, non lo stile.
Come funziona un rilevatore IA?
Un rilevatore non confronta il testo con un archivio di testi generati: misura quanto il testo è prevedibile. Calcola cioè quanto le parole che hai scritto fossero probabili dopo le precedenti — è la stessa cosa che fa un modello linguistico quando scrive, usata al contrario. Un testo molto regolare, con frasi di lunghezza simile e parole ricorrenti, risulta «probabile» e viene segnato come generato. Un testo irregolare, con frasi rotte e scelte sorprendenti, risulta «improbabile» e viene segnato come umano.
Il punto è tutto qui: sta misurando una proprietà dello stile, non l'origine del testo. Uno studente che scrive in modo semplice e regolare produce un testo «probabile». Un articolo tradotto dall'inglese con un traduttore automatico produce un testo «probabile». Un verbale, una relazione tecnica, un testo normativo: tutti «probabili». Nessuno dei quattro è stato scritto da un'IA — e tutti e quattro rischiano di essere segnalati.
Quanti falsi positivi fanno i rilevatori?
Non è un'opinione. Nel 2023 un gruppo di ricerca dell'Università di Stanford — Liang, Yuksekgonul, Mao, Wu e Zou — ha testato sette rilevatori pubblici su due insiemi di testi: saggi di studenti statunitensi e temi di inglese sostenuti da studenti non madrelingua (i test TOEFL). Il risultato è pubblicato come articolo accademico ed è brutale: i sette rilevatori hanno classificato come «generati dall'IA» il 61,22% dei temi scritti da persone.
I rilevatori hanno classificato male più della metà dei temi TOEFL come «generati dall'IA» (tasso medio di falsi positivi: 61,22%). Tutti e sette i rilevatori hanno identificato all'unanimità 18 dei 91 temi TOEFL come generati dall'IA.
Liang, Yuksekgunul, Mao, Wu, Zou — «GPT detectors are biased against non-native English writers», 2023
C'è un secondo numero, che riguarda lo strumento invece delle persone. Il classificatore di testo AI di OpenAI, pubblicato a gennaio 2023, individuava come «probabilmente scritto dall'IA» solo il 26% dei testi generati, e segnalava come generato il 9% dei testi scritti da persone. OpenAI lo ha ritirato il 20 luglio 2023 proprio per la bassa accuratezza. Vale la pena ripeterlo: l'azienda che produce i modelli ha spento il proprio rilevatore.
Chi misuraCosa ha misuratoRisultatoStanford, 7 rilevatori (2023)Temi di inglese di studenti non madrelingua (TOEFL)61,22% classificati come generati dall'IAStanford, 7 rilevatori (2023)Stessa prova, voti unanimi dei sette*18 su 91* temi segnalati da tutti e setteOpenAI, classificatore proprioTesti scritti dall'IA riconosciuti*26%* (poi ritirato)OpenAI, classificatore proprioTesti umani segnalati come IA*9%*
Anche i classici finiscono nel mirino
C'è un effetto collaterale che rende il problema evidente a chiunque ci giochi cinque minuti: se il rilevatore misura la prevedibilità, allora i testi molto regolari e molto canonici risultano «da macchina» — compresi quelli scritti prima che l'IA generativa esistesse. È la prima cosa che raccontano gli scrittori quando se ne parla. In una discussione su r/writers, un utente lo mette così:
La sfortunata realtà è che non puoi riconoscerlo — e probabilmente è meglio così, perché non vogliamo una sorta di «paura rossa» in cui gli autori cominciano ad accusare altri autori che non gli piacciono di usare l'IA. I rilevatori sono in gran parte screditati: valutano i classici — e persino cose che hai scritto tu — come se contenessero molto testo IA, anche testi scritti molto prima che l'IA esistesse.
u/drewhead118, r/writers
L'altra cosa che si legge nella stessa discussione è più difficile da accettare: il danno arriva prima della prova. Un altro utente racconta di essere stato accusato di usare l'IA «pur non usandola affatto per scrivere» — scrive, dice, in modo molto formale, ed è questo a farlo sembrare una macchina. È il meccanismo descritto dallo studio di Stanford, applicato a una persona invece che a un campione.
L'effetto non è solo digitale. Il Post, in un articolo del 30 marzo 2026, ricostruisce il caso di un romanzo ritirato dal mercato da un grande editore statunitense dopo le accuse dei lettori — e spiega che, in generale, «non esistono metodi né strumenti per riconoscere con certezza» un testo generato, con «tutti i rischi che ne conseguono per la reputazione di chi è accusato ingiustamente» (l'articolo completo è qui).
Perché i rilevatori sbagliano?
- Misurano lo stile, non l'origine. Un testo formale, tradotto o molto regolare è «probabile» per costruzione: non c'è nessuna proprietà intrinseca del testo che dica chi l'ha scritto.
- Sui testi brevi non hanno segnale. Su poche centinaia di parole non c'è abbastanza materiale per stimare una regolarità: il risultato è rumore, presentato con l'aria di una misura.
- Il campione di riferimento è inglese. Ed è la ragione per cui lo studio di Stanford trova il 61% sui temi di studenti non madrelingua: chi scrive in un inglese semplice e lineare — perché lo sta imparando — somiglia di più al «testo probabile» di chi scrive in inglese da madrelingua.
Su questo punto l'articolo di Il Post aggiunge l'elenco degli indizi che circolano — elenchi di tre punti, trattino lungo, cliché ripetuti — e la conclusione è la stessa: sono indizi, non prove, e riguardano lo stile. Chi scrive male, chi traduce, chi usa un registro formale può esibire tutti quegli indizi senza aver usato nessuna IA.
E in italiano? Cosa si può dire (e cosa no)
Vale la pena dirlo perché è la domanda che arriva subito: i rilevatori più diffusi — Copyleaks, ZeroGPT, Pangram — nascono e sono tarati principalmente sull'inglese, ed è quella la lingua su cui sono state misurate le accuratezze. Esistono strumenti dichiaratamente per l'italiano: il più citato nelle guide in italiano è isgen.ai. Ma le tre ragioni del capitolo precedente non dipendono dalla lingua: un testo tradotto, un testo breve e un testo molto formale restano «probabili» anche in italiano.
Quello che non posso dirti è una percentuale di errore per l'italiano: nessuno degli studi che ho trovato misura i rilevatori su testi italiani con la stessa metodologia di Stanford. È un dato che manca, e chi promette numeri precisi sull'italiano sta inventando. La conclusione prudente è quella che vale ovunque: un rilevatore è un indizio, mai una prova.
C'è anche un equivoco da chiarire, perché riguarda gli strumenti che molta gente usa: i cosiddetti «umanizzatori», cioè i programmi che riscrivono un testo per farlo passare come umano. Funzionano al contrario di un rilevatore — cambiano le parole più prevedibili in parole meno prevedibili — e hanno due difetti che vale la pena sapere. Il primo: non aggiungono nessuna informazione, quindi non rendono il testo più vero. Il secondo: rendono il testo peggiore, perché per abbassare la «prevedibilità» spesso sostituiscono parole semplici con sinonimi meno precisi. Se un testo va riscritto, la ragione utile è che era scritto male, non che somigliava a una macchina.
Cosa fare invece del rilevatore
Se il problema è «questo testo è affidabile?», il rilevatore risponde alla domanda sbagliata. Le quattro mosse che funzionano sono altre, e riguardano la sostanza.
- Chiedi le fonti delle affermazioni verificabili e aprirle una per una. È il controllo che smaschera davvero il testo generato, perché il modello inventa le fonti prima ancora che lo stile lo tradisca. Il metodo passo per passo è nella guida a ChatGPT per principianti, e il vocabolario di base è nella guida AI per principianti.
- Cerca l'esperienza, non lo stile. Chi ha fatto una cosa la racconta con dettagli che non si inventano: una misura, un errore, una data. È la stessa cosa che i motori di ricerca premiano da anni (esperienza, competenza, autorevolezza, affidabilità).
- Guarda il processo, non il prodotto. Cronologia delle versioni, appunti, bozze: sono la prova di come un testo è nato, e li ha solo chi l'ha scritto.
- Non usare un rilevatore come arbitro. Se la posta in gioco è un voto, un incarico o una reputazione, uno strumento con il 61% di falsi positivi su un gruppo di persone non è una prova: è un rischio.
Se sei tu quello accusato
È il capitolo che serve a chi cerca «rilevatore IA» per difendersi. Tre cose, in ordine. La prima: non rispondere con la percentuale di un altro rilevatore — la stai trattando come una prova, e nel momento in cui la usi accetti il suo quadro. La seconda: porta il processo, cioè quello che hai e che l'accusatore non ha: la cronologia del documento, gli appunti, le versioni precedenti, i file di lavoro. La terza: cita il dato, perché è pubblico e verificabile: uno studio su sette rilevatori ha misurato il 61,22% di falsi positivi su testi scritti da persone, e la stessa azienda che produce i modelli ha ritirato il proprio rilevatore per bassa accuratezza.
Se il dubbio riguarda invece cosa fa un modello quando scrive — e perché il testo risulta «probabile» — la differenza fra IA generativa e IA analitica chiarisce il meccanismo; e se stai cercando uno strumento da usare, il confronto è in migliori strumenti AI gratuiti.
Un'ultima informazione utile, che riguarda il futuro prossimo: dal 2 agosto 2026 l'articolo 50 dell'AI Act europeo impone ai fornitori di marcare in modo leggibile dalle macchine i contenuti generati o manipolati, con una proroga al 2 dicembre 2026 per i sistemi già sul mercato (il testo dell'articolo). È la direzione opposta a quella dei rilevatori: non indovinare se un testo è generato, ma dichiararlo alla fonte. Finché quella marcatura non sarà diffusa, la domanda «l'ha scritto un'IA?» resterà senza risposta affidabile — ed è meglio saperlo che credere a una percentuale.
In sintesi
I rilevatori di testo IA misurano la prevedibilità di un testo, non la sua origine: per questo sbagliano di sistema, e non per un difetto di taratura. I numeri lo dicono in modo netto — 61,22% di falsi positivi sui temi di studenti non madrelingua in uno studio su sette rilevatori, 26% di testi generati riconosciuti dal classificatore di OpenAI che è stato poi ritirato. Al posto di una percentuale servono le fonti, l'esperienza e il processo. E se l'accusa arriva a te, la difesa non è un altro rilevatore: è il tuo archivio di lavoro, più un dato pubblico che ti dà ragione.

Top comments (0)