Full text
Algoritmi Imperfetti: Limiti Tecnici e Implicazioni Etiche dei Sistemi di Rilevamento Antiplagio GianMarco Schiesaro∗ Abstract La rapida diffusione dei modelli di intelligenza artificiale generativa ha posto sfide inedite alle istituzioni accademiche e di ricerca, sollecitando lo sviluppo di sistemi automatici capaci di distinguere i contenuti prodotti da esseri umani da quelli generati algoritmicamente. Il presente studio offre un’analisi critica delle tecnologie di rilevamento antiplagio attualmente disponibili, esaminandone i principi teorici, le metodologie operative e soprattutto i limiti, tecnologici ed etici, che ne condizionano l’affidabilità e l’applicabilità in contesti ad alto rischio. La ricerca documenta come gli strumenti di rilevamento presentino tassi di accuratezza che si discostano significativamente dalle dichiarazioni promozionali delle aziende produttrici, con particolare vulnerabilità ai falsi positivi, che colpiscono fette di popolazioni già marginalizzate: persone non madrelingua, individui neurodivergenti e appartenenti a minoranze etniche. L’implementazione diffusa di tali sistemi genera conseguenze che trascendono la dimensione tecnica, con ripercussioni sulla erosione della fiducia nelle relazioni educative, sulla deriva del clima istituzionale in direzione di logiche di sorveglianza pervasiva e sulla necessità di ridefinire le categorie di plagio e autorialità nell’era dell’intelligenza artificiale generativa. Si conclude con raccomandazioni operative rivolte a istituzioni accademiche ed enti di ricerca, auspicando labbandono di approcci basati esclusivamente sulla sorveglianza algoritmica e ladozione di metodologie di valutazione più resistenti all’automazione, in un contesto di educazione all’utilizzo responsabile dell’intelligenza artificiale. Parole chiave: Intelligenza artificiale generativa, Rilevamento antiplagio, Bias algoritmici, Integrità accademica, Etica della tecnologia, Valutazione della ricerca 1 I principi teorici del rilevamento 1.1 Gli strumenti tradizionali Nel corso degli ultimi decenni la crescente diffusione delle tecnologie digitali ha reso necessario lo sviluppo di strumenti sempre più sofisticati per individuare fenomeni di plagio nei documenti accademici e professionali prodotti da istituti universitari e di ricerca, dando vita a una vera e propria rivoluzione nell’ambito dell’attribuzione della proprietà intellettuale. I primi strumenti antiplagio si basavano su algoritmi di confronto testuale che permettevano di identificare somiglianze tra il documento sottoposto a verifica e le fonti già esistenti: tali meccanismi, pur relativamente semplici e nondimeno efficaci, hanno segnato l’inizio ∗Primo Tecnologo Istat, Istituto Nazionale di Statistica di una lunga evoluzione tecnologica destinata a mutare radicalmente il panorama della proprietà intellettuale e dell’integrità accademica, introducendo nel dibattito pedagogico questioni che esorbitavano il puro ambito tecnologico, fino a lambire temi etici, educativi e persino filosofici e a porre in discussione la natura stessa della conoscenza e dell’apprendimento. Il funzionamento dei sistemi tradizionali poggia su alcuni presupposti che meritano di essere esaminati con attenzione: essi costituiscono le fondamenta su cui si è poi innestata l’intera architettura dei moderni strumenti di rilevamento. Le piattaforme più diffuse, come Turnitin e Grammarly, hanno costruito nel tempo archivi mastodontici contenenti miliardi di pagine web e articoli accademici, creando repository di una vastità tale da rendere possibile il confronto sistematico di qual-
GianMarco Schiesaro Algoritmi imperfetti Dicembre 2025 siasi nuovo documento con un corpus pressoché illimitato di testi già esistenti. Il processo di rilevamento consiste, semplicemente, nel confrontare un testo sconosciuto con l’insieme di questi vasti repertori, alla ricerca di corrispondenze: è un’operazione che, come evidenziato da Sajid et al. (2025), dipende in larga misura dalla completezza e dalla continuità di aggiornamento delle banche dati di riferimento, oltre che dalla qualità degli algoritmi impiegati per il confronto. Prima di procedere alla vera e propria analisi, i documenti da verificare vengono sottoposti a una fase di pre-elaborazione, che consiste nella rimozione di elementi di formattazione quali grassetto, corsivo e punteggiatura: si tratta di un’operazione che potrebbe apparire banale ma che in realtà riveste un’importanza cruciale nell’economia complessiva del processo. La normalizzazione del testo serve infatti a ridurre il numero di falsi positivi che potrebbero essere generati da semplici differenze stilistiche — pur mantenendosi intatto il contenuto semantico del documento — consentendo così al sistema di concentrarsi sugli aspetti sostanziali piuttosto che su quelli meramente formali. Secondo quanto riportato da Originality.AI (2024), si tratta di un passaggio che richiede un delicato equilibrio tra due necessità concorrenziali: quella di standardizzare il testo per renderlo comparabile e quella di preservare sufficienti informazioni strutturali utili a identificare eventuali pattern sospetti. Un tale bilanciamento rappresenta una delle sfide tecnologiche e progettuali più interessanti. Una volta completata la pre-elaborazione, i sistemi calcolano opportuni indici di somiglianza, dapprima scomponendo un documento in unità più piccole, ovvero frasi o anche semplici locuzioni, poi procedendo a confrontare ciascuna delle unità ottenute con le voci presenti negli archivi. È un processo che ricorda, per certi versi, il lavoro certosino di un filologo alle prese con l’analisi delle fonti, un approccio granulare che si è rivelato particolarmente efficace nell’individuare non soltanto copie integrali, che rappresentano la forma più grossolana e facilmente rilevabile di plagio, ma anche contenuti parzialmente rielaborati o parafrasati: si tratta di forme di appropriazione indebita più sottili ma non meno problematiche dal punto di vista dell’integrità accademica, che richiedono algoritmi capaci di riconoscere somiglianze semantiche anche quando la forma superficiale del testo sia stata significativamente alterata. 1.2 Il rilevamento di contenuti generati dall’intelligenza artificiale Con l’avvento dei modelli di intelligenza artificiale generativa, il panorama del rilevamento del plagio ha subito una trasformazione radicale, che ha messo in discussione molte delle certezze metodologiche acquisite nel corso dei decenni precedenti e ha posto interrogativi inediti: quello sulla natura stessa della produzione testuale, prima di tutto, e poi quello sulle modalità attraverso cui sia possibile distinguere ciò che è genuinamente umano da ciò che è generato algoritmicamente. Non si tratta più soltanto di individuare testi copiati da fonti esistenti, operazione che per quanto complessa poggia comunque su un principio relativamente chiaro di confronto e corrispondenza, ma di riconoscere quando un contenuto sia stato prodotto ex novo da un sistema di generazione automatica: ciò richiede lo sviluppo di metodologie altrettanto nuove, capaci di penetrare al di sotto della superficie testuale per individuare caratteristiche statistiche e linguistiche che tradiscano l’origine artificiale del contenuto. Una delle tecniche più significative è l’analisi della perplessità (perplexity), un concetto che trova le sue radici nella teoria dell’informazione e nella linguistica computazionale e che è stato adattato con notevole successo al problema specifico del rilevamento di testi generati artificialmente. La perplessità misura quanto un testo risulti «prevedibile»per un modello linguistico, fornendo un indicatore quantitativo della «sorpresa informativa»contenuta in una sequenza di parole. I contenuti generati dall’intelligenza artificiale tendono a mostrare valori di perplessità bassi, poiché il modello generativo seleziona le parole successive sulla base della loro probabilità statistica, privilegiando sequenze che appaiono naturali e fluide secondo i parametri appresi durante l’addestramento condotto su vasti corpus di testi, con il risultato che le frasi prodotte seguono percorsi linguistici altamente prevedibili e conformi alle regolarità statistiche del linguaggio. La scrittura umana, al contrario, presenta valori di perplessità più elevati, una conseguenza diretta delle scelte linguistiche creative e dei percorsi espressivi imprevedibili che caratterizzano il pensiero umano nella sua manifestazione testuale: qui l’improvvisazione, l’associazione libera di idee e la ricerca deliberata di originalità espressiva conducono naturalmente a costruzioni meno prevedibili e più sorprendenti dal punto 2
GianMarco Schiesaro Algoritmi imperfetti Dicembre 2025 di vista informazionale. Come spiegato da Nobel, Lindberg (2025) questa differenza costituisce uno dei pilastri fondamentali su cui poggia il rilevamento dei testi generati artificialmente, benché la sua applicazione pratica presenti numerose sfide. Per rendere più concreto un concetto che potrebbe altrimenti apparire troppo astratto, possiamo considerare un semplice esempio di differenza qualitativa tra produzione umana e artificiale. Un’intelligenza artificiale potrebbe generare una frase del tipo «il sole tramontava con uno splendido bagliore arancione», costruzione che presenta una perplessità bassa, in quanto ogni parola segue in modo naturale e prevedibile quella precedente secondo schemi linguistici ampiamente attestati nei testi su cui il modello è stato addestrato: la sequenza risultante, pur essendo grammaticalmente corretta e semanticamente coerente, appare in qualche modo sospettosamente perfetta nella sua eccessiva aderenza alle convenzioni linguistiche standard. Un essere umano, invece, avrebbe potuto scrivere «il crepuscolo dipingeva il cielo di un viola opprimente e di un rossore incandescente», frase che mostra una perplessità più elevata dovuta all’uso di scelte lessicali non convenzionali e di metafore meno immediate: sono queste ad aumentare significativamente il contenuto informativo e quindi la perplessità del testo. Accanto alla perplessità, un altro parametro fondamentale nel rilevamento dei contenuti artificiali è rappresentato dalla cosiddetta burstiness, termine inglese che potremmo tradurre come irregolarità ritmica e che indica la tendenza di una grandezza a manifestarsi in modo discontinuo e imprevedibile piuttosto che in maniera uniforme e costante. Tale indicatore valuta le variazioni nella struttura e nella lunghezza delle frasi presenti all’interno di un documento, catturando la «tessitura ritmica»del testo, ovvero il modo in cui l’autore alterna costruzioni sintattiche di diversa complessità e ampiezza. Gli scrittori umani tendono naturalmente ad alternare periodi semplici e complessi, creando un ritmo che appare discontinuo e imprevedibile, frutto tanto di scelte stilistiche consapevoli quanto di variazioni spontanee nel flusso del pensiero: esse si riflettono inevitabilmente nella struttura del testo prodotto. I testi generati dall’intelligenza artificiale, per contro, mantengono strutture frasali più uniformi e coerenti, risultando in una bassa variabilità e tradendo l’origine algoritmica del contenuto: i modelli generativi tendono a privilegiare l’omogeneità nella lunghezza e nella complessità, evitando gli sbalzi improvvisi che caratterizzano invece la scrittura umana. Secondo quanto evidenziato da Erol et al. (2025) la differenza nella variabilità stilistica rappresenta un segnale distintivo particolarmente affidabile al fine di distinguere la scrittura umana da quella artificiale: tuttavia, anche tale parametro non è esente da limitazioni e può essere in qualche misura aggirato attraverso tecniche di post-elaborazione del testo generato (per esempio la parafrasi) che introducano artificialmente elementi di variabilità. Tabella 1: Indicatori statistici per il rilevamento: Perplexity e Burstiness. Parametro Definizione e Distinzione AI/Umano Perplexity Misura la prevedibilità di un testo. I modelli IA sono addestrati per minimizzare la perplessità, producendo testi molto fluidi e probabili. Un valore basso indica spesso un’origine artificiale, mentre un valore alto indica una scrittura umana più complessa e inaspettata. Burstiness Misura la variazione nella struttura e lunghezza delle frasi. Gli esseri umani tendono a scrivere in modo "intermittente" (bursty), alternando frasi lunghe e complesse a frasi brevi. L’IA tende invece a una uniformità costante, mostrando una bassa burstiness. I sistemi di rilevamento più avanzati non si limitano alla mera applicazione di questi due parametri, per quanto significativi essi siano: essi impiegano una serie di classificatori basati su reti neurali profonde, addestrati su vasti corpus di testi attraverso un processo di apprendimento supervisionato, che permette al sistema di interiorizzare pattern complessi difficilmente catturabili attraverso metriche esplicite. Tali modelli di apprendimento automatico analizzano simultaneamente molteplici caratteristiche linguistiche, in un processo olistico che supera la semplice somma di singoli parametri. Tra loro vi sono: •i pattern di coerenza semantica, ovvero la capacità di mantenere un filo logico coerente nel 3
GianMarco Schiesaro Algoritmi imperfetti Dicembre 2025 corso del testo senza cadere in contraddizioni o salti tematici improvvisi; •le relazioni contestuali tra le parole, che rivelano come i concetti vengano collegati tra loro e quali associazioni semantiche vengano privilegiate; •la consistenza stilistica, che misura l’uniformità del registro linguistico adottato e la stabilità delle scelte espressive nel corso del documento; •le strutture del flusso logico, che valutano come le argomentazioni vengano sviluppate e concatenate in una progressione che può apparire più o meno naturale, a seconda che rispecchi i modi tipicamente umani di organizzare il pensiero oppure segua i percorsi più stereotipati caratteristici della generazione algoritmica. Come documentato in Encyclopedia MDPI (2025), gli strumenti di rilevamento basati sull’intelligenza artificiale utilizzano tecniche di finezza sempre crescente per l’elaborazione del linguaggio naturale, sfruttando l’analisi lessicale e il riconoscimento di pattern testuali: essi rappresentano l’avanguardia di un settore in rapidissima evoluzione, in cui i progressi tecnologici si susseguono con una frequenza tale da rendere difficile persino per gli specialisti mantenersi aggiornati. 1.3 Un esempio di processo di rilevamento Per comprendere come operino questi sistemi nella pratica quotidiana delle istituzioni universitarie e di ricerca, dove la verifica dell’autenticità dei testi rappresenta una preoccupazione costante, può essere utile esaminare un esempio concreto di analisi: si proverà dunque a seguire passo dopo passo il percorso che un documento compie nel processo di rilevamento. Consideriamo un breve paragrafo sottoposto a valutazione che recita: «Il cambiamento climatico rappresenta una delle sfide più urgenti che l’umanità si trova ad affrontare. L’aumento delle temperature e gli eventi meteorologici estremi minacciano gli ecosistemi in tutto il mondo. È necessaria un’azione immediata per mitigare questi effetti e proteggere le generazioni future». Il testo presenta caratteristiche interessanti dal punto di vista dell’analisi, in quanto combina affermazioni generali ampiamente condivise nella letteratura scientifica con una struttura retorica piuttosto standard nel genere della produzione accademica su temi ambientali. Di fronte a un testo simile, un sistema di rilevamento avanzato procede attraverso diverse fasi analitiche, che si integrano tra loro per produrre una valutazione complessiva della natura del contenuto esaminato. In primo luogo, il sistema calcola i punteggi di perplessità per ciascuna frase, valutando quanto ciascuna proposizione risulti prevedibile secondo i modelli statistici di linguaggio, costruiti attraverso l’analisi di enormi quantità di testi di riferimento. L’operazione richiede capacità computazionali non trascurabili, ma può essere eseguita con relativa rapidità, grazie alle ottimizzazioni algoritmiche raggiunte negli ultimi anni. In secondo luogo, il sistema analizza la variazione nella complessità delle frasi, misurando la variabilità strutturale complessiva del paragrafo attraverso metriche che catturano non solo la lunghezza ma anche la complessità sintattica e il grado di subordinazione presente nelle diverse proposizioni, cercando di identificare quegli schemi di alternanza tra semplicità e complessità che caratterizzano tipicamente la scrittura umana. Successivamente, il sistema confronta il testo con i pattern appresi durante la fase di addestramento, cercando corrispondenze con le caratteristiche di scrittura codificate nei pesi delle reti neurali attraverso l’esposizione a migliaia di esempi etichettati. Si tratta di un processo che ricorda, per certi versi, il modo in cui un esperto umano sviluppa nel tempo una propria particolare capacità intuitiva di riconoscere stili e caratteristiche testuali anche senza essere in grado di articolare esplicitamente i criteri su cui poggia il suo giudizio. Infine, integrando in modo non lineare, attraverso i livelli successivi della rete neurale, tutte queste analisi parziali, il sistema genera un punteggio di probabilità, che indica quanto sia verosimile l’ipotesi che il testo in questione sia stato prodotto da un’intelligenza artificiale: il punteggio viene poi tipicamente presentato all’utente accompagnato da una visualizzazione, nella quale sono evidenziate le porzioni del testo che hanno contribuito maggiormente a determinare il giudizio finale. Siamo in presenza di un processo solo in apparenza semplice, in realtà estremamente complesso nei dettagli implementativi: esso cela una complessità computazionale notevole e richiede l’inte4
GianMarco Schiesaro Algoritmi imperfetti Dicembre 2025 grazione di molteplici discipline, che vanno dalla linguistica computazionale alla teoria dell’informazione, dalla statistica bayesiana all’apprendimento automatico, dalla psicologia cognitiva (per lo studio dei processi di produzione testuale) alla filosofia del linguaggio (per l’indagine sulla natura del significato). La sfida principale consiste nel bilanciare accuratezza e affidabilità: sono assolutamente da evitare i cosiddetti falsi positivi, che potrebbero danneggiare ingiustamente chi abbia svolto un lavoro originale, ma anche i falsi negativi, che permetterebbero a contenuti effettivamente generati artificialmente di passare inosservati: ciò vanificherebbe l’intera finalità del sistema di rilevamento e minerebbe, di conseguenza, anche la credibilità delle istituzioni che su di esso fanno affidamento. Come vedremo nel seguito, esponendo la letteratura empirica e alcune esperienze sul campo, un tale equilibrio resta tuttora uno degli aspetti più problematici e controversi nell’implementazione di strumenti antiplagio nelle istituzioni educative e di ricerca: esso continua a generare accesi dibattiti, che non si limitano alla sola sfera tecnologica ma che travalicano frequentemente anche l’ambito etico, quello pedagogico e perfino quello politico. 2 Metodi attuali e prospettive future 2.1 I metodi di rilevamento attuali Abbiamo osservato come l’approccio basato su metriche relativamente semplici (quali perplessità e burstiness) non sia mai adeguato e suggerisca l’adozione di sistemi capaci di analizzare il tessuto linguistico da angolazioni multiple. L’analisi multiparametrica rappresenta oggi lo standard verso cui convergono le soluzioni tecnologiche: i sistemi più recenti esaminano le relazioni contestuali tra i concetti distribuiti nei paragrafi, valutando non soltanto la correttezza grammaticale o la coerenza locale, ma anche la progressione logica delle idee lungo l’intero documento, la coerenza semantica profonda, il riconoscimento di marcatori stilistici che possano caratterizzare l’opera di un autore specifico, e persino l’analisi dei pattern citazionali alla ricerca di anomalie nella formattazione dei riferimenti bibliografici. Gli strumenti possono ormai catturare regolarità linguistiche estremamente diversificate, che sfuggirebbero all’analisi umana diretta. Il National Centre for AI (2024) riporta che nessun singolo approccio fornisce affidabilità completa e suggerisce di adottare strategie di rilevamento multiple: la tendenza verso l’ibridazione metodologica riconosce implicitamente che la complessità del problema richiede risposte articolate, incapaci di essere ridotte a una singola metrica o a un unico algoritmo, per quanto sofisticato esso possa essere. 2.2 Le piattaforme commerciali Prima di procedere con una presentazione più approfondita dei problemi connessi con i software di rilevamento antiplagio, può essere utile una carrellata delle funzionalità introdotte dalle più diffuse piattaforme commerciali. Tabella 2: Confronto dell’accuratezza dichiarata tra le principali piattaforme di rilevamento. Piattaforma Accuratezza Turnitin >98% (su testi non manipolati) Copyleaks 99,12% (accuratezza complessiva) GPTZero ≈99% (accuratezza testi umani) Originality.AI 98% (test di laboratorio) Turnitin, piattaforma già operante nel rilevamento del plagio tradizionale, ha introdotto nel 2023 funzionalità specifiche per l’identificazione di contenuti generati da intelligenza artificiale, estendendo così il proprio raggio d’azione ben oltre il semplice confronto tra documenti: il sistema analizza i testi sottoposti a verifica confrontandoli non soltanto con il proprio vasto archivio proprietario, ma impiegando anche algoritmi di apprendimento automatico appositamente addestrati per riconoscere pattern linguistici tipici della generazione artificiale. Secondo quanto riportato dal National Centre for AI (2024), Turnitin dichiara tassi di accuratezza superiori al 98% nel rilevamento di testi generati da intelligenza artificiale non modificati, con percentuali di falsi positivi inferiori all’1% in studi controllati, dati che sembrerebbero attestare un’elevata affidabilità della piattaforma. Tuttavia, la University of San Diego (2024) ha evidenziato come uno studio del Washington Post abbia riscontrato un tasso di falsi positivi del 50%1su un 1L’inchiesta giornalistica di Fowler (2023) sul Washington Post ha documentato attraverso test sul campo il caso 5
GianMarco Schiesaro Algoritmi imperfetti Dicembre 2025 campione di dimensioni più ridotte, sottolineando così l’importanza cruciale delle condizioni di test e dell’ampiezza del campione nella valutazione dell’accuratezza di questi sistemi: lo scarto significativo tra risultati ottenuti in contesti diversi solleva interrogativi importanti sulla reale affidabilità di queste tecnologie quando vengano applicate in situazioni concrete, lontane dalle condizioni ideali di laboratorio, e suggerisce la necessità di una cautela interpretativa di fronte a dichiarazioni di accuratezza eccessivamente ottimistiche. Copyleaks propone invece una soluzione di livello aziendale che rivendica un’accuratezza del 99,12% nel rilevamento di contenuti generati artificialmente in oltre trenta lingue diverse, offrendo supporto per la rilevazione di testi prodotti da ChatGPT, GPT-4, Gemini, DeepSeek e Claude: la piattaforma fornisce punteggi di probabilità che indicano la verosimiglianza con cui specifici passaggi siano stati generati da intelligenza artificiale, permettendo così una valutazione graduata piuttosto che un semplice giudizio binario. Si tratta di un approccio che riconosce implicitamente la natura sfumata del problema: non sempre è possibile stabilire con certezza assoluta se un testo sia interamente umano o interamente artificiale, esistendo invece un continuum di possibilità che include la collaborazione tra autore umano e strumento artificiale, la revisione umana di testi generati automaticamente, o l’uso selettivo dell’intelligenza artificiale per specifiche porzioni di un documento. GPTZero, sviluppato specificamente per contesti educativi, impiega metodi statistici basati fondamentalmente su metriche di perplessità e burstiness: la University of Chicago (2025) ha scoperto che GPTZero è riuscito a rilevare con un’accuratezza del 100% tutti i testi generati artificialmente, ad eccezione dei contenuti prodotti da Microsoft Copilot, raggiungendo al contempo un’accuratezza del 99% sui testi scritti da esseri umani. Tuttavia si è anche notato come GPTZero produca tassi di falsi positivi superiori rispetto ad alcuni concorrenti, segnalando occasionalmente come generati artificialmente testi autentici: è un fenomeno che solleva preoccupazioni significative sull’idoneità di questo strumento per utilizzi che posemblematico di uno studente falsamente accusato da Turnitin di aver utilizzato intelligenza artificiale per produrre un elaborato interamente originale, evidenziando come i falsi positivi non siano anomalie statistiche marginali ma fenomeni con conseguenze concrete e devastanti sulla vita accademica e psicologica degli individui coinvolti. sano avere conseguenze disciplinari o accademiche rilevanti per gli individui sottoposti a verifica. Originality.AI utilizza modelli proprietari di apprendimento automatico per distinguere tra contenuto umano e artificiale: lo studio Hyatt et al. (2025) ha valutato quattro rilevatori di intelligenza artificiale e ha scoperto che Originality.AI ha classificato correttamente il 98% dei saggi generati artificialmente con solo un 2% di falsi positivi, superando sia gli strumenti concorrenti sia i valutatori umani. Questi dati suggeriscono che, almeno in determinate condizioni sperimentali, i sistemi automatizzati possano in effetti raggiungere livelli di accuratezza superiori a quelli degli esseri umani nel riconoscimento di testi generati artificialmente, un risultato che potrebbe apparire controintuitivo ma che riflette la capacità degli algoritmi di apprendimento automatico di identificare pattern sottili che sfuggono alla percezione consapevole degli esseri umani. 2.3 Le tecnologie di watermarking quale frontiera futura Mentre i sistemi di rilevamento continuano a perfezionarsi, l’attenzione del mondo della ricerca si sta progressivamente spostando verso un approccio radicalmente diverso: quello del watermarking incorporato direttamente nel processo di generazione del testo, una strategia che promette di superare molte delle limitazioni intrinseche alle metodologie di «rilevamento ex post». Il watermarking rappresenta forse lo sviluppo futuro più promettente, offrendo la prospettiva di un meccanismo di identificazione robusto, difficilmente eludibile, e al contempo rispettoso della qualità del testo generato. Google ha sviluppato SynthID, una tecnologia pionieristica che incorpora watermark direttamente nel testo durante la fase di generazione2: il meccanismo funziona attraverso una funzione pseudorandomica, che analizza le parole precedenti per creare una sorta di numero «seme», il quale influenza la scelta delle parole successive, in modo impercettibile agli esseri umani ma rilevabile dal software. Il testo risultante, in sostanza, 2La tecnologia di watermarking descritta si basa sui principi illustrati nello studio fondamentale di Kirchenbauer et al. (2023), che ha definito i meccanismi matematici per incorporare pattern statistici invisibili durante la generazione del testo, attraverso funzioni pseudorandomiche che influenzano la selezione delle parole successive. 6
GianMarco Schiesaro Algoritmi imperfetti Dicembre 2025 porta una firma invisibile, che può essere identificata dagli algoritmi di rilevamento pur rimanendo indistinguibile ai lettori umani, creando una sorta di impronta digitale incorporata nel tessuto stesso del linguaggio generato. Google ha reso open source la tecnologia SynthID, permettendo agli sviluppatori di intelligenza artificiale di integrare il watermarking nei propri sistemi: questa scelta strategica potrebbe accelerarne significativamente l’adozione, trasformandolo da tecnologia appannaggio di poche grandi aziende a standard de facto dell’industria. La ricerca tecnologica sta inoltre avanzando verso tecniche di watermarking di ispirazione crittografica, dove i watermark possono essere rilevati soltanto con la conoscenza di una chiave segreta: questo approccio offre una sicurezza più forte contro la manomissione, consentendo di incorporare watermark univoci senza che questi possano essere rilevati da soggetti non autorizzati. Uno studio del 2025 descrive metodi di creazione di watermark robusti rispetto alla parafrasi e alla traduzione: la capacità di resistere alla parafrasi è particolarmente cruciale, considerato che uno dei modi più semplici per eludere i sistemi di rilevamento tradizionali consiste proprio nel riformulare il testo generato artificialmente, utilizzando parole diverse ma mantenendo lo stesso significato3. I più recenti breakthrough includono sistemi capaci di incorporare watermark multipli e univocamente cifrati all’interno di un singolo modello di intelligenza artificiale: questa tecnologia abilita il tracciamento di contenuti attraverso canali di distribuzione multipli, mantenendo al contempo l’attribuzione alle fonti originali e creando così una sorta di catena di custodia digitale, preziosa non soltanto in ambito accademico ma anche nel più ampio contesto della lotta alla disinformazione e alla manipolazione dei contenuti online. 3Elkhatat et al. (2023) hanno dimostrato empiricamente che interventi relativamente semplici di postelaborazione, come la parafrasi attraverso strumenti dedicati o l’editing manuale selettivo, riducono drasticamente l’efficacia del rilevamento: nei loro esperimenti, tecniche di manipolazione accessibili anche a utenti non esperti hanno permesso di far crollare l’accuratezza di identificazione dal 90-98% a valori inferiori al 60%, evidenziando una vulnerabilità strutturale dei sistemi attuali. 2.4 L’evoluzione delle tecnologie di rilevamento avanzate Parallelamente allo sviluppo del watermarking, i sistemi di rilevamento correnti continuano la propria evoluzione, spingendosi verso livelli di crescente sofisticazione e promettendo di colmare almeno parzialmente il divario tra le capacità generative dei modelli linguistici più avanzati e l’abilità dei sistemi di rilevamento di identificarli: questa competizione tecnologica tra generazione e rilevamento ricorda, per certi versi, la dinamica evolutiva tra prede e predatori, dove ogni avanzamento di una parte stimola una risposta adattativa dell’altra, in un ciclo potenzialmente senza fine di innovazione reciproca. I miglioramenti dovuti all’applicazione del deep learning rappresentano la direzione principale di questa evoluzione: i sistemi di rilevamento di prossima generazione sfruttano infatti reti neurali progressivamente più sofisticate, che analizzano pattern sottili impercettibili ai metodi attuali. Essi esaminano pattern linguistici a livello micro, quali ad esempio: •la consistenza stilistica cross-documentale, che potrebbe rivelare l’uso di uno stesso sistema di generazione artificiale; •l’evoluzione temporale della scrittura, che negli esseri umani tende a mostrare variazioni e sviluppi mentre nei sistemi artificiali potrebbe manifestare una stabilità sospetta; •impronte digitali specifiche dell’autore, che potrebbero permettere di distinguere tra la scrittura genuina di un individuo e l’imitazione artificiale del suo stile. Global Market Insights (2025) prevede che il mercato del watermarking dell’intelligenza artificiale, valutato a 579,8 milioni di dollari USA nel 2024, raggiungerà i 3.112,6 milioni di dollari entro il 2034 (CAGR del 18,2%). Queste proiezioni testimoniano la convinzione dell’industria che il watermarking e il rilevamento avanzato rappresentino non soltanto necessità tecniche ma anche opportunità commerciali significative. Il monitoraggio in tempo reale costituisce un’altra frontiera promettente: i sistemi futuri forniranno capacità di monitoraggio istantaneo, permettendo alle organizzazioni di rilevare in maniera istantanea contenuti manipolati o riutilizzati senza autorizzazione attraverso canali multipli. Per 7
GianMarco Schiesaro Algoritmi imperfetti Dicembre 2025 raggiungere tale risultato occorre l’integrazione con piattaforme di social media e altri sistemi di gestione dei contenuti, allo scopo di fornire una verifica continua dell’integrità: la capacità di identificare in tempo reale la diffusione di contenuti generati artificialmente potrebbe rivelarsi cruciale nel contesto della lotta alla disinformazione, dove la rapidità di risposta è spesso determinante per limitare i danni. L’integrazione con la blockchain rappresenta un approccio emergente particolarmente interessante: combinando il watermarking con la tecnologia blockchain, si possono creare registri immutabili di provenienza per i contenuti digitali, abilitando la verifica dell’autenticità dei contenuti e il tracciamento della storia delle modifiche attraverso l’intero ciclo di vita del contenuto. Una simile fusione di tecnologie potrebbe offrire una soluzione particolarmente robusta al problema dell’autenticazione dei contenuti, creando una sorta di «certificato di nascita digitale»per ciascun testo, in grado di tracciarne inequivocabilmente l’origine e tutte le successive trasformazioni. 2.5 Gli standard di interoperabilità e le sfide implementative La proliferazione di sistemi, sia di watermarking che di rilevamento, solleva inevitabilmente questioni di interoperabilità e standardizzazione: senza standard comuni, esiste il rischio concreto che si sviluppi un ecosistema frammentato, dove contenuti su cui un sistema abbia apposto dei watermark non possano essere verificati da un altro sistema, limitando così drasticamente l’utilità pratica di queste tecnologie. La Coalition for Content Provenance and Authenticity si sta occupando di sviluppare standard industriali per l’autenticazione dei contenuti attraverso il framework C2PA, che incorpora nei file digitali metadati resistenti alla manomissione, documentando autore e storia delle modifiche: tuttavia, dato che i metadati possono essere rimossi, il watermarking serve al più come backup critico per il ripristino delle informazioni di provenienza. Un’implementazione esemplificativa di tali standard ha avuto luogo nel 2024, quando TikTok ha iniziato a segnalare automaticamente i video generati artificialmente utilizzando tag di provenienza in stile C2PA, dimostrando così l’applicazione pratica di tali standard nella scala dei social media: questa iniziativa rappresenta un importante precedente, che potrebbe spianare la strada a un’adozione più ampia di standard di autenticazione dei contenuti attraverso diverse piattaforme digitali. Nonostante gli avanzamenti tecnologici, tuttavia, permangono ostacoli significativi: la rimozione dei watermark rappresenta una minaccia reale, dato che utenti con abilità sofisticate sono in grado di farlo utilizzando parafrasi, traduzione, o attacchi mirati all’algoritmo di watermarking. Anche il controllo degli accessi presenta un dilemma: fino a che punto la prevenzione dell’abuso consente di impedire l’accesso pubblico agli strumenti di rilevamento? Se infatti gli strumenti di rilevamento risultassero troppo accessibili, attori malintenzionati potrebbero testarli iterativamente e modificare i contenuti generati artificialmente fino a quando i watermark vengano rimossi, in una sorta di processo di selezione artificiale che favorisce progressivamente i contenuti più difficili da rilevare. Le preoccupazioni relative alla privacy aggiungono un ulteriore livello di complessità: i sistemi di watermarking devono bilanciare attentamente l’attribuzione con la protezione della privacy. Si immagini, ad esempio, il caso di attivisti dei diritti umani che utilizzino strumenti di intelligenza artificiale per documentare gli abusi: è chiaro che sarebbero esposti a una situazione di pericolo se i watermark rivelassero la loro identità a regimi oppressivi. Un simile scenario mette in luce come una tecnologia concepita per promuovere la trasparenza e l’integrità possa, paradossalmente, generare nuovi rischi per individui vulnerabili, richiedendo quindi un’attenta considerazione dei contesti d’uso e delle possibili conseguenze inattese. Il costo e l’accessibilità rappresentano questioni ancora da chiarire: i modelli di prezzi e licenze per il rilevamento dei watermark rimangono ancora incerti e poco definiti e le capacità di rilevamento premium potrebbero essere accessibili soltanto a istituzioni più grandi. Esiste il rischio concreto che si crei un sistema a due velocità, dove istituzioni ricche e ben dotate possano permettersi strumenti di rilevamento sofisticati mentre quelle più povere debbano accontentarsi di soluzioni meno efficaci, con conseguenze potenzialmente problematiche per l’equità nell’accesso all’educazione e la giustizia sociale. Osservando il variegato panorama che emerge complessivamente da questa analisi, appare evi8
GianMarco Schiesaro Algoritmi imperfetti Dicembre 2025 dente come la disciplina scientifica del rilevamento dei contenuti generati artificialmente si trovi in uno stato di rapida evoluzione, caratterizzato da progressi tecnologici significativi ma anche da sfide persistenti, che richiedono soluzioni non puramente tecnologiche bensì anche normative, etiche e pedagogiche. La tensione tra il perfezionamento continuo dei sistemi generativi e l’evoluzione dei meccanismi di rilevamento definisce un paesaggio tecnologico dinamico, dove le certezze sono poche e le domande molte: appare necessario un approccio prudente e riflessivo, che sappia bilanciare l’innovazione tecnologica con la tutela dei diritti individuali e l’integrità dei processi educativi e scientifici. 3 L’affidabilità degli strumenti di rilevamento e i loro limiti 3.1 Le metriche di accuratezza: promesse e realtà L’analisi delle prestazioni effettive dei sistemi di rilevamento dei contenuti generati artificialmente è un territorio caratterizzato da una tensione costante tra le affermazioni promozionali delle aziende produttrici e i risultati concreti emersi dalle ricerche indipendenti. La tensione non è data soltanto dalle incertezze relative alle tecniche di misurazione dell’accuratezza, bensì da una serie di interrogativi più profondi circa la fiducia che le istituzioni educative possano riporre su tali strumenti e le conseguenze potenzialmente gravi che possono derivare da un utilizzo acritico di tecnologie ancora dubbie. Le cifre che circolano nel mercato dei software di rilevamento appaiono spesso rassicuranti: piattaforme premium come Copyleaks dichiarano tassi di accuratezza del 99,12%, Winston AI si spinge fino al 99,98%, mentre Originality.AI rivendica una precisione del 98,2% nell’identificazione dei contenuti artificiali4. I numeri sembrano suggerire una sorta di infallibilità nel distinguere la redazione umana di testi da quella generata algoritmicamente e potrebbero indurre a credere che il problema del rilevamento sia ormai sostanzialmente risolto, lasciando soltanto questioni tecniche marginali da perfezionare attraverso ulteriori affinamenti degli algoritmi. La realtà che emerge dalla letteratura scientifica indipendente racconta però una storia consi4Banisoft (2025). derevolmente più complessa e meno rassicurante. Una meta-analisi condotta da Weber-Wulff et al. (2023)5ha mostrato che la maggior parte dei rilevatori di intelligenza artificiale ottiene punteggi inferiori all’80% di accuratezza quando testati su campioni di testo diversificati e rappresentativi della varietà effettiva della produzione testuale che si incontra nel mondo reale: il risultato mette in evidenza come le condizioni controllate di laboratorio in cui vengono solitamente misurate le prestazioni dichiarate dalle aziende possano discostarsi significativamente dalle situazioni pratiche di utilizzo quotidiano nelle diverse istituzioni. Lo studio University of San Diego (2024) ha documentato un caso emblematico di questa discrepanza: mentre Turnitin riportava tassi di falsi positivi inferiori all’1% negli studi controllati condotti internamente, una ricerca del Washington Post che aveva utilizzato campioni di dimensioni più ridotte ha registrato un tasso di falsi positivi del 50%, una differenza clamorosa che evidenzia quanto le dimensioni del campione e le condizioni di test possano influenzare pesantemente i risultati delle valutazioni di accuratezza. Una certa prudenza appare dunque quantomeno necessaria. Il problema dei falsi positivi merita un’attenzione particolare poiché rappresenta probabilmente la vulnerabilità più insidiosa dal punto di vista delle implicazioni etiche e pedagogiche: un falso positivo si verifica quando il software identifica erroneamente come artificiale un testo scritto da un essere umano, con conseguenze potenzialmente devastanti per chi, per esempio uno studente in ambito accademico, venga ingiustamente accusato di disonestà. Lo studio Hyatt et al. (2025) ha mostrato che i rilevatori automatici di intelligenza artificiale presentano un tasso medio di falsi positivi dell’1,3% quando si considerino le tre principali piattaforme commerciali, una percentuale che potrebbe sembrare trascurabile in termini puramente statistici ma che assume una dimensione ben più preoccupante se si considera che, in un gruppo di 100 persone, equivale ad accusare ingiustamente almeno uno o due individui. Lo stesso 5La meta-analisi di Weber-Wulff et al. (2023), pubblicata sull’International Journal for Educational Integrity, ha testato sistematicamente i principali strumenti di rilevamento commerciali su un corpus diversificato di testi, documentando che la maggior parte raggiunge accuratezze inferiori all’80% in condizioni reali d’uso, significativamente al di sotto delle percentuali dichiarate dai produttori nei contesti controllati di laboratorio. 9
GianMarco Schiesaro Algoritmi imperfetti Dicembre 2025 La ricerca empirica ha iniziato a documentare con crescente precisione gli effetti psicologici e comportamentali di questo clima di sospetto generalizzato: lo studio Blommerde (2024) ha evidenziato come gli approcci centrati sul rilevamento e sulla sorveglianza favoriscano lo sviluppo di atteggiamenti di diffidenza e ansia nelle interazioni tra educatori e studenti, producendo un’atmosfera che mina alla base l’efficacia dell’insegnamento e la qualità dell’apprendimento. Gli autori dello studio sottolineano con particolare forza come gli attuali strumenti presentino limitazioni tecniche significative che ne rendono problematico l’utilizzo in contesti educativi, e sostengono la necessità di un cambiamento di paradigma14: occorre passare da una mentalità punitiva e poliziesca a un approccio collaborativo che integri l’intelligenza artificiale nel processo di apprendimento in modo da potenziare piuttosto che ostacolare i risultati formativi. Si tratta di una prospettiva che ribalta completamente la logica attualmente prevalente, spostando l’attenzione dalla repressione all’empowerment, dalla sorveglianza al supporto. Un esempio concreto aiuta a comprendere le dinamiche in gioco: si immagini uno studente che consegna un elaborato frutto di settimane di lavoro diligente, di ricerca approfondita, di riflessione personale, e che riceve come prima risposta non un feedback sul contenuto o sulla qualità del suo lavoro, ma una notifica automatica che segnala la presenza di pattern sospetti nel suo testo. L’esperienza è profondamente demotivante e alienante: invece di sentirsi riconosciuto nel proprio impegno e nella propria capacità di produrre conoscenza, lo studente si trova improvvisamente nella posizione di dover dimostrare la propria innocenza, di dover giustificare caratteristiche del proprio stile di scrittura, di dover fronteggiare un’accusa che lo raggiunge prima ancora che il docente abbia effettivamente letto ciò che ha scritto. Una tale dinamica non può che produrre risentimento, frustrazione, e progressivo distacco emotivo dall’esperienza educativa, trasformando quella che dovrebbe essere 14Il National Centre for AI di Jisc, ente di riferimento britannico per l’innovazione digitale nell’istruzione superiore, ha pubblicato una sintesi dello stato dell’arte, Webb et al. (2023), che raccomanda esplicitamente alle istituzioni accademiche di adottare approcci pedagogici collaborativi piuttosto che punitivi, enfatizzando come l’eccessiva dipendenza da strumenti di rilevamento automatico rischi di compromettere la relazione educativa e di esacerbare disuguaglianze preesistenti. un’opportunità di crescita in un esercizio burocratico di autodifesa. Il problema assume dimensioni ancora più preoccupanti quando si consideri che l’affidamento esclusivo o prevalente al software di rilevamento diventa un sostituto della conoscenza diretta dei discenti, della comprensione dei loro processi di apprendimento, della capacità di riconoscere nella loro produzione scritta tracce di crescita intellettuale e di sviluppo personale. Il paradosso che si crea è inquietante: la tecnologia che dovrebbe servire a proteggere l’integrità del processo educativo finisce per svuotarlo di quella dimensione relazionale e umana che ne costituisce il cuore pulsante, sostituendo il giudizio pedagogico informato e contestualizzato con l’output di algoritmi. 4.3 Privacy, sorveglianza e utilizzo dei dati personali L’implementazione diffusa di sistemi di rilevamento automatico dei contenuti generati artificialmente solleva interrogativi significativi anche sul fronte della privacy e della protezione dei dati personali: ogni volta che si sottomette un elaborato a un sistema di verifica, si sta di fatto consegnando il proprio lavoro intellettuale a piattaforme digitali che possono utilizzare tali dati per scopi che vanno ben oltre la semplice verifica immediata dell’autenticità del testo. La Georgetown University Library (2024) ha sollevato con particolare efficacia questo problema: i modelli di intelligenza artificiale linguistica richiedono enormi quantità di dati per il loro addestramento e perfezionamento continuo, e i contenuti sottomessi dagli utenti per la verifica possono potenzialmente essere integrati nei dataset di training senza che vi sia stato un consenso esplicito e informato da parte degli autori. Si tratta di una dinamica che trasforma surrettiziamente ogni utente in un fornitore involontario di dati per lo sviluppo di tecnologie commerciali, sollevando questioni etiche e legali di notevole complessità. Il problema assume contorni particolarmente delicati quando i testi sottomessi contengono informazioni personali o sensibili, per esempio nel caso di un saggio autobiografico su esperienze di trauma, su questioni di salute mentale, su dinamiche familiari difficili, o su altri aspetti della propria vita privata che potrebbero essere richiesti nell’ambito di determinati corsi. Si tratta di informazioni altamente personali e potenzialmente vulnerabili che entrano nell’ecosistema digitale della piattafor16
GianMarco Schiesaro Algoritmi imperfetti Dicembre 2025 ma, con rischi che non sono solo quelli della possibile incorporazione nei dati di addestramento del sistema, ma anche quelli di possibili violazioni della sicurezza o di utilizzi impropri da parte di chi ha accesso ai database. Anche le implicazioni in termini di sorveglianza sono altrettanto preoccupanti: i discenti, sapendo che ogni loro produzione scritta sarà sottoposta a scrutinio algoritmico e che le peculiarità del loro stile personale potrebbero attivare meccanismi di segnalazione, potrebbero essere indotti a forme di autocensura e di conformismo preventivo, che finiscono inevitabilmente con l’impoverire la qualità e l’originalità della produzione intellettuale. La creatività lascerebbe spazio alla preoccupazione costante di non attivare falsi allarmi, di non deviare troppo da modelli percepiti come sicuri, di non esprimersi in modi che, pur essendo autentici e legittimi, potrebbero essere interpretati dagli algoritmi come sospetti. 4.4 Ridefinire il plagio nell’era dell’intelligenza artificiale generativa Al di là delle questioni pratiche e procedurali relative all’implementazione di sistemi di rilevamento, l’emergere dell’intelligenza artificiale generativa solleva interrogativi filosofici profondi sulla natura stessa del plagio, dell’autorialità, e della proprietà intellettuale: le categorie concettuali tradizionali che hanno guidato per decenni le politiche di integrità accademica si rivelano sempre più inadeguate a catturare le complessità e le ambiguità introdotte da tecnologie che non copiano testi esistenti ma generano contenuti originali sulla base di pattern appresi da enormi corpus di dati. La Georgetown University ha affrontato la questione con particolare lucidità: sebbene l’intelligenza artificiale possa non qualificarsi come «qualcuno»nel senso convenzionale del termine, l’utilizzo di testo generato artificialmente senza citazione appropriata è comunque da considerarsi plagio, in quanto non risulta etico presentare come frutto del proprio sforzo intellettuale materiale che è stato in realtà prodotto da altri, siano essi esseri umani o algoritmi. Tale posizione, tuttavia, lascia aperte numerose zone grigie che risultano sempre più difficili da esplorare man mano che le tecnologie di intelligenza artificiale si integrano più profondamente nei flussi di lavoro quotidiani di scrittori, studenti e professionisti. Un esempio è quello dell’utilizzo di strumenti di correzione grammaticale e di miglioramento della leggibilità, funzioni ormai integrate in tutti i word processor moderni: esso viene generalmente considerato accettabile, eppure tali strumenti utilizzano sempre più frequentemente algoritmi di intelligenza artificiale per suggerire riformulazioni che vanno ben oltre la semplice correzione di errori ortografici. Si pensi ancora all’utilizzo di intelligenza artificiale per il brainstorming o per la generazione di outline preliminari: esso potrebbe essere considerato comparabile all’uso di un tutor umano che aiuta un autore a organizzare le proprie idee, eppure alcuni rilevatori potrebbero segnalare come sospetto un testo che mostra pattern strutturali simili a quelli tipici della produzione algoritmica. Ancora, la generazione di riassunti di materiale di ricerca attraverso intelligenza artificiale potrebbe essere considerata alla stregua di una forma di assistenza nella gestione di grandi quantità di informazione, analogamente all’utilizzo di abstract scritti da esseri umani, eppure verrebbe quasi certamente segnalata dai sistemi di rilevamento. Infine, l’utilizzo di intelligenza artificiale per produrre bozze iniziali che vengono poi sostanzialmente rielaborate si colloca in una zona particolarmente ambigua, dove diventa quasi impossibile stabilire dove finisca il contributo della macchina e dove inizi quello dell’essere umano. La situazione si complica ulteriormente quando si consideri che molte di queste funzionalità di assistenza basate su intelligenza artificiale stanno diventando componenti standard di software ampiamente utilizzati: Microsoft ha integrato Copilot 365 direttamente nelle applicazioni della suite Office. Google ha sviluppato funzionalità analoghe per Google Workspace. Man mano che tali strumenti si integrano nei software di produttività quotidiana, che cosa costituisce «assistenza non autorizzata»e che cosa invece un «utilizzo normale della tecnologia disponibile»? È evidente come non siano sostenibili politiche che trattino come equivalente al plagio qualsiasi forma di assistenza algoritmica. Si apre così uno spazio concettuale nuovo, una «zona grigia di autorialità ibrida15», nella quale 15Eaton (2023) propone il concetto di «era postplagio»per descrivere il nuovo paradigma in cui le categorie tradizionali di autorialità e appropriazione indebita diventano insufficienti: nell’epoca dell’intelligenza artificiale generativa integrata nei flussi di lavoro quotidiani, sostiene l’autrice, occorre sviluppare framework etici transdisciplinari che riconoscano forme di autorialità collaborativa ibrida tra intelligenza umana e artificiale, superando la dicotomia 17
GianMarco Schiesaro Algoritmi imperfetti Dicembre 2025 il contributo umano e quello algoritmico si intrecciano in modi che rendono sempre più artificioso e problematico il tentativo di tracciare confini netti tra ciò che è accettabile e ciò che non lo è: forse, invece di cercare di preservare categorie concettuali che appartengono a un’epoca precedente l’avvento dell’intelligenza artificiale generativa, sarebbe più produttivo ripensare radicalmente che cosa significhi produrre conoscenza o sviluppare competenze nel nuovo ecosistema algoritmico. Non significa ovviamente che occorra abbandonare ogni preoccupazione di integrità o accettare passivamente qualsiasi utilizzo di intelligenza artificiale: significa piuttosto riconoscere che le vecchie categorie non catturano adeguatamente le nuove realtà, e che abbiamo bisogno di framework concettuali e normativi più sofisticati, capaci di distinguere tra utilizzi che impoveriscono l’apprendimento e utilizzi che lo potenziano, amplificando le sue capacità creative e analitiche. La sfida, in definitiva, non è tanto quella di perfezionare tecnologie di rilevamento sempre più sofisticate in una corsa agli armamenti destinata a non avere mai fine, quanto piuttosto quella di re-immaginare l’educazione in modo che la questione del rilevamento dei contenuti diventi meno centrale: se le forme di valutazione e i metodi di insegnamento sono progettati in modo tale da richiedere dimostrazione di comprensione profonda, capacità di applicazione contestualizzata, originalità di pensiero e non semplicemente produzione di testo standardizzato, allora l’intelligenza artificiale generativa diventa uno strumento tra i molti di cui ci si possa avvalere nel percorso di apprendimento piuttosto che una minaccia esistenziale all’integrità dell’istituzione. Una tale trasformazione richiede coraggio intellettuale, disponibilità a mettere in discussione pratiche consolidate, e impegno sostanziale in termini di riprogettazione curricolare e di sviluppo professionale di docenti e formatori: potrebbe però rappresentare l’unica via percorribile per preservare il significato e il valore dell’educazione e della formazione nelle istituzioni accademiche e di ricerca. 5 Conclusioni e raccomandazioni L’analisi condotta ha evidenziato come i sistemi di rilevamento dei contenuti generati artificialbinaria tra originale e copiato. Tabella 4: Sintesi delle limitazioni tecniche ed etiche riscontrate nei sistemi di rilevamento. Categoria Descrizione della Limitazione / Sfida Bias Algoritmico Elevato tasso di falsi positivi per autori non madrelingua, individui neurodivergenti e minoranze. Evasione Tecnica Tecniche di parafrasi e editing riducono l’accuratezza dal 90 −98% a valori inferiori al 60%. Perplessità Testi umani con struttura lineare (bassa perplessità) vengono spesso classificati erroneamente come AI. Impatto Etico Rischio di erosione della fiducia pedagogica e deriva verso modelli di sorveglianza pervasiva. mente si trovino in una fase di sviluppo ancora incompiuta, caratterizzata da limitazioni tecniche significative, da problematiche etiche non risolte, e da implicazioni sociali che richiedono un’attenzione urgente: i tassi di accuratezza moderati, la vulnerabilità a tecniche di elusione relativamente semplici, la presenza documentata di bias sistematici a danno di popolazioni vulnerabili, e l’opacità dei meccanismi decisionali costituiscono elementi che rendono problematico l’utilizzo di questi strumenti come base esclusiva per decisioni, con conseguenze serie per le persone coinvolte. Al tempo stesso, la diffusione crescente delle tecnologie di intelligenza artificiale generativa pone sfide reali all’integrità dei processi formativi e valutativi, sfide che non possono essere semplicemente ignorate ma che richiedono risposte articolate e multidimensionali: esse debbono andare oltre la mera implementazione di strumenti di sorveglianza per abbracciare una riflessione più profonda sulla natura stessa dell’apprendimento, della valutazione e dello sviluppo professionale nell’era digitale. In questa prospettiva, le raccomandazioni che seguono si rivolgono ai diversi attori coinvolti nella gestione di questa transizione complessa, proponendo orientamenti che bilancino l’esigenza di preservare l’integrità con la necessità di tutelare i diritti individuali e di promuovere innovazioni pedagogiche significative. 18
GianMarco Schiesaro Algoritmi imperfetti Dicembre 2025 5.1 Raccomandazioni per le istituzioni accademiche e di ricerca Le istituzioni accademiche e di ricerca che si trovano a gestire la proliferazione di contenuti generati artificialmente devono operare un profondo ripensamento delle proprie strategie di valutazione, allontanandosi da approcci basati principalmente sulla sorveglianza per orientarsi verso modalità di accertamento delle competenze intrinsecamente più resistenti all’automazione: questo cambiamento rappresenta probabilmente l’unica via sostenibile per preservare l’integrità tanto dell’esperienza formativa quanto dei processi di selezione e avanzamento professionale. La riprogettazione delle metodologie di valutazione dovrebbe privilegiare approcci che enfatizzino il processo rispetto al prodotto finale, richiedendo dimostrazioni di comprensione attraverso difese orali, applicazioni pratiche, o forme di valutazione che integrino molteplici evidenze raccolte lungo l’intero percorso formativo: questo vale sia per la valutazione degli studenti universitari che per quella di docenti e ricercatori, sia per i processi di selezione nei concorsi pubblici che per le procedure di avanzamento professionale negli istituti di accademici e di ricerca. L’attenzione dovrebbe spostarsi verso competenze che l’intelligenza artificiale non può replicare, come il pensiero critico applicato a situazioni complesse, la capacità di giudizio etico, l’abilità di sintetizzare conoscenze da domini disciplinari diversi e le competenze relazionali che emergono dall’interazione diretta. Dal punto di vista normativo, le istituzioni hanno la responsabilità di elaborare politiche chiare che definiscano con precisione quali utilizzi dell’intelligenza artificiale siano considerati accettabili e quali no: queste politiche devono includere la garanzia che nessun procedimento disciplinare o decisione di selezione possa basarsi esclusivamente sui risultati di un sistema automatico di rilevamento, richiedendo invece molteplici forme di evidenza valutate da esseri umani capaci di considerare il contesto specifico. Le politiche dovrebbero inoltre prevedere meccanismi di tutela per popolazioni vulnerabili, riconoscendo che persone non madrelingua, neurodivergenti o appartenenti a minoranze etniche potrebbero essere ingiustamente discriminate, e dovrebbero garantire meccanismi di difesa chiari e accessibili. Prima di implementare qualsiasi sistema di rilevamento, le istituzioni dovrebbero condurre valutazioni indipendenti della sua accuratezza su popolazioni diverse, testando specificamente le performance su gruppi potenzialmente vulnerabili a bias sistemici: i risultati di queste valutazioni dovrebbero essere resi pubblici e informare le decisioni sull’adozione. 5.2 Raccomandazioni per gli sviluppatori di tecnologie Gli sviluppatori di sistemi di rilevamento hanno responsabilità significative nel garantire che i propri prodotti siano non soltanto tecnicamente efficaci ma anche eticamente responsabili: questo implica un impegno che va oltre l’ottimizzazione delle metriche di accuratezza e richiede attenzione costante alle implicazioni più ampie del proprio lavoro. I dataset utilizzati per l’addestramento dei modelli devono essere ampliati per includere rappresentazioni adeguate di pattern linguistici diversificati, incorporando testi prodotti da parlanti non nativi, da persone neurodivergenti, e da autori appartenenti a contesti culturali variati: il testing deve essere condotto sistematicamente su popolazioni diverse, documentando le differenze di performance e lavorando per ridurre le disparità. Gli sviluppatori dovrebbero pubblicare studi di validazione indipendenti che documentino le performance in condizioni realistiche su popolazioni rappresentative, piuttosto che limitarsi a risultati ottenuti in ambienti controllati su dataset artificiali. La trasparenza merita attenzione particolare: gli sviluppatori dovrebbero creare interfacce che forniscano spiegazioni dettagliate delle decisioni di classificazione, indicando quali caratteristiche specifiche del testo hanno contribuito al punteggio assegnato. Queste spiegazioni devono essere formulate in linguaggio accessibile anche a utenti non tecnici, consentendo loro di comprendere le ragioni per cui un testo è stato segnalato: la capacità di fornire spiegazioni comprensibili non solo aumenta la trasparenza ma permette anche di identificare più facilmente eventuali falsi positivi. Gli sviluppatori dovrebbero poi essere espliciti riguardo ai limiti e ai casi d’uso appropriati, evitando affermazioni promozionali che inducano a riporre una fiducia non giustificata dalle effettive performance. Le considerazioni etiche devono essere incorporate fin dalle prime fasi di progettazione: ciò impone di implementare protezioni robuste per la pri19
GianMarco Schiesaro Algoritmi imperfetti Dicembre 2025 vacy, garantendo che i dati personali non vengano inappropriatamente conservati o utilizzati per scopi diversi da quelli autorizzati. Il coinvolgimento di stakeholder diversificati nel processo di sviluppo, inclusi studenti, docenti, esperti di etica e rappresentanti di minoranze, permette di identificare preoccupazioni che potrebbero non essere immediatamente evidenti e di incorporare soluzioni che rendano i sistemi più equi. 5.3 Le direzioni di ricerca futura Nonostante i progressi compiuti nello studio dei sistemi di rilevamento dei contenuti generati artificialmente, permangono numerose aree che richiedono ulteriore investigazione: la ricerca futura dovrebbe abbracciare approcci multidisciplinari capaci di integrare prospettive tecniche, pedagogiche, psicologiche ed etiche, riconoscendo che la questione del rilevamento non può essere ridotta a un problema di accuratezza algoritmica. Risulta necessario condurre ricerche longitudinali che esaminino gli impatti a lungo termine dell’implementazione di strumenti di rilevamento sugli esiti di apprendimento, investigando se e in che misura l’utilizzo esteso di questi sistemi influenzi le modalità con cui le persone approcciano il proprio lavoro intellettuale: particolarmente importante sarebbe esaminare gli effetti differenziali su popolazioni diverse, verificando se l’esposizione a sistemi di sorveglianza abbia conseguenze diverse per gruppi già marginalizzati. Gli effetti psicologici dell’esposizione a sistemi di sorveglianza meritano attenzione approfondita, esplorando come le persone percepiscano la presenza di meccanismi automatici di controllo e se questa presenza generi forme di stress che interferiscono con le performance. Lo sviluppo di metodologie alternative di valutazione intrinsecamente più resistenti all’uso non dichiarato di intelligenza artificiale rappresenta un ambito che potrebbe avere implicazioni trasformative: occorre sperimentare e validare approcci innovativi, documentando non soltanto la loro capacità di ridurre le opportunità di abuso ma anche i loro effetti sugli apprendimenti e sulla qualità dell’esperienza complessiva. Sul piano dello sviluppo tecnologico, la ricerca dovrebbe concentrarsi sulla robustezza dei meccanismi di watermarking di fronte ad attacchi sofisticati e sulla capacità di identificare contenuti prodotti attraverso forme di collaborazione ibrida tra intelligenza umana e artificiale: le capacità di rilevamento cross-linguistico meritano investimenti significativi, considerando che la maggior parte dei sistemi sono stati sviluppati principalmente su testi in lingua inglese. 5.4 Il futuro dell’integrità accademica La sfida posta dai contenuti generati artificialmente non può essere affrontata adeguatamente se ci si limita a soluzioni puramente tecnologiche: i limiti di accuratezza degli attuali sistemi di rilevamento, le questioni etiche legate ai bias sistematici, nonché le trasformazioni nella natura stessa della scrittura nell’era dell’intelligenza artificiale generativa richiedono risposte che trascendano l’implementazione di strumenti di sorveglianza. La questione fondamentale non è se qualcuno abbia utilizzato un sistema di intelligenza artificiale, ma piuttosto come le istituzioni possano creare ambienti dove si sviluppino competenze genuine in un mondo dove l’intelligenza artificiale è ormai onnipresente: questo richiede un ripensamento profondo di cosa significhi integrità e di come questa possa essere promossa16. Il focus dovrebbe spostarsi dalla domanda «come possiamo impedire l’uso di AI?»alla domanda più produttiva «come possiamo creare esperienze che sviluppino competenze autentiche che preparino per un futuro dove l’AI sarà uno strumento standard?»: il cambiamento di prospettiva implica riconoscere che l’intelligenza artificiale generativa non è semplicemente una minaccia da contrastare, bensì una opportunità di adattare pratiche consolidate. Le competenze più preziose nel prossimo futuro potrebbero non essere quelle testabili attraverso elaborati tradizionali, ma piuttosto la capacità di utilizzare criticamente strumenti di intelligenza artificiale, di valutare la qualità dei contenuti da essi prodotti, di riflettere eticamente sulle implicazioni di queste tecnologie. Un clima di fiducia e comunicazione aperta risulta probabilmente più efficace nel promuovere comportamenti 16Le raccomandazioni dell’European Network for Academic Integrity (2023) forniscono un quadro normativo europeo che enfatizza tre principi cardine per l’uso etico dell’intelligenza artificiale nell’educazione: trasparenza nei meccanismi decisionali degli algoritmi, supervisione umana qualificata in tutti i procedimenti con conseguenze significative per gli individui, e protezione rafforzata per popolazioni vulnerabili, allineandosi così alle indicazioni più avanzate della ricerca internazionale sulla giustizia algoritmica. 20
GianMarco Schiesaro Algoritmi imperfetti Dicembre 2025 integri rispetto a sistemi di sorveglianza pervasivi che generano sospetto. Guardando al futuro, appare verosimile che la distinzione netta tra contenuti prodotti da esseri umani e contenuti generati da intelligenza artificiale diventerà progressivamente più sfumata: man mano che sistemi generativi vengono incorporati negli strumenti quotidiani, la questione potrebbe non essere più se qualcuno abbia utilizzato l’intelligenza artificiale, ma piuttosto come l’abbia utilizzata e con quale livello di coinvolgimento critico. In questo scenario, l’enfasi dovrebbe spostarsi dalla rilevazione verso l’educazione all’utilizzo responsabile di questi strumenti, preparando persone tecnicamente competenti ma anche eticamente consapevoli delle implicazioni delle proprie scelte. La sfida rappresenta un’opportunità per ripensare in modo fondamentale gli scopi e i metodi della formazione e della valutazione: piuttosto che preservare pratiche consolidate attraverso sistemi di sorveglianza invasivi, le istituzioni potrebbero cogliere l’occasione di innovare autenticamente, sperimentando forme di valutazione intrinsecamente più significative. Il futuro non sarà in una continua corsa al perfezionamento di tecnologie complesse di rilevamento, bensì nella capacità di re-immaginare educazione e formazione in un mondo dove l’intelligenza artificiale è parte integrante del nostro ambiente di lavoro e di apprendimento. La bibliografia completa del presente studio comprende sia la letteratura scientifica peer-reviewed di riferimento (2023-2025) utilizzata per l’analisi tecnica e sociologica, sia la grey literature (report istituzionali, white paper aziendali e linee guida universitarie) necessaria per documentare lo stato dell’arte delle policy accademiche in rapida evoluzione. Riferimenti bibliografici [1] Anthology. (2023). AI, Academic Integrity, and Authentic Assessment: An Ethical Path Forward for Education. White Paper. https://www.anthology.com/paper/ai-academicintegrity-and-authenticassessment-an-ethicalpath-forward-for-education [2] Banisoft. (2025). Are they as reliable as claimed in detecting AI? https://www.banisoft.com/the-accuracy-of-aidetectors-are-they-asreliable-as-claimed-indetecting-ai/ [3] Blommerde, T., Bright, W., Musgrave, E., Mitchell, R., & Heselton, R. (2024). AI detectors in universities: Time to turn them off and embrace AI for enhanced learning. Educational Developments, 25(4), 8-11. https://researchportal.northumbria.ac.uk/ws/ portalfiles/portal/ 180155670/Ed-Devs-25.4 [4] Coherent Market Insights. (2025). AI watermarking market size and YoY growth rate, 2025-2032. https://www.coherentmarketinsights.com/ industry-reports/ ai-watermarking-market [5] Colwell, B. D. (2025, 6 giugno). Remarkable breakthroughs in AI watermarking: 2025. Brian D. Colwell. https://briandcolwell.com/remarkablebreakthroughs-in-aiwatermarking-2025/ [6] Copyleaks. (2025). Copyleaks: AI-Based Plagiarism & AI Content Detection. https://copyleaks.com/ [7] Davalos, J. (2024, 18 ottobre). AI Detectors Falsely Accuse Students of Cheating—With Big Consequences. Bloomberg Businessweek. https://www.bloomberg.com/news/features/ 2024-10-18/ do-ai-detectors-work-students-facefalsecheating-accusations [8] Eaton, S. E. (2023). Post-plagiarism: Transdisciplinary ethics and integrity in the age of artificial intelligence and neurotechnology. International Journal for Educational Integrity, 19(1), 1-15. https://doi.org/10.1007/s40979-023-00133-4 [9] Elkhatat, A. M., Elsaid, K., & Almeer, S. (2023). Evaluating the Efficacy of AI Content Detection Tools in Differentiating between Human and AI-Generated Text. International Journal for Educational Integrity, 19(1), 17. https://doi.org/10.1007/s40979-023-00140-5 [10] Emi, B. (2025). Why Perplexity and Burstiness Fail to Detect AI. Pangram Labs. https://www.pangram.com/blog/why-perplexityand-burstiness-failto-detect-ai [11] Encyclopedia MDPI (2025), AI Technologies for Identifying Plagiarism: A Comprehensive Review. https://encyclopedia.pub/entry/58354 [12] Erol, G., Ergen, A., Erol, B. G., Ergen, . K., Bora, T. S., Çölgeçen, A. D., Araz, B., ahin, C., Bostanc, G., Klç, ., Macit, Z. B., Sevgi, U. T., & Güngör, A. (2025). Can we trust academic AI detective? Accuracy and limitations of AI-output detectors. Acta Neurochirurgica, 167(1), Article 214. https://doi.org/10.1007/s00701-025-06622-4 21
GianMarco Schiesaro Algoritmi imperfetti Dicembre 2025 [13] European Network for Academic Integrity [ENAI] (2023). Recommendations on the ethical use of artificial intelligence in education. https://link.springer.com/article/10.1007/ s40979-023-00133-4 [14] Fowler, G. A. (2023). We tested a new AI detector for teachers. It flagged an innocent student. The Washington Post. https://www.washingtonpost.com/technology/ 2023/04/01/ chatgpt-cheating-detectionturnitin/ [15] Georgetown University Library (2024). Ethics & AI – Artificial Intelligence (Generative) Resources. Georgetown University. https://guides.library.georgetown.edu/ai/ethics [16] Global Market Insights. (2025). AI Watermarking Market Size, Share & Analysis Report, 2034. Selbyville, DE: Global Market Insights. https://www.gminsights.com/industry-analysis/ ai-watermarking-market [17] GPTZero. (2023). What is perplexity & burstiness for AI detection? GPTZero Blog. https://gptzero.me/news/perplexity-andburstiness-what-is-it/ [18] Halbert, J. D., DiMatteo-Gibson, D., Cabrera, M., Mazurowski, T., & Ingram, M. (2025). Artificial Intelligence and Plagiarism. Online Journal of Distance Learning Administration, 28(1). https://ojdla.com/articles/artificial-intelligenceand-plagiarism [19] HumanizeAI. (2025). Perplexity and Burstiness: Not Just Simple Metrics Anymore. HumanizeAI Blog. https://humanizeai.now/blog/perplexityburstiness-2025 [20] Hyatt, J. K., Bienenstock, E. J., Firetto, C. M., Woods, E. R., & Comus, R. C. (2025). Using aggregated AI detector outcomes to eliminate false positives in STEM-student writing. Advances in Physiology Education, 49(2), 486-495. https://doi.org/10.1152/advan.00235.2024 [21] Kirchenbauer, J., Geiping, J., Wen, Y., Katz, J., Miers, I., & Goldstein, T. (2023). A Watermark for Large Language Models. In A. Krause, E. Brunskill, & A. Karbbar (Eds.), Proceedings of the 40th International Conference on Machine Learning (pp. 17554-17566). PMLR 202. https://proceedings.mlr.press/v202/ kirchenbauer23a.html [22] Liang, W., Yuksekgonul, M., Mao, Y., Wu, E., & Zou, J. (2023). GPT detectors are biased against non-native English writers. Patterns, 4(7), 100779. https://doi.org/10.1016/j.patter.2023.100779 [23] Markley, T. (2025). A Critical Examination of AI Detectors in Academic Integrity Enforcement. K Altman Law. https://www.kaltmanlaw.com/post/ai-detectorsacademic-integritybias [24] NIU CITL. (2024). AI detectors: An ethical minefield. Northern Illinois University, Center for Innovative Teaching and Learning. https://citl.news.niu.edu/2024/12/12/aidetectors-an-ethicalminefield/ [25] Nobel, I., & Lindberg, K. (2025). AI or Human? Detecting machine-generated text through perplexity [Bachelor’s thesis, KTH Royal Institute of Technology]. DiVA portal. https://kth.diva-portal.org/smash/record.jsf? pid=diva2%3A 1982607 [26] Originality.ai. (2024). How does plagiarism detection work? https://originality.ai/blog/how-does-plagiarismdetection-work [27] Sadasivan, V. S., Kumar, A., Balasubramanian, S., Wang, W., & Feizi, S. (2023). Can AI-generated text be reliably detected? arXiv preprint arXiv:2303.11156. https://arxiv.org/abs/2303.11156 [28] Sajid, M., Sanaullah, M., Fuzail, M., Malik, T. S., & Shuhidan, S. M. (2025). Comparative analysis of text-based plagiarism detection techniques. PLoS ONE, 20(4), e0319551. https://doi.org/10.1371/journal.pone.0319551 [29] StealthGPT. (2024). How do perplexity and burstiness make AI text undetectable? StealthGPT Blog. https://www.stealthgpt.ai/blog/how-doperplexity-and-burstinessmake-ai-textundetectable [30] Susnjak, T. (2023). ChatGPT: The End of Online Exam Integrity? Electronics, 12(10), 2356. https://doi.org/10.3390/electronics12102356 [31] University of Chicago Academic Technology Solutions. (2025). AI and plagiarism detection software: A comparative guide. https://academictech.uchicago.edu/detectionsoftware/ [32] University of San Diego Law Library. (2024). The problems with AI detectors: False positives and false negatives. https://lawlibguides.sandiego.edu/c.php?g= 1443311&p=10721367 22