di Mario Moscardin e Gianluca Colaianni
Premessa: introduzione all’Intelligenza Artificiale Generativa
La cronaca recente è stata impegnata nel trattare il provvedimento del blocco, da parte del Garante della Privacy, tramite provvedimento numero 9870832 del 30/03/2023, dell’utilizzo in Italia di ChatGPT, tra i più famosi e potenti prodotti di Intelligenza Artificiale Generativa, nei confronti di OpenAI, l’organizzazione senza fini di lucro di ricerca sull’intelligenza artificiale, fondata nel 2015, che ha sviluppato e gestisce la citata piattaforma. Nel provvedimento, il Garante della Privacy rileva la mancanza di una informativa agli utenti e a tutti gli interessati i cui dati vengono raccolti da OpenAI, ma soprattutto l’assenza di una base giuridica che giustifichi la raccolta e la conservazione massiccia di dati personali, allo scopo di “addestrare” (termine utilizzato per riferirsi al processo di elaborazione dei modelli di intelligenza artificiale) gli algoritmi sottesi al funzionamento della piattaforma1.
L’Intelligenza Artificiale Generativa (GAI) è un sottocampo dell’Intelligenza Artificiale (AI) che si concentra sulla creazione di nuovi dati che assomiglino agli stessi su cui il modello è stato addestrato. Tale procedura viene realizzata utilizzando modelli generativi ovvero reti neurali capaci di imparare a generare nuovi dati basandosi sui modelli che sono stati identificati precedentemente negli stessi dati di addestramento. I modelli generativi possono essere utilizzati per una varietà di compiti, come la generazione di immagini, testo e persino musica.
Tali reti neurali necessitano, preventivamente, di una immensa quantità di dati di input (intendendo per questi l’insieme delle informazioni inizialmente fornite al modello) e, successivamente, innescare la generazione di una risposta o di una produzione linguistica: in altri termini produrre contenuti. L’obiettivo principale della GAI è quello di creare modelli di intelligenza artificiale in grado di imparare e replicare il modo in cui il cervello umano elabora le informazioni, producendo così output che siano in grado di adattarsi a nuove situazioni nonché di generare soluzioni creative.
Tra i modelli generativi più importanti troviamo il Generative Adversarial Network (GAN), proposto per la prima volta dal noto studioso e ricercatore informatico Ian Goodfellow nel 20142 durante il suo dottorato presso l’Università di Montréal. Un qualsiasi GAN è composto da due reti neurali in competizione:
- un generatore: responsabile di creare dati sintetici che si avvicinino in maniera strabiliante alla realtà;
- un discriminatore: capace di determinare se i dati generati siano reali ovvero falsi.
Le due reti vengono addestrate insieme in un processo noto come addestramento avversario, in cui il generatore cerca di generare dati che inganneranno il discriminatore facendogli credere che siano reali, mentre il discriminatore cerca di identificare correttamente quali dati risultano reali e quali, invece, appaiono falsi.
Tra i più recenti sviluppi dell’AI generativa troviamo, come accennato, ChatGPT, una grande macchina del linguaggio addestrata da OpenAI. ChatGPT è un programma basato sulla famiglia di modelli di generazione del linguaggio GPT (Generative Pre-trained Transformer), che utilizza una combinazione di tecniche di apprendimento automatico per generare testo. ChatGPT è in grado di rispondere a domande, generare testo e persino dialogare con gli utenti in modo naturale. La rete neurale di ChatGPT è infatti in grado di generare testo in risposta a una determinata domanda o input. Il funzionamento di ChatGPT è abbastanza semplice: l’utente fornisce una frase di input e la rete neurale ne elabora la richiesta, generando una risposta in grado di imitare la scrittura umana.
Addestramento di una GAI
L’addestramento delle reti neurali è chiamato training. Sistemi complessi come le GAI richiedono grandi quantità di dati di training al fine di migliorare le prestazioni del sistema. Durante questa fase di training, la rete neurale cerca di apprendere i modelli dei dati, in modo da poter generare nuovi dati che risultino simili a quelli esistenti. Una volta che la rete neurale ha appreso i modelli, può essere utilizzata per generare nuovi ed ulteriori dati.
ChatGPT, ad esempio, ha richiesto l’utilizzo di un dataset consistente in miliardi di parole al fine del training della rete neurale. Tale dataset di training è noto come “WebText” ed è stato creato da OpenAI utilizzando dati provenienti da pagine web disponibili pubblicamente. In particolare, il dataset di training di ChatGPT è costituito da circa 40 gigabyte di testo, corrispondenti a circa 8 milioni di documenti e a oltre 40 miliardi di token, ovvero parole e simboli.
Il dataset è stato selezionato in modo da includere una vasta gamma di argomenti, in modo da garantire (al momento) una copertura completa della lingua inglese. WebText è stato creato utilizzando un web crawler, cioè un software che raccoglie dati da siti web e li (ri)organizza in modo strutturato ossia secondo uno schema ovvero secondo una specifica struttura predefinita, in un formato coerente e prevedibile, tale da poter essere facilmente interpretato e analizzato. Il web crawler utilizzato per creare WebText ha estratto unicamente i testi che soddisfano determinati criteri di qualità e contenuto. In particolare, il crawler ha escluso le pagine web che contengono, in via principale od esclusiva, immagini, video o audio, o che presentano contenuti di testo illegali o inappropriati.
È fondamentale considerare che le dimensioni dei dati appena descritte hanno permesso lo sviluppo di GPT-3, che possiamo già considerare una tecnologia obsoleta. OpenAI ha infatti lanciato GPT-4, una nuova generazione del modello GPT, per il quale l’azienda ha ulteriormente aumentato il dataset di training, aggiungendo ulteriori documenti pubblici e non pubblici. Soprattutto, GPT-4 ha beneficiato del feedback degli utenti che nei mesi hanno utilizzato ChatGPT. Tutte le conversazioni (chat) elaborate su ChatGPT sono state utilizzate come fonte per il nuovo dataset di training che ha permesso di migliorare ulteriormente il modello generativo fino a raggiungere GPT-43.
È evidente, dunque, come il dato, qualunque forma esso abbia, sia oggi un asset di assoluto valore che deve essere tutelato. La dimensione del dataset di training ha un impatto diretto sulla capacità di generare testo di alta qualità. In altre parole, maggiore è il dataset di training, migliore sarà la qualità del testo generato dalla GAI.
GAI e Copyright
Fatti brevi cenni sulla quantità di dati e parametri che i sistemi ricompresi nella presente trattazione sono in grado di processare, è fondamentale interrogarsi circa la questione relativa al diritto d’autore del materiale utilizzato dai sistemi GAI per l’addestramento delle proprie reti neurali.
Infatti, l’utilizzo di ChatGPT e di altre AI generative solleva importanti questioni etiche e legali riguardo alla proprietà intellettuale e alla privacy dei dati. È evidente come il dibattito possa focalizzarsi su almeno due livelli:
- un primo, legato all’utilizzo di dati coperti da “diritto d’autore” nella cd. “fase di addestramento” dei sistemi di Intelligenza Artificiale Generativa;
- un secondo, immediatamente successivo, connesso alla questione giuridica in base alla quale le eventuali elaborazioni prodotte dalle GAI, sotto forma di testo, immagini, suoni e video, siano da considerarsi protette, a loro volta, da diritto d’autore o meno.
Secondo il codice civile italiano, l’autore di un’opera ha il diritto esclusivo di sfruttarla economicamente, cioè il diritto di sfruttare l’opera in qualsiasi modo egli ritenga opportuno. Tuttavia, quando si tratta di opere create da Intelligenza Artificiale Generativa, la questione della proprietà intellettuale può diventare complessa. Infatti, si pongono importanti quesiti al riguardo: chi è l’autore dell’opera? È l’AI generativa stessa o la persona che ha creato il modello di generazione del linguaggio utilizzato dall’AI? Può essere considerato autore l’utente che, attraverso l’utilizzo dei modelli di generazione, ha prodotto un artefatto? La risposta a queste domande è ancora incerta e potrebbe richiedere un adeguamento da parte del Legislatore.
Al momento si possono però formulare alcune importanti osservazioni, basate su alcuni dati di fatto. Il 3 novembre 2018 Stephen Thaler, noto sostenitore della paternità algoritmica della proprietà intellettuale, ha presentato domanda al Copyright Office (Ufficio Copyright degli Stati Uniti – USCO) per registrare l’opera figurativa intitolata “Creativity Machine’s A Recent Entrance to Paradise” attribuendone l’origine all’algoritmo dal nome “Creativity Machine” e la titolarità al medesimo in quanto proprietario, invocando la work-for-hire doctrine4. Tale principio sancisce che, in linea generale, i diritti di proprietà intellettuale riconducibili ad un’opera realizzata da un dipendente o da un soggetto impiegato nell’ambito di un contratto di lavoro appartengano al datore di lavoro. La work-for-hire doctrine trova applicazione in diverse forme di proprietà intellettuale, quali i diritti d’autore, i brevetti e i marchi registrati. In conformità al Copyright Act del 1976 degli Stati Uniti, le opere create nell’ambito di un rapporto di lavoro sono considerate work-for-hire, salvo che non sia stato stipulato un accordo scritto che conferisca i diritti all’autore. Di conseguenza, il datore di lavoro viene riconosciuto quale legittimo autore e titolare dei diritti di proprietà intellettuale inerenti all’opera.
La USCO ha così dovuto affrontare per la prima volta nella storia dell’uomo la questione del diritto d’autore per un’opera generata da un’intelligenza artificiale. Il board della USCO ha determinato, in data 12 agosto 2019, l’inammissibilità di tale opera al diritto d’autore essendo l’opera stessa priva di elementi di paternità umana e giudicando tale requisito uno standard necessario. La decisione del board della USCO è stata motivata definendo “il legame tra la mente umana e l’espressione creativa” un elemento vitale del copyright. È stato altresì evidenziato come la legislazione statunitense non preveda regole per autori non umani tanto che la Corte d’Appello statunitense si è espressa in tal senso ritenendo che l’espressione non umana non sia ammissibile per la protezione del diritto d’autore. Tale linea è stata nuovamente ribadita in una sentenza di rigetto, più recente, datata 14 febbraio 2022.
Anche all’interno dell’Unione Europea il dibattito sulla questione della tutela del diritto d’autore per le opere generate dall’Intelligenza Artificiale è attivo. L’Artificial Intelligence Act (AI Act) è una legge europea proposta per la regolamentazione sullo sviluppo e l’utilizzo dell’Intelligenza Artificiale5. È stato presentato alla Commissione Europea per la prima volta il 21 aprile 2021 ed ha visto fortemente coinvolta l’italiana Lucilla Sioli, Direttrice per l’Intelligenza Artificiale e l’Industria Digitale presso la Commissione Europea.
Il quadro normativo europeo sull’intelligenza artificiale può essere richiamato e contenuto nei seguenti macro-obiettivi:
- assicurare che i sistemi di AI immessi sul mercato dell’Unione e utilizzati siano sicuri e rispettino la normativa vigente in materia di diritti fondamentali ed i valori dell’Unione;
- assicurare la certezza del diritto per facilitare gli investimenti e l’innovazione nell’intelligenza artificiale;
- migliorare la governance e l’applicazione effettiva della normativa esistente in materia di diritti fondamentali e requisiti di sicurezza applicabili ai sistemi di AI;
- facilitare lo sviluppo di un mercato unico per applicazioni di AI lecite, sicure e affidabili nonché prevenire la frammentazione del mercato.
Il 14 giugno 2023 il Parlamento europeo ha approvato la sua posizione negoziale sull’AI Act. Tale approvazione permette di avviare i negoziati, ovvero i “triloghi”, al fine di approvare definitivamente la nuova normativa. L’aspettativa della comunità riguarda un regolamento europeo conclusivo entro la fine dell’anno, e comunque prima delle elezioni europee. La versione approvata contiene ora una sezione dedicata alla gestione del copyright. I legislatori hanno inserito l’obbligo a rivelare le opere utilizzate per il training delle Intelligenze Artificiali, ponendo le basi per il riconoscimento del copyright nei confronti dei detentori dei diritti di tali opere.
L’evoluzione delle normative, ad ogni livello, è seguita con grande attenzione dalle varie associazioni che normalmente sono coinvolte nella tutela del copyright e della proprietà intellettuale. Enzo Mazza, CEO della Federazione industria Musicale Italiana (F.I.M.I.), ha recentemente espresso la propria posizione sul tema fornendo delle importanti indicazioni su come tali diritti debbano essere garantiti e tutelati.
Il parere di Mazza è che l’intelligenza artificiale debba essere soggetta a licenze di libero mercato per l’utilizzo di opere nello sviluppo e nella formazione dei modelli di intelligenza artificiale. I creatori e i titolari dei diritti devono mantenere il controllo esclusivo sulla determinazione della modalità di utilizzo del loro contenuto. Gli sviluppatori di intelligenza artificiale devono garantire che qualsiasi contenuto utilizzato a scopo di formazione sia approvato e concesso in licenza dal titolare dei diritti, inclusi i contenuti utilizzati in precedenza da eventuali AI pre-addestrate. Inoltre, le voci e le sembianze di artisti e atleti devono essere utilizzate solo con il loro libero consenso e con un compenso di mercato per usi specifici. Infine, Mazza ritiene essenziale tenere traccia completa di opere, spettacoli e immagini protette da copyright, incluso il modo in cui essi sono stati utilizzati per sviluppare e addestrare qualsiasi sistema di intelligenza artificiale6.
GAI e privacy
Come accennato in premessa, il Garante della Privacy, con proprio provvedimento, aveva recentemente disposto il blocco in Italia di ChatGPT per problematiche legate alla gestione dei dati ivi utilizzati. In particolare, secondo il Garante, risultava assente l’informativa e la connessa base giuridica che avrebbe permesso una raccolta e conservazione dei dati da parte degli utilizzatori del sistema. Con il provvedimento in esame erano state avanzate una serie di richieste di adeguamento in relazione alle quali, con comunicato del 28 aprile 2023, lo stesso Garante comunicava il parziale riscontro positivo da parte di ChatGPT. Infatti lo stesso Garante, con il comunicato appena richiamato specificava che “OpenAI, la società statunitense che gestisce ChatGPT, ha fatto pervenire al Garante per la protezione dei dati personali una nota nella quale illustra le misure introdotte in ottemperanza alle richieste dell’Autorità contenute nel provvedimento dello scorso 11 aprile, spiegando di aver messo a disposizione degli utenti e non utenti europei e, in alcuni casi, anche extra-europei, una serie di informazioni aggiuntive, di aver modificato e chiarito alcuni punti e riconosciuto a utenti e non utenti soluzioni accessibili per l’esercizio dei loro diritti.” E ancora, che “alla luce di questi miglioramenti OpenAI ha reso nuovamente accessibile ChatGPT agli utenti italiani”.7
È stata quindi fornita, come richiesto dall’Autorità indipendente, un’informativa trasparente e rispettosa dei diritti degli utenti in tema di raccolta dei dati nonché una base giuridica con un consenso o un legittimo interesse come presupposto per l’utilizzo dei dati8. Tra gli obiettivi raggiunti con il provvedimento appare opportuno elencare i seguenti, così come riportati nel comunicato dello scorso aprile:
- predisposizione e pubblicazione sul sito di ChatGPT di un’informativa rivolta a tutti gli utenti e non utenti, in Europa e nel resto del mondo, per illustrare quali dati personali e con quali modalità sono trattati per l’addestramento degli algoritmi e per ricordare che chiunque ha diritto di opporsi a tale trattamento;
- ampliamento dell’informativa sul trattamento dei dati riservata agli utenti del servizio rendendola ora accessibile anche nella maschera di registrazione prima che un utente si registri al servizio;
- riconoscimento a tutte le persone che vivono in Europa, anche non utenti, del diritto di opporsi a che i loro dati personali siano trattati per l’addestramento degli algoritmi anche attraverso un apposito modulo compilabile online e facilmente accessibile;
- introduzione di una schermata di benvenuto alla riattivazione di ChatGPT in Italia, con i rimandi alla nuova informativa sulla privacy e alle modalità di trattamento dei dati personali per il training degli algoritmi;
- espressa previsione per gli interessati della possibilità di far cancellare le informazioni ritenute errate dichiarandosi, allo stato, tecnicamente impossibilitata a correggere gli errori;
- chiarimento, nell’informativa riservata agli utenti, che mentre si continuerà a trattare taluni dati personali per garantire il corretto funzionamento del servizio sulla base del contratto, verranno trattati i loro dati personali ai fini dell’addestramento degli algoritmi, salvo che esercitino il diritto di opposizione, sulla base del legittimo interesse;
- implementazione per gli utenti già nei giorni scorsi di un modulo che consente a tutti gli utenti europei di esercitare il diritto di opposizione al trattamento dei propri dati personali e poter così escludere le conversazioni e la relativa cronologia dal training dei propri algoritmi;
- inserimento nella schermata di benvenuto riservata agli utenti italiani già registrati al servizio un pulsante attraverso il quale, per riaccedere al servizio, dovranno dichiarare di essere maggiorenni o ultratredicenni e, in questo caso, di avere il consenso dei genitori;
- inserimento nella maschera di registrazione al servizio della richiesta della data di nascita prevedendo un blocco alla registrazione per gli utenti infratredicenni con previsione, nell’ipotesi di utenti con ultratredicenni (ma minorenni) della conferma di avere il consenso dei genitori all’uso del servizio.
Dunque, il Garante ha espresso soddisfazione per i citati adeguamenti seppur indicando ulteriori margini di miglioramento in relazione all’implementazione di un sistema di verifica dell’età e alla pianificazione e realizzazione di una campagna di comunicazione finalizzata a informare tutti gli italiani di quanto accaduto e della possibilità di opporsi all’utilizzo dei propri dati personali ai fini dell’addestramento degli algoritmi processati dal sistema.
In conclusione, alla luce di quanto sin qui descritto, è possibile affermare che l’intelligenza artificiale generativa sta diventando sempre più presente nella nostra vita quotidiana, con sviluppi, come ChatGPT, che stanno cambiando il modo in cui interagiamo con la tecnologia. Tuttavia, è importante considerare le implicazioni etiche e legali dell’utilizzo dell’AI generativa e garantire che vengano prese le misure necessarie per proteggere i diritti dei consumatori e la proprietà intellettuale dei contenuti. Questa risulterà una nuova sfida per il futuro e un tema su cui ci si continuerà a confrontare, soprattutto in tema di diritti, nei vari ordinamenti statali e sovranazionali.
- https://www.garanteprivacy.it/web/guest/home/docweb/-/docweb-display/docweb/9870832 ↩︎
- https://dl.acm.org/doi/abs/10.1145/3422622 ↩︎
- https://openai.com/research/gpt-4 ↩︎
- https://www.copyright.gov/rulings-filings/review-board/docs/a-recent-entrance-to-paradise.pdf ↩︎
- https://artificialintelligenceact.eu/ ↩︎
- https://www.agendadigitale.eu/mercati-digitali/copyright-e-intelligenza-artificiale-nei-lavori-delleu-e-del-g7-i-prossimi-passi/ ↩︎
- https://www.garanteprivacy.it/home/docweb/-/docweb-display/docweb/9881490 ↩︎
- https://www.dirittoegiustizia.it/#/documentDetail/10400364 ↩︎


