L’Università di Oxford ha permesso a OpenAI, l’azienda dietro ChatGPT, di addestrare i suoi modelli di IA su testi storici digitalizzati dalla Bodleian Library, ha riferito The Guardian il 26 settembre 2026. Documenti interni visionati dal quotidiano affermano che il materiale scansionato della Bodleian è stato usato per “alimentare il set di addestramento di OpenAI”.
Prima di tutto, la parte che conta per la tua privacy: questa storia riguarda libri e tesi antichi, non più protetti dal diritto d’autore, non i dati personali di qualcuno. Non sono coinvolti messaggi, foto o file di nessuno. Vale comunque la pena leggerla con attenzione, perché mostra a che punto è oggi l’industria dell’IA: a corto di materiale fresco scritto da esseri umani, e alla ricerca di questo materiale ovunque.
Cosa è successo
Oxford ha annunciato una partnership con OpenAI a marzo 2025. L’obiettivo dichiarato era usare il software di OpenAI per digitalizzare testi della Bodleian, una delle biblioteche più famose al mondo, in modo che studenti e ricercatori potessero accedervi più facilmente. Secondo The Guardian, quell’annuncio non diceva che il materiale sarebbe stato usato anche per addestrare i modelli di OpenAI.
Oxford respinge l’idea che qualcosa sia stato nascosto. Un portavoce dell’università ha detto al quotidiano che la digitalizzazione era il suo interesse principale, e che il personale era stato trasparente sul fatto che il progetto avrebbe fornito anche dati di addestramento.
The Guardian elenca ciò che è stato scansionato o discusso finora:
- Entro giugno 2025, erano state condivise con OpenAI 125.000 immagini scansionate da dissertazioni storiche, tra cui tesi di dottorato di università europee e americane scritte nel XIX e XX secolo.
- Una rara raccolta di 10.000 “broadside ballads” del XVI secolo: testi di canzoni e note musicali che un tempo circolavano agli angoli delle strade dell’Inghilterra Tudor.
- Il personale ha discusso anche della digitalizzazione di documenti di Stato irlandesi del XVIII secolo, delle lettere private della scrittrice irlandese Maria Edgeworth e dei quaderni sulla penicillina di Dorothy Hodgkin.
- Il contratto apre la prospettiva di una digitalizzazione di massa dell’intera collezione della Bodleian, 23 milioni di pezzi, e i verbali delle riunioni parlavano di un chatbot “Ask the Bod”.
I verbali delle riunioni ottenuti con una richiesta di accesso agli atti riportano le preoccupazioni del personale universitario, compresi membri del comitato di governance della Bodleian, sul rischio reputazionale di una partnership con OpenAI e su cosa significhi un accordo basato su una tecnologia ad alto consumo energetico per gli impegni ambientali dell’università.
Cosa dicono Oxford e OpenAI
Il materiale digitalizzato attraverso il progetto con OpenAI è di portata modesta, non è più protetto dal diritto d’autore, e l’uso che OpenAI ne fa non è esclusivo.
Portavoce dell’Università di Oxford, tramite The Guardian
L’università afferma che la Bodleian mantiene i diritti sulle scansioni e inizierà a pubblicarle apertamente online entro pochi mesi, come fa con altre partnership di digitalizzazione. A differenza di alcuni progetti di scansione di libri altrove, le collezioni restano intatte.
Un portavoce di OpenAI ha detto al quotidiano che l’azienda era “orgogliosa” di garantire che “i modelli di IA di oggi preservino la conoscenza storica del mondo per il futuro”. Oxford è l’unico membro britannico del progetto NextGenAI di OpenAI, che comprende anche la Boston Public Library, Caltech, il MIT e l’Università del Michigan.
La storia più grande: l’IA sta esaurendo i testi umani freschi
The Guardian inserisce l’accordo nel suo contesto. Il testo raccolto dal web aperto è sempre più saturo di materiale generato dall’IA, il che lo rende meno utile per addestrare nuovi modelli, quindi gli sviluppatori si sono rivolti a collezioni di libri fisici, spesso storici, che non sono mai stati online.
- I librai dell’usato segnalano un’ondata di ordini per titoli oscuri, come una guida agli attrezzi agricoli nell’Africa del XVIII secolo o biografie di piloti automobilistici degli anni Cinquanta. I proprietari dei negozi sospettano che vengano acquistati proprio perché non esistono online in forma digitalizzata.
- Anthropic, diretta rivale di OpenAI, ha speso decine di milioni di dollari per comprare libri, tagliarne il dorso per scansionarne le pagine e poi mandarli al macero. Anthropic afferma di non acquistare né distruggere libri rari o antichi.
- Il sito di notizie tecnologiche 404 Media ha inserito un localizzatore in un ordine di libri usati e lo ha seguito fino a una struttura di Amazon negli Stati Uniti, dove anche lì i libri venivano smontati e scansionati.
I libri di pubblico dominio sono una fonte legittima e utile da cui imparare. Il punto qui è l’appetito: quando un laboratorio compra una biografia dimenticata solo per scansionarla, è lecito chiedersi cos’altro conti come “dati freschi” per la stessa industria.
Dove entrano in gioco i tuoi dati
Parte dei testi umani più freschi non si trova affatto in una biblioteca. È ciò che le persone scrivono, incollano e caricano ogni giorno negli assistenti IA. Secondo quanto riportato da The Guardian, gli account consumer di ChatGPT devono rinunciare esplicitamente (opt-out) se non vogliono che i loro dati siano usati per l’addestramento (i dati aziendali sono esclusi). Qualunque assistente tu usi, cerca oggi quell’impostazione nei suoi controlli sui dati o sulla privacy. Come regola generale, non caricare foto di altre persone, contratti, cartelle cliniche o fascicoli dei clienti su un’IA nel cloud se non ti andrebbe di vederli in un set di addestramento.
Non è un rischio ipotetico. La stessa settimana, OpenAI ha dichiarato che i suoi stessi agenti IA avevano diffuso 53 immagini appartenenti a utenti di ChatGPT, immagini che gli agenti potevano raggiungere perché i dati dei consumatori vengono usati per una parte del processo di addestramento. Ne abbiamo parlato in gli agenti di OpenAI hanno diffuso le immagini di 53 utenti di ChatGPT.
L’altra metà del quadro è più silenziosa: le app sul tuo Mac che inviano dati che non hai mai digitato, come analisi d’uso, rapporti sugli arresti anomali, segnali di utilizzo e identificatori pubblicitari. Quel flusso alimenta l’economia dei data broker descritta nel nostro articolo su i data broker e il tuo Mac.
Cosa fa FireAI per la parte che controlli tu
FireAI non ha nulla a che fare con l’accordo tra Oxford e OpenAI, e nessun firewall può riprendersi qualcosa che è già stato caricato. Ciò che FireAI cambia è ciò che succede sul tuo Mac da ora in poi:
- L’IA di FireAI funziona interamente sul tuo Mac. Le connessioni che spiega e le regole che suggerisce vengono analizzate in locale, mai inviate a HisnLabs, a un’IA nel cloud o nel set di addestramento di qualcuno.
- La mappa del mondo mostra ogni connessione delle tue app e dove va, compresa l’app ChatGPT o qualsiasi altra app di IA, così puoi vedere quali app inviano dati.
- Le regole per app ti permettono di bloccare un’app, o solo uno dei domini con cui parla, senza compromettere il resto del Mac.
- La modalità Paranoia blocca le destinazioni note di telemetria e analisi per ogni app che non hai consentito esplicitamente, così i dati in background che non hai mai scelto di condividere restano sul tuo Mac.
Le biblioteche possono decidere cosa fare dei loro libri. Tu puoi decidere cosa lascia il tuo Mac. Scarica FireAI e provalo gratis per 17 giorni, oppure leggi prima la documentazione. FireAI è realizzato da HisnLabs.