University of Oxford har latt OpenAI, selskapet bak ChatGPT, trene AI-modellene sine på historiske tekster digitalisert fra Bodleian-biblioteket, meldte The Guardian 26. september 2026. Interne dokumenter avisen har sett, sier at det skannede materialet fra Bodleian ble brukt til å «fylle OpenAIs treningsdata».
Først det som betyr noe for ditt eget personvern: Denne saken handler om gamle bøker og avhandlinger uten opphavsrett, ikke om noens personopplysninger. Ingen meldinger, bilder eller filer var involvert. Den er likevel verdt å lese nøye, fordi den viser hvor AI-bransjen står akkurat nå: Den mangler ferskt, menneskeskrevet materiale og leter etter det overalt.
Hva som skjedde
Oxford kunngjorde et partnerskap med OpenAI i mars 2025. Det uttalte målet var å bruke OpenAIs programvare til å digitalisere tekster fra Bodleian, et av verdens mest berømte biblioteker, slik at studenter og forskere lettere kunne få tilgang til dem. Ifølge The Guardian sa ikke den kunngjøringen at materialet også skulle brukes til å trene OpenAIs modeller.
Oxford avviser at noe ble holdt skjult. En talsperson for universitetet sa til avisen at digitaliseringen var universitetets hovedinteresse, og at ansatte hadde vært åpne om at prosjektet også ville bidra med treningsdata.
The Guardian lister opp hva som er skannet eller diskutert så langt:
- Innen juni 2025 var 125 000 bilder skannet fra historiske avhandlinger delt med OpenAI, blant dem doktoravhandlinger fra europeiske og amerikanske universiteter skrevet på 1800- og 1900-tallet.
- En sjelden samling på 10 000 «broadside ballads» fra 1500-tallet: sangtekster og noter som en gang ble spredt på gatehjørner i Tudor-tiden.
- Ansatte har også diskutert å digitalisere irske statspapirer fra 1700-tallet, de private brevene til den irske romanforfatteren Maria Edgeworth og Dorothy Hodgkins notatbøker om penicillin.
- Kontrakten åpner for massedigitalisering av hele Bodleians samling på 23 millioner objekter, og møtereferater diskuterte en chatbot kalt «Ask the Bod».
Møtereferater som er hentet ut gjennom innsynsbegjæringer, dokumenterer bekymringer fra ansatte ved universitetet, blant dem medlemmer av Bodleians styringskomité, om omdømmerisikoen ved å samarbeide med OpenAI, og om hva en avtale bygget på en energikrevende teknologi betyr for universitetets miljøforpliktelser.
Hva Oxford og OpenAI sier
Materialet som er digitalisert gjennom prosjektet med OpenAI, er beskjedent i omfang og uten opphavsrett, og OpenAIs bruk av materialet er ikke eksklusiv.
Talsperson for University of Oxford, via The Guardian
Universitetet sier at Bodleian beholder rettighetene til skanningene og vil begynne å publisere dem åpent på nettet i løpet av måneder, slik det gjør med andre digitaliseringspartnerskap. I motsetning til enkelte bokskanningsprosjekter andre steder forblir selve samlingene intakte.
En talsperson for OpenAI sa til avisen at selskapet var «stolt» over å sørge for at «dagens AI-modeller bevarer verdens historiske kunnskap for fremtiden». Oxford er det eneste britiske medlemmet av OpenAIs NextGenAI-prosjekt, som også omfatter Boston Public Library, Caltech, MIT og University of Michigan.
Den større historien: AI går tom for ny menneskeskrevet tekst
The Guardian setter avtalen i sammenheng. Tekst som er hentet fra det åpne nettet, er i økende grad mettet med AI-generert materiale, noe som gjør den mindre nyttig for å trene nye modeller, så utviklerne har vendt seg til fysiske, ofte historiske, boksamlinger som aldri har vært på nett.
- Antikvariater melder om en bølge av bestillinger på obskure titler, som en guide til landbruksredskaper i Afrika på 1700-tallet eller biografier om bilførere fra 1950-tallet. Butikkeierne mistenker at de kjøpes nettopp fordi de ikke finnes digitalisert på nettet.
- Anthropic, OpenAIs nære konkurrent, har brukt titalls millioner dollar på å kjøpe bøker, skjære av ryggene slik at sidene kan skannes, og deretter makulere dem. Anthropic sier at selskapet ikke kjøper og ødelegger sjeldne eller antikvariske bøker.
- Teknologinettstedet 404 Media la en sporingsenhet i en bestilling av en brukt bok og sporet den til et Amazon-anlegg i USA, der bøker også ble demontert og skannet.
Bøker uten opphavsrett er en rimelig og nyttig kilde å lære av. Poenget her er appetitten: Når et laboratorium kjøper en glemt biografi bare for å skanne den, er det rimelig å spørre hva annet den samme bransjen regner som «ferske data».
Hvor dine egne data passer inn
Noe av den ferskeste menneskeskrevne teksten finnes ikke i et bibliotek i det hele tatt. Det er det folk skriver, limer inn og laster opp i AI-assistenter hver dag. Ifølge The Guardians dekning må forbrukerkontoer i ChatGPT reservere seg hvis de ikke vil at dataene deres skal brukes til trening (bedriftsdata kan ikke brukes). Uansett hvilken assistent du bruker, se etter den innstillingen i data- eller personvernkontrollene i dag. Som tommelfingerregel: Ikke last opp bilder av andre mennesker, kontrakter, journaler eller klientfiler til noen AI i skyen hvis du ikke ville vært komfortabel med å se dem i treningsdata.
Dette er ikke en hypotetisk risiko. Samme uke sa OpenAI at selskapets egne AI-agenter hadde lekket 53 bilder som tilhørte ChatGPT-brukere, bilder agentene kunne nå fordi forbrukerdata brukes i deler av treningsprosessen. Vi omtalte det i OpenAIs agenter lekket bilder fra 53 ChatGPT-brukere.
Den andre halvdelen av bildet er stillere: appene på Mac-en din som sender data du aldri har skrevet i det hele tatt, som analysedata, krasjrapporter, bruksmålinger og reklameidentifikatorer. Den strømmen mater økonomien rundt datameglere som vi beskriver i artikkelen vår om datameglere og Mac-en din.
Hva FireAI gjør med den delen du styrer
FireAI har ingenting med avtalen mellom Oxford og OpenAI å gjøre, og ingen brannmur kan hente tilbake noe som allerede er lastet opp. Det FireAI endrer, er hva som skjer på din egen Mac fra nå av:
- FireAIs egen AI kjører helt og holdent på Mac-en din. Tilkoblingene den forklarer og reglene den foreslår, analyseres lokalt, og sendes aldri til HisnLabs, til en AI i skyen eller inn i noens treningsdata.
- Verdenskartet viser hver tilkobling appene dine gjør og hvor den går, også ChatGPT-appen og andre AI-apper, slik at du kan se hvilke apper som i det hele tatt sender data.
- Regler per app lar deg blokkere en app, eller bare ett av domenene den snakker med, uten å ødelegge resten av Mac-en.
- Paranoid-modus blokkerer kjente mål for telemetri og analyse for alle apper du ikke uttrykkelig har tillatt, slik at bakgrunnsdata du aldri valgte å dele, blir på Mac-en din.
Bibliotekene kan bestemme hva de gjør med bøkene sine. Du bestemmer hva som forlater Mac-en din. Last ned FireAI og prøv den gratis i 17 dager, eller les dokumentasjonen først. FireAI er laget av HisnLabs.