Säkerhet & AI-nyheter

Oxford, OpenAI och Bodleian-biblioteket · Av FireAI Security & Research Team · Publicerad

Oxford lät OpenAI träna på Bodleian-biblioteket. AI:s hunger efter färska data stannar inte vid gamla böcker

Inskanningar från Oxfords Bodleian-bibliotek hamnade i OpenAI:s träningsdata. Det gäller böcker fria från upphovsrätt, men visar hur ivrigt AI-labben jagar ny mänsklig text.

Illustration: a classical library building with binary digits floating around it, next to the words “AI is reading the Bodleian.”

University of Oxford har låtit OpenAI, företaget bakom ChatGPT, träna sina AI-modeller på historiska texter som digitaliserats från Bodleian-biblioteket, rapporterade The Guardian den 26 september 2026. Interna dokument som tidningen tagit del av säger att det inskannade materialet från Bodleian användes för att ”fylla på OpenAI:s träningsdata”.

Först det som spelar roll för din egen integritet: den här historien handlar om gamla böcker och avhandlingar som inte längre skyddas av upphovsrätt, inte om någons personuppgifter. Ingens meddelanden, foton eller filer var inblandade. Den är ändå värd att läsa noga, eftersom den visar var AI-branschen står just nu: med brist på färskt, människoskrivet material, och på jakt efter det överallt.

Vad som hände

Oxford meddelade ett samarbete med OpenAI i mars 2025. Det uttalade målet var att använda OpenAI:s programvara för att digitalisera texter från Bodleian, ett av världens mest kända bibliotek, så att studenter och forskare lättare kunde nå dem. Enligt The Guardian sa det beskedet inte att materialet också skulle användas för att träna OpenAI:s modeller.

Oxford avvisar tanken att något skulle ha döljts. En talesperson för universitetet sa till tidningen att digitaliseringen var dess främsta intresse, och att personalen hade varit öppen med att projektet också skulle bidra med träningsdata.

The Guardian listar vad som hittills har skannats eller diskuterats:

  • I juni 2025 hade 125 000 bilder inskannade från historiska avhandlingar delats med OpenAI, bland annat doktorsavhandlingar från europeiska och amerikanska universitet skrivna under 1800- och 1900-talen.
  • En sällsynt samling på 10 000 ”skillingtryck” från 1500-talet: sångtexter och noter som en gång spreds i gathörnen under Tudortiden.
  • Personalen har också diskuterat att digitalisera irländska statshandlingar från 1700-talet, den irländska romanförfattaren Maria Edgeworths privata brev och Dorothy Hodgkins anteckningsböcker om penicillin.
  • Avtalet öppnar för en massdigitalisering av Bodleians hela samling på 23 miljoner föremål, och mötesprotokoll diskuterade en chattbot kallad ”Ask the Bod”.

Mötesprotokoll som begärts ut med stöd av offentlighetslagstiftningen visar farhågor bland universitetets personal, bland annat ledamöter i Bodleians styrgrupp, om ryktesrisken i att samarbeta med OpenAI och om vad ett avtal byggt på en energikrävande teknik betyder för universitetets miljöåtaganden.

Vad Oxford och OpenAI säger

Materialet som digitaliserats genom projektet med OpenAI är begränsat i omfattning, fritt från upphovsrätt, och OpenAI:s användning av materialet är inte exklusiv.

Talesperson för University of Oxford, via The Guardian

Universitetet säger att Bodleian behåller rättigheterna till inskanningarna och inom några månader börjar publicera dem öppet på nätet, som det gör med andra digitaliseringssamarbeten. Till skillnad från vissa bokskanningsprojekt på andra håll förblir själva samlingarna intakta.

En talesperson för OpenAI sa till tidningen att företaget var ”stolt” över att se till att ”dagens AI-modeller bevarar världens historiska kunskap för framtiden”. Oxford är den enda brittiska medlemmen i OpenAI:s projekt NextGenAI, där även Boston Public Library, Caltech, MIT och University of Michigan ingår.

Den större historien: AI håller på att få slut på färsk mänsklig text

The Guardian sätter avtalet i sitt sammanhang. Text som skrapats från den öppna webben är i allt högre grad mättad med AI-genererat material, vilket gör den mindre användbar för att träna nya modeller, så utvecklare har vänt sig till fysiska, ofta historiska, boksamlingar som aldrig har funnits på nätet.

  • Antikvariat rapporterar en våg av beställningar på obskyra titlar, som en guide till jordbruksredskap i 1700-talets Afrika eller biografier över 1950-talets bilförare. Butiksägare misstänker att de köps just för att de inte finns digitaliserade på nätet.
  • Anthropic, OpenAI:s nära rival, har lagt tiotals miljoner dollar på att köpa böcker, skära bort ryggarna så att sidorna kan skannas och sedan mala ner dem. Anthropic säger att företaget inte köper och förstör sällsynta eller antikvariska böcker.
  • Tekniknyhetssajten 404 Media placerade en spårningsenhet i en beställning av begagnade böcker och spårade den till en Amazon-anläggning i USA, där böcker också plockades isär och skannades.

Böcker i allmän egendom är något rimligt och nyttigt att lära sig av. Poängen här är aptiten: när ett labb köper en bortglömd biografi bara för att skanna den är det rimligt att fråga vad mer som räknas som ”färska data” för samma bransch.

Var dina egna data kommer in

En del av den färskaste mänskliga texten finns inte alls på något bibliotek. Det är det som människor skriver, klistrar in och laddar upp i AI-assistenter varje dag. Enligt The Guardians rapportering måste ChatGPT-konsumentkonton aktivt avstå om de inte vill att deras data används för träning (företagsdata får inte användas). Vilken assistent du än använder, leta efter den inställningen i dess data- eller integritetsinställningar i dag. Som tumregel: ladda inte upp foton på andra människor, avtal, journaler eller kundfiler till någon AI i molnet som du inte skulle vara bekväm med att se i en träningsdatamängd.

Det här är ingen hypotetisk risk. Samma vecka sa OpenAI att dess egna AI-agenter hade läckt 53 bilder som tillhörde ChatGPT-användare, bilder som agenterna kunde nå eftersom konsumentdata används i en del av träningsprocessen. Vi skrev om det i OpenAI:s agenter läckte 53 ChatGPT-användares bilder.

Den andra halvan av bilden är tystare: apparna på din Mac som skickar data som du aldrig har skrivit in, som analysdata, kraschrapporter, användningssignaler och annonsidentifierare. Det flödet göder den datamäklarekonomi som beskrivs i vår artikel om datamäklare och din Mac.

Vad FireAI gör åt den del du styr över

FireAI har inget med avtalet mellan Oxford och OpenAI att göra, och ingen brandvägg kan ta tillbaka något som redan laddats upp. Det FireAI ändrar är vad som händer på din egen Mac från och med nu:

  • FireAIs egen AI körs helt på din Mac. Anslutningarna den förklarar och reglerna den föreslår analyseras lokalt, skickas aldrig till HisnLabs, till en AI i molnet eller in i någons träningsdata.
  • Världskartan visar varje anslutning dina appar gör och vart den går, inklusive ChatGPT-appen eller andra AI-appar, så att du kan se vilka appar som överhuvudtaget skickar data.
  • Regler per app låter dig blockera en app, eller bara en av domänerna den pratar med, utan att resten av din Mac slutar fungera.
  • Paranoia-läget blockerar kända mål för telemetri och analys för varje app du inte uttryckligen har tillåtit, så att bakgrundsdata du aldrig valt att dela stannar på din Mac.

Bibliotek får bestämma vad de gör med sina böcker. Du får bestämma vad som lämnar din Mac. Ladda ner FireAI och prova gratis i 17 dagar, eller läs dokumentationen först. FireAI är gjort av HisnLabs.

Källor