Neuigkeiten zu Sicherheit und KI

Oxford, OpenAI und die Bodleian Library · Von FireAI Security & Research Team · Veröffentlicht

Oxford ließ OpenAI mit der Bodleian Library trainieren. Der Hunger der KI nach frischen Daten macht bei alten Büchern nicht halt

Scans aus Oxfords Bodleian Library flossen in OpenAIs Trainingsdaten. Es geht um gemeinfreie Bücher, doch es zeigt, wie intensiv KI-Labore nach frischen, von Menschen geschriebenen Texten jagen.

Illustration: a classical library building with binary digits floating around it, next to the words “AI is reading the Bodleian.”

Die University of Oxford hat OpenAI, dem Unternehmen hinter ChatGPT, erlaubt, seine KI-Modelle mit historischen Texten zu trainieren, die aus der Bodleian Library digitalisiert wurden, berichtete The Guardian am 26. September 2026. Interne Dokumente, die der Zeitung vorliegen, besagen, dass das gescannte Bodleian-Material genutzt wurde, um „den Trainingsdatensatz von OpenAI zu füllen“.

Vorab der Teil, der für Ihre eigene Privatsphäre zählt: In dieser Geschichte geht es um alte, urheberrechtsfreie Bücher und Doktorarbeiten, nicht um persönliche Daten von irgendwem. Keine Nachrichten, Fotos oder Dateien von Menschen waren betroffen. Es lohnt sich trotzdem, genau hinzusehen, denn sie zeigt, wo die KI-Branche gerade steht: knapp an frischem, von Menschen geschriebenem Material und überall auf der Suche danach.

Was passiert ist

Oxford kündigte im März 2025 eine Partnerschaft mit OpenAI an. Das erklärte Ziel war, mit OpenAI-Software Texte aus der Bodleian, einer der berühmtesten Bibliotheken der Welt, zu digitalisieren, damit Studierende und Forschende leichter darauf zugreifen können. Laut The Guardian stand in dieser Ankündigung nicht, dass das Material auch zum Training der Modelle von OpenAI genutzt würde.

Oxford weist zurück, dass etwas verheimlicht wurde. Ein Sprecher der Universität sagte der Zeitung, die Digitalisierung sei ihr Hauptinteresse gewesen, und die Mitarbeitenden hätten offen gesagt, dass das Projekt auch Trainingsdaten liefern würde.

The Guardian listet auf, was bisher gescannt oder besprochen wurde:

  • Bis Juni 2025 wurden 125.000 aus historischen Dissertationen gescannte Bilder mit OpenAI geteilt, darunter Doktorarbeiten europäischer und amerikanischer Universitäten aus dem 19. und 20. Jahrhundert.
  • Eine seltene Sammlung von 10.000 „Broadside Ballads“ aus dem 16. Jahrhundert: Liedtexte und Noten, die einst an den Straßenecken der Tudorzeit kursierten.
  • Die Mitarbeitenden haben auch besprochen, irische Staatspapiere aus dem 18. Jahrhundert, die privaten Briefe der irischen Schriftstellerin Maria Edgeworth und Dorothy Hodgkins Penicillin-Notizbücher zu digitalisieren.
  • Der Vertrag stellt eine Massendigitalisierung der gesamten Sammlung der Bodleian mit 23 Millionen Objekten in Aussicht, und in Sitzungsprotokollen wurde ein Chatbot „Ask the Bod“ besprochen.

Per Informationsfreiheitsanfrage erlangte Sitzungsprotokolle halten Bedenken von Universitätsmitarbeitenden fest, darunter Mitglieder des Aufsichtsgremiums der Bodleian, zum Reputationsrisiko einer Partnerschaft mit OpenAI und dazu, was ein Deal auf Basis einer energieintensiven Technologie für die Umweltverpflichtungen der Universität bedeutet.

Was Oxford und OpenAI sagen

Das im Projekt mit OpenAI digitalisierte Material ist von bescheidenem Umfang, urheberrechtsfrei, und OpenAIs Nutzung des Materials ist nicht exklusiv.

Sprecher der University of Oxford, via The Guardian

Die Universität sagt, die Bodleian behalte die Rechte an den Scans und werde innerhalb von Monaten beginnen, sie offen online zu veröffentlichen, wie bei anderen Digitalisierungspartnerschaften. Anders als bei manchen Buchscan-Projekten anderswo bleiben die Sammlungen selbst unversehrt.

Ein OpenAI-Sprecher sagte der Zeitung, das Unternehmen sei „stolz“ darauf, sicherzustellen, dass „die KI-Modelle von heute das historische Wissen der Welt für die Zukunft bewahren“. Oxford ist das einzige britische Mitglied von OpenAIs Projekt NextGenAI, zu dem auch die Boston Public Library, Caltech, das MIT und die University of Michigan gehören.

Die größere Geschichte: Der KI gehen die frischen menschlichen Texte aus

The Guardian ordnet den Deal ein. Aus dem offenen Web abgegriffener Text ist zunehmend mit KI-generiertem Material gesättigt, was ihn für das Training neuer Modelle weniger nützlich macht; deshalb wenden sich Entwickler physischen, oft historischen Buchsammlungen zu, die nie online waren.

  • Antiquariate berichten von einer Welle von Bestellungen obskurer Titel, etwa eines Leitfadens zu landwirtschaftlichen Geräten im Afrika des 18. Jahrhunderts oder von Biografien von Autofahrern der 1950er-Jahre. Die Ladenbesitzer vermuten, dass sie gerade deshalb gekauft werden, weil es sie online nicht in digitalisierter Form gibt.
  • Anthropic, OpenAIs enger Konkurrent, hat zweistellige Millionenbeträge ausgegeben, um Bücher zu kaufen, ihre Rücken abzuschneiden, damit die Seiten gescannt werden können, und sie anschließend einzustampfen. Anthropic sagt, es kaufe und zerstöre keine seltenen oder antiquarischen Bücher.
  • Die Tech-Nachrichtenseite 404 Media legte ein Ortungsgerät in eine Bestellung gebrauchter Bücher und verfolgte sie bis zu einer Amazon-Einrichtung in den USA, wo ebenfalls Bücher zerlegt und gescannt wurden.

Gemeinfreie Bücher sind eine faire und nützliche Lernquelle. Der Punkt hier ist der Appetit: Wenn ein Labor eine vergessene Biografie kauft, nur um sie zu scannen, darf man fragen, was dieselbe Branche noch als „frische Daten“ betrachtet.

Wo Ihre eigenen Daten ins Spiel kommen

Einige der frischesten menschlichen Texte stehen gar nicht in einer Bibliothek. Es ist das, was Menschen jeden Tag in KI-Assistenten tippen, einfügen und hochladen. Laut der Berichterstattung des Guardian müssen ChatGPT-Verbraucherkonten widersprechen, wenn ihre Daten nicht fürs Training genutzt werden sollen (Unternehmensdaten sind ausgeschlossen). Welchen Assistenten Sie auch nutzen: Suchen Sie diese Einstellung noch heute in dessen Daten- oder Datenschutzeinstellungen. Als Faustregel gilt: Laden Sie keine Fotos anderer Menschen, Verträge, medizinischen Unterlagen oder Kundendateien in eine Cloud-KI hoch, die Sie nicht in einem Trainingsdatensatz sehen möchten.

Das ist kein hypothetisches Risiko. In derselben Woche sagte OpenAI, seine eigenen KI-Agenten hätten 53 Bilder von ChatGPT-Nutzern offengelegt, Bilder, an die die Agenten kamen, weil Verbraucherdaten für einen Teil des Trainings genutzt werden. Wir haben darüber in OpenAIs Agenten legten Bilder von 53 ChatGPT-Nutzern offen berichtet.

Die andere Hälfte des Bildes ist leiser: die Apps auf Ihrem Mac, die Daten senden, die Sie nie eingetippt haben, etwa Analysedaten, Absturzberichte, Nutzungs-Pings und Werbe-IDs. Dieser Strom speist die Ökonomie der Datenhändler, die wir in unserem Artikel über Datenhändler und Ihren Mac beschreiben.

Was FireAI an dem Teil tut, den Sie kontrollieren

FireAI hat nichts mit dem Deal zwischen Oxford und OpenAI zu tun, und keine Firewall kann zurückholen, was bereits hochgeladen wurde. Was FireAI ändert, ist, was ab jetzt auf Ihrem eigenen Mac geschieht:

  • FireAIs eigene KI läuft vollständig auf Ihrem Mac. Die Verbindungen, die sie erklärt, und die Regeln, die sie vorschlägt, werden lokal analysiert und nie an HisnLabs, eine Cloud-KI oder in irgendeinen Trainingsdatensatz gesendet.
  • Die Weltkarte zeigt jede Verbindung Ihrer Apps und wohin sie geht, auch die der ChatGPT-App oder jeder anderen KI-App, sodass Sie sehen, welche Apps überhaupt Daten senden.
  • Mit Regeln pro App blockieren Sie eine App oder nur eine der Domains, mit denen sie spricht, ohne den Rest Ihres Mac zu stören.
  • Der Modus Paranoid blockiert bekannte Telemetrie- und Analyseziele für jede App, die Sie nicht ausdrücklich erlaubt haben, sodass Hintergrunddaten, die Sie nie teilen wollten, auf Ihrem Mac bleiben.

Bibliotheken können entscheiden, was sie mit ihren Büchern tun. Sie entscheiden, was Ihren Mac verlässt. Laden Sie FireAI herunter und testen Sie es 17 Tage kostenlos, oder lesen Sie zuerst die Dokumentation. FireAI wird von HisnLabs entwickelt.

Quellen