Wiadomości dotyczące bezpieczeństwa i sztucznej inteligencji

Oxford, OpenAI i Biblioteka Bodlejańska · Autor FireAI Security & Research Team · Opublikowano

Oxford pozwolił OpenAI trenować na zbiorach Biblioteki Bodlejańskiej. Głód świeżych danych AI nie kończy się na starych książkach

Skany z oksfordzkiej Biblioteki Bodlejańskiej trafiły do zbioru treningowego OpenAI. Chodzi o książki z domeny publicznej, ale widać, jak usilnie laboratoria AI szukają świeżych ludzkich tekstów.

Illustration: a classical library building with binary digits floating around it, next to the words “AI is reading the Bodleian.”

Uniwersytet Oksfordzki pozwolił OpenAI, firmie stojącej za ChatGPT, trenować swoje modele AI na historycznych tekstach zdigitalizowanych z Biblioteki Bodlejańskiej, podał The Guardian 26 września 2026 roku. Wewnętrzne dokumenty, do których dotarła gazeta, mówią, że zeskanowane materiały z Bodleian posłużyły do „zasilenia zbioru treningowego OpenAI”.

Przede wszystkim to, co ważne dla twojej własnej prywatności: ta historia dotyczy starych książek i rozpraw, do których prawa autorskie wygasły, a nie czyichkolwiek danych osobowych. Nie chodziło o niczyje wiadomości, zdjęcia ani pliki. Mimo to warto przeczytać ją uważnie, bo pokazuje, gdzie jest teraz branża AI: brakuje jej świeżych tekstów napisanych przez ludzi i szuka ich wszędzie.

Co się stało

Oxford ogłosił partnerstwo z OpenAI w marcu 2025 roku. Deklarowanym celem było użycie oprogramowania OpenAI do digitalizacji tekstów z Bodleian, jednej z najsłynniejszych bibliotek świata, aby studenci i badacze mogli łatwiej do nich dotrzeć. Według The Guardian w tamtym ogłoszeniu nie wspomniano, że materiały posłużą także do trenowania modeli OpenAI.

Oxford odrzuca sugestię, że cokolwiek ukrywano. Rzecznik uczelni powiedział gazecie, że głównym celem była digitalizacja, a pracownicy otwarcie mówili, że projekt dostarczy również danych treningowych.

The Guardian wymienia, co do tej pory zeskanowano lub omawiano:

  • Do czerwca 2025 roku przekazano OpenAI 125 000 obrazów zeskanowanych z historycznych rozpraw, w tym prac doktorskich z europejskich i amerykańskich uczelni napisanych w XIX i XX wieku.
  • Rzadką kolekcję 10 000 XVI-wiecznych „ballad ulotnych”: tekstów piosenek i zapisów nutowych, które krążyły kiedyś na rogach ulic w czasach Tudorów.
  • Pracownicy omawiali też digitalizację XVIII-wiecznych irlandzkich akt państwowych, prywatnych listów irlandzkiej powieściopisarki Marii Edgeworth oraz notatników Dorothy Hodgkin dotyczących penicyliny.
  • Umowa otwiera perspektywę masowej digitalizacji całej kolekcji Bodleian liczącej 23 miliony pozycji, a w protokołach spotkań omawiano chatbota „Ask the Bod”.

Protokoły spotkań uzyskane na wniosek o dostęp do informacji publicznej odnotowują obawy pracowników uczelni, w tym członków komitetu zarządzającego Bodleian, dotyczące ryzyka dla reputacji związanego z partnerstwem z OpenAI oraz tego, co umowa oparta na energochłonnej technologii oznacza dla zobowiązań środowiskowych uczelni.

Co mówią Oxford i OpenAI

Materiały zdigitalizowane w ramach projektu z OpenAI mają skromną skalę, nie są chronione prawem autorskim, a korzystanie z nich przez OpenAI nie jest wyłączne.

Rzecznik Uniwersytetu Oksfordzkiego, za The Guardian

Uczelnia twierdzi, że Bodleian zachowuje prawa do skanów i w ciągu kilku miesięcy zacznie publikować je otwarcie w internecie, tak jak w przypadku innych partnerstw digitalizacyjnych. W przeciwieństwie do niektórych projektów skanowania książek w innych miejscach same zbiory pozostają nienaruszone.

Rzecznik OpenAI powiedział gazecie, że firma jest „dumna”, że dba o to, by „dzisiejsze modele AI zachowały historyczną wiedzę świata dla przyszłości”. Oxford jest jedynym brytyjskim członkiem projektu NextGenAI OpenAI, do którego należą też Boston Public Library, Caltech, MIT i Uniwersytet Michigan.

Szerszy obraz: AI kończą się świeże teksty pisane przez ludzi

The Guardian umieszcza tę umowę w kontekście. Tekst zebrany z otwartej sieci jest coraz bardziej nasycony materiałami wygenerowanymi przez AI, co czyni go mniej przydatnym do trenowania nowych modeli, więc twórcy zwrócili się ku fizycznym, często historycznym zbiorom książek, których nigdy nie było w sieci.

  • Antykwariusze zgłaszają falę zamówień na mało znane tytuły, takie jak przewodnik po narzędziach rolniczych w XVIII-wiecznej Afryce czy biografie kierowców wyścigowych z lat 50. Właściciele sklepów podejrzewają, że kupuje się je właśnie dlatego, że nie istnieją w sieci w wersji cyfrowej.
  • Anthropic, bliski rywal OpenAI, wydał dziesiątki milionów dolarów na kupowanie książek, odcinanie im grzbietów, by zeskanować strony, a następnie ich przemiał. Anthropic twierdzi, że nie kupuje ani nie niszczy rzadkich czy antykwarycznych książek.
  • Serwis technologiczny 404 Media umieścił lokalizator w zamówieniu używanej książki i namierzył go w zakładzie Amazon w USA, gdzie książki również rozbierano i skanowano.

Książki z domeny publicznej to uczciwy i przydatny materiał do nauki. Chodzi tu o apetyt: skoro laboratorium kupuje zapomnianą biografię tylko po to, by ją zeskanować, można zapytać, co jeszcze ta sama branża uważa za „świeże dane”.

Gdzie są twoje własne dane

Część najświeższych tekstów pisanych przez ludzi w ogóle nie jest w bibliotece. To to, co ludzie codziennie wpisują, wklejają i przesyłają do asystentów AI. Według ustaleń The Guardian użytkownicy indywidualnych kont ChatGPT muszą sami zrezygnować, jeśli nie chcą, by ich dane służyły do trenowania (dane biznesowe się do tego nie kwalifikują). Niezależnie od tego, jakiego asystenta używasz, poszukaj dziś tego ustawienia w jego ustawieniach danych lub prywatności. Zasada ogólna: nie przesyłaj zdjęć innych osób, umów, dokumentacji medycznej ani plików klientów do żadnej AI w chmurze, jeśli nie chciałbyś zobaczyć ich w zbiorze treningowym.

To nie jest hipotetyczne ryzyko. W tym samym tygodniu OpenAI poinformowało, że jego własne agenty AI ujawniły 53 obrazy należące do użytkowników ChatGPT, obrazy, do których agenty miały dostęp, bo dane użytkowników indywidualnych są wykorzystywane w części procesu trenowania. Pisaliśmy o tym w tekście Agenty OpenAI ujawniły obrazy 53 użytkowników ChatGPT.

Druga połowa obrazu jest cichsza: aplikacje na twoim Macu, które wysyłają dane, których nigdy nie wpisałeś, takie jak analityka, raporty o awariach, sygnały użycia i identyfikatory reklamowe. Ten strumień zasila gospodarkę brokerów danych opisaną w naszym artykule o brokerach danych i twoim Macu.

Co FireAI robi z częścią, którą kontrolujesz

FireAI nie ma nic wspólnego z umową Oxfordu z OpenAI i żaden firewall nie cofnie czegoś, co już zostało przesłane. FireAI zmienia natomiast to, co od teraz dzieje się na twoim Macu:

  • Własna AI FireAI działa w całości na twoim Macu. Połączenia, które wyjaśnia, i reguły, które proponuje, są analizowane lokalnie, nigdy nie trafiają do HisnLabs, do AI w chmurze ani do niczyjego zbioru treningowego.
  • Mapa świata pokazuje każde połączenie twoich aplikacji i to, dokąd prowadzi, w tym aplikacji ChatGPT czy dowolnej innej aplikacji AI, więc widzisz, które aplikacje w ogóle wysyłają dane.
  • Reguły dla aplikacji pozwalają zablokować aplikację albo tylko jedną z domen, z którymi się łączy, bez psucia reszty Maca.
  • Tryb Paranoiczny blokuje znane cele telemetrii i analityki wszystkich aplikacji, na które wyraźnie nie zezwoliłeś, więc dane w tle, których nigdy nie postanowiłeś udostępniać, zostają na twoim Macu.

Biblioteki mogą decydować, co zrobić ze swoimi książkami. Ty decydujesz, co opuszcza twojego Maca. Pobierz FireAI i wypróbuj go bezpłatnie przez 17 dni albo najpierw przeczytaj dokumentację. FireAI tworzy HisnLabs.

Źródła