Güvenlik ve Yapay Zeka haberleri

Oxford, OpenAI ve Bodleian Kütüphanesi · Yazan FireAI Security & Research Team · Yayınlandı

Oxford, OpenAI’ın Bodleian Kütüphanesi ile model eğitmesine izin verdi. Yapay zekânın taze veri açlığı eski kitaplarda bitmiyor

Oxford’un Bodleian Kütüphanesi’nden taramalar OpenAI’ın eğitim veri kümesine girdi. Konu kamu malı kitaplar, ama laboratuvarların taze insan yazısını ne kadar hırsla aradığını gösteriyor.

Illustration: a classical library building with binary digits floating around it, next to the words “AI is reading the Bodleian.”

The Guardian’ın 26 Eylül 2026’da bildirdiğine göre Oxford Üniversitesi, ChatGPT’nin arkasındaki şirket OpenAI’ın, Bodleian Kütüphanesi’nden sayısallaştırılan tarihî metinlerle yapay zekâ modellerini eğitmesine izin verdi. Gazetenin gördüğü iç belgeler, taranan Bodleian malzemesinin “OpenAI eğitim veri kümesini doldurmak” için kullanıldığını söylüyor.

Her şeyden önce, kendi gizliliğiniz için önemli olan kısım: bu hikâye kimsenin kişisel verileriyle değil, telif hakkı süresi dolmuş eski kitaplar ve tezlerle ilgili. Kimsenin mesajları, fotoğrafları ya da dosyaları işin içinde değildi. Yine de dikkatle okumaya değer, çünkü yapay zekâ sektörünün şu anda nerede olduğunu gösteriyor: taze, insan eliyle yazılmış malzemeden yoksun ve onu her yerde arıyor.

Ne oldu

Oxford, Mart 2025’te OpenAI ile bir ortaklık duyurdu. Açıklanan amaç, öğrencilerin ve araştırmacıların daha kolay ulaşabilmesi için dünyanın en ünlü kütüphanelerinden biri olan Bodleian’daki metinleri OpenAI yazılımıyla sayısallaştırmaktı. The Guardian’a göre bu duyuruda malzemenin OpenAI’ın modellerini eğitmek için de kullanılacağı söylenmiyordu.

Oxford, herhangi bir şeyin saklandığı fikrini reddediyor. Bir üniversite sözcüsü gazeteye, önceliklerinin sayısallaştırma olduğunu ve çalışanların projenin eğitim verisine de katkı sağlayacağı konusunda açık davrandığını söyledi.

The Guardian, şimdiye kadar taranan ya da konuşulanları sıralıyor:

  • Haziran 2025’e kadar, 19. ve 20. yüzyıllarda yazılmış Avrupa ve Amerikan üniversitelerine ait doktora tezleri dahil, tarihî tezlerden taranan 125.000 görüntü OpenAI ile paylaşılmıştı.
  • 16. yüzyıldan kalma 10.000 “broadside ballad”dan oluşan nadir bir koleksiyon: bir zamanlar Tudor döneminin sokak köşelerinde dolaşan şarkı sözleri ve notalar.
  • Çalışanlar ayrıca 18. yüzyıla ait İrlanda devlet belgelerinin, İrlandalı romancı Maria Edgeworth’ün özel mektuplarının ve Dorothy Hodgkin’in penisilin defterlerinin sayısallaştırılmasını da konuştu.
  • Sözleşme, Bodleian’ın 23 milyon parçalık koleksiyonunun tamamının toplu olarak sayısallaştırılması olasılığını gündeme getiriyor ve toplantı tutanaklarında bir “Ask the Bod” sohbet botu konuşulmuş.

Bilgi edinme hakkı talebiyle elde edilen toplantı tutanakları, Bodleian’ın yönetim komitesi üyeleri dahil üniversite çalışanlarının, OpenAI ile ortaklık kurmanın itibar riski ve enerji yoğun bir teknoloji üzerine kurulu bir anlaşmanın üniversitenin çevre taahhütleri için ne anlama geldiği konusundaki endişelerini kaydediyor.

Oxford ve OpenAI ne diyor

OpenAI ile yürütülen proje kapsamında sayısallaştırılan malzeme ölçek olarak mütevazıdır, telif hakkı kapsamı dışındadır ve OpenAI’ın bu malzemeyi kullanımı münhasır değildir.

Oxford Üniversitesi sözcüsü, The Guardian aracılığıyla

Üniversite, taramaların haklarının Bodleian’da kaldığını ve diğer sayısallaştırma ortaklıklarında olduğu gibi birkaç ay içinde bunları internette açık olarak yayımlamaya başlayacağını söylüyor. Başka yerlerdeki bazı kitap tarama projelerinin aksine koleksiyonların kendisi bozulmadan kalıyor.

Bir OpenAI sözcüsü gazeteye, şirketin “bugünün yapay zekâ modellerinin dünyanın tarihî bilgisini gelecek için korumasını” sağlamaktan “gurur” duyduğunu söyledi. Oxford, Boston Halk Kütüphanesi, Caltech, MIT ve Michigan Üniversitesi’ni de kapsayan OpenAI’ın NextGenAI projesinin Birleşik Krallık’taki tek üyesi.

Büyük resim: yapay zekânın taze insan yazısı tükeniyor

The Guardian anlaşmayı bağlamına oturtuyor. Açık internetten kazınan metinler giderek daha fazla yapay zekâ tarafından üretilmiş içerikle doluyor; bu da onları yeni modelleri eğitmek için daha az kullanışlı hâle getiriyor. Bu yüzden geliştiriciler hiç internete çıkmamış fiziksel, çoğu zaman tarihî kitap koleksiyonlarına yöneldi.

  • İkinci el kitapçılar, 18. yüzyıl Afrika’sında tarım aletlerine dair bir rehber ya da 1950’lerin araba sürücülerinin biyografileri gibi az bilinen kitaplara yönelik bir sipariş dalgası bildiriyor. Dükkân sahipleri bunların tam da internette sayısallaştırılmış biçimde bulunmadıkları için satın alındığından şüpheleniyor.
  • OpenAI’ın yakın rakibi Anthropic, kitap satın almaya, sayfaların taranabilmesi için sırtlarını kesmeye ve ardından onları hamur hâline getirmeye on milyonlarca dolar harcadı. Anthropic, nadir ya da antika kitapları satın alıp yok etmediğini söylüyor.
  • Teknoloji haber sitesi 404 Media, bir ikinci el kitap siparişinin içine bir takip cihazı yerleştirdi ve izini ABD’de, kitapların yine söküldüğü ve tarandığı bir Amazon tesisine kadar sürdü.

Kamu malı kitaplar, öğrenmek için adil ve yararlı bir kaynak. Buradaki mesele iştah: bir laboratuvar unutulmuş bir biyografiyi yalnızca taramak için satın alıyorsa, aynı sektör için başka nelerin “taze veri” sayıldığını sormak yerinde olur.

Kendi verileriniz bu tabloda nerede

En taze insan yazılarının bir kısmı bir kütüphanede değil. İnsanların her gün yapay zekâ asistanlarına yazdıkları, yapıştırdıkları ve yükledikleri şeyler. The Guardian’ın haberine göre ChatGPT’nin bireysel hesapları, verilerinin eğitimde kullanılmasını istemiyorlarsa bunu kapatmak zorunda (kurumsal veriler eğitimde kullanılamıyor). Hangi asistanı kullanıyor olursanız olun, bu ayarı bugün veri ya da gizlilik denetimlerinde arayın. Genel bir kural olarak, bir eğitim veri kümesinde görmekten rahatsız olacağınız hiçbir bulut yapay zekâsına başka insanların fotoğraflarını, sözleşmeleri, tıbbi kayıtları ya da müşteri dosyalarını yüklemeyin.

Bu varsayımsal bir risk değil. Aynı hafta OpenAI, kendi yapay zekâ ajanlarının ChatGPT kullanıcılarına ait 53 görüntüyü sızdırdığını söyledi; ajanlar bu görüntülere, bireysel kullanıcı verileri eğitim sürecinin bir bölümünde kullanıldığı için ulaşabiliyordu. Bunu OpenAI’ın ajanları 53 ChatGPT kullanıcısının görüntülerini sızdırdı haberimizde ele aldık.

Tablonun diğer yarısı daha sessiz: Mac’inizde, sizin hiç yazmadığınız verileri gönderen uygulamalar; analitik veriler, çökme raporları, kullanım sinyalleri ve reklam tanımlayıcıları gibi. Bu akış, veri simsarları ve Mac’iniz hakkındaki yazımızda anlatılan veri simsarı ekonomisini besliyor.

FireAI’ın, kontrol ettiğiniz kısım için yaptıkları

FireAI’ın Oxford–OpenAI anlaşmasıyla hiçbir ilgisi yok ve hiçbir güvenlik duvarı zaten yüklenmiş bir şeyi geri alamaz. FireAI’ın değiştirdiği şey, bundan sonra kendi Mac’inizde olanlardır:

  • FireAI’ın kendi yapay zekâsı tamamen Mac’inizde çalışır. Açıkladığı bağlantılar ve önerdiği kurallar yerel olarak analiz edilir; asla HisnLabs’a, bir bulut yapay zekâsına ya da kimsenin eğitim veri kümesine gönderilmez.
  • Dünya haritası, ChatGPT uygulaması ya da başka herhangi bir yapay zekâ uygulaması dahil, uygulamalarınızın yaptığı her bağlantıyı ve nereye gittiğini gösterir; böylece hangi uygulamaların veri gönderdiğini görebilirsiniz.
  • Uygulama bazlı kurallar, Mac’inizin geri kalanını bozmadan bir uygulamayı ya da konuştuğu alan adlarından yalnızca birini engellemenizi sağlar.
  • Çok temkinli mod, açıkça izin vermediğiniz her uygulama için bilinen telemetri ve analitik hedeflerini engeller; böylece paylaşmayı hiç seçmediğiniz arka plan verileri Mac’inizde kalır.

Kütüphaneler kitaplarıyla ne yapacaklarına karar verebilir. Mac’inizden neyin çıkacağına ise siz karar verirsiniz. FireAI’ı indirin ve 17 gün ücretsiz deneyin ya da önce belgeleri okuyun. FireAI, HisnLabs tarafından geliştirilmiştir.

Kaynaklar