Новини безпеки та ШІ

Оксфорд, OpenAI і Бодліанська бібліотека · Автор FireAI Security & Research Team · Опубліковано

Оксфорд дозволив OpenAI навчатися на Бодліанській бібліотеці. Голод ШІ на свіжі дані не зупиняється на старих книжках

Скани з Бодліанської бібліотеки Оксфорда потрапили в навчальний набір OpenAI. Ідеться про книжки в суспільному надбанні, але видно, як завзято ШІ-лабораторії шукають свіжі людські тексти.

Illustration: a classical library building with binary digits floating around it, next to the words “AI is reading the Bodleian.”

Оксфордський університет дозволив OpenAI, компанії, що стоїть за ChatGPT, навчати свої ШІ-моделі на історичних текстах, оцифрованих із Бодліанської бібліотеки, повідомив The Guardian 26 вересня 2026 року. Внутрішні документи, які бачило видання, свідчать, що відскановані матеріали Бодліанської бібліотеки використали, щоб «наповнити навчальний набір OpenAI».

Насамперед те, що важливо для вашої власної приватності: ця історія про старі книжки й дисертації, авторське право на які вже спливло, а не про чиїсь особисті дані. Нічиї повідомлення, фото чи файли не постраждали. І все ж її варто уважно прочитати, бо вона показує, де зараз ШІ-індустрія: їй бракує свіжих текстів, написаних людьми, і вона шукає їх усюди.

Що сталося

Оксфорд оголосив про партнерство з OpenAI в березні 2025 року. Заявленою метою було за допомогою програм OpenAI оцифрувати тексти з Бодліанської бібліотеки, однієї з найвідоміших бібліотек світу, щоб студентам і дослідникам було легше до них дістатися. За даними The Guardian, у тому оголошенні не йшлося, що матеріали також використовуватимуть для навчання моделей OpenAI.

Оксфорд заперечує, що щось приховувалося. Речник університету сказав виданню, що головним інтересом була оцифровка і що працівники відкрито казали, що проєкт також дасть дані для навчання.

The Guardian наводить, що вже відскановано або обговорювалося:

  • До червня 2025 року OpenAI передали 125 000 зображень, відсканованих з історичних дисертацій, зокрема докторських дисертацій європейських та американських університетів, написаних у XIX і XX століттях.
  • Рідкісну колекцію з 10 000 «балад на аркушах» XVI століття: тексти пісень і ноти, що колись поширювалися на вуличних перехрестях за часів Тюдорів.
  • Працівники також обговорювали оцифровку ірландських державних паперів XVIII століття, приватних листів ірландської письменниці Марії Еджворт і записників Дороті Годжкін про пеніцилін.
  • Договір відкриває перспективу масової оцифровки всієї колекції Бодліанської бібліотеки з 23 мільйонів одиниць, а в протоколах засідань обговорювали чатбот «Ask the Bod».

Протоколи засідань, отримані за запитом на доступ до публічної інформації, фіксують занепокоєння працівників університету, зокрема членів керівного комітету Бодліанської бібліотеки, щодо репутаційного ризику партнерства з OpenAI і щодо того, що угода, побудована на енергоємній технології, означає для екологічних зобов’язань університету.

Що кажуть Оксфорд і OpenAI

Матеріали, оцифровані в межах проєкту з OpenAI, скромні за обсягом, не захищені авторським правом, а використання їх OpenAI не є ексклюзивним.

Речник Оксфордського університету, через The Guardian

Університет каже, що Бодліанська бібліотека зберігає права на скани й протягом кількох місяців почне відкрито публікувати їх онлайн, як це відбувається з іншими партнерствами з оцифровки. На відміну від деяких проєктів сканування книжок деінде, самі колекції лишаються цілими.

Речник OpenAI сказав виданню, що компанія «пишається» тим, що допомагає «сьогоднішнім ШІ-моделям зберегти історичні знання світу для майбутнього». Оксфорд — єдиний британський учасник проєкту OpenAI NextGenAI, до якого також входять Бостонська публічна бібліотека, Каліфорнійський технологічний інститут, MIT і Мічиганський університет.

Більша історія: ШІ вичерпує свіжі тексти, написані людьми

The Guardian поміщає угоду в контекст. Текст, зібраний із відкритого вебу, дедалі більше насичений матеріалами, згенерованими ШІ, що робить його менш корисним для навчання нових моделей, тож розробники звернулися до фізичних, часто історичних, книжкових колекцій, яких узагалі ніколи не було онлайн.

  • Букіністи повідомляють про хвилю замовлень маловідомих видань, як-от посібника із сільськогосподарських знарядь в Африці XVIII століття чи біографій автогонщиків 1950-х. Власники крамниць підозрюють, що їх купують саме тому, що вони не існують онлайн в оцифрованому вигляді.
  • Anthropic, найближчий конкурент OpenAI, витратила десятки мільйонів доларів на купівлю книжок, у яких відрізали корінці, щоб відсканувати сторінки, а потім відправляли їх на переробку. Anthropic каже, що не купує й не знищує рідкісні чи антикварні книжки.
  • Технологічне видання 404 Media вклало пристрій відстеження в замовлення вживаних книжок і простежило його до об’єкта Amazon у США, де книжки теж розбирали й сканували.

Книжки в суспільному надбанні — чесне й корисне джерело для навчання. Суть тут в апетиті: коли лабораторія купує забуту біографію лише для того, щоб її відсканувати, доречно запитати, що ще ця сама індустрія вважає «свіжими даними».

Де тут ваші власні дані

Частина найсвіжіших людських текстів узагалі не в бібліотеці. Це те, що люди щодня набирають, вставляють і завантажують у ШІ-асистентів. За даними The Guardian, власники споживчих акаунтів ChatGPT мають самі відмовитися, якщо не хочуть, щоб їхні дані використовували для навчання (корпоративні дані для цього не використовуються). Хай яким асистентом ви користуєтеся, знайдіть цей параметр у його налаштуваннях даних чи приватності вже сьогодні. Загальне правило: не завантажуйте фото інших людей, договори, медичні записи чи файли клієнтів у жоден хмарний ШІ, якщо вам було б некомфортно побачити їх у навчальному наборі.

Це не гіпотетичний ризик. Того ж тижня OpenAI заявила, що її власні ШІ-агенти оприлюднили 53 зображення, що належать користувачам ChatGPT, — зображення, до яких агенти мали доступ, бо споживчі дані використовуються для частини процесу навчання. Ми писали про це в новині Агенти OpenAI оприлюднили зображення 53 користувачів ChatGPT.

Друга половина картини тихіша: застосунки на вашому Mac, які надсилають дані, яких ви взагалі не набирали, як-от аналітику, звіти про збої, сигнали використання й рекламні ідентифікатори. Цей потік живить економіку брокерів даних, описану в нашій статті про брокерів даних і ваш Mac.

Що FireAI робить із тією частиною, яку ви контролюєте

FireAI не має жодного стосунку до угоди Оксфорда з OpenAI, і жоден фаєрвол не може повернути те, що вже завантажено. FireAI змінює те, що відбувається на вашому власному Mac відтепер:

  • Власний ШІ FireAI працює повністю на вашому Mac. З’єднання, які він пояснює, і правила, які він пропонує, аналізуються локально й ніколи не надсилаються в HisnLabs, у хмарний ШІ чи в чийсь навчальний набір.
  • Карта світу показує кожне з’єднання ваших застосунків і куди воно веде, зокрема застосунку ChatGPT чи будь-якого іншого ШІ-застосунку, тож ви бачите, які застосунки взагалі надсилають дані.
  • Правила для застосунків дають змогу заблокувати застосунок або лише один із доменів, з якими він спілкується, не зламавши решту вашого Mac.
  • Режим «Параноїк» блокує відомі адреси телеметрії й аналітики для кожного застосунку, якому ви явно не дозволили, тож фонові дані, якими ви ніколи не вирішували ділитися, лишаються на вашому Mac.

Бібліотеки можуть вирішувати, що робити зі своїми книжками. А ви вирішуєте, що залишає ваш Mac. Завантажте FireAI і спробуйте безкоштовно 17 днів або спершу прочитайте документацію. FireAI створює HisnLabs.

Джерела