Новости безопасности и искусственного интеллекта

Оксфорд, OpenAI и Бодлианская библиотека · Автор FireAI Security & Research Team · Опубликовано

Оксфорд разрешил OpenAI обучаться на Бодлианской библиотеке. Голод ИИ по свежим данным не ограничивается старыми книгами

Сканы из Бодлианской библиотеки Оксфорда попали в обучающий набор OpenAI. История о книгах в общественном достоянии, но она показывает, как настойчиво ИИ-лаборатории ищут свежие тексты людей.

Illustration: a classical library building with binary digits floating around it, next to the words “AI is reading the Bodleian.”

Оксфордский университет разрешил OpenAI, компании, стоящей за ChatGPT, обучать свои ИИ-модели на исторических текстах, оцифрованных из Бодлианской библиотеки, сообщила The Guardian 26 сентября 2026 года. Во внутренних документах, с которыми ознакомилась газета, говорится, что отсканированные материалы Бодлианской библиотеки использовались, чтобы «наполнить обучающий набор OpenAI».

Прежде всего о том, что важно для вашей собственной приватности: эта история о старых книгах и диссертациях, авторское право на которые истекло, а не о чьих-либо личных данных. Ничьи сообщения, фото или файлы не затронуты. И всё же её стоит прочитать внимательно, потому что она показывает, где сейчас находится ИИ-индустрия: ей не хватает свежих текстов, написанных людьми, и она ищет их повсюду.

Что произошло

Оксфорд объявил о партнёрстве с OpenAI в марте 2025 года. Заявленной целью было использовать программы OpenAI для оцифровки текстов из Бодлианской библиотеки, одной из самых известных библиотек мира, чтобы студентам и исследователям было проще до них добраться. По данным The Guardian, в том объявлении не говорилось, что материалы также будут использоваться для обучения моделей OpenAI.

Оксфорд отвергает мысль, что что-то скрывалось. Представитель университета сказал газете, что оцифровка была его главным интересом и что сотрудники открыто говорили: проект также предоставит данные для обучения.

The Guardian перечисляет, что уже отсканировано или обсуждалось:

  • К июню 2025 года OpenAI были переданы 125 000 изображений, отсканированных из исторических диссертаций, включая докторские диссертации европейских и американских университетов XIX и XX веков.
  • Редкое собрание из 10 000 «уличных баллад» (broadside ballads) XVI века: тексты песен и ноты, которые когда-то распространялись на улицах тюдоровской Англии.
  • Сотрудники также обсуждали оцифровку ирландских государственных бумаг XVIII века, частных писем ирландской писательницы Марии Эджворт и тетрадей Дороти Ходжкин о пенициллине.
  • Договор допускает массовую оцифровку всего собрания Бодлианской библиотеки из 23 миллионов единиц хранения, а в протоколах совещаний обсуждался чат-бот «Ask the Bod».

Протоколы совещаний, полученные по запросу о свободе информации, фиксируют опасения сотрудников университета, в том числе членов руководящего комитета Бодлианской библиотеки, о репутационном риске партнёрства с OpenAI и о том, что значит сделка, построенная на энергоёмкой технологии, для экологических обязательств университета.

Что говорят Оксфорд и OpenAI

Материалы, оцифрованные в рамках проекта с OpenAI, скромны по объёму, не защищены авторским правом, и использование их OpenAI не является эксклюзивным.

Представитель Оксфордского университета, по данным The Guardian

Университет говорит, что Бодлианская библиотека сохраняет права на сканы и в течение нескольких месяцев начнёт открыто публиковать их в интернете, как и в других партнёрствах по оцифровке. В отличие от некоторых проектов по сканированию книг в других местах, сами собрания остаются нетронутыми.

Представитель OpenAI сказал газете, что компания «гордится» тем, что «сегодняшние ИИ-модели сохраняют исторические знания мира для будущего». Оксфорд — единственный британский участник проекта OpenAI NextGenAI, в который также входят Бостонская публичная библиотека, Калтех, MIT и Мичиганский университет.

Большая история: у ИИ заканчиваются свежие тексты, написанные людьми

The Guardian помещает сделку в контекст. Тексты, собранные в открытом интернете, всё сильнее насыщены материалом, созданным ИИ, что делает их менее полезными для обучения новых моделей, поэтому разработчики обратились к физическим, часто историческим, книжным собраниям, которых никогда не было в сети.

  • Букинисты сообщают о волне заказов малоизвестных книг, например справочника по сельскохозяйственным орудиям в Африке XVIII века или биографий автогонщиков 1950-х. Владельцы магазинов подозревают, что их покупают именно потому, что в оцифрованном виде их в сети нет.
  • Anthropic, ближайший соперник OpenAI, потратила десятки миллионов долларов на покупку книг, отрезая им корешки, чтобы отсканировать страницы, а затем отправляя их в макулатуру. Anthropic заявляет, что не покупает и не уничтожает редкие или антикварные книги.
  • Технологическое издание 404 Media поместило устройство слежения в заказ подержанных книг и отследило его до объекта Amazon в США, где книги также разбирали и сканировали.

Книги в общественном достоянии — справедливый и полезный источник для обучения. Суть здесь в аппетите: когда лаборатория готова купить забытую биографию только ради сканирования, справедливо спросить, что ещё та же индустрия считает «свежими данными».

Где здесь ваши собственные данные

Некоторые из самых свежих текстов, написанных людьми, вовсе не в библиотеках. Это то, что люди каждый день набирают, вставляют и загружают в ИИ-ассистентов. Согласно материалам The Guardian, владельцам потребительских аккаунтов ChatGPT приходится отказываться самим, если они не хотят, чтобы их данные использовались для обучения (корпоративные данные не используются). Каким бы ассистентом вы ни пользовались, найдите эту настройку в его параметрах данных или приватности сегодня. Как правило, не загружайте в облачный ИИ фото других людей, договоры, медицинские записи или файлы клиентов, если вам было бы неприятно увидеть их в обучающем наборе.

Это не гипотетический риск. На той же неделе OpenAI сообщила, что её собственные ИИ-агенты допустили утечку 53 изображений, принадлежащих пользователям ChatGPT, — изображений, до которых агенты могли добраться, потому что потребительские данные используются в части процесса обучения. Мы писали об этом в материале Агенты OpenAI допустили утечку изображений 53 пользователей ChatGPT.

Другая половина картины тише: приложения на вашем Mac, которые отправляют данные, которые вы вообще не вводили, — аналитику, отчёты о сбоях, пинги использования и рекламные идентификаторы. Этот поток питает экономику брокеров данных, описанную в нашей статье о брокерах данных и вашем Mac.

Что FireAI делает с той частью, которую вы контролируете

FireAI не имеет никакого отношения к сделке Оксфорда и OpenAI, и ни один файрвол не может вернуть то, что уже загружено. FireAI меняет то, что происходит на вашем собственном Mac отныне:

  • Собственный ИИ FireAI работает полностью на вашем Mac. Подключения, которые он объясняет, и правила, которые он предлагает, анализируются локально и никогда не отправляются ни в HisnLabs, ни в облачный ИИ, ни в чей-либо обучающий набор.
  • Карта мира показывает каждое подключение ваших приложений и куда оно идёт, включая приложение ChatGPT или любое другое ИИ-приложение, так что вы видите, какие приложения вообще отправляют данные.
  • Правила для приложений позволяют заблокировать приложение или только один из доменов, с которыми оно общается, не ломая остальной Mac.
  • Режим «Паранойя» блокирует известные адреса телеметрии и аналитики для каждого приложения, которое вы явно не разрешили, поэтому фоновые данные, которыми вы никогда не решали делиться, остаются на вашем Mac.

Библиотеки могут решать, что делать со своими книгами. Вы решаете, что покидает ваш Mac. Скачайте FireAI и попробуйте бесплатно 17 дней или сначала прочитайте документацию. FireAI создан HisnLabs.

Источники