Actualités sécurité et IA

Oxford, OpenAI et la Bodleian Library · Par FireAI Security & Research Team · Publié

Oxford a laissé OpenAI s’entraîner sur la Bodleian Library. La faim de données fraîches de l’IA ne s’arrête pas aux vieux livres

Des numérisations de la Bodleian Library d’Oxford ont nourri l’entraînement d’OpenAI. Des livres du domaine public, mais cela montre à quel point l’IA chasse l’écrit humain frais.

Illustration: a classical library building with binary digits floating around it, next to the words “AI is reading the Bodleian.”

L’Université d’Oxford a laissé OpenAI, l’entreprise derrière ChatGPT, entraîner ses modèles d’IA sur des textes historiques numérisés de la Bodleian Library, a rapporté The Guardian le 26 septembre 2026. Des documents internes consultés par le journal indiquent que le matériel numérisé de la Bodleian a servi à « alimenter le jeu d’entraînement d’OpenAI ».

Avant toute chose, ce qui compte pour votre propre vie privée : cette histoire concerne des livres et des thèses anciens, tombés dans le domaine public, pas les données personnelles de qui que ce soit. Aucun message, aucune photo, aucun fichier personnel n’était en jeu. Elle mérite pourtant une lecture attentive, car elle montre où en est l’industrie de l’IA aujourd’hui : à court de textes frais écrits par des humains, et à leur recherche partout.

Ce qui s’est passé

Oxford a annoncé un partenariat avec OpenAI en mars 2025. L’objectif affiché était d’utiliser les logiciels d’OpenAI pour numériser des textes de la Bodleian, l’une des bibliothèques les plus célèbres du monde, afin que étudiants et chercheurs y accèdent plus facilement. Selon The Guardian, cette annonce ne disait pas que le matériel servirait aussi à entraîner les modèles d’OpenAI.

Oxford rejette l’idée que quoi que ce soit ait été caché. Un porte-parole de l’université a déclaré au journal que la numérisation était son intérêt principal, et que le personnel n’avait pas caché que le projet fournirait aussi des données d’entraînement.

The Guardian liste ce qui a été numérisé ou envisagé jusqu’ici :

  • En juin 2025, 125 000 images numérisées de thèses historiques avaient été partagées avec OpenAI, dont des thèses de doctorat d’universités européennes et américaines écrites aux XIXe et XXe siècles.
  • Une collection rare de 10 000 « broadside ballads » du XVIe siècle : des paroles de chansons et des notations musicales qui circulaient autrefois au coin des rues de l’Angleterre des Tudor.
  • Le personnel a aussi évoqué la numérisation de papiers d’État irlandais du XVIIIe siècle, des lettres privées de la romancière irlandaise Maria Edgeworth, et des carnets de Dorothy Hodgkin sur la pénicilline.
  • Le contrat ouvre la perspective d’une numérisation massive de toute la collection de la Bodleian, soit 23 millions de documents, et des comptes rendus de réunion évoquaient un chatbot « Ask the Bod ».

Des comptes rendus de réunion obtenus grâce à une demande d’accès à l’information font état d’inquiétudes du personnel de l’université, y compris de membres du comité de gouvernance de la Bodleian, sur le risque pour la réputation d’un partenariat avec OpenAI, et sur ce que signifie un accord reposant sur une technologie gourmande en énergie pour les engagements environnementaux de l’université.

Ce que disent Oxford et OpenAI

Le matériel numérisé dans le cadre du projet avec OpenAI est d’ampleur modeste, libre de droits, et l’usage qu’en fait OpenAI n’est pas exclusif.

Porte-parole de l’Université d’Oxford, via The Guardian

L’université précise que la Bodleian conserve les droits sur les numérisations et commencera à les publier librement en ligne d’ici quelques mois, comme elle le fait avec d’autres partenariats de numérisation. Contrairement à certains projets de numérisation de livres ailleurs, les collections elles-mêmes restent intactes.

Un porte-parole d’OpenAI a déclaré au journal que l’entreprise était « fière » de veiller à ce que « les modèles d’IA d’aujourd’hui préservent le savoir historique du monde pour l’avenir ». Oxford est le seul membre britannique du projet NextGenAI d’OpenAI, qui comprend aussi la Boston Public Library, Caltech, le MIT et l’Université du Michigan.

L’histoire plus large : l’IA manque d’écrits humains frais

The Guardian replace l’accord dans son contexte. Le texte aspiré sur le Web ouvert est de plus en plus saturé de contenus générés par IA, ce qui le rend moins utile pour entraîner de nouveaux modèles ; les développeurs se sont donc tournés vers des collections de livres physiques, souvent anciennes, qui n’ont jamais été en ligne.

  • Des bouquinistes signalent une vague de commandes de titres obscurs, comme un guide des outils agricoles dans l’Afrique du XVIIIe siècle ou des biographies de pilotes automobiles des années 1950. Les libraires soupçonnent qu’ils sont achetés précisément parce qu’ils n’existent pas en ligne sous forme numérisée.
  • Anthropic, grand rival d’OpenAI, a dépensé des dizaines de millions de dollars pour acheter des livres, en découper le dos afin de numériser les pages, puis les envoyer au pilon. Anthropic affirme ne pas acheter ni détruire de livres rares ou anciens.
  • Le site d’actualité tech 404 Media a glissé un traceur dans une commande de livre d’occasion et l’a suivi jusqu’à un site d’Amazon aux États-Unis, où des livres étaient aussi démontés et numérisés.

Les livres du domaine public sont une source d’apprentissage légitime et utile. Le sujet ici, c’est l’appétit : quand un laboratoire achète une biographie oubliée juste pour la numériser, il est légitime de se demander ce qui d’autre compte comme « données fraîches » pour la même industrie.

Où se situent vos propres données

Une partie des écrits humains les plus frais ne se trouve pas du tout dans une bibliothèque. C’est ce que les gens tapent, collent et envoient chaque jour aux assistants d’IA. Selon les informations du Guardian, les comptes grand public de ChatGPT doivent s’opposer à l’utilisation de leurs données pour l’entraînement s’ils n’en veulent pas (les données des entreprises ne sont pas éligibles). Quel que soit l’assistant que vous utilisez, cherchez ce réglage dès aujourd’hui dans ses contrôles de données ou de confidentialité. En règle générale, n’envoyez à aucune IA dans le cloud des photos d’autres personnes, des contrats, des dossiers médicaux ou des dossiers clients que vous ne seriez pas à l’aise de voir dans des données d’entraînement.

Ce n’est pas un risque théorique. La même semaine, OpenAI a indiqué que ses propres agents d’IA avaient divulgué 53 images appartenant à des utilisateurs de ChatGPT, des images que les agents pouvaient atteindre parce que les données grand public servent à une partie de l’entraînement. Nous l’avons raconté dans les agents d’OpenAI ont divulgué les images de 53 utilisateurs de ChatGPT.

L’autre moitié du tableau est plus discrète : les applis de votre Mac qui envoient des données que vous n’avez jamais tapées, comme des statistiques d’usage, des rapports de plantage, des signaux d’utilisation et des identifiants publicitaires. Ce flux alimente l’économie des courtiers en données décrite dans notre article sur les courtiers en données et votre Mac.

Ce que fait FireAI pour la partie que vous contrôlez

FireAI n’a rien à voir avec l’accord entre Oxford et OpenAI, et aucun pare-feu ne peut reprendre ce qui a déjà été envoyé. Ce que FireAI change, c’est ce qui se passe sur votre propre Mac à partir de maintenant :

  • La propre IA de FireAI tourne entièrement sur votre Mac. Les connexions qu’elle explique et les règles qu’elle suggère sont analysées en local, jamais envoyées à HisnLabs, à une IA dans le cloud ni dans les données d’entraînement de qui que ce soit.
  • La carte du monde montre chaque connexion de vos applis et sa destination, y compris l’appli ChatGPT ou toute autre appli d’IA : vous voyez quelles applis envoient des données.
  • Les règles par appli vous permettent de bloquer une appli, ou seulement l’un des domaines auxquels elle parle, sans casser le reste de votre Mac.
  • Le mode Paranoïa bloque les destinations connues de télémétrie et de statistiques pour toute appli que vous n’avez pas explicitement autorisée : les données d’arrière-plan que vous n’avez jamais choisi de partager restent sur votre Mac.

Les bibliothèques peuvent décider de ce qu’elles font de leurs livres. Vous décidez de ce qui quitte votre Mac. Téléchargez FireAI et essayez-le gratuitement pendant 17 jours, ou lisez d’abord la documentation. FireAI est conçu par HisnLabs.

Sources