La Universidad de Oxford dejó que OpenAI, la empresa detrás de ChatGPT, entrenara sus modelos de IA con textos históricos digitalizados de la Biblioteca Bodleiana, informó The Guardian el 26 de septiembre de 2026. Documentos internos que vio el periódico dicen que el material escaneado de la Bodleiana se usó para “alimentar el conjunto de entrenamiento de OpenAI”.
Antes que nada, la parte que importa para tu propia privacidad: esta historia trata de libros y tesis viejos, sin derechos de autor vigentes, no de datos personales de nadie. No se tocaron mensajes, fotos ni archivos de nadie. Aun así vale la pena leerla con atención, porque muestra dónde está hoy la industria de la IA: corta de material nuevo escrito por humanos, y buscándolo por todos lados.
Qué pasó
Oxford anunció una alianza con OpenAI en marzo de 2025. El objetivo declarado era usar software de OpenAI para digitalizar textos de la Bodleiana, una de las bibliotecas más famosas del mundo, para que estudiantes e investigadores pudieran consultarlos más fácilmente. Según The Guardian, ese anuncio no decía que el material también se usaría para entrenar los modelos de OpenAI.
Oxford rechaza la idea de que se haya ocultado algo. Un portavoz de la universidad dijo al periódico que la digitalización era su interés principal, y que el personal había sido claro en que el proyecto también aportaría datos de entrenamiento.
The Guardian enumera lo que se ha escaneado o discutido hasta ahora:
- Para junio de 2025, se habían compartido con OpenAI 125,000 imágenes escaneadas de tesis históricas, incluidas tesis doctorales de universidades europeas y estadounidenses escritas en los siglos XIX y XX.
- Una colección rara de 10,000 “baladas de pliego suelto” del siglo XVI: letras de canciones y notas musicales que circulaban en las esquinas de la época Tudor.
- El personal también ha discutido digitalizar documentos de Estado irlandeses del siglo XVIII, las cartas privadas de la novelista irlandesa Maria Edgeworth y los cuadernos de Dorothy Hodgkin sobre la penicilina.
- El contrato abre la posibilidad de digitalizar de forma masiva toda la colección de la Bodleiana, de 23 millones de piezas, y en actas de reuniones se discutió un chatbot “Ask the Bod”.
Actas de reuniones obtenidas por una solicitud de acceso a la información registran preocupaciones del personal universitario, incluidos miembros del comité de gobierno de la Bodleiana, sobre el riesgo para la reputación de aliarse con OpenAI, y sobre lo que un acuerdo basado en una tecnología que consume mucha energía significa para los compromisos ambientales de la universidad.
Lo que dicen Oxford y OpenAI
El material digitalizado en el proyecto con OpenAI es de escala modesta, no tiene derechos de autor vigentes, y el uso que hace OpenAI del material no es exclusivo.
Portavoz de la Universidad de Oxford, vía The Guardian
La universidad dice que la Bodleiana conserva los derechos de los escaneos y empezará a publicarlos abiertamente en línea en cuestión de meses, como hace con otras alianzas de digitalización. A diferencia de algunos proyectos de escaneo de libros en otros lugares, las colecciones mismas quedan intactas.
Un portavoz de OpenAI dijo al periódico que la empresa estaba “orgullosa” de asegurar que “los modelos de IA de hoy preserven el conocimiento histórico del mundo para el futuro”. Oxford es el único miembro británico del proyecto NextGenAI de OpenAI, que también incluye a la Biblioteca Pública de Boston, Caltech, el MIT y la Universidad de Michigan.
La historia de fondo: la IA se está quedando sin textos humanos nuevos
The Guardian pone el acuerdo en contexto. El texto que se extrae de la web abierta está cada vez más saturado de material generado por IA, lo que lo hace menos útil para entrenar modelos nuevos, así que los desarrolladores recurren a colecciones físicas de libros, muchas veces históricas, que nunca estuvieron en línea.
- Librerías de viejo reportan una oleada de pedidos de títulos oscuros, como una guía de implementos agrícolas en el África del siglo XVIII o biografías de pilotos de autos de los años cincuenta. Los dueños sospechan que se compran justamente porque no existen digitalizados en línea.
- Anthropic, el rival cercano de OpenAI, ha gastado decenas de millones de dólares comprando libros, cortándoles el lomo para escanear las páginas y luego haciéndolos pulpa. Anthropic dice que no compra ni destruye libros raros o antiguos.
- El sitio de noticias tecnológicas 404 Media metió un rastreador dentro de un pedido de libros usados y lo siguió hasta una instalación de Amazon en EE. UU., donde también se desarmaban y escaneaban libros.
Los libros de dominio público son algo justo y útil de lo que aprender. El punto aquí es el apetito: cuando un laboratorio compra una biografía olvidada solo para escanearla, es justo preguntarse qué más cuenta como “datos nuevos” para esa misma industria.
Dónde entran tus propios datos
Parte del texto humano más nuevo ni siquiera está en una biblioteca. Es lo que la gente escribe, pega y sube a los asistentes de IA todos los días. Según el reportaje de The Guardian, las cuentas de consumidor de ChatGPT tienen que excluirse si no quieren que sus datos se usen para entrenar (los datos empresariales no se usan). Uses el asistente que uses, busca hoy ese ajuste en sus controles de datos o de privacidad. Como regla general, no subas fotos de otras personas, contratos, expedientes médicos ni archivos de clientes a ninguna IA en la nube si no te sentirías cómodo viéndolos en un conjunto de entrenamiento.
No es un riesgo hipotético. La misma semana, OpenAI dijo que sus propios agentes de IA habían filtrado 53 imágenes de usuarios de ChatGPT, imágenes a las que los agentes podían llegar porque los datos de consumidores se usan en parte del proceso de entrenamiento. Lo cubrimos en Los agentes de OpenAI filtraron imágenes de 53 usuarios de ChatGPT.
La otra mitad del panorama es más silenciosa: las apps de tu Mac que envían datos que nunca escribiste, como analíticas, reportes de fallos, pings de uso e identificadores publicitarios. Ese flujo alimenta la economía de los data brokers que describimos en nuestro artículo sobre los data brokers y tu Mac.
Lo que hace FireAI con la parte que tú controlas
FireAI no tiene nada que ver con el acuerdo entre Oxford y OpenAI, y ningún firewall puede recuperar algo que ya se subió. Lo que FireAI cambia es lo que pasa en tu propia Mac de ahora en adelante:
- La IA propia de FireAI corre por completo en tu Mac. Las conexiones que explica y las reglas que sugiere se analizan en local, nunca se envían a HisnLabs, a una IA en la nube ni al conjunto de entrenamiento de nadie.
- El mapa mundial muestra cada conexión que hacen tus apps y a dónde va, incluida la app de ChatGPT o cualquier otra app de IA, para que veas qué apps envían datos.
- Las reglas por app te dejan bloquear una app, o solo uno de los dominios con los que habla, sin descomponer el resto de tu Mac.
- El modo Paranoico bloquea los destinos conocidos de telemetría y analíticas para toda app que no hayas permitido explícitamente, así que los datos en segundo plano que nunca elegiste compartir se quedan en tu Mac.
Las bibliotecas pueden decidir qué hacer con sus libros. Tú decides qué sale de tu Mac. Descarga FireAI y pruébalo gratis durante 17 días, o lee primero la documentación. FireAI es un producto de HisnLabs.