La Universidad de Oxford ha permitido que OpenAI, la empresa que está detrás de ChatGPT, entrene sus modelos de IA con textos históricos digitalizados de la Biblioteca Bodleiana, informó The Guardian el 26 de septiembre de 2026. Documentos internos a los que tuvo acceso el periódico dicen que el material escaneado de la Bodleiana se usó para “nutrir el conjunto de entrenamiento de OpenAI”.
Antes de nada, lo que importa para tu propia privacidad: esta historia trata de libros y tesis antiguos, sin derechos de autor, no de datos personales de nadie. No hubo mensajes, fotos ni archivos de ninguna persona implicados. Aun así merece una lectura atenta, porque muestra en qué punto está la industria de la IA ahora mismo: escasa de material nuevo escrito por humanos, y buscándolo en todas partes.
Qué pasó
Oxford anunció una alianza con OpenAI en marzo de 2025. El objetivo declarado era usar software de OpenAI para digitalizar textos de la Bodleiana, una de las bibliotecas más famosas del mundo, para que estudiantes e investigadores pudieran acceder a ellos con más facilidad. Según The Guardian, ese anuncio no decía que el material también se usaría para entrenar los modelos de OpenAI.
Oxford rechaza que se ocultara nada. Un portavoz de la universidad dijo al periódico que la digitalización era su interés principal, y que el personal había dicho abiertamente que el proyecto también aportaría datos de entrenamiento.
The Guardian enumera lo que se ha escaneado o debatido hasta ahora:
- Para junio de 2025 se habían compartido con OpenAI 125.000 imágenes escaneadas de tesis históricas, incluidas tesis doctorales de universidades europeas y estadounidenses escritas en los siglos XIX y XX.
- Una rara colección de 10.000 “broadside ballads” del siglo XVI: letras de canciones y notas musicales que circulaban en las esquinas de la época Tudor.
- El personal también ha debatido digitalizar documentos del Estado irlandés del siglo XVIII, las cartas privadas de la novelista irlandesa Maria Edgeworth y los cuadernos sobre la penicilina de Dorothy Hodgkin.
- El contrato abre la posibilidad de digitalizar en masa toda la colección de la Bodleiana, de 23 millones de piezas, y en las actas de las reuniones se habló de un chatbot llamado “Ask the Bod”.
Las actas de reuniones obtenidas mediante una solicitud de acceso a la información recogen la preocupación del personal de la universidad, incluidos miembros del comité de gobierno de la Bodleiana, por el riesgo reputacional de asociarse con OpenAI, y por lo que supone un acuerdo basado en una tecnología de alto consumo energético para los compromisos medioambientales de la universidad.
Lo que dicen Oxford y OpenAI
El material digitalizado en el proyecto con OpenAI es de escala modesta, no tiene derechos de autor y el uso que hace OpenAI de él no es exclusivo.
Portavoz de la Universidad de Oxford, vía The Guardian
La universidad dice que la Bodleiana conserva los derechos de los escaneos y empezará a publicarlos abiertamente en internet en unos meses, como hace con otras alianzas de digitalización. A diferencia de algunos proyectos de escaneo de libros en otros lugares, las colecciones en sí se conservan intactas.
Un portavoz de OpenAI dijo al periódico que la empresa estaba “orgullosa” de garantizar que “los modelos de IA de hoy preserven el conocimiento histórico del mundo para el futuro”. Oxford es el único miembro británico del proyecto NextGenAI de OpenAI, que también incluye la Biblioteca Pública de Boston, Caltech, el MIT y la Universidad de Míchigan.
La historia de fondo: a la IA se le acaban los textos humanos nuevos
The Guardian sitúa el acuerdo en su contexto. El texto extraído de la web abierta está cada vez más saturado de material generado por IA, lo que lo hace menos útil para entrenar modelos nuevos, así que los desarrolladores han recurrido a colecciones de libros físicos, a menudo históricos, que nunca estuvieron en internet.
- Libreros de segunda mano cuentan una avalancha de pedidos de títulos poco conocidos, como una guía de aperos agrícolas en el África del siglo XVIII o biografías de pilotos de coches de los años cincuenta. Los libreros sospechan que se compran precisamente porque no existen en internet en formato digital.
- Anthropic, gran rival de OpenAI, ha gastado decenas de millones de dólares en comprar libros, cortarles el lomo para poder escanear las páginas y después convertirlos en pasta de papel. Anthropic dice que no compra ni destruye libros raros o antiguos.
- La web de noticias tecnológicas 404 Media colocó un dispositivo de seguimiento dentro de un pedido de libros de segunda mano y lo rastreó hasta unas instalaciones de Amazon en EE. UU., donde también se desmontaban y escaneaban libros.
Los libros de dominio público son algo legítimo y útil de lo que aprender. Lo que importa aquí es el apetito: cuando un laboratorio compra una biografía olvidada solo para escanearla, es razonable preguntarse qué más cuenta como “datos nuevos” para esa misma industria.
Dónde encajan tus propios datos
Parte de los textos humanos más nuevos no está en ninguna biblioteca. Es lo que la gente escribe, pega y sube cada día a los asistentes de IA. Según la información de The Guardian, en las cuentas de consumo de ChatGPT hay que desactivar el uso de los datos para entrenar si no se quiere (los datos de empresas no se usan). Uses el asistente que uses, busca hoy ese ajuste en sus controles de datos o de privacidad. Como regla general, no subas a ninguna IA en la nube fotos de otras personas, contratos, historiales médicos ni archivos de clientes que no te gustaría ver en unos datos de entrenamiento.
No es un riesgo hipotético. Esa misma semana, OpenAI dijo que sus propios agentes de IA habían filtrado 53 imágenes de usuarios de ChatGPT, imágenes a las que los agentes podían llegar porque los datos de consumo se usan en parte del proceso de entrenamiento. Lo contamos en Los agentes de OpenAI filtraron las imágenes de 53 usuarios de ChatGPT.
La otra mitad del panorama es más silenciosa: las apps de tu Mac que envían datos que nunca escribiste, como analítica, informes de fallos, avisos de uso e identificadores publicitarios. Ese flujo alimenta la economía de los brókeres de datos que describimos en nuestro artículo sobre los brókeres de datos y tu Mac.
Lo que hace FireAI con la parte que controlas
FireAI no tiene nada que ver con el acuerdo entre Oxford y OpenAI, y ningún cortafuegos puede recuperar algo que ya se ha subido. Lo que cambia FireAI es lo que pasa en tu propio Mac a partir de ahora:
- La propia IA de FireAI funciona íntegramente en tu Mac. Las conexiones que explica y las reglas que sugiere se analizan en local, nunca se envían a HisnLabs, a una IA en la nube ni a los datos de entrenamiento de nadie.
- El mapa mundial muestra cada conexión de tus apps y adónde va, incluida la app de ChatGPT o cualquier otra app de IA, para que veas qué apps envían datos.
- Las reglas por app te permiten bloquear una app, o solo uno de los dominios con los que habla, sin estropear el resto de tu Mac.
- El modo Paranoico bloquea los destinos de telemetría y analítica conocidos para todas las apps que no has permitido expresamente, así que los datos en segundo plano que nunca decidiste compartir se quedan en tu Mac.
Las bibliotecas pueden decidir qué hacen con sus libros. Tú decides lo que sale de tu Mac. Descarga FireAI y pruébalo gratis durante 17 días, o lee primero la documentación. FireAI es un producto de HisnLabs.