Notícias sobre segurança e IA

Oxford, a OpenAI e a Biblioteca Bodleiana · Por FireAI Security & Research Team · Publicado

Oxford deixou a OpenAI treinar com a Biblioteca Bodleiana. A fome da IA por dados novos não para nos livros antigos

Digitalizações da Biblioteca Bodleiana, de Oxford, entraram no conjunto de treinamento da OpenAI. A história é sobre livros em domínio público, mas mostra o quanto os laboratórios de IA caçam texto humano novo.

Illustration: a classical library building with binary digits floating around it, next to the words “AI is reading the Bodleian.”

A Universidade de Oxford deixou a OpenAI, a empresa por trás do ChatGPT, treinar seus modelos de IA com textos históricos digitalizados da Biblioteca Bodleiana, informou o The Guardian em 26 de setembro de 2026. Documentos internos vistos pelo jornal dizem que o material digitalizado da Bodleiana foi usado para “alimentar o conjunto de treinamento da OpenAI”.

Antes de tudo, a parte que importa para a sua própria privacidade: esta história é sobre livros e teses antigos, sem direitos autorais, não sobre dados pessoais de ninguém. Nenhuma mensagem, foto ou arquivo de ninguém esteve envolvido. Ainda assim vale ler com atenção, porque mostra onde a indústria de IA está agora: sem material novo escrito por humanos, e procurando por ele em todo lugar.

O que aconteceu

Oxford anunciou uma parceria com a OpenAI em março de 2025. O objetivo declarado era usar o software da OpenAI para digitalizar textos da Bodleiana, uma das bibliotecas mais famosas do mundo, para que estudantes e pesquisadores pudessem acessá-los com mais facilidade. Segundo o The Guardian, esse anúncio não dizia que o material também seria usado para treinar os modelos da OpenAI.

Oxford rejeita a ideia de que algo tenha sido escondido. Um porta-voz da universidade disse ao jornal que a digitalização era o interesse principal e que os funcionários tinham sido transparentes sobre o projeto também fornecer dados de treinamento.

O The Guardian lista o que foi digitalizado ou discutido até agora:

  • Até junho de 2025, 125.000 imagens digitalizadas de dissertações históricas tinham sido compartilhadas com a OpenAI, incluindo teses de doutorado de universidades europeias e americanas escritas nos séculos XIX e XX.
  • Uma coleção rara de 10.000 “broadside ballads” do século XVI: letras de canções e notas musicais que circulavam nas esquinas da Inglaterra Tudor.
  • Os funcionários também discutiram digitalizar papéis de Estado irlandeses do século XVIII, as cartas pessoais da romancista irlandesa Maria Edgeworth e os cadernos de Dorothy Hodgkin sobre a penicilina.
  • O contrato levanta a possibilidade de digitalização em massa de todo o acervo da Bodleiana, de 23 milhões de itens, e atas de reuniões discutiram um chatbot “Ask the Bod”.

Atas de reuniões obtidas por meio de pedido de acesso à informação registram preocupações de funcionários da universidade, incluindo membros do comitê de governança da Bodleiana, sobre o risco à reputação de uma parceria com a OpenAI, e sobre o que um acordo baseado em uma tecnologia que consome muita energia significa para os compromissos ambientais da universidade.

O que Oxford e a OpenAI dizem

O material digitalizado no projeto com a OpenAI é de escala modesta, não tem direitos autorais, e o uso que a OpenAI faz dele não é exclusivo.

Porta-voz da Universidade de Oxford, via The Guardian

A universidade diz que a Bodleiana mantém os direitos sobre as digitalizações e vai começar a publicá-las abertamente online em alguns meses, como faz com outras parcerias de digitalização. Ao contrário de alguns projetos de digitalização de livros em outros lugares, os acervos em si continuam intactos.

Um porta-voz da OpenAI disse ao jornal que a empresa tinha “orgulho” de garantir que “os modelos de IA de hoje preservem o conhecimento histórico do mundo para o futuro”. Oxford é o único membro britânico do projeto NextGenAI da OpenAI, que também inclui a Biblioteca Pública de Boston, o Caltech, o MIT e a Universidade de Michigan.

A história maior: a IA está ficando sem texto humano novo

O The Guardian coloca o acordo em contexto. O texto coletado da web aberta está cada vez mais saturado de material gerado por IA, o que o torna menos útil para treinar novos modelos, então os desenvolvedores passaram a buscar acervos físicos de livros, muitas vezes históricos, que nunca estiveram online.

  • Sebos relatam uma onda de pedidos de títulos obscuros, como um guia de implementos agrícolas na África do século XVIII ou biografias de pilotos de carro dos anos 1950. Os donos das lojas suspeitam que eles são comprados justamente por não existirem online em forma digitalizada.
  • A Anthropic, rival próxima da OpenAI, gastou dezenas de milhões de dólares comprando livros, cortando as lombadas para que as páginas pudessem ser digitalizadas e depois triturando-os. A Anthropic diz que não compra nem destrói livros raros ou antigos.
  • O site de notícias de tecnologia 404 Media colocou um rastreador dentro de um pedido de livro usado e o rastreou até uma instalação da Amazon nos EUA, onde livros também eram desmontados e digitalizados.

Livros em domínio público são uma fonte justa e útil de aprendizado. O ponto aqui é o apetite: quando um laboratório compra uma biografia esquecida só para digitalizá-la, é justo perguntar o que mais conta como “dados novos” para essa mesma indústria.

Onde entram os seus próprios dados

Parte do texto humano mais novo nem está em uma biblioteca. É o que as pessoas digitam, colam e enviam a assistentes de IA todos os dias. Segundo a reportagem do The Guardian, as contas de consumidor do ChatGPT precisam desativar a opção se não quiserem que seus dados sejam usados no treinamento (dados corporativos não entram). Seja qual for o assistente que você usa, procure essa configuração hoje nos controles de dados ou de privacidade dele. Como regra prática, não envie fotos de outras pessoas, contratos, prontuários médicos ou arquivos de clientes a nenhuma IA na nuvem se você não ficaria à vontade em vê-los em um conjunto de treinamento.

Não é um risco hipotético. Na mesma semana, a OpenAI disse que os próprios agentes de IA dela tinham vazado 53 imagens de usuários do ChatGPT, imagens a que os agentes tinham acesso porque os dados de consumidores são usados em parte do processo de treinamento. Cobrimos isso em Os agentes da OpenAI vazaram imagens de 53 usuários do ChatGPT.

A outra metade do quadro é mais silenciosa: os apps do seu Mac que enviam dados que você nunca digitou, como estatísticas de uso, relatórios de falha, sinais de uso e identificadores de publicidade. Esse fluxo alimenta a economia dos corretores de dados descrita no nosso artigo sobre corretores de dados e o seu Mac.

O que o FireAI faz com a parte que você controla

O FireAI não tem nada a ver com o acordo entre Oxford e a OpenAI, e nenhum firewall consegue recuperar algo que já foi enviado. O que o FireAI muda é o que acontece no seu próprio Mac daqui em diante:

  • A IA do próprio FireAI roda inteiramente no seu Mac. As conexões que ela explica e as regras que ela sugere são analisadas localmente, nunca enviadas à HisnLabs, a uma IA na nuvem ou ao conjunto de treinamento de ninguém.
  • O mapa-múndi mostra cada conexão que os seus apps fazem e para onde ela vai, incluindo o app do ChatGPT ou qualquer outro app de IA, para que você veja quais apps estão enviando dados.
  • As regras por app permitem bloquear um app, ou só um dos domínios com que ele conversa, sem quebrar o resto do seu Mac.
  • O modo Paranoico bloqueia destinos conhecidos de telemetria e de estatísticas de uso para todo app que você não permitiu explicitamente, então os dados em segundo plano que você nunca escolheu compartilhar ficam no seu Mac.

As bibliotecas podem decidir o que fazer com os seus livros. Você decide o que sai do seu Mac. Baixe o FireAI e experimente grátis por 17 dias, ou leia antes a Documentação. O FireAI é feito pela HisnLabs.

Fontes