A Universidade de Oxford deixou a OpenAI, a empresa por trás do ChatGPT, treinar os seus modelos de IA com textos históricos digitalizados da Biblioteca Bodleiana, noticiou o The Guardian a 26 de setembro de 2026. Documentos internos a que o jornal teve acesso dizem que o material digitalizado da Bodleiana foi usado para “alimentar o conjunto de treino da OpenAI”.
Antes de mais, a parte que importa para a sua própria privacidade: esta história é sobre livros e teses antigos, sem direitos de autor, e não sobre dados pessoais de ninguém. Não estiveram envolvidas mensagens, fotografias ou ficheiros de ninguém. Vale mesmo assim a pena lê-la com atenção, porque mostra onde está hoje a indústria da IA: com falta de material novo escrito por humanos, e à procura dele em todo o lado.
O que aconteceu
Oxford anunciou uma parceria com a OpenAI em março de 2025. O objetivo declarado era usar software da OpenAI para digitalizar textos da Bodleiana, uma das bibliotecas mais famosas do mundo, para que estudantes e investigadores lhes pudessem aceder mais facilmente. Segundo o The Guardian, esse anúncio não dizia que o material seria também usado para treinar os modelos da OpenAI.
Oxford rejeita a ideia de que alguma coisa tenha sido escondida. Um porta-voz da universidade disse ao jornal que a digitalização era o seu interesse principal e que os funcionários tinham sido claros quanto ao facto de o projeto também fornecer dados de treino.
O The Guardian enumera o que foi digitalizado ou discutido até agora:
- Até junho de 2025, tinham sido partilhadas com a OpenAI 125 000 imagens digitalizadas de dissertações históricas, incluindo teses de doutoramento de universidades europeias e norte-americanas escritas nos séculos XIX e XX.
- Uma coleção rara de 10 000 “broadside ballads” do século XVI: letras de canções e notas musicais que circulavam outrora nas esquinas da Inglaterra Tudor.
- Os funcionários discutiram também a digitalização de documentos de Estado irlandeses do século XVIII, das cartas privadas da romancista irlandesa Maria Edgeworth e dos cadernos de Dorothy Hodgkin sobre a penicilina.
- O contrato abre a perspetiva de uma digitalização em massa de toda a coleção da Bodleiana, com 23 milhões de itens, e as atas de reuniões discutiam um chatbot “Ask the Bod”.
Atas de reuniões obtidas através de um pedido de acesso à informação registam preocupações de funcionários da universidade, incluindo membros do comité de governação da Bodleiana, quanto ao risco reputacional de uma parceria com a OpenAI, e quanto ao que um acordo assente numa tecnologia que consome muita energia significa para os compromissos ambientais da universidade.
O que dizem Oxford e a OpenAI
O material digitalizado através do projeto com a OpenAI é de escala modesta, não tem direitos de autor, e a utilização do material pela OpenAI não é exclusiva.
Porta-voz da Universidade de Oxford, via The Guardian
A universidade diz que a Bodleiana mantém os direitos sobre as digitalizações e vai começar a publicá-las abertamente online dentro de meses, como faz com outras parcerias de digitalização. Ao contrário de alguns projetos de digitalização de livros noutros sítios, as próprias coleções ficam intactas.
Um porta-voz da OpenAI disse ao jornal que a empresa estava “orgulhosa” de garantir que “os modelos de IA de hoje preservam o conhecimento histórico do mundo para o futuro”. Oxford é o único membro do Reino Unido no projeto NextGenAI da OpenAI, que inclui também a Biblioteca Pública de Boston, o Caltech, o MIT e a Universidade do Michigan.
A história maior: a IA está a ficar sem escrita humana nova
O The Guardian põe o acordo em contexto. O texto recolhido da web aberta está cada vez mais saturado de material gerado por IA, o que o torna menos útil para treinar novos modelos, por isso os programadores voltaram-se para coleções físicas de livros, muitas vezes históricas, que nunca estiveram online.
- Alfarrabistas relatam uma vaga de encomendas de títulos obscuros, como um guia de alfaias agrícolas na África do século XVIII ou biografias de pilotos de automóveis dos anos 1950. Os donos das lojas suspeitam que são comprados precisamente por não existirem online em formato digital.
- A Anthropic, rival direta da OpenAI, gastou dezenas de milhões de dólares a comprar livros, a cortar-lhes as lombadas para digitalizar as páginas e depois a transformá-los em pasta de papel. A Anthropic diz não comprar nem destruir livros raros ou antigos.
- O site de notícias tecnológicas 404 Media colocou um localizador dentro de uma encomenda de livros usados e seguiu-o até uma instalação da Amazon nos EUA, onde também se desmontavam e digitalizavam livros.
Os livros de domínio público são uma fonte justa e útil de aprendizagem. A questão aqui é o apetite: quando um laboratório compra uma biografia esquecida só para a digitalizar, é justo perguntar o que mais conta como “dados novos” para a mesma indústria.
Onde entram os seus próprios dados
Parte da escrita humana mais recente nem sequer está numa biblioteca. É o que as pessoas escrevem, colam e enviam para assistentes de IA todos os dias. Segundo a reportagem do The Guardian, as contas de consumidor do ChatGPT têm de recusar ativamente se não quiserem que os seus dados sejam usados para treino (os dados empresariais não são elegíveis). Seja qual for o assistente que usa, procure hoje essa definição nos controlos de dados ou de privacidade. Como regra geral, não envie para nenhuma IA na nuvem fotografias de outras pessoas, contratos, registos médicos ou ficheiros de clientes que não se sentiria bem a ver num conjunto de treino.
Este não é um risco hipotético. Na mesma semana, a OpenAI disse que os seus próprios agentes de IA tinham divulgado 53 imagens pertencentes a utilizadores do ChatGPT, imagens a que os agentes conseguiam chegar porque os dados dos consumidores são usados numa parte do processo de treino. Falámos disso em Os agentes da OpenAI divulgaram imagens de 53 utilizadores do ChatGPT.
A outra metade do quadro é mais discreta: as apps do seu Mac que enviam dados que nunca escreveu, como estatísticas de utilização, relatórios de falhas, sinais de uso e identificadores publicitários. Esse fluxo alimenta a economia dos corretores de dados descrita no nosso artigo sobre os corretores de dados e o seu Mac.
O que o FireAI faz quanto à parte que controla
O FireAI não tem nada a ver com o acordo entre Oxford e a OpenAI, e nenhuma firewall pode recuperar algo que já foi enviado. O que o FireAI muda é o que acontece no seu próprio Mac a partir de agora:
- A IA do próprio FireAI corre inteiramente no seu Mac. As ligações que explica e as regras que sugere são analisadas localmente, nunca enviadas para a HisnLabs, para uma IA na nuvem ou para o conjunto de treino de ninguém.
- O mapa-múndi mostra cada ligação feita pelas suas apps e para onde vai, incluindo a app do ChatGPT ou qualquer outra app de IA, para que veja que apps estão sequer a enviar dados.
- As regras por app permitem bloquear uma app, ou apenas um dos domínios com que fala, sem estragar o resto do seu Mac.
- O modo Paranoico bloqueia destinos conhecidos de telemetria e de estatísticas para todas as apps que não autorizou explicitamente, para que os dados em segundo plano que nunca escolheu partilhar fiquem no seu Mac.
As bibliotecas podem decidir o que fazer com os seus livros. Você decide o que sai do seu Mac. Descarregue o FireAI e experimente-o gratuitamente durante 17 dias, ou leia primeiro a Documentação. O FireAI é feito pela HisnLabs.