安全与人工智能新闻

牛津、OpenAI 与博德利图书馆 · 作者 FireAI Security & Research Team · 发布于

牛津让 OpenAI 用博德利图书馆的藏书训练模型。AI 对新鲜数据的渴求,并不止于旧书

牛津博德利图书馆的扫描件进入了 OpenAI 的训练集。故事讲的是公有领域的书籍,却揭示了 AI 实验室如今多么卖力地搜寻新鲜的人类文字。

Illustration: a classical library building with binary digits floating around it, next to the words “AI is reading the Bodleian.”

据《卫报》2026 年 9 月 26 日报道,牛津大学已允许 ChatGPT 背后的公司 OpenAI,用博德利图书馆数字化的历史文献来训练其 AI 模型。该报看到的内部文件称,扫描的博德利资料被用于“充实 OpenAI 训练集”。

首先说与你自己的隐私有关的部分:这个故事讲的是已过版权期的旧书和论文,而不是任何人的个人数据。没有涉及任何人的消息、照片或文件。但它仍然值得细读,因为它展示了 AI 行业此刻的处境:缺乏新鲜的、由人类书写的材料,并在四处寻找。

发生了什么

牛津于 2025 年 3 月宣布与 OpenAI 建立合作关系。其公开目标是使用 OpenAI 的软件,把世界最著名图书馆之一——博德利图书馆的文献数字化,让学生和研究人员更容易获取。据《卫报》报道,那份公告并没有说这些资料也将被用来训练 OpenAI 的模型。

牛津否认有任何隐瞒。一位大学发言人告诉该报,数字化是其首要关注点,而工作人员一直坦言,该项目也会贡献训练数据。

《卫报》列出了迄今已被扫描或讨论过的内容:

  • 截至 2025 年 6 月,已有 12.5 万张扫描自历史学位论文的图像被分享给 OpenAI,其中包括 19 和 20 世纪欧美大学的博士论文。
  • 一套珍稀的 1 万份 16 世纪“宽幅民谣”(broadside ballads):曾在都铎时代街头流传的歌词和乐谱。
  • 工作人员还讨论过将 18 世纪的爱尔兰国家文件、爱尔兰小说家玛丽亚·埃奇沃思的私人信件,以及多萝西·霍奇金的青霉素笔记本数字化。
  • 合同提出了将博德利全部 2,300 万件藏品大规模数字化的前景,会议纪要中还讨论了一个“问问博德利”(Ask the Bod)聊天机器人。

通过信息公开申请获得的会议纪要记录了大学工作人员(包括博德利治理委员会成员)的担忧:与 OpenAI 合作的声誉风险,以及一项建立在高能耗技术之上的协议,对大学的环境承诺意味着什么。

牛津和 OpenAI 怎么说

通过与 OpenAI 合作项目数字化的资料规模不大,已不受版权保护,而且 OpenAI 对这些资料的使用并非独家。

牛津大学发言人,引自《卫报》

大学表示,博德利保留扫描件的权利,并将在几个月内开始在网上公开发布,就像它与其他数字化合作伙伴所做的那样。与其他地方的一些图书扫描项目不同,藏品本身保持完好。

一位 OpenAI 发言人告诉该报,公司“自豪”能够确保“今天的 AI 模型为未来保存世界的历史知识”。牛津是 OpenAI NextGenAI 项目中唯一的英国成员,该项目的成员还包括波士顿公共图书馆、加州理工学院、麻省理工学院和密歇根大学。

更大的故事:AI 正在耗尽新鲜的人类文字

《卫报》把这项协议放在更大的背景下审视。从开放网络上抓取的文本越来越多地充斥着 AI 生成的内容,这使它们对训练新模型的用处越来越小,因此开发者转向了实体的、往往是历史性的藏书——那些从一开始就不在网上的书。

  • 二手书商报告说,冷门书目的订单骤增,比如一本 18 世纪非洲农具指南,或 1950 年代赛车手的传记。店主们怀疑,买家恰恰是因为这些书在网上没有数字化版本才买的。
  • OpenAI 的主要竞争对手 Anthropic 已花费数千万美元购买书籍,切掉书脊以便扫描书页,然后将它们打成纸浆。Anthropic 表示,它不会购买并销毁珍本或古籍。
  • 科技新闻网站 404 Media 在一份二手书订单中放入了一个追踪器,并追踪到美国的一处亚马逊设施,那里的书籍同样被拆开扫描。

公有领域的书籍是公平且有用的学习材料。这里的重点是胃口:当一家实验室愿意为了扫描而买下一本被遗忘的传记时,就有理由问一问,在同一个行业眼中,还有什么东西也算作“新鲜数据”。

你自己的数据处在什么位置

一些最新鲜的人类文字根本不在图书馆里。它们是人们每天在 AI 助手中输入、粘贴和上传的内容。据《卫报》的报道,ChatGPT 的个人账户如果不希望自己的数据被用于训练,就必须主动选择退出(企业数据不能用于训练)。无论你用的是哪个助手,今天就在它的数据或隐私控制中找到这个设置。一条经验法则:不要把他人的照片、合同、病历或客户文件上传到任何你不愿看到它们出现在训练集中的云端 AI。

这并不是假设性的风险。同一周,OpenAI 表示其自家 AI 智能体泄露了 53 张属于 ChatGPT 用户的图片——智能体之所以能接触到这些图片,是因为部分训练过程使用了个人用户的数据。我们在OpenAI 的智能体泄露了 53 名 ChatGPT 用户的图片中作了报道。

图景的另一半更加安静:你 Mac 上的那些 App 发送着你从未输入过的数据,比如分析数据、崩溃报告、使用情况回传和广告标识符。这股数据流滋养着数据经纪经济,我们在数据经纪商与你的 Mac一文中有过介绍。

FireAI 针对你能掌控的部分做了什么

FireAI 与牛津和 OpenAI 的协议毫无关系,也没有任何防火墙能收回已经上传的东西。FireAI 改变的,是从现在起在你自己的 Mac 上发生的事:

  • FireAI 自己的 AI 完全在你的 Mac 上运行。它解释的连接和建议的规则都在本地分析,从不会被发送给 HisnLabs、云端 AI,或进入任何人的训练集。
  • 世界地图显示你的 App 建立的每一个连接及其去向,包括 ChatGPT App 或任何其他 AI App,让你看清究竟有哪些 App 在发送数据。
  • 按 App 设置的规则让你拦截某个 App,或只拦截它连接的某一个域名,而不会影响 Mac 的其他部分。
  • “偏执”模式会为每个你没有明确允许的 App 拦截已知的遥测和分析目的地,让你从未选择分享的后台数据留在你的 Mac 上。

图书馆可以决定如何处置自己的藏书。什么离开你的 Mac,由你决定。下载 FireAI,免费试用 17 天,或者先阅读文档。FireAI 由 HisnLabs 出品。

来源