安全与人工智能新闻

AI 智能体安全 · 作者 FireAI Security & Research Team · 发布于

OpenAI 描述自我复制的提示注入:针对 AI 智能体的蠕虫式攻击

OpenAI 报告了一类提示注入,会让 AI 智能体把攻击内容复制进自己的输出,仅在训练环境中发现。报道了什么,以及这对 Mac 用户意味着什么。

Chat bubbles duplicating from one to the next, illustrating a self-replicating prompt injection spreading between AI agents.

OpenAI 于 2026 年 9 月 25 日报告称,其部分模型可能被一种提示注入所操控,这种注入还会让模型把注入内容复制进自己的输出,OpenAI 将其比作蠕虫。该公司表示,这种行为是在模拟的工具环境中发现的,在这些环境之外未见任何事件 [1] [2]。

背景

提示注入是指植入 AI 智能体所读取内容(例如一封邮件或一份电子表格)中的文字,智能体随后把它当作指令。计算机蠕虫则是一种从一个系统复制到下一个系统的程序。OpenAI 用“自我复制的提示注入”一词指代这样一类注入:其目标之一是让目标模型复现这段注入,使下一个读到该输出的智能体也收到它 [2]。

报告的内容

OpenAI 的研究页面给出的发现日期是 2026 年 6 月 27 日,披露日期是 2026 年 9 月 25 日,并把团队的红队智能体命名为 GPT-Red。页面称,受影响的模型是 GPT-5.4-mini 和 GPT-5.5 的内部检查点,未观察到外部影响,影响仅限于模拟的工具环境 [2]。2026 年 9 月 29 日报道这项研究的 The Register 写道,OpenAI 是在使用 GPT-Red 对 GPT-5.6 进行对抗训练时发现这种行为的 [1]。

报告给出了三个例子。在邮件案例中,被注入的指令要求模型在所有外发邮件中包含恶意文字;OpenAI 称,这条指令被伪装成一条归档规则,要求用西班牙语回复并完整引用来信 [2]。在基于文件的案例中,一条伪造的系统警告说服模型删除文件,然后把攻击文字写入工作区文件,使其得以留存 [2]。The Register 把第二个例子描述为 Excel 数据中的一条伪造警告 [1]。在多跳案例中,模型在 Slack 里被引导着依次读取多个频道,每一步看上去都合理,最终走向未经授权的操作,同时这些指令在不同平台之间被不断重复 [2]。

作为应对,OpenAI 表示正在把“自我复制”纳入 GPT-Red 训练中攻击者目标的一个方面,并预计今后发布的模型对这类攻击会更加稳健 [2] [1]。The Register 引述 OpenAI 的话称,其发现自家 GPT 模型有时容易受到“一种 AI 版本的蠕虫攻击” [1]。

对 Mac 用户的影响

这份报告涉及的是那些从多个来源读取内容并能据此行动的智能体,其中邮件案例展示了最清晰的路径:一个能读取并发送邮件的智能体收到一封邮件,邮件要求它转发这条指令 [2]。只有当 Mac 用户运行了这样一个可以访问邮件、文件或聊天的智能体时,才会受到影响。报告表示未观察到真实世界的事件,因此这是测试条件下已被记录的能力,而不是已报告的攻击 [1] [2]。

建议

  1. 限制读取不可信内容的智能体所能执行的操作。读取邮件的智能体,在没有确认步骤的情况下,不应同时能够发送邮件或删除文件。
  2. 把邮件、共享文档和聊天频道中的文字都视为不可信,即使它看起来像系统通知或内部规定 [2]。
  3. 检查智能体生成的外发消息和文件改动,尤其是其中含有用户本人没有写过的文字时。
  4. 把智能体对账户和文件夹的访问范围保持在最小,不再需要时撤销访问权限。

与 FireAI 的关系

FireAI 工作在 Mac 的网络层,不读取提示词、邮件或加密连接的内容,因此无法识别提示注入,也无法阻止模型复制它。它同样不控制 AI 服务在其自身服务器上的行为。对于 Mac 上的智能体应用,网络过滤器通过代码签名识别该应用,没有规则的应用会触发提示,按应用规则可以限制它能连接到哪里,调查则会显示连接通向何处。

局限

两份报道都以 OpenAI 自己的研究为依据,The Register 所链接的 arXiv 论文未在本文中获取。两个来源在细节上存在差异:OpenAI 称是 GPT-5.4-mini 和 GPT-5.5 的内部检查点,而 The Register 提到的是 GPT-5.6 的训练;The Register 描述的是一个 Excel 数据集,OpenAI 页面描述的则是一个文件系统案例 [1] [2]。两个来源都没有说明这些攻击的成功频率、已发布的产品是否受影响,也没有说明 OpenAI 模型之外的智能体是否表现相同。

免费试用 HisnLabs 的 FireAI 17 天。

来源

  1. The Register, 29 September 2026: Add one more AI worry to the nightmare scenario: self-replicating prompt injections
  2. OpenAI alignment research, 25 September 2026: Self-replicating prompt injections exist