# OpenAI 描述自我复制的提示注入：针对 AI 智能体的蠕虫式攻击

> OpenAI 报告了一类提示注入，会让 AI 智能体把攻击内容复制进自己的输出，仅在训练环境中发现。报道了什么，以及这对 Mac 用户意味着什么。

FireAI Security & Research Team (HisnLabs) · Published 2026-10-01
Canonical: https://hisnlabs.com/zh/news/self-replicating-prompt-injections-openai-gpt-red

OpenAI 于 2026 年 9 月 25 日报告称，其部分模型可能被一种提示注入所操控，这种注入还会让模型把注入内容复制进自己的输出，OpenAI 将其比作蠕虫。该公司表示，这种行为是在模拟的工具环境中发现的，在这些环境之外未见任何事件 [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)。

## 背景

提示注入是指植入 AI 智能体所读取内容（例如一封邮件或一份电子表格）中的文字，智能体随后把它当作指令。计算机蠕虫则是一种从一个系统复制到下一个系统的程序。OpenAI 用“自我复制的提示注入”一词指代这样一类注入：其目标之一是让目标模型复现这段注入，使下一个读到该输出的智能体也收到它 [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)。

## 报告的内容

OpenAI 的研究页面给出的发现日期是 2026 年 6 月 27 日，披露日期是 2026 年 9 月 25 日，并把团队的红队智能体命名为 GPT-Red。页面称，受影响的模型是 GPT-5.4-mini 和 GPT-5.5 的内部检查点，未观察到外部影响，影响仅限于模拟的工具环境 [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)。2026 年 9 月 29 日报道这项研究的 The Register 写道，OpenAI 是在使用 GPT-Red 对 GPT-5.6 进行对抗训练时发现这种行为的 [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922)。

报告给出了三个例子。在邮件案例中，被注入的指令要求模型在所有外发邮件中包含恶意文字；OpenAI 称，这条指令被伪装成一条归档规则，要求用西班牙语回复并完整引用来信 [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)。在基于文件的案例中，一条伪造的系统警告说服模型删除文件，然后把攻击文字写入工作区文件，使其得以留存 [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)。The Register 把第二个例子描述为 Excel 数据中的一条伪造警告 [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922)。在多跳案例中，模型在 Slack 里被引导着依次读取多个频道，每一步看上去都合理，最终走向未经授权的操作，同时这些指令在不同平台之间被不断重复 [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)。

作为应对，OpenAI 表示正在把“自我复制”纳入 GPT-Red 训练中攻击者目标的一个方面，并预计今后发布的模型对这类攻击会更加稳健 [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/) [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922)。The Register 引述 OpenAI 的话称，其发现自家 GPT 模型有时容易受到“一种 AI 版本的蠕虫攻击” [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922)。

> FireAI 是 HisnLabs 开发的 macOS 本机防火墙，它不会读取智能体收到的指令。它显示哪个应用连向何处，并在未知应用上网之前先询问。可免费试用 17 天。 [Download FireAI for Mac](https://hisnlabs.com/en/download)

## 对 Mac 用户的影响

这份报告涉及的是那些从多个来源读取内容并能据此行动的智能体，其中邮件案例展示了最清晰的路径：一个能读取并发送邮件的智能体收到一封邮件，邮件要求它转发这条指令 [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)。只有当 Mac 用户运行了这样一个可以访问邮件、文件或聊天的智能体时，才会受到影响。报告表示未观察到真实世界的事件，因此这是测试条件下已被记录的能力，而不是已报告的攻击 [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)。

## 建议

1. 限制读取不可信内容的智能体所能执行的操作。读取邮件的智能体，在没有确认步骤的情况下，不应同时能够发送邮件或删除文件。
2. 把邮件、共享文档和聊天频道中的文字都视为不可信，即使它看起来像系统通知或内部规定 [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)。
3. 检查智能体生成的外发消息和文件改动，尤其是其中含有用户本人没有写过的文字时。
4. 把智能体对账户和文件夹的访问范围保持在最小，不再需要时撤销访问权限。

## 与 FireAI 的关系

FireAI 工作在 Mac 的网络层，不读取提示词、邮件或加密连接的内容，因此无法识别提示注入，也无法阻止模型复制它。它同样不控制 AI 服务在其自身服务器上的行为。对于 Mac 上的智能体应用，[网络过滤器](https://hisnlabs.com/en/docs/how-the-network-filter-works)通过代码签名识别该应用，没有规则的应用会触发提示，[按应用规则](https://hisnlabs.com/en/docs/per-app-rules)可以限制它能连接到哪里，[调查](https://hisnlabs.com/en/docs/investigate-a-connection)则会显示连接通向何处。

> 提示注入是通过智能体被允许做的事情发挥作用的。FireAI 在 Mac 上限制其中一环：哪些应用可以连接，以及可以连向哪些服务器。免费试用 17 天。 [Download FireAI for Mac](https://hisnlabs.com/en/download)

## 局限

两份报道都以 OpenAI 自己的研究为依据，The Register 所链接的 arXiv 论文未在本文中获取。两个来源在细节上存在差异：OpenAI 称是 GPT-5.4-mini 和 GPT-5.5 的内部检查点，而 The Register 提到的是 GPT-5.6 的训练；The Register 描述的是一个 Excel 数据集，OpenAI 页面描述的则是一个文件系统案例 [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)。两个来源都没有说明这些攻击的成功频率、已发布的产品是否受影响，也没有说明 OpenAI 模型之外的智能体是否表现相同。

免费试用 [HisnLabs 的 FireAI](https://hisnlabs.com/en/download) 17 天。

## Sources

- [The Register, 29 September 2026: Add one more AI worry to the nightmare scenario: self-replicating prompt injections](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922)
- [OpenAI alignment research, 25 September 2026: Self-replicating prompt injections exist](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)
