# OpenAI описывает самовоспроизводящиеся инъекции промптов — атаку на ИИ-агентов по типу червя

> OpenAI сообщает об инъекциях промптов, заставляющих ИИ-агента копировать атаку в собственные ответы; они обнаружены только в обучающих средах. Что сообщается и что это значит для пользователей Mac.

FireAI Security & Research Team (HisnLabs) · Published 2026-10-01
Canonical: https://hisnlabs.com/ru/news/self-replicating-prompt-injections-openai-gpt-red

OpenAI сообщила 25 сентября 2026 года, что некоторыми её моделями можно управлять с помощью инъекции промпта, которая заодно заставляет модель копировать эту инъекцию в собственные ответы; OpenAI сравнивает это с червём. Компания говорит, что обнаружила такое поведение в имитированных средах с инструментами и не видела ни одного инцидента за их пределами [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/).

## Предыстория

Инъекция промпта — это текст, помещённый в содержимое, которое читает ИИ-агент, например в письмо или электронную таблицу, и который агент затем принимает за инструкцию. Компьютерный червь — это программа, копирующая себя из одной системы в другую. Термином «самовоспроизводящаяся инъекция промпта» OpenAI обозначает инъекцию, цель которой включает заставить целевую модель воспроизвести эту инъекцию, чтобы следующий агент, прочитав результат, получил её тоже [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/).

## Что описывает отчёт

На исследовательской странице OpenAI датой обнаружения указано 27 июня 2026 года, датой раскрытия — 25 сентября 2026 года, а агент команды для red-teaming назван GPT-Red. Там сказано, что затронутые модели были внутренними контрольными точками GPT-5.4-mini и GPT-5.5, что внешних последствий не наблюдалось и что эффекты ограничивались имитированными средами с инструментами [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). The Register, написавший об исследовании 29 сентября 2026 года, пишет, что OpenAI обнаружила это поведение, используя GPT-Red для состязательного обучения GPT-5.6 [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922).

Приведены три примера. В случае с почтой внедрённая инструкция велит модели включать вредный текст во все исходящие сообщения; по словам OpenAI, она была замаскирована под правило сортировки, требовавшее отвечать по-испански и полностью цитировать письмо [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). В случае с файлами поддельное системное предупреждение убеждает модель удалить файлы, а затем записать текст атаки в файлы рабочего пространства, чтобы он сохранился [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). The Register описывает второй пример как поддельное предупреждение внутри данных Excel [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922). В многошаговом случае модель через ряд прочтений каналов в Slack, каждое из которых выглядит законным, подводят к несанкционированным действиям, а инструкции при этом повторяются на разных платформах [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/).

В ответ, как заявляет OpenAI, она включает самовоспроизведение в число целей атакующего при обучении GPT-Red и ожидает, что будущие выпущенные модели будут устойчивее к таким атакам [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/) [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922). The Register цитирует OpenAI: компания обнаружила случаи, когда её модели GPT были подвержены «ИИ-версии атаки червя» [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922).

> FireAI — межсетевой экран для macOS от HisnLabs, работающий прямо на устройстве, — не читает, что говорят агенту. Он показывает, какое приложение куда подключается, и спрашивает, прежде чем неизвестное приложение выйдет в сеть. Доступен 17-дневный пробный период. [Download FireAI for Mac](https://hisnlabs.com/en/download)

## Выводы для пользователей Mac

Отчёт касается агентов, которые читают содержимое из нескольких источников и могут действовать на его основе; самый наглядный путь показывает пример с почтой: агент, умеющий читать и отправлять письма, получает сообщение с требованием переслать инструкцию дальше [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). Пользователь Mac затронут, только если запускает такого агента с доступом к почте, файлам или чату. В отчёте сказано, что реальных инцидентов не наблюдалось, так что это задокументированная возможность в тестовых условиях, а не сообщённая атака [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/).

## Рекомендации

1. Ограничивайте то, что может делать агент, читающий недоверенное содержимое. Агент, читающий почту, не должен одновременно уметь отправлять письма или удалять файлы без шага подтверждения.
2. Считайте текст в письмах, общих документах и чатах недоверенным, даже если он выглядит как системное уведомление или внутреннее правило [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/).
3. Проверяйте исходящие сообщения и изменения файлов, которые произвёл агент, особенно если в них есть текст, которого пользователь не писал.
4. Держите доступ агента к учётным записям и папкам узким и отзывайте его, когда он больше не нужен.

## Какое отношение это имеет к FireAI

FireAI работает на сетевом уровне Mac и не читает ни промпты, ни письма, ни содержимое зашифрованных соединений, поэтому не может распознать инъекцию промпта или помешать модели её скопировать. Он также не контролирует, что делает ИИ-сервис на собственных серверах. Для приложения-агента на Mac [сетевой фильтр](https://hisnlabs.com/en/docs/how-the-network-filter-works) определяет приложение по подписи кода, а приложение без правила вызывает запрос; [правила для отдельных приложений](https://hisnlabs.com/en/docs/per-app-rules) могут ограничить, куда оно может подключаться, а [«Исследовать»](https://hisnlabs.com/en/docs/investigate-a-connection) показывает, куда ведёт соединение.

> Инъекция промпта действует через то, что агенту разрешено делать. FireAI ограничивает на Mac одну часть этого: какие приложения могут подключаться и к каким серверам. Попробуйте бесплатно 17 дней. [Download FireAI for Mac](https://hisnlabs.com/en/download)

## Ограничения

Оба изложения опираются на собственное исследование OpenAI, а статья на arXiv, на которую ссылается The Register, для этого материала не загружалась. Источники расходятся в деталях: OpenAI называет внутренними контрольными точками GPT-5.4-mini и GPT-5.5, тогда как The Register упоминает обучение GPT-5.6, а там, где страница OpenAI описывает случай с файловой системой, The Register говорит о наборе данных Excel [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). Ни один источник не сообщает, как часто атаки удавались, затронуты ли выпущенные продукты и ведут ли себя так же агенты на моделях не от OpenAI.

Попробуйте [FireAI от HisnLabs](https://hisnlabs.com/en/download) бесплатно 17 дней.

## Sources

- [The Register, 29 September 2026: Add one more AI worry to the nightmare scenario: self-replicating prompt injections](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922)
- [OpenAI alignment research, 25 September 2026: Self-replicating prompt injections exist](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)
