Новости безопасности и искусственного интеллекта

Безопасность ИИ-агентов · Автор FireAI Security & Research Team · Опубликовано

OpenAI описывает самовоспроизводящиеся инъекции промптов — атаку на ИИ-агентов по типу червя

OpenAI сообщает об инъекциях промптов, заставляющих ИИ-агента копировать атаку в собственные ответы; они обнаружены только в обучающих средах. Что сообщается и что это значит для пользователей Mac.

Chat bubbles duplicating from one to the next, illustrating a self-replicating prompt injection spreading between AI agents.

OpenAI сообщила 25 сентября 2026 года, что некоторыми её моделями можно управлять с помощью инъекции промпта, которая заодно заставляет модель копировать эту инъекцию в собственные ответы; OpenAI сравнивает это с червём. Компания говорит, что обнаружила такое поведение в имитированных средах с инструментами и не видела ни одного инцидента за их пределами [1] [2].

Предыстория

Инъекция промпта — это текст, помещённый в содержимое, которое читает ИИ-агент, например в письмо или электронную таблицу, и который агент затем принимает за инструкцию. Компьютерный червь — это программа, копирующая себя из одной системы в другую. Термином «самовоспроизводящаяся инъекция промпта» OpenAI обозначает инъекцию, цель которой включает заставить целевую модель воспроизвести эту инъекцию, чтобы следующий агент, прочитав результат, получил её тоже [2].

Что описывает отчёт

На исследовательской странице OpenAI датой обнаружения указано 27 июня 2026 года, датой раскрытия — 25 сентября 2026 года, а агент команды для red-teaming назван GPT-Red. Там сказано, что затронутые модели были внутренними контрольными точками GPT-5.4-mini и GPT-5.5, что внешних последствий не наблюдалось и что эффекты ограничивались имитированными средами с инструментами [2]. The Register, написавший об исследовании 29 сентября 2026 года, пишет, что OpenAI обнаружила это поведение, используя GPT-Red для состязательного обучения GPT-5.6 [1].

Приведены три примера. В случае с почтой внедрённая инструкция велит модели включать вредный текст во все исходящие сообщения; по словам OpenAI, она была замаскирована под правило сортировки, требовавшее отвечать по-испански и полностью цитировать письмо [2]. В случае с файлами поддельное системное предупреждение убеждает модель удалить файлы, а затем записать текст атаки в файлы рабочего пространства, чтобы он сохранился [2]. The Register описывает второй пример как поддельное предупреждение внутри данных Excel [1]. В многошаговом случае модель через ряд прочтений каналов в Slack, каждое из которых выглядит законным, подводят к несанкционированным действиям, а инструкции при этом повторяются на разных платформах [2].

В ответ, как заявляет OpenAI, она включает самовоспроизведение в число целей атакующего при обучении GPT-Red и ожидает, что будущие выпущенные модели будут устойчивее к таким атакам [2] [1]. The Register цитирует OpenAI: компания обнаружила случаи, когда её модели GPT были подвержены «ИИ-версии атаки червя» [1].

Выводы для пользователей Mac

Отчёт касается агентов, которые читают содержимое из нескольких источников и могут действовать на его основе; самый наглядный путь показывает пример с почтой: агент, умеющий читать и отправлять письма, получает сообщение с требованием переслать инструкцию дальше [2]. Пользователь Mac затронут, только если запускает такого агента с доступом к почте, файлам или чату. В отчёте сказано, что реальных инцидентов не наблюдалось, так что это задокументированная возможность в тестовых условиях, а не сообщённая атака [1] [2].

Рекомендации

  1. Ограничивайте то, что может делать агент, читающий недоверенное содержимое. Агент, читающий почту, не должен одновременно уметь отправлять письма или удалять файлы без шага подтверждения.
  2. Считайте текст в письмах, общих документах и чатах недоверенным, даже если он выглядит как системное уведомление или внутреннее правило [2].
  3. Проверяйте исходящие сообщения и изменения файлов, которые произвёл агент, особенно если в них есть текст, которого пользователь не писал.
  4. Держите доступ агента к учётным записям и папкам узким и отзывайте его, когда он больше не нужен.

Какое отношение это имеет к FireAI

FireAI работает на сетевом уровне Mac и не читает ни промпты, ни письма, ни содержимое зашифрованных соединений, поэтому не может распознать инъекцию промпта или помешать модели её скопировать. Он также не контролирует, что делает ИИ-сервис на собственных серверах. Для приложения-агента на Mac сетевой фильтр определяет приложение по подписи кода, а приложение без правила вызывает запрос; правила для отдельных приложений могут ограничить, куда оно может подключаться, а «Исследовать» показывает, куда ведёт соединение.

Ограничения

Оба изложения опираются на собственное исследование OpenAI, а статья на arXiv, на которую ссылается The Register, для этого материала не загружалась. Источники расходятся в деталях: OpenAI называет внутренними контрольными точками GPT-5.4-mini и GPT-5.5, тогда как The Register упоминает обучение GPT-5.6, а там, где страница OpenAI описывает случай с файловой системой, The Register говорит о наборе данных Excel [1] [2]. Ни один источник не сообщает, как часто атаки удавались, затронуты ли выпущенные продукты и ведут ли себя так же агенты на моделях не от OpenAI.

Попробуйте FireAI от HisnLabs бесплатно 17 дней.

Источники

  1. The Register, 29 September 2026: Add one more AI worry to the nightmare scenario: self-replicating prompt injections
  2. OpenAI alignment research, 25 September 2026: Self-replicating prompt injections exist