OpenAI повідомила 25 вересня 2026 року, що деякими її моделями можна керувати за допомогою ін’єкції промпту, яка водночас змушує модель копіювати ін’єкцію у власні відповіді, що OpenAI порівнює з хробаком. Компанія каже, що виявила таку поведінку в змодельованих середовищах з інструментами і не бачила жодного інциденту поза ними [1] [2].
Передумови
Ін’єкція промпту — це текст, розміщений у вмісті, який читає агент ШІ, наприклад у листі чи електронній таблиці, і який агент потім сприймає як інструкцію. Комп’ютерний хробак — це програма, що копіює сама себе з однієї системи в іншу. OpenAI вживає термін «самовідтворювана ін’єкція промпту» для ін’єкції, мета якої включає змусити цільову модель відтворити цю ін’єкцію, щоб наступний агент, який прочитає вихідні дані, теж її отримав [2].
Що описує звіт
На дослідницькій сторінці OpenAI датою виявлення названо 27 червня 2026 року, а датою розкриття — 25 вересня 2026 року, і названо агента команди для red-teaming GPT-Red. Там сказано, що вражені моделі були внутрішніми контрольними точками GPT-5.4-mini і GPT-5.5, що зовнішнього впливу не спостерігали, а наслідки обмежувалися змодельованими середовищами з інструментами [2]. The Register, який повідомив про дослідження 29 вересня 2026 року, пише, що OpenAI виявила таку поведінку, коли використовувала GPT-Red для змагального навчання GPT-5.6 [1].
Наведено три приклади. У випадку з електронною поштою вставлена інструкція велить моделі додавати зловмисний текст до всіх вихідних повідомлень; OpenAI каже, що її замаскували під правило архівування, яке вимагало відповідати іспанською та повністю цитувати лист [2]. У випадку з файлами фальшиве системне попередження переконує модель видалити файли, а потім записати текст атаки у файли робочого простору, щоб він зберігався [2]. The Register описує другий приклад як фальшиве попередження всередині даних Excel [1]. У випадку з багатьма стрибками модель крок за кроком спрямовують через серію прочитаних каналів Slack, кожне з яких виглядає легітимним, до несанкціонованих дій, поки інструкції повторюються на різних платформах [2].
У відповідь OpenAI заявляє, що додає самовідтворення як один з аспектів цілей зловмисника в навчання GPT-Red, і очікує, що майбутні випущені моделі будуть стійкішими до таких атак [2] [1]. The Register цитує OpenAI, яка каже, що виявила випадки, коли її моделі GPT були вразливими до «ШІ-версії атаки хробака» [1].
Наслідки для користувачів Mac
Звіт стосується агентів, які читають вміст з кількох джерел і можуть діяти на його основі; найочевидніший шлях показує приклад з поштою: агент, що вміє читати й надсилати пошту, отримує повідомлення, яке велить йому переслати інструкцію далі [2]. Користувача Mac це зачіпає лише якщо він запускає такого агента з доступом до пошти, файлів чи чатів. Звіт стверджує, що жодного реального інциденту не спостерігали, тож це задокументована можливість у тестових умовах, а не повідомлена атака [1] [2].
Рекомендації
- Обмежуйте, що може робити агент, який читає недовірений вміст. Агент, що читає пошту, не повинен водночас мати змогу надсилати листи чи видаляти файли без кроку підтвердження.
- Сприймайте текст у листах, спільних документах і чат-каналах як недовірений, навіть якщо він виглядає як системне повідомлення чи внутрішнє правило [2].
- Переглядайте вихідні повідомлення та зміни у файлах, створені агентом, особливо коли вони містять текст, якого користувач не писав.
- Тримайте доступ агента до акаунтів і папок вузьким і скасовуйте його, коли він більше не потрібен.
Стосунок до FireAI
FireAI працює на мережевому рівні Mac і не читає промптів, листів чи вмісту зашифрованих з’єднань, тому не може розпізнати ін’єкцію промпту чи завадити моделі її скопіювати. Він також не контролює, що ШІ-сервіс робить на власних серверах. Для застосунку-агента на Mac мережевий фільтр ідентифікує застосунок за підписом коду, а застосунок без правила викликає запит, правила для окремих застосунків можуть обмежити, куди він може з’єднуватися, а Дослідження показує, куди веде з’єднання.
Обмеження
Обидва виклади спираються на власне дослідження OpenAI, а статтю на arXiv, на яку посилається The Register, для цього матеріалу не отримували. Джерела розходяться в деталях: OpenAI називає внутрішніми контрольними точками GPT-5.4-mini і GPT-5.5, тоді як The Register згадує навчання GPT-5.6, а також The Register описує набір даних Excel там, де сторінка OpenAI описує випадок із файловою системою [1] [2]. Жодне з джерел не вказує, як часто атаки були успішними, чи вражені випущені продукти і чи поводяться так само агенти поза моделями OpenAI.
Спробуйте FireAI від HisnLabs безкоштовно 17 днів.