Новини безпеки та ШІ

Безпека API мовних моделей · Автор FireAI Security & Research Team · Опубліковано

OpenAI зупинила кампанію з видобування міркувань, яка зловживала взаємозамінними зашифрованими трасами міркувань

OpenAI повідомляє, що 28 липня 2026 року зупинила кампанію дистиляції, а дослідження показує, що зашифровані траси міркувань в API LLM взаємозамінні.

A key icon and the FireAI research mascot, illustrating OpenAI disrupting a campaign that extracted protected reasoning from its models.

The Hacker News 1 жовтня 2026 року повідомило, що OpenAI зупинила скоординовану кампанію дистиляції, спрямовану на захищені міркування її моделей, і що OpenAI пов’язала основний кластер цієї діяльності з особами, асоційованими з Moonshot AI [1]. Дослідницька стаття, подана на arXiv 10 серпня 2026 року, описує слабкість, що лежить в основі: зашифровані траси міркувань, взаємозамінні між сесіями, користувачами й моделями [2]. Матеріал стосується безпеки API мовних моделей, до яких багато користувачів Mac звертаються через застосунки й агентів.

Передумови

Стаття пояснює, що великі постачальники LLM повертають покрокові міркування моделі у вигляді блоків зашифрованого тексту, які клієнт передає назад із кожним наступним запитом [2]. Дистиляція, як її описує The Hacker News, — це систематичне видобування відповідей однієї моделі для навчання чи вдосконалення іншої [1].

Результати

За звітом, діяльність почалася 1 липня 2026 року з малого обсягу, досягла піку 24 і 25 липня, коли понад 4 000 окремих користувачів здійснили 16 000 спроб запитів за шаблоном видобування, і була повністю зупинена 28 липня 2026 року [1]. Пов’язану активність із подібними шаблонами промптів виявлено в понад 15 000 окремих користувачів [1].

Звіт цитує заяву OpenAI, що оператори не зламували її шифрування, не компрометували базу даних і не отримували прямого доступу до збережених розмов користувачів, а натомість маніпулювали взаємодією з моделлю так, щоб захищені міркування можна було відтворити у формі, видимій для того, хто робить запит [1]. OpenAI заблокувала причетні шахрайські облікові записи, закрила шлях, що дозволяв користувачам повторно надсилати зашифровані міркування й відновлювати їхній вміст, і додала перевірки, які виявляють і затримують потоковий вивід, що може розкрити міркування [1].

The Hacker News зазначає, що OpenAI, посилаючись на міркування безпеки, не надала технічних доказів атрибуції Moonshot AI, компанії з Пекіна, і що стаття не містить відповіді Moonshot AI [1]. Видання також нагадує, що минулого місяця Anthropic звинуватила Moonshot AI в ретрансляції запитів клієнтів до Claude; ця діяльність відстежується як GTG-16002 [1].

Стаття на arXiv повідомляє, що зашифровані блоки повністю сумісні й взаємозамінні між різними сесіями, користувачами й моделями, і демонструє чотири атаки: дистиляцію моделі шляхом вставляння зашифрованих трас у слабші моделі, видобування даних, розкриття прихованого небезпечного вмісту та невидиму ін’єкцію промптів в агентні системи [2]. У випадку видобування даних автори відновили 367 артефактів з персональними даними та 182 облікові дані з 315 320 блоків міркувань, зібраних із публічних репозиторіїв [2]. У статті зазначено, що дослідження передбачало відповідальне розкриття, і запропоновано криптографічні та системні заходи пом’якшення [2].

Наслідки для користувачів Mac

Кампанія була спрямована на відповіді моделей постачальника, а не на пристрої його користувачів, і джерела не повідомляють, що в її межах розкрито розмову будь-якого користувача [1]. Стаття важлива для людей, які користуються ШІ-агентами, бо одна з її чотирьох атак — невидима ін’єкція промптів в агентні системи, а також тому, що автори знайшли облікові дані й персональні дані в блоках міркувань, опублікованих у публічних репозиторіях [2].

Рекомендації

  1. Не зберігайте ключі API постачальників у репозиторіях і спільних журналах та відкличте будь-який ключ, що потрапив у відкритий доступ.
  2. Зберігаючи чи поширюючи журнали сесій ШІ, видаляйте блоки міркувань та інші повернені постачальником поля, які не потрібні застосунку.
  3. Перегляньте дозволи, надані ШІ-агентові, адже стаття містить атаку на агентні системи.
  4. Стежте за оголошеннями постачальників про зміни в обробці міркувань в API, якими ви користуєтеся.
  5. Команді, що будує продукти на цих API, варто ознайомитися із запропонованими в статті заходами пом’якшення, перш ніж проєктувати зберігання сесій [2].

Стосунок до FireAI

FireAI не обслуговує й не захищає API моделей. На Mac він ідентифікує застосунок за підписом коду й застосовує правила для застосунків до кожного з’єднання, а профіль агентів позначає найперше нове призначення чи сплеск вивантаження даних від агентних застосунків, як-от Claude Code і Cursor, використовуючи лише імена хостів і кількість байтів. Власна необов’язкова модель ШІ на пристрої FireAI завантажується один раз із Hugging Face і далі працює лише на Mac.

FireAI не бачить вмісту зашифрованого з’єднання, тож не може прочитати блок міркувань, промпт чи відповідь моделі. Він не виявляє дистиляції, не контролює, що повертає постачальник, і не заважає авторизованому обліковому запису надсилати запити до API.

Обмеження

Опис кампанії спирається на виклад заяви OpenAI в The Hacker News; саму заяву для цього матеріалу отримати не вдалося [1]. Атрибуція Moonshot AI — це оцінка OpenAI без опублікованих технічних доказів. Стаття є препринтом; цей матеріал спирався на її анотацію й не перевіряв її результатів незалежно [2]. Джерела не повідомляють, які постачальники змінили свої API, окрім наведених заходів OpenAI.

Спробуйте FireAI від HisnLabs безкоштовно 17 днів.

Джерела

  1. The Hacker News, 1 October 2026: OpenAI disrupts reasoning extraction campaign linked to Moonshot AI associates
  2. arXiv, 10 August 2026: Stealing Reasoning Traces from Proprietary LLM APIs (Panfilov et al.)