The Hacker News 1 жовтня 2026 року повідомило, що OpenAI зупинила скоординовану кампанію дистиляції, спрямовану на захищені міркування її моделей, і що OpenAI пов’язала основний кластер цієї діяльності з особами, асоційованими з Moonshot AI [1]. Дослідницька стаття, подана на arXiv 10 серпня 2026 року, описує слабкість, що лежить в основі: зашифровані траси міркувань, взаємозамінні між сесіями, користувачами й моделями [2]. Матеріал стосується безпеки API мовних моделей, до яких багато користувачів Mac звертаються через застосунки й агентів.
Передумови
Стаття пояснює, що великі постачальники LLM повертають покрокові міркування моделі у вигляді блоків зашифрованого тексту, які клієнт передає назад із кожним наступним запитом [2]. Дистиляція, як її описує The Hacker News, — це систематичне видобування відповідей однієї моделі для навчання чи вдосконалення іншої [1].
Результати
За звітом, діяльність почалася 1 липня 2026 року з малого обсягу, досягла піку 24 і 25 липня, коли понад 4 000 окремих користувачів здійснили 16 000 спроб запитів за шаблоном видобування, і була повністю зупинена 28 липня 2026 року [1]. Пов’язану активність із подібними шаблонами промптів виявлено в понад 15 000 окремих користувачів [1].
Звіт цитує заяву OpenAI, що оператори не зламували її шифрування, не компрометували базу даних і не отримували прямого доступу до збережених розмов користувачів, а натомість маніпулювали взаємодією з моделлю так, щоб захищені міркування можна було відтворити у формі, видимій для того, хто робить запит [1]. OpenAI заблокувала причетні шахрайські облікові записи, закрила шлях, що дозволяв користувачам повторно надсилати зашифровані міркування й відновлювати їхній вміст, і додала перевірки, які виявляють і затримують потоковий вивід, що може розкрити міркування [1].
The Hacker News зазначає, що OpenAI, посилаючись на міркування безпеки, не надала технічних доказів атрибуції Moonshot AI, компанії з Пекіна, і що стаття не містить відповіді Moonshot AI [1]. Видання також нагадує, що минулого місяця Anthropic звинуватила Moonshot AI в ретрансляції запитів клієнтів до Claude; ця діяльність відстежується як GTG-16002 [1].
Стаття на arXiv повідомляє, що зашифровані блоки повністю сумісні й взаємозамінні між різними сесіями, користувачами й моделями, і демонструє чотири атаки: дистиляцію моделі шляхом вставляння зашифрованих трас у слабші моделі, видобування даних, розкриття прихованого небезпечного вмісту та невидиму ін’єкцію промптів в агентні системи [2]. У випадку видобування даних автори відновили 367 артефактів з персональними даними та 182 облікові дані з 315 320 блоків міркувань, зібраних із публічних репозиторіїв [2]. У статті зазначено, що дослідження передбачало відповідальне розкриття, і запропоновано криптографічні та системні заходи пом’якшення [2].
Наслідки для користувачів Mac
Кампанія була спрямована на відповіді моделей постачальника, а не на пристрої його користувачів, і джерела не повідомляють, що в її межах розкрито розмову будь-якого користувача [1]. Стаття важлива для людей, які користуються ШІ-агентами, бо одна з її чотирьох атак — невидима ін’єкція промптів в агентні системи, а також тому, що автори знайшли облікові дані й персональні дані в блоках міркувань, опублікованих у публічних репозиторіях [2].
Рекомендації
- Не зберігайте ключі API постачальників у репозиторіях і спільних журналах та відкличте будь-який ключ, що потрапив у відкритий доступ.
- Зберігаючи чи поширюючи журнали сесій ШІ, видаляйте блоки міркувань та інші повернені постачальником поля, які не потрібні застосунку.
- Перегляньте дозволи, надані ШІ-агентові, адже стаття містить атаку на агентні системи.
- Стежте за оголошеннями постачальників про зміни в обробці міркувань в API, якими ви користуєтеся.
- Команді, що будує продукти на цих API, варто ознайомитися із запропонованими в статті заходами пом’якшення, перш ніж проєктувати зберігання сесій [2].
Стосунок до FireAI
FireAI не обслуговує й не захищає API моделей. На Mac він ідентифікує застосунок за підписом коду й застосовує правила для застосунків до кожного з’єднання, а профіль агентів позначає найперше нове призначення чи сплеск вивантаження даних від агентних застосунків, як-от Claude Code і Cursor, використовуючи лише імена хостів і кількість байтів. Власна необов’язкова модель ШІ на пристрої FireAI завантажується один раз із Hugging Face і далі працює лише на Mac.
FireAI не бачить вмісту зашифрованого з’єднання, тож не може прочитати блок міркувань, промпт чи відповідь моделі. Він не виявляє дистиляції, не контролює, що повертає постачальник, і не заважає авторизованому обліковому запису надсилати запити до API.
Обмеження
Опис кампанії спирається на виклад заяви OpenAI в The Hacker News; саму заяву для цього матеріалу отримати не вдалося [1]. Атрибуція Moonshot AI — це оцінка OpenAI без опублікованих технічних доказів. Стаття є препринтом; цей матеріал спирався на її анотацію й не перевіряв її результатів незалежно [2]. Джерела не повідомляють, які постачальники змінили свої API, окрім наведених заходів OpenAI.
Спробуйте FireAI від HisnLabs безкоштовно 17 днів.