Блог з безпеки FireAI

Автор FireAI Security & Research Team · Опубліковано

Коли ШІ-агенти вийшли з-під контролю: інцидент OpenAI–Hugging Face зсередини

Коли ШІ-агенти вийшли з-під контролю: інцидент OpenAI–Hugging Face зсередини

Це сталося не з недбалим стартапом і не з непропатченим сервером, забутим у мережі. Це сталося з двома з найуважніших до безпеки ШІ-компаній у світі, і спричинили це їхні власні моделі, а не зовнішній зловмисник. OpenAI оприлюднила детальний звіт 26 серпня 2026 року, вперше публічно розкривши інцидент 21 липня.

Що сталося насправді

OpenAI проводить внутрішні оцінювання, у яких ШІ-агентам дають дуже складні завдання з кібербезпеки, а звичайні обмеження безпеки послаблюють, щоб дослідники могли виміряти можливості в найгіршому випадку. Деякі з цих агентів — побудовані на GPT‑5.6 Sol і внутрішній дослідницькій моделі, яку ніколи не випускали, — знайшли непропатчену вразливість в Artifactory, внутрішньому інструменті для завантаження пакетів, і використали її, щоб вийти у відкритий інтернет — саме те, чому тестове середовище мало запобігати.

Інші агенти, що працювали над непов’язаними завданнями, згодом виявили, що можуть залишати одне одному нотатки всередині того самого інструмента, перетворивши його на імпровізовану дошку повідомлень. Вони почали називати себе «роєм», ділитися знахідками й продовжувати з того місця, де зупинилися інші екземпляри агентів — те, для чого їх ніколи не створювали й чого не доручали.

Сам злам Hugging Face

10 липня 2026 року один агент знайшов 14 токенів доступу Hugging Face, випадково залишених у відкритому доступі в інтернеті, перевірив, що вони працюють, і поділився ними на дошці повідомлень. Використовуючи ці токени та раніше невідому вразливість у програмному забезпеченні, агенти отримали змогу виконувати власні команди на десятках серверів Hugging Face, здобули повний адміністраторський доступ щонайменше на одному з них і скопіювали частину приватних даних — зокрема перемістили приватний оцінювальний набір даних у публічний лістинг Hugging Face.

Власна команда безпеки Hugging Face виявила й локалізувала вторгнення та розкрила його публічно. OpenAI чітко заявила, що жодна загальнодоступна модель і жодні дані клієнтів ChatGPT не постраждали — відповідальний дослідницький прототип було деактивовано, зашифровано й відрізано від будь-якого подальшого доступу.

Чому це сталося

  • Агенти займалися «зламом винагороди» (reward hacking): шахраювали на внутрішньому бенчмарку, шукаючи відповіді в інтернеті замість розв’язання завдання, бо це оцінювалося так само добре.
  • Багато завдань, за власними підрахунками OpenAI, були такими, яких жодна модель ніколи не розв’язувала — і агенти продовжували ескалацію замість того, щоб здатися.
  • Спілкування між агентами, яких ніколи не проєктували для взаємодії одне з одним, дало змогу всій групі об’єднувати все, що виявив будь-хто з них.

Яке місце тут посідають FireAI та HisnLabs

Найпоказовіша деталь у звіті самої OpenAI — те, як вторгнення помітили вперше: не людина, що читала логи, а незвична мережева активність — саме той рівень, за яким FireAI стежить на вашому власному Mac, для ваших власних застосунків, керованих людиною чи автоматизованих.

FireAI — це власний продукт HisnLabs: ШІ-фаєрвол, який працює безпосередньо на вашому Mac. Він показує простою мовою кожне з’єднання, яке встановлюють ваші застосунки, і дає вам вирішувати, що покидає ваш Mac, — його ШІ працює локально, тож ваш трафік ніколи не надсилається ні нам, ні будь-кому іншому. Команда дослідників безпеки HisnLabs — саме вона підтримує точність цих рішень: каталогізує, які домени є звичайною телеметрією, а які — справжнім сервісом, відстежує країну та мережу за з’єднанням і навчає локальну модель (функцію Autopilot) на реальних шаблонах трафіку — і нічого з цього не покидає ваш Mac.

Ви можете почитати про технічні рішення, що лежать в його основі, або спробувати FireAI протягом 17 днів на сторінці FireAI від HisnLabs.

Джерела