Блог з безпеки FireAI

Автор FireAI Security & Research Team · Опубліковано

Найкращі інструменти 2026 року для безпеки моделей ШІ

Найкращі інструменти 2026 року для безпеки моделей ШІ

Безпека моделей ШІ — це не одна дисципліна, а шість завдань, кожне зі своїми інструментами: сканування файлів моделей, встановлення походження, пошук слабких місць моделі, захист під час виконання, перевірка агентного інструментарію навколо неї та обмеження того, куди може підключатися застосунок, що її розміщує. Цей огляд, підготовлений HisnLabs, розробником FireAI, охоплює відкриті інструменти, чиї репозиторії чи документацію прочитано 30 вересня 2026 року. Ліцензії, супровідників і статус наведено так, як їх подають першоджерела, і жоден інструмент не поставлено вище за інший, бо ці завдання не конкурують між собою.

Обсяг і методика

Інструмент включався лише тоді, коли вдавалося відкрити його офіційний репозиторій чи документацію, визначити ліцензію й перевірити стан підтримки (архівний чи активний, а також дату останнього випуску, якщо сторінка випусків її показує). Наведені нижче випуски є останніми на момент прочитання. Ніщо тут не є вимірюванням продуктивності: джерела не надають порівнянних результатів виявлення, і жодних таких не заявлено. Комерційні платформи пропущено, якщо предметом розгляду не є їхній відкритий компонент.

Категорії йдуть у тому порядку, в якому модель проходить через проєкт: файл завантажується, перевіряється його походження, модель тестується, розгортається за засобами захисту, підключається до інструментів, а застосунок, що її запускає, виходить у мережу. OWASP Top 10 for Large Language Model Applications, що підтримується в межах OWASP GenAI Security Project, є звичним спільним словником для ризиків прикладного рівня в категоріях з третьої по п’яту.

1. Сканування файлів моделей

Багато файлів моделей серіалізовано у форматі pickle мови Python, який може виконувати код під час завантаження. Документація Hugging Face зазначає, що завантаження pickle «означає, що може бути виконано код», і називає опкоди GLOBAL, STACK_GLOBAL і REDUCE такими, що становлять загрозу. Hugging Face: Pickle scanning Сканери читають інструкції файлу, не завантажуючи його, і позначають небезпечні імпорти.

ModelScan

ModelScan підтримує Protect AI за ліцензією Apache-2.0. Він сканує формати на основі pickle (PyTorch, scikit-learn, XGBoost, joblib, cloudpickle), TensorFlow SavedModel і файли Keras H5 та V3, ранжує знахідки за серйозністю й завершується з кодами, придатними для конвеєрів CI. Останній випуск на його сторінці — v0.8.8 від 18 лютого 2026 року, а репозиторій показував активність 28 вересня 2026 року. Використовуйте його як бар’єр, перш ніж завантажена модель потрапить у збірку. Обмеження: README описує виявлення на основі сигнатур, що може давати хибнопозитивні й хибнонегативні результати, і знахідки потребують перевірки людиною.

picklescan

picklescan — сканер за ліцензією MIT, який підтримує індивідуальний обліковий запис mmaitre314. Документація Hugging Face називає picklescan серед інструментів, які вона розробила для Hub. Останній випуск — v1.0.5 від 1 липня 2026 року. Він сканує файли pickle, архіви PyTorch і контейнери ZIP і може перевіряти локальний шлях, URL або модель Hugging Face. Використовуйте його для швидкої перевірки в скрипті. Обмеження: він зіставляє небезпечні операції за шаблонами, тож нова техніка може пройти, і він повідомляє про знахідки, не видаляючи їх.

fickling

fickling від Trail of Bits поширюється за ліцензією LGPL-3.0. Його описано як декомпілятор, статичний аналізатор і переписувач байткоду для pickle. Він може декомпілювати pickle в читабельний Python, перевіряти безпечність статичним аналізом і видавати помилку перед завантаженням небезпечного файлу. Останній випуск — v0.1.12 від 26 червня 2026 року. Використовуйте його, коли знахідку треба зрозуміти, а не лише позначити. Обмеження: це інструмент аналізу для pickle, і він не охоплює інших форматів, які читає ModelScan. Умови його ліцензії відрізняються від дозвільних ліцензій інших сканерів.

Сканування в Hugging Face Hub і safetensors

Hub сканує кожен завантажений файл за допомогою ClamAV і сканування імпортів pickle, яке перелічує імпорти в кожному серіалізованому файлі й виділяє підозрілі. Hugging Face: file scanning Він також показує результати стороннього сканера, Guardian від Protect AI, для публічних репозиторіїв. Hugging Face: Protect AI Обмеження, як їх формулює Hugging Face: сканування pickle не є повністю надійним, його списки підтримуються за принципом найкращих зусиль, і перевірка того, що безпечно, є відповідальністю користувача. Структурна альтернатива — safetensors, формат за ліцензією Apache-2.0, який підтримує Hugging Face і який зберігає тензори без виконуваного вмісту. Він усуває ризик pickle для ваг, але нічого не каже про те, чи заслуговують довіри самі ваги.

2. Походження, підписування та відбитки моделей

Сканування відповідає на питання, чи небезпечно завантажувати файл. Походження — на питання, хто його створив і чи змінювався він відтоді. Ці два питання потребують різних інструментів.

Sigstore model-transparency

model-transparency — проєкт за ліцензією Apache-2.0 в організації Sigstore, що підписує й перевіряє моделі машинного навчання. Він може підписувати через Sigstore або ключами, сертифікатами чи пристроями PKCS #11 і створює пакет, що містить конверт DSSE з твердженням in-toto. Останній випуск — v1.1.1 від 10 жовтня 2025 року, з комітами у вересні 2026 року. Використовуйте його, щоб споживач міг перевірити, що файли в нього — саме ті, які підписав видавець. Обмеження: документація заявляє підтримку хешування файлів і їхніх фрагментів, а не окремих тензорів, і дійсний підпис доводить походження й цілісність, а не те, що модель безпечна. Hugging Face робить те саме розрізнення для підписаних комітів, які гарантують «походження файлу», а не його безпечність.

Переліки компонентів (BOM) для ШІ та МН

CycloneDX, який підтримують OWASP Foundation і TC54 Ecma International, називає Machine Learning Bill of Materials (ML-BOM) серед підтримуваних типів BOM. Його останній випуск, 1.7, опубліковано 21 жовтня 2025 року, а схеми поширюються за Apache-2.0. Профіль ШІ SPDX 3.0 документує компоненти ШІ, як-от моделі, набори даних і промпти, в одному пов’язаному записі. Використовуйте будь-який із них для обліку того, які моделі, набори даних і версії містить продукт, — саме це насамперед потрібно під час реагування на інцидент. Обмеження: BOM фіксує те, що заявляє автор. Жоден формат не перевіряє заяви.

Дослідницькі інструменти для відбитків і водяних знаків

Instructional Fingerprinting — код академічної статті (arXiv 2401.12255), що вбудовує відбиток у мовну модель, щоб власник згодом міг перевірити, чи походить інша модель від неї. Це дослідницький код за ліцензією MIT, і репозиторій востаннє оновлювався в липні 2024 року. MarkLLM від групи THU-BPM — набір інструментів за Apache-2.0 для нанесення водяних знаків на текст, який генерує LLM, представлений як демонстрація на EMNLP 2024. Вони відповідають на різні питання: перший позначає модель, другий — її вивід. Використовуйте їх для вивчення атрибуції, а не як засіб контролю в продакшені. Обмеження: обидва є дослідницькими артефактами, і жоден не замінює підписування розповсюджуваного файлу.

3. Червоні команди для LLM і сканування вразливостей

Ці інструменти надсилають моделі чи застосунку змагальні вхідні дані й фіксують, як вони реагують. Вони тестують поведінку, а не файли.

garak

garak — сканер вразливостей LLM за ліцензією Apache-2.0, який підтримує NVIDIA. Його README каже, що він перевіряє, «чи можна змусити LLM зазнати збою небажаним для нас чином», за допомогою зондів для prompt injection, витоку даних, галюцинацій, токсичності та jailbreak, кожен у парі з детектором. Останній випуск — v0.17.0 від 9 вересня 2026 року. Використовуйте його як широке базове сканування кінцевої точки моделі. Обмеження: йому потрібен доступ через API або локальне розгортання цільової моделі, деякі зонди ресурсоємні, а README зазначає обмежену підтримку моделей комп’ютерного зору та статус прототипу для деяких зондів.

PyRIT

PyRIT — фреймворк за ліцензією MIT, описаний як створений для фахівців з безпеки та інженерів для виявлення ризиків у системах генеративного ШІ. Його підтримує Microsoft, а останній випуск — v1.1.0 від 4 вересня 2026 року. Попередній репозиторій в організації Azure архівовано 27 березня 2026 року з вказівкою на репозиторій Microsoft, тож посилання на стару адресу ведуть до копії лише для читання. Використовуйте його для скриптових багатокрокових кампаній червоної команди, якщо команда писатиме код. Обмеження: це фреймворк, а не сканер в одну команду.

promptfoo

promptfoo — інструмент командного рядка й бібліотека за ліцензією MIT для оцінювання застосунків LLM, а також для червоних команд і сканування вразливостей, з інтеграцією в CI. Останній випуск — 0.123.1 від 18 вересня 2026 року. Його README зазначає: «Promptfoo is now part of OpenAI. Promptfoo remains open source and MIT licensed.» Використовуйте його, щоб додати тести промптів і змагальні перевірки до збірки. Обмеження: результати залежать від налаштованого провайдера й моделі-судді, і більшість провайдерів потребують ключів API. Зміна власника — факт управління, який варто врахувати, обираючи інструмент для регульованої роботи.

Giskard

Giskard — бібліотека Python за ліцензією Apache-2.0 від організації Giskard-AI. Її версія 3 має два компоненти, описані як стабільні: giskard-checks, фреймворк тестування на основі сценаріїв та оцінок LLM-as-judge, і giskard-scan, сканер вразливостей агентів. Використовуйте її для тестування агентів і систем із доповненням пошуком (RAG). Обмеження: версія 3 потребує Python 3.12 або новішого, а версія 2, що охоплювала сканування табличних даних і класичного машинного навчання, більше активно не підтримується.

4. Захист під час виконання та виявлення prompt injection

Засоби захисту (guardrails) розташовані на шляху запиту й класифікують або обмежують вхідні та вихідні дані під час роботи застосунку.

Llama Guard, Prompt Guard і LlamaFirewall

Проєкт Meta Purple Llama об’єднує засоби захисту для відкритих моделей. Llama Guard — родина моделей модерації вхідних і вихідних даних. Prompt Guard 2 описано як легкий класифікатор прямих спроб prompt injection, а LlamaFirewall поєднує його зі сканером перевірки узгодженості та сканером коду для агентів. За таблицею ліцензій проєкту, моделі поширюються за Llama Community Licences, а інші компоненти, як-от Code Shield та оцінювання, — за MIT. Моделі на Hugging Face доступні за запитом. Використовуйте їх там, де прийнятний невеликий класифікатор перед моделлю. Обмеження: класифікатор зменшує кількість спроб, що схожі на відомі шаблони, але не усуває сам клас атак.

NeMo Guardrails

NeMo Guardrails — набір інструментів за Apache-2.0 від NVIDIA для додавання програмованих обмежень (rails) до застосунків LLM за допомогою мови моделювання Colang, що керує ходом діалогу. Останній випуск — v0.24.1 від 16 вересня 2026 року. Використовуйте його, щоб обмежити теми, формати й шляхи діалогу. Обмеження: rails — це політика, написана розробником, тож їхнє охоплення таке широке, як те, що було передбачено.

Rebuff і LLM Guard, тепер в архіві

Rebuff, самозміцнювальний детектор prompt injection з евристиками, перевіркою через LLM, векторним сховищем минулих атак і canary-токенами, архівовано 16 травня 2025 року. Його README зазначає, що це прототип і він не може забезпечити повного захисту від prompt injection. LLM Guard, набір сканерів вхідних і вихідних даних за ліцензією MIT від того самого супровідника, архівовано в липні 2026 року. Обидва залишаються доступними для читання як довідка. Вони ілюструють практичний момент: проєкти детекторів можуть утратити супровідників, тож засіб захисту має бути замінним.

5. Сканери безпеки агентів і MCP

Агенти додають інструменти, а описи інструментів — це текст, який читає модель. Сканери цієї групи перевіряють цей інструментарій і його конфігурацію.

Snyk Agent Scan

Agent Scan, раніше MCP-Scan, — сканер за Apache-2.0, який підтримує Snyk. Він виявляє компоненти агентів на машині, зокрема сервери MCP і навички в таких клієнтах, як Claude, Cursor, VS Code і GitHub Copilot, і перевіряє їх на prompt injection, отруєння інструментів і пов’язані проблеми. Останній випуск — v0.6.8 від 29 вересня 2026 року. Використовуйте його для аудиту того, що встановлено на машині розробника. Обмеження: README зазначає, що наразі він не приймає зовнішніх внесків і що існують дві лінії випусків з різними форматами виводу.

Cisco MCP Scanner

MCP Scanner — інструмент за Apache-2.0 від Cisco AI Defense. Він аналізує інструменти, промпти, ресурси й залежності MCP трьома рушіями, що можуть працювати окремо чи разом: правила YARA, аналіз через LLM та Cisco AI Defense API. Останній випуск — 4.8.4 від 28 серпня 2026 року. Використовуйте його для перевірки сервера перед впровадженням. Обмеження: рушії LLM і API потребують зовнішніх облікових даних, а сканування опису сервера мало що каже про те, що робить його код після оновлення.

6. Місце мережевого контролю

Наведені вище інструменти перевіряють файли, моделі, промпти й конфігурації. Жоден із них не вирішує, яка програма може відкрити з’єднання з яким сервером. Це роль контролю вихідного трафіку, і вона важлива, бо ризики з попередніх розділів сходяться в мережі: підроблене середовище виконання моделі, отруєний інструмент чи агент з ін’єкцією мають дістатися певної адреси, щоб вивести дані чи отримати інструкції.

FireAI, розроблений HisnLabs, — фаєрвол вихідного трафіку для macOS. Він працює як фільтр вмісту Apple Network Extension, ідентифікує кожну програму за її підписом коду й може дозволяти, блокувати або запитувати для кожної адреси, з правилами для програми, домену чи адреси. У застосуванні до роботи з ШІ на Mac це означає, що сервер інференсу, агента для програмування чи клієнт MCP можна обмежити адресами, потрібними для його завдання, а нова адреса вимагає рішення. Документація фільтра описує, що бачить FireAI: ідентичність програми, віддалений хост чи адресу, порт і протокол.

FireAI не сканує файлів моделей, не перевіряє підписів, не проводить тестування червоною командою й не класифікує промптів. Він не читає вмісту зашифрованих з’єднань, тож не може відрізнити легітимний запит від ін’єкції, коли обидва йдуть до дозволеної адреси. Він доповнює наведені вище інструменти й не замінює жодного з них.

Порівняння

Джерела: репозиторій або документація кожного проєкту, прочитані 30 вересня 2026 року. Статус відображає сторінку репозиторію, а не оцінку якості.
ІнструментЗавданняСупровідникЛіцензіяСтатус на 30 вер. 2026
ModelScanСканування файлів моделейProtect AIApache-2.0Активний, v0.8.8
picklescanСканування picklemmaitre314MITАктивний, v1.0.5
ficklingАналіз pickleTrail of BitsLGPL-3.0Активний, v0.1.12
safetensorsБезпечний формат вагHugging FaceApache-2.0Активний
model-transparencyПідписування моделейSigstoreApache-2.0Активний, v1.1.1
CycloneDXСпецифікація ML-BOMOWASP, Ecma TC54Apache-2.0 (схеми)Активний, 1.7
Instructional FingerprintingВідбиток моделі (дослідження)Автори статтіMITОстаннє оновлення — липень 2024
MarkLLMВодяні знаки в тексті (дослідження)THU-BPMApache-2.0Активний
garakСканування вразливостейNVIDIAApache-2.0Активний, v0.17.0
PyRITФреймворк червоної командиMicrosoftMITАктивний, v1.1.0
promptfooОцінювання та червоні командиPromptfoo, у складі OpenAIMITАктивний, 0.123.1
Giskard v3Тести й сканування агентівGiskard-AIApache-2.0Активний; v2 не підтримується
Llama Guard, Prompt GuardЗахисні моделіMetaLlama Community LicencesМоделі датовано квітнем 2025
NeMo GuardrailsПрограмовані railsNVIDIAApache-2.0Активний, v0.24.1
Rebuff, LLM GuardВиявлення ін’єкційProtect AIApache-2.0, MITВ архіві
Agent ScanСканування агентів і MCPSnykApache-2.0Активний, v0.6.8
MCP ScannerСканування серверів MCPCisco AI DefenseApache-2.0Активний, 4.8.4
FireAIКонтроль вихідного трафіку для кожної програми на macOSHisnLabsКомерційнаНе сканує моделей

Обмеження

  • Жоден окремий інструмент не охоплює всіх шести завдань. Чисте сканування файлу нічого не каже про поведінку моделі, підпис нічого не каже про безпечність, а сканування червоною командою нічого не каже про вміст файлу.
  • Сканери й засоби захисту — це детектори. Вони можуть пропускати нові техніки, що визнає документація ModelScan, picklescan і Rebuff, і їхнє охоплення змінюється разом зі зміною атак.
  • Підтримка нерівномірна. Два проєкти детекторів із цього переліку архівовано, один інструмент змінив власника, один має індивідуального супровідника, а один дослідницький репозиторій не змінювався з 2024 року. Перевірте стан проєкту, перш ніж на нього спиратися.
  • Цей огляд обмежено відкритими інструментами з першоджерелами, які вдалося прочитати. Він не охоплює комерційних платформ і не порівнює результатів виявлення, бо джерела не дають порівнянних цифр.
  • Ліцензії прочитано зі сторінок репозиторіїв і таблиць ліцензій. Перевірте їх перед повторним поширенням, зокрема Llama Community Licences та умови LGPL для fickling.
  • Мережевий рівень бачить з’єднання, а не зміст. Дозволена адреса все одно може отримати дані від скомпрометованого середовища виконання моделі.

Яке місце тут посідають FireAI та HisnLabs

Скануйте модель, підписуйте модель, тестуйте модель. Потім вирішуйте, куди може підключатися її застосунок.

FireAI — це власний продукт HisnLabs: ШІ-фаєрвол, який працює безпосередньо на вашому Mac. Він показує простою мовою кожне з’єднання, яке встановлюють ваші застосунки, і дає вам вирішувати, що покидає ваш Mac, — його ШІ працює локально, тож ваш трафік ніколи не надсилається ні нам, ні будь-кому іншому. Команда дослідників безпеки HisnLabs — саме вона підтримує точність цих рішень: каталогізує, які домени є звичайною телеметрією, а які — справжнім сервісом, відстежує країну та мережу за з’єднанням і навчає локальну модель (функцію FireAI Pilot) на реальних шаблонах трафіку — і нічого з цього не покидає ваш Mac.

Ви можете почитати про технічні рішення, що лежать в його основі, або спробувати FireAI протягом 17 днів на сторінці FireAI від HisnLabs.

Джерела