Блог о безопасности FireAI

Автор FireAI Security & Research Team · Опубликовано

Лучшие инструменты 2026 года для безопасности моделей ИИ

Лучшие инструменты 2026 года для безопасности моделей ИИ

Безопасность моделей ИИ — это не одна дисциплина, а шесть задач, у каждой из которых свои инструменты: сканирование файлов моделей, установление происхождения, поиск слабых мест модели, защита во время выполнения, проверка агентного инструментария вокруг неё и ограничение того, куда может подключаться приложение, в котором она работает. Этот обзор, подготовленный HisnLabs, разработчиком FireAI, охватывает открытые инструменты, репозитории или документация которых были изучены 30 сентября 2026 года. Лицензии, сопровождающие и статус указаны так, как их приводят первоисточники, и ни один инструмент не ставится выше другого, поскольку задачи не конкурируют между собой.

Охват и методика

Инструмент включался в обзор только в том случае, если удалось открыть его официальный репозиторий или документацию, установить лицензию и проверить состояние сопровождения (архивирован или активен, а также дату последнего выпуска, если страница выпусков её показывает). Указанные ниже выпуски — последние на момент изучения. Здесь нет измерений производительности: источники не дают сопоставимых результатов обнаружения, и таких утверждений не делается. Коммерческие платформы не рассматриваются, если только предметом обзора не является их открытый компонент.

Категории следуют порядку, в котором модель проходит через проект: файл загружается, проверяется его происхождение, модель тестируется, развёртывается за защитными механизмами, подключается к инструментам, и приложение, в котором она работает, выходит в сеть. OWASP Top 10 for Large Language Model Applications, который ведётся в рамках OWASP GenAI Security Project, — обычный общий словарь для рисков прикладного уровня в категориях с третьей по пятую.

1. Сканирование файлов моделей

Многие файлы моделей сериализуются в формате Python pickle, который может выполнять код при загрузке. В документации Hugging Face сказано, что загрузка pickle «означает, что может быть выполнен код», а угрозу представляют опкоды GLOBAL, STACK_GLOBAL и REDUCE. Hugging Face: Pickle scanning Сканеры читают инструкции файла, не загружая его, и помечают опасные импорты.

ModelScan

ModelScan сопровождается Protect AI и распространяется по лицензии Apache-2.0. Он сканирует форматы на основе pickle (PyTorch, scikit-learn, XGBoost, joblib, cloudpickle), TensorFlow SavedModel и файлы Keras H5 и V3, ранжирует находки по степени серьёзности и завершается с кодами возврата, удобными для конвейеров CI. Последний выпуск на его странице — v0.8.8 от 18 февраля 2026 года; активность в репозитории отмечалась 28 сентября 2026 года. Его стоит использовать как контрольную точку до того, как загруженная модель попадёт в сборку. Ограничение: README описывает обнаружение на основе сигнатур, которое может давать ложноположительные и ложноотрицательные результаты, и находки требуют проверки человеком.

picklescan

picklescan — сканер под лицензией MIT, который сопровождает частная учётная запись mmaitre314. В документации Hugging Face picklescan назван среди инструментов, разработанных для Hub. Последний выпуск — v1.0.5 от 1 июля 2026 года. Он сканирует файлы pickle, архивы PyTorch и ZIP-контейнеры и может проверять локальный путь, URL или модель на Hugging Face. Подходит для быстрой проверки в скрипте. Ограничение: он сопоставляет опасные операции по шаблону, поэтому новая техника может пройти незамеченной, и он сообщает о находках, не удаляя их.

fickling

fickling от Trail of Bits распространяется по лицензии LGPL-3.0. Он описан как декомпилятор, статический анализатор и переписчик байт-кода для pickle. Он может декомпилировать pickle в читаемый Python, проверять безопасность с помощью статического анализа и выдавать ошибку до загрузки небезопасного файла. Последний выпуск — v0.1.12 от 26 июня 2026 года. Подходит, когда находку нужно понять, а не только пометить. Ограничение: это инструмент анализа pickle, и он не охватывает другие форматы, которые читает ModelScan. Условия его лицензии отличаются от разрешительных лицензий остальных сканеров.

Сканирование на Hugging Face Hub и safetensors

Hub сканирует каждый загруженный файл с помощью ClamAV и сканера импортов pickle, который перечисляет импорты внутри каждого pickle-файла и выделяет подозрительные. Hugging Face: file scanning Он также показывает для публичных репозиториев результаты стороннего сканера — Guardian от Protect AI. Hugging Face: Protect AI Ограничение, как его формулирует сама Hugging Face: сканирование pickle не даёт полной гарантии, его списки ведутся по мере возможности, а проверка безопасности остаётся ответственностью пользователя. Структурная альтернатива — safetensors, формат под лицензией Apache-2.0, поддерживаемый Hugging Face, который хранит тензоры без исполняемого содержимого. Он устраняет риск pickle для весов, но ничего не говорит о том, заслуживают ли доверия сами веса.

2. Происхождение, подпись и цифровые отпечатки моделей

Сканирование отвечает на вопрос, опасно ли загружать файл. Проверка происхождения отвечает на вопрос, кто его создал и изменился ли он с тех пор. Для этих двух вопросов нужны разные инструменты.

Sigstore model-transparency

model-transparency — проект под лицензией Apache-2.0 в организации Sigstore, который подписывает и проверяет модели машинного обучения. Он может подписывать через Sigstore либо с помощью ключей, сертификатов или устройств PKCS #11 и формирует пакет, содержащий конверт DSSE с утверждением in-toto. Последний выпуск — v1.1.1 от 10 октября 2025 года, коммиты продолжались в сентябре 2026 года. Подходит, чтобы потребитель мог убедиться, что имеющиеся у него файлы — те самые, что подписал издатель. Ограничения: в документации заявлена поддержка хеширования файлов и их фрагментов, но не отдельных тензоров, а действительная подпись доказывает происхождение и целостность, но не безопасность модели. Hugging Face проводит то же различие для подписанных коммитов, которые гарантируют «происхождение файла», но не его безопасность.

Спецификации компонентов (BOM) для ИИ и МО

CycloneDX, который поддерживают OWASP Foundation и технический комитет TC54 Ecma International, включает Machine Learning Bill of Materials (ML-BOM) в число поддерживаемых типов BOM. Последний выпуск, 1.7, опубликован 21 октября 2025 года; его схемы распространяются по лицензии Apache-2.0. Профиль SPDX 3.0 для ИИ документирует компоненты ИИ — модели, наборы данных и промпты — в одной связанной записи. Любой из форматов подходит для учёта того, какие модели, наборы данных и версии входят в продукт, — а это первое, что нужно при реагировании на инцидент. Ограничение: BOM фиксирует то, что заявляет автор. Ни один из форматов не проверяет это заявление.

Исследовательские инструменты для цифровых отпечатков и водяных знаков

Instructional Fingerprinting — код научной статьи (arXiv 2401.12255), который встраивает цифровой отпечаток в языковую модель, чтобы владелец мог впоследствии проверить, произведена ли от неё другая модель. Это исследовательский код под лицензией MIT; последнее обновление репозитория было в июле 2024 года. MarkLLM от группы THU-BPM — набор инструментов под лицензией Apache-2.0 для нанесения водяных знаков на текст, генерируемый LLM, представленный как демонстрация на EMNLP 2024. Они отвечают на разные вопросы: первый маркирует модель, второй — её вывод. Их стоит использовать для изучения атрибуции, а не как механизм контроля в продакшене. Ограничение: оба являются исследовательскими артефактами, и ни один не заменяет подписи распространяемого файла.

3. Ред-тиминг LLM и сканирование уязвимостей

Эти инструменты отправляют модели или приложению состязательные входные данные и фиксируют реакцию. Они проверяют поведение, а не файлы.

garak

garak — сканер уязвимостей LLM под лицензией Apache-2.0, который сопровождает NVIDIA. Согласно его README, он проверяет, «можно ли заставить LLM дать сбой нежелательным для нас образом», с помощью зондов для prompt injection, утечки данных, галлюцинаций, токсичности и джейлбрейков, каждый из которых сопряжён с детектором. Последний выпуск — v0.17.0 от 9 сентября 2026 года. Подходит для широкого базового сканирования конечной точки модели. Ограничения: ему нужен доступ к API или локальное развёртывание целевой модели, некоторые зонды ресурсоёмки, а README отмечает ограниченную поддержку моделей компьютерного зрения и прототипный статус некоторых зондов.

PyRIT

PyRIT — фреймворк под лицензией MIT, описанный как созданный для специалистов по безопасности и инженеров с целью выявления рисков в системах генеративного ИИ. Его сопровождает Microsoft; последний выпуск — v1.1.0 от 4 сентября 2026 года. Прежний репозиторий в организации Azure был архивирован 27 марта 2026 года со ссылкой на репозиторий Microsoft, поэтому ссылки на старый адрес ведут на копию только для чтения. Подходит для скриптовых многоходовых кампаний ред-тиминга командой, готовой писать код. Ограничение: это фреймворк, а не сканер, запускаемый одной командой.

promptfoo

promptfoo — инструмент командной строки и библиотека под лицензией MIT для оценки LLM-приложений, ред-тиминга и сканирования уязвимостей с интеграцией в CI. Последний выпуск — 0.123.1 от 18 сентября 2026 года. В его README сказано: «Promptfoo is now part of OpenAI. Promptfoo remains open source and MIT licensed.» Подходит для включения тестов промптов и состязательных проверок в сборку. Ограничение: результаты зависят от настроенного провайдера и модели-судьи, и большинству провайдеров нужны ключи API. Смена владельца — факт управления проектом, который стоит учитывать при выборе инструмента для регулируемой деятельности.

Giskard

Giskard — библиотека Python под лицензией Apache-2.0 от организации Giskard-AI. В версии 3 есть два компонента, описанные как стабильные: giskard-checks — фреймворк тестирования на основе сценариев и оценок по схеме LLM-as-judge, и giskard-scan — сканер уязвимостей агентов. Подходит для тестирования агентов и систем с дополненной генерацией на основе поиска (RAG). Ограничения: версии 3 нужен Python 3.12 или новее, а версия 2, которая охватывала сканирование табличных и классических моделей машинного обучения, больше активно не сопровождается.

4. Защитные механизмы во время выполнения и обнаружение prompt injection

Защитные механизмы (guardrails) находятся на пути запроса и классифицируют или ограничивают входные и выходные данные во время работы приложения.

Llama Guard, Prompt Guard и LlamaFirewall

Проект Meta Purple Llama объединяет средства защиты для открытых моделей. Llama Guard — семейство моделей модерации входных и выходных данных. Prompt Guard 2 описан как лёгкий классификатор для попыток прямой prompt injection, а LlamaFirewall сочетает его со сканером проверки согласованности (alignment check) и сканером кода для агентов. Согласно таблице лицензий проекта, модели распространяются по лицензиям Llama Community License, а другие компоненты, такие как Code Shield и оценочные наборы, — по MIT. Доступ к моделям на Hugging Face ограничен. Подходят там, где допустим небольшой классификатор перед моделью. Ограничения: классификатор сокращает число попыток, похожих на известные шаблоны, но не устраняет сам класс атак.

NeMo Guardrails

NeMo Guardrails — набор инструментов NVIDIA под лицензией Apache-2.0 для добавления программируемых ограничителей (rails) в LLM-приложения с использованием языка моделирования Colang для управления ходом диалога. Последний выпуск — v0.24.1 от 16 сентября 2026 года. Подходит для ограничения тем, форматов и сценариев диалога. Ограничение: ограничители — это политика, написанная разработчиком, поэтому их охват не шире того, что было предусмотрено.

Rebuff и LLM Guard, ныне архивированные

Rebuff — самоукрепляющийся детектор prompt injection с эвристиками, проверкой с помощью LLM, векторным хранилищем прошлых атак и canary-токенами — был архивирован 16 мая 2025 года. В его README сказано, что это прототип и он не может обеспечить полную защиту от prompt injection. LLM Guard — набор сканеров входных и выходных данных под лицензией MIT от того же сопровождающего — был архивирован в июле 2026 года. Оба остаются доступными для чтения в справочных целях. Они иллюстрируют практический момент: проекты детекторов могут лишиться сопровождающих, поэтому защитный механизм должен быть заменяемым.

5. Сканеры безопасности агентов и MCP

Агенты добавляют инструменты, а описания инструментов — это текст, который читает модель. Сканеры этой группы проверяют этот инструментарий и его конфигурацию.

Snyk Agent Scan

Agent Scan, ранее MCP-Scan, — сканер под лицензией Apache-2.0, который сопровождает Snyk. Он обнаруживает компоненты агентов на машине, включая серверы MCP и навыки (skills) в таких клиентах, как Claude, Cursor, VS Code и GitHub Copilot, и проверяет их на prompt injection, отравление инструментов (tool poisoning) и связанные проблемы. Последний выпуск — v0.6.8 от 29 сентября 2026 года. Подходит для аудита того, что установлено на машине разработчика. Ограничения: в README указано, что в настоящее время проект не принимает внешний вклад и что существуют две линии выпусков с разными форматами вывода.

Cisco MCP Scanner

MCP Scanner — инструмент под лицензией Apache-2.0 от Cisco AI Defense. Он анализирует инструменты, промпты, ресурсы и зависимости MCP с помощью трёх движков, которые могут работать по отдельности или вместе: правил YARA, анализа с помощью LLM и API Cisco AI Defense. Последний выпуск — 4.8.4 от 28 августа 2026 года. Подходит для проверки сервера перед его внедрением. Ограничение: движкам LLM и API нужны внешние учётные данные, а сканирование описания сервера мало говорит о том, что делает его код после обновления.

6. Место сетевого контроля

Перечисленные выше инструменты проверяют файлы, модели, промпты и конфигурации. Ни один из них не решает, какому приложению можно открыть соединение с каким сервером. Это задача контроля исходящего трафика, и она важна, потому что риски из предыдущих разделов сходятся в сети: изменённая среда выполнения модели, отравленный инструмент или агент, подвергшийся инъекции, должны достичь какого-то адреса, чтобы вывести данные или получить инструкции.

FireAI, разработанный HisnLabs, — файрвол исходящих соединений для macOS. Он работает как фильтр содержимого Apple Network Extension, идентифицирует каждое приложение по подписи кода и может разрешать, блокировать или запрашивать решение для каждого адреса назначения с помощью правил для приложения, домена или адреса. Применительно к работе с ИИ на Mac это означает, что сервер инференса, агент для программирования или клиент MCP можно ограничить адресами, которые нужны для его задачи, а новый адрес назначения потребует решения. Документация фильтра описывает, что видит FireAI: идентичность приложения, удалённый хост или адрес, порт и протокол.

FireAI не сканирует файлы моделей, не проверяет подписи, не проводит ред-тиминг моделей и не классифицирует промпты. Он не читает содержимое зашифрованных соединений, поэтому не может отличить легитимный запрос от внедрённого, если оба направлены на разрешённый адрес. Он дополняет перечисленные выше инструменты и не заменяет ни один из них.

Сравнение

Источники: репозиторий или документация каждого проекта, изученные 30 сентября 2026 года. Статус отражает страницу репозитория, а не оценку качества.
ИнструментЗадачаСопровождающийЛицензияСтатус на 30 сентября 2026 года
ModelScanСканирование файлов моделейProtect AIApache-2.0Активен, v0.8.8
picklescanСканирование picklemmaitre314MITАктивен, v1.0.5
ficklingАнализ pickleTrail of BitsLGPL-3.0Активен, v0.1.12
safetensorsБезопасный формат весовHugging FaceApache-2.0Активен
model-transparencyПодпись моделейSigstoreApache-2.0Активен, v1.1.1
CycloneDXСпецификация ML-BOMOWASP, Ecma TC54Apache-2.0 (схемы)Активен, 1.7
Instructional FingerprintingОтпечаток модели (исследование)Авторы статьиMITПоследнее обновление в июле 2024 года
MarkLLMВодяные знаки в тексте (исследование)THU-BPMApache-2.0Активен
garakСканирование уязвимостейNVIDIAApache-2.0Активен, v0.17.0
PyRITФреймворк ред-тимингаMicrosoftMITАктивен, v1.1.0
promptfooОценки и ред-тимингPromptfoo, часть OpenAIMITАктивен, 0.123.1
Giskard v3Тесты и сканирование агентовGiskard-AIApache-2.0Активен; v2 не сопровождается
Llama Guard, Prompt GuardЗащитные моделиMetaLlama Community LicenseМодели датированы апрелем 2025 года
NeMo GuardrailsПрограммируемые ограничителиNVIDIAApache-2.0Активен, v0.24.1
Rebuff, LLM GuardОбнаружение инъекцийProtect AIApache-2.0, MITАрхивированы
Agent ScanСканирование агентов и MCPSnykApache-2.0Активен, v0.6.8
MCP ScannerСканирование серверов MCPCisco AI DefenseApache-2.0Активен, 4.8.4
FireAIКонтроль исходящего трафика по приложениям в macOSHisnLabsКоммерческаяНе сканирует модели

Ограничения

  • Ни один инструмент не охватывает все шесть задач. Чистый результат сканирования файла ничего не говорит о поведении модели, подпись ничего не говорит о безопасности, а ред-тиминг ничего не говорит о содержимом файла.
  • Сканеры и защитные механизмы — это детекторы. Они могут пропускать новые техники, что признаёт документация ModelScan, picklescan и Rebuff, и их охват меняется вместе с атаками.
  • Сопровождение неравномерно. Два перечисленных здесь проекта детекторов архивированы, у одного инструмента сменился владелец, у другого один частный сопровождающий, а один исследовательский репозиторий не менялся с 2024 года. Прежде чем строить что-либо на проекте, проверьте его состояние.
  • Обзор ограничен открытыми инструментами, первоисточники по которым удалось прочитать. Он не включает коммерческие платформы и не сравнивает результаты обнаружения, поскольку источники не приводят сопоставимых данных.
  • Лицензии взяты со страниц репозиториев и из таблиц лицензий. Проверьте их перед повторным распространением, в частности лицензии Llama Community License и условия LGPL для fickling.
  • Сетевой уровень видит соединения, а не их смысл. Разрешённый адрес назначения по-прежнему может получить данные от скомпрометированной среды выполнения модели.

Какое место здесь занимают FireAI и HisnLabs

Просканируйте модель, подпишите модель, протестируйте модель. Затем решите, куда может подключаться её приложение.

FireAI — это собственный продукт HisnLabs: ИИ-файрвол, работающий прямо на вашем Mac. Он показывает простым языком каждое соединение, которое устанавливают ваши приложения, и позволяет вам решать, что покидает ваш Mac, — его ИИ работает локально, поэтому ваш трафик никогда не отправляется ни нам, ни кому-либо ещё. Команда исследователей безопасности HisnLabs — это те, кто поддерживает точность этих решений: они каталогизируют, какие домены являются обычной телеметрией, а какие — реальным сервисом, отслеживают страну и сеть, стоящие за соединением, и обучают локальную модель (функцию FireAI Pilot) на реальных шаблонах трафика — и ничего из этого не покидает ваш Mac.

Вы можете прочитать о технических решениях, лежащих в его основе, или попробовать FireAI в течение 17 дней на странице FireAI от HisnLabs.

Источники