# Лучшие инструменты 2026 года для безопасности моделей ИИ > Обзор открытых инструментов защиты моделей ИИ и LLM-приложений в 2026 году по задачам: сопровождающие, лицензии, ограничения и роль сетевого контроля. FireAI Security & Research Team (HisnLabs) · Published 2026-09-30 Canonical: https://hisnlabs.com/ru/blog/luchshie-instrumenty-bezopasnosti-modeley-ii-2026 Безопасность моделей ИИ — это не одна дисциплина, а шесть задач, у каждой из которых свои инструменты: сканирование файлов моделей, установление происхождения, поиск слабых мест модели, защита во время выполнения, проверка агентного инструментария вокруг неё и ограничение того, куда может подключаться приложение, в котором она работает. Этот обзор, подготовленный HisnLabs, разработчиком FireAI, охватывает открытые инструменты, репозитории или документация которых были изучены 30 сентября 2026 года. Лицензии, сопровождающие и статус указаны так, как их приводят первоисточники, и ни один инструмент не ставится выше другого, поскольку задачи не конкурируют между собой. ## Охват и методика Инструмент включался в обзор только в том случае, если удалось открыть его официальный репозиторий или документацию, установить лицензию и проверить состояние сопровождения (архивирован или активен, а также дату последнего выпуска, если страница выпусков её показывает). Указанные ниже выпуски — последние на момент изучения. Здесь нет измерений производительности: источники не дают сопоставимых результатов обнаружения, и таких утверждений не делается. Коммерческие платформы не рассматриваются, если только предметом обзора не является их открытый компонент. Категории следуют порядку, в котором модель проходит через проект: файл загружается, проверяется его происхождение, модель тестируется, развёртывается за защитными механизмами, подключается к инструментам, и приложение, в котором она работает, выходит в сеть. [OWASP Top 10 for Large Language Model Applications](https://owasp.org/www-project-top-10-for-large-language-model-applications/), который ведётся в рамках OWASP GenAI Security Project, — обычный общий словарь для рисков прикладного уровня в категориях с третьей по пятую. ## 1. Сканирование файлов моделей Многие файлы моделей сериализуются в формате Python pickle, который может выполнять код при загрузке. В документации Hugging Face сказано, что загрузка pickle «означает, что может быть выполнен код», а угрозу представляют опкоды `GLOBAL`, `STACK_GLOBAL` и `REDUCE`. [Hugging Face: Pickle scanning](https://huggingface.co/docs/hub/security-pickle) Сканеры читают инструкции файла, не загружая его, и помечают опасные импорты. ### ModelScan [ModelScan](https://github.com/protectai/modelscan) сопровождается Protect AI и распространяется по лицензии Apache-2.0. Он сканирует форматы на основе pickle (PyTorch, scikit-learn, XGBoost, joblib, cloudpickle), TensorFlow SavedModel и файлы Keras H5 и V3, ранжирует находки по степени серьёзности и завершается с кодами возврата, удобными для конвейеров CI. Последний выпуск на его странице — v0.8.8 от 18 февраля 2026 года; активность в репозитории отмечалась 28 сентября 2026 года. Его стоит использовать как контрольную точку до того, как загруженная модель попадёт в сборку. Ограничение: README описывает обнаружение на основе сигнатур, которое может давать ложноположительные и ложноотрицательные результаты, и находки требуют проверки человеком. ### picklescan [picklescan](https://github.com/mmaitre314/picklescan) — сканер под лицензией MIT, который сопровождает частная учётная запись mmaitre314. В документации Hugging Face picklescan назван среди инструментов, разработанных для Hub. Последний выпуск — v1.0.5 от 1 июля 2026 года. Он сканирует файлы pickle, архивы PyTorch и ZIP-контейнеры и может проверять локальный путь, URL или модель на Hugging Face. Подходит для быстрой проверки в скрипте. Ограничение: он сопоставляет опасные операции по шаблону, поэтому новая техника может пройти незамеченной, и он сообщает о находках, не удаляя их. ### fickling [fickling](https://github.com/trailofbits/fickling) от Trail of Bits распространяется по лицензии LGPL-3.0. Он описан как декомпилятор, статический анализатор и переписчик байт-кода для pickle. Он может декомпилировать pickle в читаемый Python, проверять безопасность с помощью статического анализа и выдавать ошибку до загрузки небезопасного файла. Последний выпуск — v0.1.12 от 26 июня 2026 года. Подходит, когда находку нужно понять, а не только пометить. Ограничение: это инструмент анализа pickle, и он не охватывает другие форматы, которые читает ModelScan. Условия его лицензии отличаются от разрешительных лицензий остальных сканеров. ### Сканирование на Hugging Face Hub и safetensors Hub сканирует каждый загруженный файл с помощью ClamAV и сканера импортов pickle, который перечисляет импорты внутри каждого pickle-файла и выделяет подозрительные. [Hugging Face: file scanning](https://huggingface.co/docs/hub/security-malware) Он также показывает для публичных репозиториев результаты стороннего сканера — Guardian от Protect AI. [Hugging Face: Protect AI](https://huggingface.co/docs/hub/security-protectai) Ограничение, как его формулирует сама Hugging Face: сканирование pickle не даёт полной гарантии, его списки ведутся по мере возможности, а проверка безопасности остаётся ответственностью пользователя. Структурная альтернатива — [safetensors](https://github.com/huggingface/safetensors), формат под лицензией Apache-2.0, поддерживаемый Hugging Face, который хранит тензоры без исполняемого содержимого. Он устраняет риск pickle для весов, но ничего не говорит о том, заслуживают ли доверия сами веса. ## 2. Происхождение, подпись и цифровые отпечатки моделей Сканирование отвечает на вопрос, опасно ли загружать файл. Проверка происхождения отвечает на вопрос, кто его создал и изменился ли он с тех пор. Для этих двух вопросов нужны разные инструменты. ### Sigstore model-transparency [model-transparency](https://github.com/sigstore/model-transparency) — проект под лицензией Apache-2.0 в организации Sigstore, который подписывает и проверяет модели машинного обучения. Он может подписывать через Sigstore либо с помощью ключей, сертификатов или устройств PKCS #11 и формирует пакет, содержащий конверт DSSE с утверждением in-toto. Последний выпуск — v1.1.1 от 10 октября 2025 года, коммиты продолжались в сентябре 2026 года. Подходит, чтобы потребитель мог убедиться, что имеющиеся у него файлы — те самые, что подписал издатель. Ограничения: в документации заявлена поддержка хеширования файлов и их фрагментов, но не отдельных тензоров, а действительная подпись доказывает происхождение и целостность, но не безопасность модели. Hugging Face проводит то же различие для подписанных коммитов, которые гарантируют «происхождение файла», но не его безопасность. ### Спецификации компонентов (BOM) для ИИ и МО [CycloneDX](https://github.com/CycloneDX/specification), который поддерживают OWASP Foundation и технический комитет TC54 Ecma International, включает Machine Learning Bill of Materials (ML-BOM) в число поддерживаемых типов BOM. Последний выпуск, 1.7, опубликован 21 октября 2025 года; его схемы распространяются по лицензии Apache-2.0. [Профиль SPDX 3.0 для ИИ](https://spdx.dev/learn/areas-of-interest/ai/) документирует компоненты ИИ — модели, наборы данных и промпты — в одной связанной записи. Любой из форматов подходит для учёта того, какие модели, наборы данных и версии входят в продукт, — а это первое, что нужно при реагировании на инцидент. Ограничение: BOM фиксирует то, что заявляет автор. Ни один из форматов не проверяет это заявление. ### Исследовательские инструменты для цифровых отпечатков и водяных знаков [Instructional Fingerprinting](https://github.com/cnut1648/Model-Fingerprint) — код научной статьи ([arXiv 2401.12255](https://arxiv.org/abs/2401.12255)), который встраивает цифровой отпечаток в языковую модель, чтобы владелец мог впоследствии проверить, произведена ли от неё другая модель. Это исследовательский код под лицензией MIT; последнее обновление репозитория было в июле 2024 года. [MarkLLM](https://github.com/THU-BPM/MarkLLM) от группы THU-BPM — набор инструментов под лицензией Apache-2.0 для нанесения водяных знаков на текст, генерируемый LLM, представленный как демонстрация на EMNLP 2024. Они отвечают на разные вопросы: первый маркирует модель, второй — её вывод. Их стоит использовать для изучения атрибуции, а не как механизм контроля в продакшене. Ограничение: оба являются исследовательскими артефактами, и ни один не заменяет подписи распространяемого файла. > FireAI, файрвол для macOS, работающий на устройстве и разработанный HisnLabs, не сканирует и не подписывает файлы моделей. Он контролирует, какое приложение на Mac куда подключается. Доступен 17-дневный пробный период. [Download FireAI for Mac](https://hisnlabs.com/en/download) ## 3. Ред-тиминг LLM и сканирование уязвимостей Эти инструменты отправляют модели или приложению состязательные входные данные и фиксируют реакцию. Они проверяют поведение, а не файлы. ### garak [garak](https://github.com/NVIDIA/garak) — сканер уязвимостей LLM под лицензией Apache-2.0, который сопровождает NVIDIA. Согласно его README, он проверяет, «можно ли заставить LLM дать сбой нежелательным для нас образом», с помощью зондов для prompt injection, утечки данных, галлюцинаций, токсичности и джейлбрейков, каждый из которых сопряжён с детектором. Последний выпуск — v0.17.0 от 9 сентября 2026 года. Подходит для широкого базового сканирования конечной точки модели. Ограничения: ему нужен доступ к API или локальное развёртывание целевой модели, некоторые зонды ресурсоёмки, а README отмечает ограниченную поддержку моделей компьютерного зрения и прототипный статус некоторых зондов. ### PyRIT [PyRIT](https://github.com/microsoft/PyRIT) — фреймворк под лицензией MIT, описанный как созданный для специалистов по безопасности и инженеров с целью выявления рисков в системах генеративного ИИ. Его сопровождает Microsoft; последний выпуск — v1.1.0 от 4 сентября 2026 года. Прежний репозиторий в организации Azure был архивирован 27 марта 2026 года со ссылкой на репозиторий Microsoft, поэтому ссылки на старый адрес ведут на копию только для чтения. Подходит для скриптовых многоходовых кампаний ред-тиминга командой, готовой писать код. Ограничение: это фреймворк, а не сканер, запускаемый одной командой. ### promptfoo [promptfoo](https://github.com/promptfoo/promptfoo) — инструмент командной строки и библиотека под лицензией MIT для оценки LLM-приложений, ред-тиминга и сканирования уязвимостей с интеграцией в CI. Последний выпуск — 0.123.1 от 18 сентября 2026 года. В его README сказано: «Promptfoo is now part of OpenAI. Promptfoo remains open source and MIT licensed.» Подходит для включения тестов промптов и состязательных проверок в сборку. Ограничение: результаты зависят от настроенного провайдера и модели-судьи, и большинству провайдеров нужны ключи API. Смена владельца — факт управления проектом, который стоит учитывать при выборе инструмента для регулируемой деятельности. ### Giskard [Giskard](https://github.com/Giskard-AI/giskard-oss) — библиотека Python под лицензией Apache-2.0 от организации Giskard-AI. В версии 3 есть два компонента, описанные как стабильные: giskard-checks — фреймворк тестирования на основе сценариев и оценок по схеме LLM-as-judge, и giskard-scan — сканер уязвимостей агентов. Подходит для тестирования агентов и систем с дополненной генерацией на основе поиска (RAG). Ограничения: версии 3 нужен Python 3.12 или новее, а версия 2, которая охватывала сканирование табличных и классических моделей машинного обучения, больше активно не сопровождается. ## 4. Защитные механизмы во время выполнения и обнаружение prompt injection Защитные механизмы (guardrails) находятся на пути запроса и классифицируют или ограничивают входные и выходные данные во время работы приложения. ### Llama Guard, Prompt Guard и LlamaFirewall Проект Meta [Purple Llama](https://github.com/meta-llama/PurpleLlama) объединяет средства защиты для открытых моделей. Llama Guard — семейство моделей модерации входных и выходных данных. Prompt Guard 2 описан как лёгкий классификатор для попыток прямой prompt injection, а LlamaFirewall сочетает его со сканером проверки согласованности (alignment check) и сканером кода для агентов. Согласно таблице лицензий проекта, модели распространяются по лицензиям Llama Community License, а другие компоненты, такие как Code Shield и оценочные наборы, — по MIT. Доступ к моделям на Hugging Face ограничен. Подходят там, где допустим небольшой классификатор перед моделью. Ограничения: классификатор сокращает число попыток, похожих на известные шаблоны, но не устраняет сам класс атак. ### NeMo Guardrails [NeMo Guardrails](https://github.com/NVIDIA-NeMo/Guardrails) — набор инструментов NVIDIA под лицензией Apache-2.0 для добавления программируемых ограничителей (rails) в LLM-приложения с использованием языка моделирования Colang для управления ходом диалога. Последний выпуск — v0.24.1 от 16 сентября 2026 года. Подходит для ограничения тем, форматов и сценариев диалога. Ограничение: ограничители — это политика, написанная разработчиком, поэтому их охват не шире того, что было предусмотрено. ### Rebuff и LLM Guard, ныне архивированные [Rebuff](https://github.com/protectai/rebuff) — самоукрепляющийся детектор prompt injection с эвристиками, проверкой с помощью LLM, векторным хранилищем прошлых атак и canary-токенами — был архивирован 16 мая 2025 года. В его README сказано, что это прототип и он не может обеспечить полную защиту от prompt injection. [LLM Guard](https://github.com/protectai/llm-guard) — набор сканеров входных и выходных данных под лицензией MIT от того же сопровождающего — был архивирован в июле 2026 года. Оба остаются доступными для чтения в справочных целях. Они иллюстрируют практический момент: проекты детекторов могут лишиться сопровождающих, поэтому защитный механизм должен быть заменяемым. ## 5. Сканеры безопасности агентов и MCP Агенты добавляют инструменты, а описания инструментов — это текст, который читает модель. Сканеры этой группы проверяют этот инструментарий и его конфигурацию. ### Snyk Agent Scan [Agent Scan](https://github.com/snyk/agent-scan), ранее MCP-Scan, — сканер под лицензией Apache-2.0, который сопровождает Snyk. Он обнаруживает компоненты агентов на машине, включая серверы MCP и навыки (skills) в таких клиентах, как Claude, Cursor, VS Code и GitHub Copilot, и проверяет их на prompt injection, отравление инструментов (tool poisoning) и связанные проблемы. Последний выпуск — v0.6.8 от 29 сентября 2026 года. Подходит для аудита того, что установлено на машине разработчика. Ограничения: в README указано, что в настоящее время проект не принимает внешний вклад и что существуют две линии выпусков с разными форматами вывода. ### Cisco MCP Scanner [MCP Scanner](https://github.com/cisco-ai-defense/mcp-scanner) — инструмент под лицензией Apache-2.0 от Cisco AI Defense. Он анализирует инструменты, промпты, ресурсы и зависимости MCP с помощью трёх движков, которые могут работать по отдельности или вместе: правил YARA, анализа с помощью LLM и API Cisco AI Defense. Последний выпуск — 4.8.4 от 28 августа 2026 года. Подходит для проверки сервера перед его внедрением. Ограничение: движкам LLM и API нужны внешние учётные данные, а сканирование описания сервера мало говорит о том, что делает его код после обновления. ## 6. Место сетевого контроля Перечисленные выше инструменты проверяют файлы, модели, промпты и конфигурации. Ни один из них не решает, какому приложению можно открыть соединение с каким сервером. Это задача контроля исходящего трафика, и она важна, потому что риски из предыдущих разделов сходятся в сети: изменённая среда выполнения модели, отравленный инструмент или агент, подвергшийся инъекции, должны достичь какого-то адреса, чтобы вывести данные или получить инструкции. FireAI, разработанный HisnLabs, — файрвол исходящих соединений для macOS. Он работает как фильтр содержимого Apple Network Extension, идентифицирует каждое приложение по подписи кода и может разрешать, блокировать или запрашивать решение для каждого адреса назначения с помощью [правил для приложения, домена или адреса](https://hisnlabs.com/ru/docs/per-app-rules). Применительно к работе с ИИ на Mac это означает, что сервер инференса, агент для программирования или клиент MCP можно ограничить адресами, которые нужны для его задачи, а новый адрес назначения потребует решения. [Документация фильтра](https://hisnlabs.com/ru/docs/how-the-network-filter-works) описывает, что видит FireAI: идентичность приложения, удалённый хост или адрес, порт и протокол. FireAI не сканирует файлы моделей, не проверяет подписи, не проводит ред-тиминг моделей и не классифицирует промпты. Он не читает содержимое зашифрованных соединений, поэтому не может отличить легитимный запрос от внедрённого, если оба направлены на разрешённый адрес. Он дополняет перечисленные выше инструменты и не заменяет ни один из них. ## Сравнение | Инструмент | Задача | Сопровождающий | Лицензия | Статус на 30 сентября 2026 года | | --- | --- | --- | --- | --- | | ModelScan | Сканирование файлов моделей | Protect AI | Apache-2.0 | Активен, v0.8.8 | | picklescan | Сканирование pickle | mmaitre314 | MIT | Активен, v1.0.5 | | fickling | Анализ pickle | Trail of Bits | LGPL-3.0 | Активен, v0.1.12 | | safetensors | Безопасный формат весов | Hugging Face | Apache-2.0 | Активен | | model-transparency | Подпись моделей | Sigstore | Apache-2.0 | Активен, v1.1.1 | | CycloneDX | Спецификация ML-BOM | OWASP, Ecma TC54 | Apache-2.0 (схемы) | Активен, 1.7 | | Instructional Fingerprinting | Отпечаток модели (исследование) | Авторы статьи | MIT | Последнее обновление в июле 2024 года | | MarkLLM | Водяные знаки в тексте (исследование) | THU-BPM | Apache-2.0 | Активен | | garak | Сканирование уязвимостей | NVIDIA | Apache-2.0 | Активен, v0.17.0 | | PyRIT | Фреймворк ред-тиминга | Microsoft | MIT | Активен, v1.1.0 | | promptfoo | Оценки и ред-тиминг | Promptfoo, часть OpenAI | MIT | Активен, 0.123.1 | | Giskard v3 | Тесты и сканирование агентов | Giskard-AI | Apache-2.0 | Активен; v2 не сопровождается | | Llama Guard, Prompt Guard | Защитные модели | Meta | Llama Community License | Модели датированы апрелем 2025 года | | NeMo Guardrails | Программируемые ограничители | NVIDIA | Apache-2.0 | Активен, v0.24.1 | | Rebuff, LLM Guard | Обнаружение инъекций | Protect AI | Apache-2.0, MIT | Архивированы | | Agent Scan | Сканирование агентов и MCP | Snyk | Apache-2.0 | Активен, v0.6.8 | | MCP Scanner | Сканирование серверов MCP | Cisco AI Defense | Apache-2.0 | Активен, 4.8.4 | | FireAI | Контроль исходящего трафика по приложениям в macOS | HisnLabs | Коммерческая | Не сканирует модели | *Источники: репозиторий или документация каждого проекта, изученные 30 сентября 2026 года. Статус отражает страницу репозитория, а не оценку качества.* ## Ограничения - Ни один инструмент не охватывает все шесть задач. Чистый результат сканирования файла ничего не говорит о поведении модели, подпись ничего не говорит о безопасности, а ред-тиминг ничего не говорит о содержимом файла. - Сканеры и защитные механизмы — это детекторы. Они могут пропускать новые техники, что признаёт документация ModelScan, picklescan и Rebuff, и их охват меняется вместе с атаками. - Сопровождение неравномерно. Два перечисленных здесь проекта детекторов архивированы, у одного инструмента сменился владелец, у другого один частный сопровождающий, а один исследовательский репозиторий не менялся с 2024 года. Прежде чем строить что-либо на проекте, проверьте его состояние. - Обзор ограничен открытыми инструментами, первоисточники по которым удалось прочитать. Он не включает коммерческие платформы и не сравнивает результаты обнаружения, поскольку источники не приводят сопоставимых данных. - Лицензии взяты со страниц репозиториев и из таблиц лицензий. Проверьте их перед повторным распространением, в частности лицензии Llama Community License и условия LGPL для fickling. - Сетевой уровень видит соединения, а не их смысл. Разрешённый адрес назначения по-прежнему может получить данные от скомпрометированной среды выполнения модели. ## Какое место здесь занимают FireAI и HisnLabs Просканируйте модель, подпишите модель, протестируйте модель. Затем решите, куда может подключаться её приложение. FireAI — это собственный продукт HisnLabs: ИИ-файрвол, работающий прямо на вашем Mac. Он показывает простым языком каждое соединение, которое устанавливают ваши приложения, и позволяет вам решать, что покидает ваш Mac, — его ИИ работает локально, поэтому ваш трафик никогда не отправляется ни нам, ни кому-либо ещё. Команда исследователей безопасности HisnLabs — это те, кто поддерживает точность этих решений: они каталогизируют, какие домены являются обычной телеметрией, а какие — реальным сервисом, отслеживают страну и сеть, стоящие за соединением, и обучают локальную модель (функцию FireAI Pilot) на реальных шаблонах трафика — и ничего из этого не покидает ваш Mac. Вы можете прочитать о технических решениях, лежащих в его основе, или попробовать FireAI в течение 17 дней на странице [FireAI от HisnLabs](https://hisnlabs.com/ru/download). ## Sources - [GitHub: protectai/modelscan (Apache-2.0)](https://github.com/protectai/modelscan) - [GitHub: mmaitre314/picklescan (MIT)](https://github.com/mmaitre314/picklescan) - [GitHub: trailofbits/fickling (LGPL-3.0)](https://github.com/trailofbits/fickling) - [Hugging Face Hub docs: Pickle scanning](https://huggingface.co/docs/hub/security-pickle) - [Hugging Face Hub docs: Malware scanning](https://huggingface.co/docs/hub/security-malware) - [Hugging Face Hub docs: Third-party scanner, Protect AI](https://huggingface.co/docs/hub/security-protectai) - [GitHub: huggingface/safetensors (Apache-2.0)](https://github.com/huggingface/safetensors) - [GitHub: sigstore/model-transparency (Apache-2.0)](https://github.com/sigstore/model-transparency) - [GitHub: CycloneDX/specification (schemas Apache-2.0, ML-BOM)](https://github.com/CycloneDX/specification) - [SPDX: AI profile](https://spdx.dev/learn/areas-of-interest/ai/) - [GitHub: cnut1648/Model-Fingerprint, Instructional Fingerprinting (MIT)](https://github.com/cnut1648/Model-Fingerprint) - [arXiv 2401.12255: Instructional Fingerprinting of Large Language Models](https://arxiv.org/abs/2401.12255) - [GitHub: THU-BPM/MarkLLM (Apache-2.0)](https://github.com/THU-BPM/MarkLLM) - [GitHub: NVIDIA/garak (Apache-2.0)](https://github.com/NVIDIA/garak) - [GitHub: microsoft/PyRIT (MIT)](https://github.com/microsoft/PyRIT) - [GitHub: promptfoo/promptfoo (MIT)](https://github.com/promptfoo/promptfoo) - [GitHub: Giskard-AI/giskard-oss (Apache-2.0)](https://github.com/Giskard-AI/giskard-oss) - [GitHub: meta-llama/PurpleLlama (Llama Guard, Prompt Guard, LlamaFirewall)](https://github.com/meta-llama/PurpleLlama) - [GitHub: NVIDIA-NeMo/Guardrails (Apache-2.0)](https://github.com/NVIDIA-NeMo/Guardrails) - [GitHub: protectai/rebuff (archived)](https://github.com/protectai/rebuff) - [GitHub: protectai/llm-guard (archived)](https://github.com/protectai/llm-guard) - [GitHub: snyk/agent-scan, formerly MCP-Scan (Apache-2.0)](https://github.com/snyk/agent-scan) - [GitHub: cisco-ai-defense/mcp-scanner (Apache-2.0)](https://github.com/cisco-ai-defense/mcp-scanner) - [OWASP Top 10 for Large Language Model Applications](https://owasp.org/www-project-top-10-for-large-language-model-applications/) - [FireAI docs: How FireAI watches your Mac’s connections](https://hisnlabs.com/en/docs/how-the-network-filter-works) - [FireAI docs: Rules](https://hisnlabs.com/en/docs/per-app-rules)