Безопасность моделей ИИ — это не одна дисциплина, а шесть задач, у каждой из которых свои инструменты: сканирование файлов моделей, установление происхождения, поиск слабых мест модели, защита во время выполнения, проверка агентного инструментария вокруг неё и ограничение того, куда может подключаться приложение, в котором она работает. Этот обзор, подготовленный HisnLabs, разработчиком FireAI, охватывает открытые инструменты, репозитории или документация которых были изучены 30 сентября 2026 года. Лицензии, сопровождающие и статус указаны так, как их приводят первоисточники, и ни один инструмент не ставится выше другого, поскольку задачи не конкурируют между собой.
Охват и методика
Инструмент включался в обзор только в том случае, если удалось открыть его официальный репозиторий или документацию, установить лицензию и проверить состояние сопровождения (архивирован или активен, а также дату последнего выпуска, если страница выпусков её показывает). Указанные ниже выпуски — последние на момент изучения. Здесь нет измерений производительности: источники не дают сопоставимых результатов обнаружения, и таких утверждений не делается. Коммерческие платформы не рассматриваются, если только предметом обзора не является их открытый компонент.
Категории следуют порядку, в котором модель проходит через проект: файл загружается, проверяется его происхождение, модель тестируется, развёртывается за защитными механизмами, подключается к инструментам, и приложение, в котором она работает, выходит в сеть. OWASP Top 10 for Large Language Model Applications, который ведётся в рамках OWASP GenAI Security Project, — обычный общий словарь для рисков прикладного уровня в категориях с третьей по пятую.
1. Сканирование файлов моделей
Многие файлы моделей сериализуются в формате Python pickle, который может выполнять код при загрузке. В документации Hugging Face сказано, что загрузка pickle «означает, что может быть выполнен код», а угрозу представляют опкоды GLOBAL, STACK_GLOBAL и REDUCE. Hugging Face: Pickle scanning Сканеры читают инструкции файла, не загружая его, и помечают опасные импорты.
ModelScan
ModelScan сопровождается Protect AI и распространяется по лицензии Apache-2.0. Он сканирует форматы на основе pickle (PyTorch, scikit-learn, XGBoost, joblib, cloudpickle), TensorFlow SavedModel и файлы Keras H5 и V3, ранжирует находки по степени серьёзности и завершается с кодами возврата, удобными для конвейеров CI. Последний выпуск на его странице — v0.8.8 от 18 февраля 2026 года; активность в репозитории отмечалась 28 сентября 2026 года. Его стоит использовать как контрольную точку до того, как загруженная модель попадёт в сборку. Ограничение: README описывает обнаружение на основе сигнатур, которое может давать ложноположительные и ложноотрицательные результаты, и находки требуют проверки человеком.
picklescan
picklescan — сканер под лицензией MIT, который сопровождает частная учётная запись mmaitre314. В документации Hugging Face picklescan назван среди инструментов, разработанных для Hub. Последний выпуск — v1.0.5 от 1 июля 2026 года. Он сканирует файлы pickle, архивы PyTorch и ZIP-контейнеры и может проверять локальный путь, URL или модель на Hugging Face. Подходит для быстрой проверки в скрипте. Ограничение: он сопоставляет опасные операции по шаблону, поэтому новая техника может пройти незамеченной, и он сообщает о находках, не удаляя их.
fickling
fickling от Trail of Bits распространяется по лицензии LGPL-3.0. Он описан как декомпилятор, статический анализатор и переписчик байт-кода для pickle. Он может декомпилировать pickle в читаемый Python, проверять безопасность с помощью статического анализа и выдавать ошибку до загрузки небезопасного файла. Последний выпуск — v0.1.12 от 26 июня 2026 года. Подходит, когда находку нужно понять, а не только пометить. Ограничение: это инструмент анализа pickle, и он не охватывает другие форматы, которые читает ModelScan. Условия его лицензии отличаются от разрешительных лицензий остальных сканеров.
Сканирование на Hugging Face Hub и safetensors
Hub сканирует каждый загруженный файл с помощью ClamAV и сканера импортов pickle, который перечисляет импорты внутри каждого pickle-файла и выделяет подозрительные. Hugging Face: file scanning Он также показывает для публичных репозиториев результаты стороннего сканера — Guardian от Protect AI. Hugging Face: Protect AI Ограничение, как его формулирует сама Hugging Face: сканирование pickle не даёт полной гарантии, его списки ведутся по мере возможности, а проверка безопасности остаётся ответственностью пользователя. Структурная альтернатива — safetensors, формат под лицензией Apache-2.0, поддерживаемый Hugging Face, который хранит тензоры без исполняемого содержимого. Он устраняет риск pickle для весов, но ничего не говорит о том, заслуживают ли доверия сами веса.
2. Происхождение, подпись и цифровые отпечатки моделей
Сканирование отвечает на вопрос, опасно ли загружать файл. Проверка происхождения отвечает на вопрос, кто его создал и изменился ли он с тех пор. Для этих двух вопросов нужны разные инструменты.
Sigstore model-transparency
model-transparency — проект под лицензией Apache-2.0 в организации Sigstore, который подписывает и проверяет модели машинного обучения. Он может подписывать через Sigstore либо с помощью ключей, сертификатов или устройств PKCS #11 и формирует пакет, содержащий конверт DSSE с утверждением in-toto. Последний выпуск — v1.1.1 от 10 октября 2025 года, коммиты продолжались в сентябре 2026 года. Подходит, чтобы потребитель мог убедиться, что имеющиеся у него файлы — те самые, что подписал издатель. Ограничения: в документации заявлена поддержка хеширования файлов и их фрагментов, но не отдельных тензоров, а действительная подпись доказывает происхождение и целостность, но не безопасность модели. Hugging Face проводит то же различие для подписанных коммитов, которые гарантируют «происхождение файла», но не его безопасность.
Спецификации компонентов (BOM) для ИИ и МО
CycloneDX, который поддерживают OWASP Foundation и технический комитет TC54 Ecma International, включает Machine Learning Bill of Materials (ML-BOM) в число поддерживаемых типов BOM. Последний выпуск, 1.7, опубликован 21 октября 2025 года; его схемы распространяются по лицензии Apache-2.0. Профиль SPDX 3.0 для ИИ документирует компоненты ИИ — модели, наборы данных и промпты — в одной связанной записи. Любой из форматов подходит для учёта того, какие модели, наборы данных и версии входят в продукт, — а это первое, что нужно при реагировании на инцидент. Ограничение: BOM фиксирует то, что заявляет автор. Ни один из форматов не проверяет это заявление.
Исследовательские инструменты для цифровых отпечатков и водяных знаков
Instructional Fingerprinting — код научной статьи (arXiv 2401.12255), который встраивает цифровой отпечаток в языковую модель, чтобы владелец мог впоследствии проверить, произведена ли от неё другая модель. Это исследовательский код под лицензией MIT; последнее обновление репозитория было в июле 2024 года. MarkLLM от группы THU-BPM — набор инструментов под лицензией Apache-2.0 для нанесения водяных знаков на текст, генерируемый LLM, представленный как демонстрация на EMNLP 2024. Они отвечают на разные вопросы: первый маркирует модель, второй — её вывод. Их стоит использовать для изучения атрибуции, а не как механизм контроля в продакшене. Ограничение: оба являются исследовательскими артефактами, и ни один не заменяет подписи распространяемого файла.
3. Ред-тиминг LLM и сканирование уязвимостей
Эти инструменты отправляют модели или приложению состязательные входные данные и фиксируют реакцию. Они проверяют поведение, а не файлы.
garak
garak — сканер уязвимостей LLM под лицензией Apache-2.0, который сопровождает NVIDIA. Согласно его README, он проверяет, «можно ли заставить LLM дать сбой нежелательным для нас образом», с помощью зондов для prompt injection, утечки данных, галлюцинаций, токсичности и джейлбрейков, каждый из которых сопряжён с детектором. Последний выпуск — v0.17.0 от 9 сентября 2026 года. Подходит для широкого базового сканирования конечной точки модели. Ограничения: ему нужен доступ к API или локальное развёртывание целевой модели, некоторые зонды ресурсоёмки, а README отмечает ограниченную поддержку моделей компьютерного зрения и прототипный статус некоторых зондов.
PyRIT
PyRIT — фреймворк под лицензией MIT, описанный как созданный для специалистов по безопасности и инженеров с целью выявления рисков в системах генеративного ИИ. Его сопровождает Microsoft; последний выпуск — v1.1.0 от 4 сентября 2026 года. Прежний репозиторий в организации Azure был архивирован 27 марта 2026 года со ссылкой на репозиторий Microsoft, поэтому ссылки на старый адрес ведут на копию только для чтения. Подходит для скриптовых многоходовых кампаний ред-тиминга командой, готовой писать код. Ограничение: это фреймворк, а не сканер, запускаемый одной командой.
promptfoo
promptfoo — инструмент командной строки и библиотека под лицензией MIT для оценки LLM-приложений, ред-тиминга и сканирования уязвимостей с интеграцией в CI. Последний выпуск — 0.123.1 от 18 сентября 2026 года. В его README сказано: «Promptfoo is now part of OpenAI. Promptfoo remains open source and MIT licensed.» Подходит для включения тестов промптов и состязательных проверок в сборку. Ограничение: результаты зависят от настроенного провайдера и модели-судьи, и большинству провайдеров нужны ключи API. Смена владельца — факт управления проектом, который стоит учитывать при выборе инструмента для регулируемой деятельности.
Giskard
Giskard — библиотека Python под лицензией Apache-2.0 от организации Giskard-AI. В версии 3 есть два компонента, описанные как стабильные: giskard-checks — фреймворк тестирования на основе сценариев и оценок по схеме LLM-as-judge, и giskard-scan — сканер уязвимостей агентов. Подходит для тестирования агентов и систем с дополненной генерацией на основе поиска (RAG). Ограничения: версии 3 нужен Python 3.12 или новее, а версия 2, которая охватывала сканирование табличных и классических моделей машинного обучения, больше активно не сопровождается.
4. Защитные механизмы во время выполнения и обнаружение prompt injection
Защитные механизмы (guardrails) находятся на пути запроса и классифицируют или ограничивают входные и выходные данные во время работы приложения.
Llama Guard, Prompt Guard и LlamaFirewall
Проект Meta Purple Llama объединяет средства защиты для открытых моделей. Llama Guard — семейство моделей модерации входных и выходных данных. Prompt Guard 2 описан как лёгкий классификатор для попыток прямой prompt injection, а LlamaFirewall сочетает его со сканером проверки согласованности (alignment check) и сканером кода для агентов. Согласно таблице лицензий проекта, модели распространяются по лицензиям Llama Community License, а другие компоненты, такие как Code Shield и оценочные наборы, — по MIT. Доступ к моделям на Hugging Face ограничен. Подходят там, где допустим небольшой классификатор перед моделью. Ограничения: классификатор сокращает число попыток, похожих на известные шаблоны, но не устраняет сам класс атак.
NeMo Guardrails
NeMo Guardrails — набор инструментов NVIDIA под лицензией Apache-2.0 для добавления программируемых ограничителей (rails) в LLM-приложения с использованием языка моделирования Colang для управления ходом диалога. Последний выпуск — v0.24.1 от 16 сентября 2026 года. Подходит для ограничения тем, форматов и сценариев диалога. Ограничение: ограничители — это политика, написанная разработчиком, поэтому их охват не шире того, что было предусмотрено.
Rebuff и LLM Guard, ныне архивированные
Rebuff — самоукрепляющийся детектор prompt injection с эвристиками, проверкой с помощью LLM, векторным хранилищем прошлых атак и canary-токенами — был архивирован 16 мая 2025 года. В его README сказано, что это прототип и он не может обеспечить полную защиту от prompt injection. LLM Guard — набор сканеров входных и выходных данных под лицензией MIT от того же сопровождающего — был архивирован в июле 2026 года. Оба остаются доступными для чтения в справочных целях. Они иллюстрируют практический момент: проекты детекторов могут лишиться сопровождающих, поэтому защитный механизм должен быть заменяемым.
5. Сканеры безопасности агентов и MCP
Агенты добавляют инструменты, а описания инструментов — это текст, который читает модель. Сканеры этой группы проверяют этот инструментарий и его конфигурацию.
Snyk Agent Scan
Agent Scan, ранее MCP-Scan, — сканер под лицензией Apache-2.0, который сопровождает Snyk. Он обнаруживает компоненты агентов на машине, включая серверы MCP и навыки (skills) в таких клиентах, как Claude, Cursor, VS Code и GitHub Copilot, и проверяет их на prompt injection, отравление инструментов (tool poisoning) и связанные проблемы. Последний выпуск — v0.6.8 от 29 сентября 2026 года. Подходит для аудита того, что установлено на машине разработчика. Ограничения: в README указано, что в настоящее время проект не принимает внешний вклад и что существуют две линии выпусков с разными форматами вывода.
Cisco MCP Scanner
MCP Scanner — инструмент под лицензией Apache-2.0 от Cisco AI Defense. Он анализирует инструменты, промпты, ресурсы и зависимости MCP с помощью трёх движков, которые могут работать по отдельности или вместе: правил YARA, анализа с помощью LLM и API Cisco AI Defense. Последний выпуск — 4.8.4 от 28 августа 2026 года. Подходит для проверки сервера перед его внедрением. Ограничение: движкам LLM и API нужны внешние учётные данные, а сканирование описания сервера мало говорит о том, что делает его код после обновления.
6. Место сетевого контроля
Перечисленные выше инструменты проверяют файлы, модели, промпты и конфигурации. Ни один из них не решает, какому приложению можно открыть соединение с каким сервером. Это задача контроля исходящего трафика, и она важна, потому что риски из предыдущих разделов сходятся в сети: изменённая среда выполнения модели, отравленный инструмент или агент, подвергшийся инъекции, должны достичь какого-то адреса, чтобы вывести данные или получить инструкции.
FireAI, разработанный HisnLabs, — файрвол исходящих соединений для macOS. Он работает как фильтр содержимого Apple Network Extension, идентифицирует каждое приложение по подписи кода и может разрешать, блокировать или запрашивать решение для каждого адреса назначения с помощью правил для приложения, домена или адреса. Применительно к работе с ИИ на Mac это означает, что сервер инференса, агент для программирования или клиент MCP можно ограничить адресами, которые нужны для его задачи, а новый адрес назначения потребует решения. Документация фильтра описывает, что видит FireAI: идентичность приложения, удалённый хост или адрес, порт и протокол.
FireAI не сканирует файлы моделей, не проверяет подписи, не проводит ред-тиминг моделей и не классифицирует промпты. Он не читает содержимое зашифрованных соединений, поэтому не может отличить легитимный запрос от внедрённого, если оба направлены на разрешённый адрес. Он дополняет перечисленные выше инструменты и не заменяет ни один из них.
Сравнение
| Инструмент | Задача | Сопровождающий | Лицензия | Статус на 30 сентября 2026 года |
|---|---|---|---|---|
| ModelScan | Сканирование файлов моделей | Protect AI | Apache-2.0 | Активен, v0.8.8 |
| picklescan | Сканирование pickle | mmaitre314 | MIT | Активен, v1.0.5 |
| fickling | Анализ pickle | Trail of Bits | LGPL-3.0 | Активен, v0.1.12 |
| safetensors | Безопасный формат весов | Hugging Face | Apache-2.0 | Активен |
| model-transparency | Подпись моделей | Sigstore | Apache-2.0 | Активен, v1.1.1 |
| CycloneDX | Спецификация ML-BOM | OWASP, Ecma TC54 | Apache-2.0 (схемы) | Активен, 1.7 |
| Instructional Fingerprinting | Отпечаток модели (исследование) | Авторы статьи | MIT | Последнее обновление в июле 2024 года |
| MarkLLM | Водяные знаки в тексте (исследование) | THU-BPM | Apache-2.0 | Активен |
| garak | Сканирование уязвимостей | NVIDIA | Apache-2.0 | Активен, v0.17.0 |
| PyRIT | Фреймворк ред-тиминга | Microsoft | MIT | Активен, v1.1.0 |
| promptfoo | Оценки и ред-тиминг | Promptfoo, часть OpenAI | MIT | Активен, 0.123.1 |
| Giskard v3 | Тесты и сканирование агентов | Giskard-AI | Apache-2.0 | Активен; v2 не сопровождается |
| Llama Guard, Prompt Guard | Защитные модели | Meta | Llama Community License | Модели датированы апрелем 2025 года |
| NeMo Guardrails | Программируемые ограничители | NVIDIA | Apache-2.0 | Активен, v0.24.1 |
| Rebuff, LLM Guard | Обнаружение инъекций | Protect AI | Apache-2.0, MIT | Архивированы |
| Agent Scan | Сканирование агентов и MCP | Snyk | Apache-2.0 | Активен, v0.6.8 |
| MCP Scanner | Сканирование серверов MCP | Cisco AI Defense | Apache-2.0 | Активен, 4.8.4 |
| FireAI | Контроль исходящего трафика по приложениям в macOS | HisnLabs | Коммерческая | Не сканирует модели |
Ограничения
- Ни один инструмент не охватывает все шесть задач. Чистый результат сканирования файла ничего не говорит о поведении модели, подпись ничего не говорит о безопасности, а ред-тиминг ничего не говорит о содержимом файла.
- Сканеры и защитные механизмы — это детекторы. Они могут пропускать новые техники, что признаёт документация ModelScan, picklescan и Rebuff, и их охват меняется вместе с атаками.
- Сопровождение неравномерно. Два перечисленных здесь проекта детекторов архивированы, у одного инструмента сменился владелец, у другого один частный сопровождающий, а один исследовательский репозиторий не менялся с 2024 года. Прежде чем строить что-либо на проекте, проверьте его состояние.
- Обзор ограничен открытыми инструментами, первоисточники по которым удалось прочитать. Он не включает коммерческие платформы и не сравнивает результаты обнаружения, поскольку источники не приводят сопоставимых данных.
- Лицензии взяты со страниц репозиториев и из таблиц лицензий. Проверьте их перед повторным распространением, в частности лицензии Llama Community License и условия LGPL для fickling.
- Сетевой уровень видит соединения, а не их смысл. Разрешённый адрес назначения по-прежнему может получить данные от скомпрометированной среды выполнения модели.
Какое место здесь занимают FireAI и HisnLabs
Просканируйте модель, подпишите модель, протестируйте модель. Затем решите, куда может подключаться её приложение.
FireAI — это собственный продукт HisnLabs: ИИ-файрвол, работающий прямо на вашем Mac. Он показывает простым языком каждое соединение, которое устанавливают ваши приложения, и позволяет вам решать, что покидает ваш Mac, — его ИИ работает локально, поэтому ваш трафик никогда не отправляется ни нам, ни кому-либо ещё. Команда исследователей безопасности HisnLabs — это те, кто поддерживает точность этих решений: они каталогизируют, какие домены являются обычной телеметрией, а какие — реальным сервисом, отслеживают страну и сеть, стоящие за соединением, и обучают локальную модель (функцию FireAI Pilot) на реальных шаблонах трафика — и ничего из этого не покидает ваш Mac.
Вы можете прочитать о технических решениях, лежащих в его основе, или попробовать FireAI в течение 17 дней на странице FireAI от HisnLabs.
