Bezpieczeństwo modeli AI to nie jedna dyscyplina, lecz sześć zadań, z których każde ma własne narzędzia: skanowanie plików modeli, ustalanie pochodzenia, badanie modelu pod kątem słabości, ochrona w czasie działania, weryfikacja narzędzi agentowych wokół modelu oraz ograniczanie, z czym może łączyć się aplikacja, która go hostuje. Ten przegląd, przygotowany przez HisnLabs, twórcę FireAI, obejmuje otwarte narzędzia, których repozytoria lub dokumentację przeczytano 30 września 2026 roku. Licencje, opiekunów i status podano tak, jak przedstawiają je źródła pierwotne, a żadne narzędzie nie jest stawiane wyżej od innego, ponieważ zadania ze sobą nie konkurują.
Zakres i metoda
Narzędzie uwzględniano tylko wtedy, gdy można było otworzyć jego oficjalne repozytorium lub dokumentację, ustalić licencję i sprawdzić stan utrzymania (zarchiwizowane lub aktywne oraz data najnowszego wydania, jeśli strona wydań ją podaje). Wymienione niżej wydania są najnowsze w chwili lektury. Nic tu nie jest pomiarem wydajności: źródła nie podają porównywalnych wyników wykrywania i żadnych takich wyników się nie przypisuje. Platformy komercyjne pominięto, chyba że przedmiotem jest ich otwarty komponent.
Kategorie odpowiadają kolejności, w jakiej model przechodzi przez projekt: plik jest pobierany, sprawdzane jest jego pochodzenie, model jest testowany, wdrażany za zabezpieczeniami, łączony z narzędziami, a aplikacja, która go uruchamia, łączy się z siecią. OWASP Top 10 for Large Language Model Applications, utrzymywany w ramach OWASP GenAI Security Project, stanowi zwykle wspólne słownictwo dla ryzyk na poziomie aplikacji w kategoriach od trzeciej do piątej.
1. Skanowanie plików modeli
Wiele plików modeli jest serializowanych w formacie pickle języka Python, który może wykonywać kod podczas wczytywania. Dokumentacja Hugging Face stwierdza, że wczytanie pliku pickle „oznacza, że kod może zostać wykonany”, i wymienia opkody GLOBAL, STACK_GLOBAL i REDUCE jako te, które stanowią zagrożenie. Hugging Face: Pickle scanning Skanery odczytują instrukcje pliku bez jego wczytywania i oznaczają niebezpieczne importy.
ModelScan
ModelScan jest utrzymywany przez Protect AI na licencji Apache-2.0. Skanuje formaty oparte na pickle (PyTorch, scikit-learn, XGBoost, joblib, cloudpickle), TensorFlow SavedModel oraz pliki Keras H5 i V3, porządkuje wyniki według istotności i kończy działanie kodami dostosowanymi do potoków CI. Najnowsze wydanie na jego stronie to v0.8.8 z 18 lutego 2026 roku, a repozytorium wykazywało aktywność 28 września 2026 roku. Służy jako bramka, zanim pobrany model trafi do kompilacji. Ograniczenie: README opisuje wykrywanie oparte na sygnaturach, które może dawać wyniki fałszywie dodatnie i fałszywie ujemne, a wyniki wymagają przeglądu przez człowieka.
picklescan
picklescan to skaner na licencji MIT utrzymywany przez konto indywidualne, mmaitre314. Dokumentacja Hugging Face wymienia picklescan wśród narzędzi opracowanych dla Hub. Najnowsze wydanie to v1.0.5 z 1 lipca 2026 roku. Skanuje pliki pickle, archiwa PyTorch i kontenery ZIP i może skanować ścieżkę lokalną, adres URL lub model z Hugging Face. Służy do szybkiego sprawdzenia w skrypcie. Ograniczenie: dopasowuje niebezpieczne operacje według wzorców, więc nowa technika może przejść, a wyniki tylko zgłasza, bez ich usuwania.
fickling
fickling od Trail of Bits jest udostępniany na licencji LGPL-3.0. Jest opisywany jako dekompilator, analizator statyczny i narzędzie do przepisywania kodu bajtowego dla pickle. Potrafi zdekompilować plik pickle do czytelnego kodu Python, sprawdzić bezpieczeństwo za pomocą analizy statycznej i zgłosić błąd przed wczytaniem niebezpiecznego pliku. Najnowsze wydanie to v0.1.12 z 26 czerwca 2026 roku. Służy wtedy, gdy wynik trzeba zrozumieć, a nie tylko oznaczyć. Ograniczenie: jest narzędziem analitycznym dla pickle i nie obejmuje innych formatów odczytywanych przez ModelScan. Warunki jego licencji różnią się od liberalnych licencji pozostałych skanerów.
Skanowanie w Hugging Face Hub i safetensors
Hub skanuje każdy przesłany plik za pomocą ClamAV oraz skanowania importów pickle, które wymienia importy w każdym pliku pickle i wyróżnia podejrzane. Hugging Face: file scanning Pokazuje też w publicznych repozytoriach wyniki zewnętrznego skanera, Guardian od Protect AI. Hugging Face: Protect AI Ograniczenie, w sformułowaniu Hugging Face: skanowanie pickle nie jest w pełni niezawodne, jego listy są utrzymywane na zasadzie najlepszych starań, a sprawdzenie, co jest bezpieczne, należy do użytkownika. Alternatywą strukturalną jest safetensors, format na licencji Apache-2.0 utrzymywany przez Hugging Face, który przechowuje tensory bez zawartości wykonywalnej. Usuwa ryzyko pickle dla wag, ale nie mówi, czy same wagi są godne zaufania.
2. Pochodzenie modeli, podpisywanie i odciski
Skanowanie odpowiada na pytanie, czy wczytanie pliku jest niebezpieczne. Pochodzenie odpowiada na pytanie, kto go wytworzył i czy od tego czasu się zmienił. Te dwa pytania wymagają różnych narzędzi.
Sigstore model-transparency
model-transparency to projekt na licencji Apache-2.0 w organizacji Sigstore, który podpisuje i weryfikuje modele uczenia maszynowego. Może podpisywać przez Sigstore albo za pomocą kluczy, certyfikatów lub urządzeń PKCS #11 i tworzy pakiet zawierający kopertę DSSE z oświadczeniem in-toto. Najnowsze wydanie to v1.1.1 z 10 października 2025 roku, z commitami we wrześniu 2026 roku. Służy do tego, by odbiorca mógł zweryfikować, że posiadane przez niego pliki to te, które podpisał wydawca. Ograniczenia: dokumentacja deklaruje obsługę haszowania plików i fragmentów plików, a nie pojedynczych tensorów, a ważny podpis dowodzi pochodzenia i integralności, nie tego, że model jest bezpieczny. Hugging Face dokonuje tego samego rozróżnienia w przypadku podpisanych commitów, które gwarantują „pochodzenie pliku”, a nie jego bezpieczeństwo.
Wykazy komponentów AI i ML
CycloneDX, utrzymywany przez OWASP Foundation i komitet TC54 Ecma International, wymienia Machine Learning Bill of Materials (ML-BOM) wśród obsługiwanych typów BOM. Najnowsze wydanie, 1.7, opublikowano 21 października 2025 roku, a jego schematy są na licencji Apache-2.0. Profil AI w SPDX 3.0 dokumentuje komponenty AI, takie jak modele, zbiory danych i prompty, w jednym powiązanym rekordzie. Każdy z nich służy do prowadzenia spisu modeli, zbiorów danych i wersji zawartych w produkcie, czego reagowanie na incydent potrzebuje w pierwszej kolejności. Ograniczenie: BOM zapisuje to, co deklaruje autor. Żaden z formatów nie weryfikuje tej deklaracji.
Narzędzia badawcze do odcisków i znakowania wodnego
Instructional Fingerprinting to kod artykułu naukowego (arXiv 2401.12255), który osadza odcisk w modelu językowym, aby właściciel mógł później sprawdzić, czy inny model od niego pochodzi. Jest to kod badawczy na licencji MIT, a ostatnia aktualizacja repozytorium miała miejsce w lipcu 2024 roku. MarkLLM od grupy THU-BPM to zestaw narzędzi na licencji Apache-2.0 do znakowania wodnego tekstu generowanego przez LLM, zaprezentowany jako demo na EMNLP 2024. Oba odpowiadają na różne pytania: pierwszy oznacza model, drugi jego wyniki. Służą do badania atrybucji, a nie jako kontrola produkcyjna. Ograniczenie: oba są artefaktami badawczymi i żaden nie zastępuje podpisywania rozpowszechnianego pliku.
3. Red teaming LLM i skanowanie podatności
Te narzędzia wysyłają do modelu lub aplikacji dane wejściowe o charakterze adwersaryjnym i rejestrują odpowiedzi. Testują zachowanie, a nie pliki.
garak
garak to skaner podatności LLM na licencji Apache-2.0 utrzymywany przez NVIDIA. Jego README podaje, że sprawdza, „czy LLM można doprowadzić do awarii w niepożądany sposób”, za pomocą sond dotyczących wstrzykiwania promptów, wycieku danych, halucynacji, toksyczności i jailbreaków, z których każda jest połączona z detektorem. Najnowsze wydanie to v0.17.0 z 9 września 2026 roku. Służy jako szerokie skanowanie bazowe punktu końcowego modelu. Ograniczenia: wymaga dostępu przez API lub lokalnego wdrożenia celu, niektóre sondy są zasobochłonne, a README odnotowuje ograniczoną obsługę modeli wizyjnych i status prototypu niektórych sond.
PyRIT
PyRIT to framework na licencji MIT opisywany jako zbudowany dla specjalistów ds. bezpieczeństwa i inżynierów w celu identyfikowania ryzyk w systemach generatywnej AI. Jest utrzymywany przez Microsoft, a najnowsze wydanie to v1.1.0 z 4 września 2026 roku. Wcześniejsze repozytorium w organizacji Azure zostało zarchiwizowane 27 marca 2026 roku ze wskazaniem na repozytorium Microsoftu, więc odnośniki do starego adresu prowadzą do kopii tylko do odczytu. Służy do skryptowych, wieloturowych kampanii red teamingowych prowadzonych przez zespół, który będzie pisał kod. Ograniczenie: jest frameworkiem, a nie skanerem uruchamianym jednym poleceniem.
promptfoo
promptfoo to narzędzie wiersza poleceń i biblioteka na licencji MIT do oceny aplikacji LLM oraz do red teamingu i skanowania podatności, z integracją CI. Najnowsze wydanie to 0.123.1 z 18 września 2026 roku. Jego README stwierdza: „Promptfoo jest teraz częścią OpenAI. Promptfoo pozostaje open source na licencji MIT”. Służy do włączenia testów promptów i kontroli adwersaryjnych do kompilacji. Ograniczenie: wyniki zależą od skonfigurowanego dostawcy i modelu oceniającego, a większość dostawców wymaga kluczy API. Zmiana właściciela to fakt dotyczący zarządzania projektem, który warto odnotować przy wyborze narzędzia do pracy w środowisku regulowanym.
Giskard
Giskard to biblioteka Python na licencji Apache-2.0 od organizacji Giskard-AI. Jej wersja 3 ma dwa komponenty opisywane jako stabilne: giskard-checks, framework testowy wykorzystujący scenariusze i oceny typu LLM-as-judge, oraz giskard-scan, skaner podatności agentów. Służy do testowania agentów i systemów z generowaniem wspomaganym wyszukiwaniem. Ograniczenia: wersja 3 wymaga Pythona 3.12 lub nowszego, a wersja 2, która obejmowała skanowanie danych tabelarycznych i klasycznego uczenia maszynowego, nie jest już aktywnie utrzymywana.
4. Zabezpieczenia w czasie działania i wykrywanie wstrzykiwania promptów
Zabezpieczenia (guardrails) znajdują się na ścieżce żądań i klasyfikują lub ograniczają dane wejściowe i wyjściowe podczas działania aplikacji.
Llama Guard, Prompt Guard i LlamaFirewall
Projekt Purple Llama od Meta grupuje zabezpieczenia dla otwartych modeli. Llama Guard to rodzina modeli moderujących dane wejściowe i wyjściowe. Prompt Guard 2 jest opisywany jako lekki klasyfikator bezpośrednich prób wstrzykiwania promptów, a LlamaFirewall łączy go ze skanerem zgodności (alignment check) i skanerem kodu dla agentów. Według tabeli licencji projektu modele są rozpowszechniane na licencjach Llama Community Licence, a inne komponenty, takie jak Code Shield i ewaluacje, na licencji MIT. Dostęp do modeli w Hugging Face jest ograniczony. Służą tam, gdzie mały klasyfikator przed modelem jest akceptowalny. Ograniczenia: klasyfikator ogranicza próby przypominające znane wzorce, ale nie eliminuje tej klasy ataków.
NeMo Guardrails
NeMo Guardrails to zestaw narzędzi na licencji Apache-2.0 od NVIDIA do dodawania programowalnych barier (rails) do aplikacji LLM, wykorzystujący język modelowania Colang do sterowania przebiegiem dialogu. Najnowsze wydanie to v0.24.1 z 16 września 2026 roku. Służy do ograniczania tematów, formatów i ścieżek dialogu. Ograniczenie: bariery są polityką napisaną przez programistę, więc ich zasięg jest tak szeroki, jak to, co przewidziano.
Rebuff i LLM Guard, obecnie zarchiwizowane
Rebuff, samoutwardzający się detektor wstrzykiwania promptów wykorzystujący heurystyki, kontrolę przez LLM, bazę wektorową wcześniejszych ataków i tokeny kanarkowe, został zarchiwizowany 16 maja 2025 roku. Jego README stwierdza, że jest prototypem i nie może zapewnić pełnej ochrony przed wstrzykiwaniem promptów. LLM Guard, zestaw skanerów danych wejściowych i wyjściowych na licencji MIT od tego samego opiekuna, został zarchiwizowany w lipcu 2026 roku. Oba pozostają dostępne do wglądu. Ilustrują praktyczną kwestię: projekty detektorów mogą tracić opiekunów, więc zabezpieczenie powinno być wymienne.
5. Skanery bezpieczeństwa agentów i MCP
Agenci dodają narzędzia, a opisy narzędzi to tekst, który czyta model. Skanery z tej grupy sprawdzają te narzędzia i ich konfigurację.
Snyk Agent Scan
Agent Scan, dawniej MCP-Scan, to skaner na licencji Apache-2.0 utrzymywany przez Snyk. Wykrywa komponenty agentów na komputerze, w tym serwery MCP i umiejętności (skills) w klientach takich jak Claude, Cursor, VS Code i GitHub Copilot, i sprawdza je pod kątem wstrzykiwania promptów, zatruwania narzędzi i powiązanych problemów. Najnowsze wydanie to v0.6.8 z 29 września 2026 roku. Służy do audytu tego, co zainstalowano na komputerze programisty. Ograniczenia: README stwierdza, że obecnie nie przyjmuje wkładu z zewnątrz oraz że istnieją dwie linie wydań o różnych formatach wyników.
Cisco MCP Scanner
MCP Scanner to narzędzie na licencji Apache-2.0 od Cisco AI Defense. Analizuje narzędzia, prompty, zasoby i zależności MCP za pomocą trzech silników, które mogą działać osobno lub razem: reguł YARA, analizy przez LLM i Cisco AI Defense API. Najnowsze wydanie to 4.8.4 z 28 sierpnia 2026 roku. Służy do sprawdzenia serwera przed jego przyjęciem. Ograniczenie: silniki LLM i API wymagają zewnętrznych poświadczeń, a skanowanie opisu serwera niewiele mówi o tym, co robi jego kod po aktualizacji.
6. Miejsce kontroli sieci
Powyższe narzędzia badają pliki, modele, prompty i konfiguracje. Żadne z nich nie decyduje, która aplikacja może otworzyć połączenie z którym serwerem. To rola kontroli ruchu wychodzącego, a ma ona znaczenie, ponieważ ryzyka z poprzednich sekcji zbiegają się w sieci: zmodyfikowane środowisko uruchomieniowe modelu, zatrute narzędzie lub agent po wstrzyknięciu promptu musi połączyć się z miejscem docelowym, aby wyprowadzić dane lub otrzymać instrukcje.
FireAI, rozwijany przez HisnLabs, to zapora ruchu wychodzącego dla macOS. Działa jako filtr treści Apple Network Extension, identyfikuje każdą aplikację po podpisie kodu i może zezwolić na połączenie, zablokować je lub zapytać o każde miejsce docelowe, z regułami dla aplikacji, domeny lub adresu. W odniesieniu do pracy z AI na Macu oznacza to, że serwer wnioskowania, agenta programistycznego lub klienta MCP można ograniczyć do miejsc docelowych potrzebnych do jego zadania, a nowe miejsce docelowe wymaga decyzji. Dokumentacja filtra opisuje, co widzi FireAI: tożsamość aplikacji, zdalny host lub adres, port i protokół.
FireAI nie skanuje plików modeli, nie weryfikuje podpisów, nie przeprowadza red teamingu modeli ani nie klasyfikuje promptów. Nie czyta zawartości szyfrowanych połączeń, więc nie potrafi odróżnić uprawnionego żądania od wstrzykniętego, gdy oba trafiają do dozwolonego miejsca docelowego. Uzupełnia powyższe narzędzia i nie zastępuje żadnego z nich.
Porównanie
| Narzędzie | Zadanie | Opiekun | Licencja | Status na 30 września 2026 |
|---|---|---|---|---|
| ModelScan | Skanowanie plików modeli | Protect AI | Apache-2.0 | Aktywne, v0.8.8 |
| picklescan | Skanowanie pickle | mmaitre314 | MIT | Aktywne, v1.0.5 |
| fickling | Analiza pickle | Trail of Bits | LGPL-3.0 | Aktywne, v0.1.12 |
| safetensors | Bezpieczny format wag | Hugging Face | Apache-2.0 | Aktywne |
| model-transparency | Podpisywanie modeli | Sigstore | Apache-2.0 | Aktywne, v1.1.1 |
| CycloneDX | Specyfikacja ML-BOM | OWASP, Ecma TC54 | Apache-2.0 (schematy) | Aktywne, 1.7 |
| Instructional Fingerprinting | Odcisk modelu (badania) | Autorzy artykułu | MIT | Ostatnia aktualizacja: lipiec 2024 |
| MarkLLM | Znakowanie wodne tekstu (badania) | THU-BPM | Apache-2.0 | Aktywne |
| garak | Skanowanie podatności | NVIDIA | Apache-2.0 | Aktywne, v0.17.0 |
| PyRIT | Framework red teamingowy | Microsoft | MIT | Aktywne, v1.1.0 |
| promptfoo | Ewaluacje i red teaming | Promptfoo, część OpenAI | MIT | Aktywne, 0.123.1 |
| Giskard v3 | Testy i skanowanie agentów | Giskard-AI | Apache-2.0 | Aktywne; v2 nieutrzymywana |
| Llama Guard, Prompt Guard | Modele ochronne | Meta | Llama Community Licences | Modele z kwietnia 2025 |
| NeMo Guardrails | Programowalne bariery | NVIDIA | Apache-2.0 | Aktywne, v0.24.1 |
| Rebuff, LLM Guard | Wykrywanie wstrzyknięć | Protect AI | Apache-2.0, MIT | Zarchiwizowane |
| Agent Scan | Skanowanie agentów i MCP | Snyk | Apache-2.0 | Aktywne, v0.6.8 |
| MCP Scanner | Skanowanie serwerów MCP | Cisco AI Defense | Apache-2.0 | Aktywne, 4.8.4 |
| FireAI | Kontrola ruchu wychodzącego dla aplikacji w macOS | HisnLabs | Komercyjna | Nie skanuje modeli |
Ograniczenia
- Żadne pojedyncze narzędzie nie obejmuje sześciu zadań. Czysty wynik skanowania pliku nic nie mówi o zachowaniu modelu, podpis nic nie mówi o bezpieczeństwie, a skanowanie red teamingowe nic nie mówi o zawartości pliku.
- Skanery i zabezpieczenia są detektorami. Mogą przeoczyć nowe techniki, co przyznaje dokumentacja ModelScan, picklescan i Rebuff, a ich zakres zmienia się wraz ze zmianą ataków.
- Utrzymanie jest nierówne. Dwa wymienione tu projekty detektorów są zarchiwizowane, jedno narzędzie zmieniło właściciela, jedno ma indywidualnego opiekuna, a jedno repozytorium badawcze nie zmieniło się od 2024 roku. Przed oparciem się na projekcie sprawdź jego stan.
- Przegląd ograniczono do otwartych narzędzi ze źródłami pierwotnymi, które można było przeczytać. Wyklucza platformy komercyjne i nie porównuje wyników wykrywania, ponieważ źródła nie podają porównywalnych danych.
- Licencje odczytano ze stron repozytoriów i tabel licencji. Zweryfikuj je przed redystrybucją, w szczególności Llama Community Licences i warunki LGPL dla fickling.
- Warstwa sieciowa widzi połączenia, a nie ich znaczenie. Dozwolone miejsce docelowe nadal może otrzymać dane ze skompromitowanego środowiska uruchomieniowego modelu.
Jaką rolę odgrywają FireAI i HisnLabs
Przeskanuj model, podpisz model, przetestuj model. Potem zdecyduj, z czym może łączyć się jego aplikacja.
FireAI to własny produkt HisnLabs: zapora sieciowa z AI działająca bezpośrednio na Macu. Pokazuje prostym językiem każde połączenie nawiązywane przez twoje aplikacje i pozwala ci decydować, co opuszcza twojego Maca — jej AI działa lokalnie, więc twój ruch nigdy nie jest wysyłany do nas ani do nikogo innego. Zespół badań nad bezpieczeństwem HisnLabs dba o to, by te decyzje pozostały trafne: kataloguje, które domeny to zwykła telemetria, a które prawdziwa usługa, śledzi kraj i sieć stojące za połączeniem oraz trenuje lokalny model (funkcję FireAI Pilot) na rzeczywistych wzorcach ruchu — a nic z tego nie opuszcza twojego Maca.
Możesz przeczytać o decyzjach technicznych, które za tym stoją, albo wypróbować FireAI przez 17 dni na FireAI od HisnLabs.
