# Najlepsze narzędzia 2026 roku do zabezpieczania modeli AI

> Wyważony przegląd otwartych narzędzi zabezpieczających modele AI i aplikacje LLM w 2026 roku, według zadań, z opiekunami, licencjami, ograniczeniami i rolą kontroli sieci.

FireAI Security & Research Team (HisnLabs) · Published 2026-09-30
Canonical: https://hisnlabs.com/pl/blog/najlepsze-narzedzia-bezpieczenstwa-modeli-ai-2026

Bezpieczeństwo modeli AI to nie jedna dyscyplina, lecz sześć zadań, z których każde ma własne narzędzia: skanowanie plików modeli, ustalanie pochodzenia, badanie modelu pod kątem słabości, ochrona w czasie działania, weryfikacja narzędzi agentowych wokół modelu oraz ograniczanie, z czym może łączyć się aplikacja, która go hostuje. Ten przegląd, przygotowany przez HisnLabs, twórcę FireAI, obejmuje otwarte narzędzia, których repozytoria lub dokumentację przeczytano 30 września 2026 roku. Licencje, opiekunów i status podano tak, jak przedstawiają je źródła pierwotne, a żadne narzędzie nie jest stawiane wyżej od innego, ponieważ zadania ze sobą nie konkurują.

## Zakres i metoda

Narzędzie uwzględniano tylko wtedy, gdy można było otworzyć jego oficjalne repozytorium lub dokumentację, ustalić licencję i sprawdzić stan utrzymania (zarchiwizowane lub aktywne oraz data najnowszego wydania, jeśli strona wydań ją podaje). Wymienione niżej wydania są najnowsze w chwili lektury. Nic tu nie jest pomiarem wydajności: źródła nie podają porównywalnych wyników wykrywania i żadnych takich wyników się nie przypisuje. Platformy komercyjne pominięto, chyba że przedmiotem jest ich otwarty komponent.

Kategorie odpowiadają kolejności, w jakiej model przechodzi przez projekt: plik jest pobierany, sprawdzane jest jego pochodzenie, model jest testowany, wdrażany za zabezpieczeniami, łączony z narzędziami, a aplikacja, która go uruchamia, łączy się z siecią. [OWASP Top 10 for Large Language Model Applications](https://owasp.org/www-project-top-10-for-large-language-model-applications/), utrzymywany w ramach OWASP GenAI Security Project, stanowi zwykle wspólne słownictwo dla ryzyk na poziomie aplikacji w kategoriach od trzeciej do piątej.

## 1. Skanowanie plików modeli

Wiele plików modeli jest serializowanych w formacie pickle języka Python, który może wykonywać kod podczas wczytywania. Dokumentacja Hugging Face stwierdza, że wczytanie pliku pickle „oznacza, że kod może zostać wykonany”, i wymienia opkody `GLOBAL`, `STACK_GLOBAL` i `REDUCE` jako te, które stanowią zagrożenie. [Hugging Face: Pickle scanning](https://huggingface.co/docs/hub/security-pickle) Skanery odczytują instrukcje pliku bez jego wczytywania i oznaczają niebezpieczne importy.

### ModelScan

[ModelScan](https://github.com/protectai/modelscan) jest utrzymywany przez Protect AI na licencji Apache-2.0. Skanuje formaty oparte na pickle (PyTorch, scikit-learn, XGBoost, joblib, cloudpickle), TensorFlow SavedModel oraz pliki Keras H5 i V3, porządkuje wyniki według istotności i kończy działanie kodami dostosowanymi do potoków CI. Najnowsze wydanie na jego stronie to v0.8.8 z 18 lutego 2026 roku, a repozytorium wykazywało aktywność 28 września 2026 roku. Służy jako bramka, zanim pobrany model trafi do kompilacji. Ograniczenie: README opisuje wykrywanie oparte na sygnaturach, które może dawać wyniki fałszywie dodatnie i fałszywie ujemne, a wyniki wymagają przeglądu przez człowieka.

### picklescan

[picklescan](https://github.com/mmaitre314/picklescan) to skaner na licencji MIT utrzymywany przez konto indywidualne, mmaitre314. Dokumentacja Hugging Face wymienia picklescan wśród narzędzi opracowanych dla Hub. Najnowsze wydanie to v1.0.5 z 1 lipca 2026 roku. Skanuje pliki pickle, archiwa PyTorch i kontenery ZIP i może skanować ścieżkę lokalną, adres URL lub model z Hugging Face. Służy do szybkiego sprawdzenia w skrypcie. Ograniczenie: dopasowuje niebezpieczne operacje według wzorców, więc nowa technika może przejść, a wyniki tylko zgłasza, bez ich usuwania.

### fickling

[fickling](https://github.com/trailofbits/fickling) od Trail of Bits jest udostępniany na licencji LGPL-3.0. Jest opisywany jako dekompilator, analizator statyczny i narzędzie do przepisywania kodu bajtowego dla pickle. Potrafi zdekompilować plik pickle do czytelnego kodu Python, sprawdzić bezpieczeństwo za pomocą analizy statycznej i zgłosić błąd przed wczytaniem niebezpiecznego pliku. Najnowsze wydanie to v0.1.12 z 26 czerwca 2026 roku. Służy wtedy, gdy wynik trzeba zrozumieć, a nie tylko oznaczyć. Ograniczenie: jest narzędziem analitycznym dla pickle i nie obejmuje innych formatów odczytywanych przez ModelScan. Warunki jego licencji różnią się od liberalnych licencji pozostałych skanerów.

### Skanowanie w Hugging Face Hub i safetensors

Hub skanuje każdy przesłany plik za pomocą ClamAV oraz skanowania importów pickle, które wymienia importy w każdym pliku pickle i wyróżnia podejrzane. [Hugging Face: file scanning](https://huggingface.co/docs/hub/security-malware) Pokazuje też w publicznych repozytoriach wyniki zewnętrznego skanera, Guardian od Protect AI. [Hugging Face: Protect AI](https://huggingface.co/docs/hub/security-protectai) Ograniczenie, w sformułowaniu Hugging Face: skanowanie pickle nie jest w pełni niezawodne, jego listy są utrzymywane na zasadzie najlepszych starań, a sprawdzenie, co jest bezpieczne, należy do użytkownika. Alternatywą strukturalną jest [safetensors](https://github.com/huggingface/safetensors), format na licencji Apache-2.0 utrzymywany przez Hugging Face, który przechowuje tensory bez zawartości wykonywalnej. Usuwa ryzyko pickle dla wag, ale nie mówi, czy same wagi są godne zaufania.

## 2. Pochodzenie modeli, podpisywanie i odciski

Skanowanie odpowiada na pytanie, czy wczytanie pliku jest niebezpieczne. Pochodzenie odpowiada na pytanie, kto go wytworzył i czy od tego czasu się zmienił. Te dwa pytania wymagają różnych narzędzi.

### Sigstore model-transparency

[model-transparency](https://github.com/sigstore/model-transparency) to projekt na licencji Apache-2.0 w organizacji Sigstore, który podpisuje i weryfikuje modele uczenia maszynowego. Może podpisywać przez Sigstore albo za pomocą kluczy, certyfikatów lub urządzeń PKCS #11 i tworzy pakiet zawierający kopertę DSSE z oświadczeniem in-toto. Najnowsze wydanie to v1.1.1 z 10 października 2025 roku, z commitami we wrześniu 2026 roku. Służy do tego, by odbiorca mógł zweryfikować, że posiadane przez niego pliki to te, które podpisał wydawca. Ograniczenia: dokumentacja deklaruje obsługę haszowania plików i fragmentów plików, a nie pojedynczych tensorów, a ważny podpis dowodzi pochodzenia i integralności, nie tego, że model jest bezpieczny. Hugging Face dokonuje tego samego rozróżnienia w przypadku podpisanych commitów, które gwarantują „pochodzenie pliku”, a nie jego bezpieczeństwo.

### Wykazy komponentów AI i ML

[CycloneDX](https://github.com/CycloneDX/specification), utrzymywany przez OWASP Foundation i komitet TC54 Ecma International, wymienia Machine Learning Bill of Materials (ML-BOM) wśród obsługiwanych typów BOM. Najnowsze wydanie, 1.7, opublikowano 21 października 2025 roku, a jego schematy są na licencji Apache-2.0. [Profil AI w SPDX 3.0](https://spdx.dev/learn/areas-of-interest/ai/) dokumentuje komponenty AI, takie jak modele, zbiory danych i prompty, w jednym powiązanym rekordzie. Każdy z nich służy do prowadzenia spisu modeli, zbiorów danych i wersji zawartych w produkcie, czego reagowanie na incydent potrzebuje w pierwszej kolejności. Ograniczenie: BOM zapisuje to, co deklaruje autor. Żaden z formatów nie weryfikuje tej deklaracji.

### Narzędzia badawcze do odcisków i znakowania wodnego

[Instructional Fingerprinting](https://github.com/cnut1648/Model-Fingerprint) to kod artykułu naukowego ([arXiv 2401.12255](https://arxiv.org/abs/2401.12255)), który osadza odcisk w modelu językowym, aby właściciel mógł później sprawdzić, czy inny model od niego pochodzi. Jest to kod badawczy na licencji MIT, a ostatnia aktualizacja repozytorium miała miejsce w lipcu 2024 roku. [MarkLLM](https://github.com/THU-BPM/MarkLLM) od grupy THU-BPM to zestaw narzędzi na licencji Apache-2.0 do znakowania wodnego tekstu generowanego przez LLM, zaprezentowany jako demo na EMNLP 2024. Oba odpowiadają na różne pytania: pierwszy oznacza model, drugi jego wyniki. Służą do badania atrybucji, a nie jako kontrola produkcyjna. Ograniczenie: oba są artefaktami badawczymi i żaden nie zastępuje podpisywania rozpowszechnianego pliku.

> FireAI, zapora sieciowa dla macOS działająca na urządzeniu, rozwijana przez HisnLabs, nie skanuje plików modeli ani ich nie podpisuje. Kontroluje, która aplikacja na Macu z czym się łączy. Dostępny jest 17-dniowy okres próbny. [Download FireAI for Mac](https://hisnlabs.com/en/download)

## 3. Red teaming LLM i skanowanie podatności

Te narzędzia wysyłają do modelu lub aplikacji dane wejściowe o charakterze adwersaryjnym i rejestrują odpowiedzi. Testują zachowanie, a nie pliki.

### garak

[garak](https://github.com/NVIDIA/garak) to skaner podatności LLM na licencji Apache-2.0 utrzymywany przez NVIDIA. Jego README podaje, że sprawdza, „czy LLM można doprowadzić do awarii w niepożądany sposób”, za pomocą sond dotyczących wstrzykiwania promptów, wycieku danych, halucynacji, toksyczności i jailbreaków, z których każda jest połączona z detektorem. Najnowsze wydanie to v0.17.0 z 9 września 2026 roku. Służy jako szerokie skanowanie bazowe punktu końcowego modelu. Ograniczenia: wymaga dostępu przez API lub lokalnego wdrożenia celu, niektóre sondy są zasobochłonne, a README odnotowuje ograniczoną obsługę modeli wizyjnych i status prototypu niektórych sond.

### PyRIT

[PyRIT](https://github.com/microsoft/PyRIT) to framework na licencji MIT opisywany jako zbudowany dla specjalistów ds. bezpieczeństwa i inżynierów w celu identyfikowania ryzyk w systemach generatywnej AI. Jest utrzymywany przez Microsoft, a najnowsze wydanie to v1.1.0 z 4 września 2026 roku. Wcześniejsze repozytorium w organizacji Azure zostało zarchiwizowane 27 marca 2026 roku ze wskazaniem na repozytorium Microsoftu, więc odnośniki do starego adresu prowadzą do kopii tylko do odczytu. Służy do skryptowych, wieloturowych kampanii red teamingowych prowadzonych przez zespół, który będzie pisał kod. Ograniczenie: jest frameworkiem, a nie skanerem uruchamianym jednym poleceniem.

### promptfoo

[promptfoo](https://github.com/promptfoo/promptfoo) to narzędzie wiersza poleceń i biblioteka na licencji MIT do oceny aplikacji LLM oraz do red teamingu i skanowania podatności, z integracją CI. Najnowsze wydanie to 0.123.1 z 18 września 2026 roku. Jego README stwierdza: „Promptfoo jest teraz częścią OpenAI. Promptfoo pozostaje open source na licencji MIT”. Służy do włączenia testów promptów i kontroli adwersaryjnych do kompilacji. Ograniczenie: wyniki zależą od skonfigurowanego dostawcy i modelu oceniającego, a większość dostawców wymaga kluczy API. Zmiana właściciela to fakt dotyczący zarządzania projektem, który warto odnotować przy wyborze narzędzia do pracy w środowisku regulowanym.

### Giskard

[Giskard](https://github.com/Giskard-AI/giskard-oss) to biblioteka Python na licencji Apache-2.0 od organizacji Giskard-AI. Jej wersja 3 ma dwa komponenty opisywane jako stabilne: giskard-checks, framework testowy wykorzystujący scenariusze i oceny typu LLM-as-judge, oraz giskard-scan, skaner podatności agentów. Służy do testowania agentów i systemów z generowaniem wspomaganym wyszukiwaniem. Ograniczenia: wersja 3 wymaga Pythona 3.12 lub nowszego, a wersja 2, która obejmowała skanowanie danych tabelarycznych i klasycznego uczenia maszynowego, nie jest już aktywnie utrzymywana.

## 4. Zabezpieczenia w czasie działania i wykrywanie wstrzykiwania promptów

Zabezpieczenia (guardrails) znajdują się na ścieżce żądań i klasyfikują lub ograniczają dane wejściowe i wyjściowe podczas działania aplikacji.

### Llama Guard, Prompt Guard i LlamaFirewall

Projekt [Purple Llama](https://github.com/meta-llama/PurpleLlama) od Meta grupuje zabezpieczenia dla otwartych modeli. Llama Guard to rodzina modeli moderujących dane wejściowe i wyjściowe. Prompt Guard 2 jest opisywany jako lekki klasyfikator bezpośrednich prób wstrzykiwania promptów, a LlamaFirewall łączy go ze skanerem zgodności (alignment check) i skanerem kodu dla agentów. Według tabeli licencji projektu modele są rozpowszechniane na licencjach Llama Community Licence, a inne komponenty, takie jak Code Shield i ewaluacje, na licencji MIT. Dostęp do modeli w Hugging Face jest ograniczony. Służą tam, gdzie mały klasyfikator przed modelem jest akceptowalny. Ograniczenia: klasyfikator ogranicza próby przypominające znane wzorce, ale nie eliminuje tej klasy ataków.

### NeMo Guardrails

[NeMo Guardrails](https://github.com/NVIDIA-NeMo/Guardrails) to zestaw narzędzi na licencji Apache-2.0 od NVIDIA do dodawania programowalnych barier (rails) do aplikacji LLM, wykorzystujący język modelowania Colang do sterowania przebiegiem dialogu. Najnowsze wydanie to v0.24.1 z 16 września 2026 roku. Służy do ograniczania tematów, formatów i ścieżek dialogu. Ograniczenie: bariery są polityką napisaną przez programistę, więc ich zasięg jest tak szeroki, jak to, co przewidziano.

### Rebuff i LLM Guard, obecnie zarchiwizowane

[Rebuff](https://github.com/protectai/rebuff), samoutwardzający się detektor wstrzykiwania promptów wykorzystujący heurystyki, kontrolę przez LLM, bazę wektorową wcześniejszych ataków i tokeny kanarkowe, został zarchiwizowany 16 maja 2025 roku. Jego README stwierdza, że jest prototypem i nie może zapewnić pełnej ochrony przed wstrzykiwaniem promptów. [LLM Guard](https://github.com/protectai/llm-guard), zestaw skanerów danych wejściowych i wyjściowych na licencji MIT od tego samego opiekuna, został zarchiwizowany w lipcu 2026 roku. Oba pozostają dostępne do wglądu. Ilustrują praktyczną kwestię: projekty detektorów mogą tracić opiekunów, więc zabezpieczenie powinno być wymienne.

## 5. Skanery bezpieczeństwa agentów i MCP

Agenci dodają narzędzia, a opisy narzędzi to tekst, który czyta model. Skanery z tej grupy sprawdzają te narzędzia i ich konfigurację.

### Snyk Agent Scan

[Agent Scan](https://github.com/snyk/agent-scan), dawniej MCP-Scan, to skaner na licencji Apache-2.0 utrzymywany przez Snyk. Wykrywa komponenty agentów na komputerze, w tym serwery MCP i umiejętności (skills) w klientach takich jak Claude, Cursor, VS Code i GitHub Copilot, i sprawdza je pod kątem wstrzykiwania promptów, zatruwania narzędzi i powiązanych problemów. Najnowsze wydanie to v0.6.8 z 29 września 2026 roku. Służy do audytu tego, co zainstalowano na komputerze programisty. Ograniczenia: README stwierdza, że obecnie nie przyjmuje wkładu z zewnątrz oraz że istnieją dwie linie wydań o różnych formatach wyników.

### Cisco MCP Scanner

[MCP Scanner](https://github.com/cisco-ai-defense/mcp-scanner) to narzędzie na licencji Apache-2.0 od Cisco AI Defense. Analizuje narzędzia, prompty, zasoby i zależności MCP za pomocą trzech silników, które mogą działać osobno lub razem: reguł YARA, analizy przez LLM i Cisco AI Defense API. Najnowsze wydanie to 4.8.4 z 28 sierpnia 2026 roku. Służy do sprawdzenia serwera przed jego przyjęciem. Ograniczenie: silniki LLM i API wymagają zewnętrznych poświadczeń, a skanowanie opisu serwera niewiele mówi o tym, co robi jego kod po aktualizacji.

## 6. Miejsce kontroli sieci

Powyższe narzędzia badają pliki, modele, prompty i konfiguracje. Żadne z nich nie decyduje, która aplikacja może otworzyć połączenie z którym serwerem. To rola kontroli ruchu wychodzącego, a ma ona znaczenie, ponieważ ryzyka z poprzednich sekcji zbiegają się w sieci: zmodyfikowane środowisko uruchomieniowe modelu, zatrute narzędzie lub agent po wstrzyknięciu promptu musi połączyć się z miejscem docelowym, aby wyprowadzić dane lub otrzymać instrukcje.

FireAI, rozwijany przez HisnLabs, to zapora ruchu wychodzącego dla macOS. Działa jako filtr treści Apple Network Extension, identyfikuje każdą aplikację po podpisie kodu i może zezwolić na połączenie, zablokować je lub zapytać o każde miejsce docelowe, z [regułami dla aplikacji, domeny lub adresu](https://hisnlabs.com/pl/docs/per-app-rules). W odniesieniu do pracy z AI na Macu oznacza to, że serwer wnioskowania, agenta programistycznego lub klienta MCP można ograniczyć do miejsc docelowych potrzebnych do jego zadania, a nowe miejsce docelowe wymaga decyzji. [Dokumentacja filtra](https://hisnlabs.com/pl/docs/how-the-network-filter-works) opisuje, co widzi FireAI: tożsamość aplikacji, zdalny host lub adres, port i protokół.

FireAI nie skanuje plików modeli, nie weryfikuje podpisów, nie przeprowadza red teamingu modeli ani nie klasyfikuje promptów. Nie czyta zawartości szyfrowanych połączeń, więc nie potrafi odróżnić uprawnionego żądania od wstrzykniętego, gdy oba trafiają do dozwolonego miejsca docelowego. Uzupełnia powyższe narzędzia i nie zastępuje żadnego z nich.

## Porównanie

| Narzędzie | Zadanie | Opiekun | Licencja | Status na 30 września 2026 |
| --- | --- | --- | --- | --- |
| ModelScan | Skanowanie plików modeli | Protect AI | Apache-2.0 | Aktywne, v0.8.8 |
| picklescan | Skanowanie pickle | mmaitre314 | MIT | Aktywne, v1.0.5 |
| fickling | Analiza pickle | Trail of Bits | LGPL-3.0 | Aktywne, v0.1.12 |
| safetensors | Bezpieczny format wag | Hugging Face | Apache-2.0 | Aktywne |
| model-transparency | Podpisywanie modeli | Sigstore | Apache-2.0 | Aktywne, v1.1.1 |
| CycloneDX | Specyfikacja ML-BOM | OWASP, Ecma TC54 | Apache-2.0 (schematy) | Aktywne, 1.7 |
| Instructional Fingerprinting | Odcisk modelu (badania) | Autorzy artykułu | MIT | Ostatnia aktualizacja: lipiec 2024 |
| MarkLLM | Znakowanie wodne tekstu (badania) | THU-BPM | Apache-2.0 | Aktywne |
| garak | Skanowanie podatności | NVIDIA | Apache-2.0 | Aktywne, v0.17.0 |
| PyRIT | Framework red teamingowy | Microsoft | MIT | Aktywne, v1.1.0 |
| promptfoo | Ewaluacje i red teaming | Promptfoo, część OpenAI | MIT | Aktywne, 0.123.1 |
| Giskard v3 | Testy i skanowanie agentów | Giskard-AI | Apache-2.0 | Aktywne; v2 nieutrzymywana |
| Llama Guard, Prompt Guard | Modele ochronne | Meta | Llama Community Licences | Modele z kwietnia 2025 |
| NeMo Guardrails | Programowalne bariery | NVIDIA | Apache-2.0 | Aktywne, v0.24.1 |
| Rebuff, LLM Guard | Wykrywanie wstrzyknięć | Protect AI | Apache-2.0, MIT | Zarchiwizowane |
| Agent Scan | Skanowanie agentów i MCP | Snyk | Apache-2.0 | Aktywne, v0.6.8 |
| MCP Scanner | Skanowanie serwerów MCP | Cisco AI Defense | Apache-2.0 | Aktywne, 4.8.4 |
| FireAI | Kontrola ruchu wychodzącego dla aplikacji w macOS | HisnLabs | Komercyjna | Nie skanuje modeli |

*Źródła: repozytorium lub dokumentacja każdego projektu, przeczytane 30 września 2026 roku. Status odzwierciedla stronę repozytorium, a nie ocenę jakości.*

## Ograniczenia

- Żadne pojedyncze narzędzie nie obejmuje sześciu zadań. Czysty wynik skanowania pliku nic nie mówi o zachowaniu modelu, podpis nic nie mówi o bezpieczeństwie, a skanowanie red teamingowe nic nie mówi o zawartości pliku.
- Skanery i zabezpieczenia są detektorami. Mogą przeoczyć nowe techniki, co przyznaje dokumentacja ModelScan, picklescan i Rebuff, a ich zakres zmienia się wraz ze zmianą ataków.
- Utrzymanie jest nierówne. Dwa wymienione tu projekty detektorów są zarchiwizowane, jedno narzędzie zmieniło właściciela, jedno ma indywidualnego opiekuna, a jedno repozytorium badawcze nie zmieniło się od 2024 roku. Przed oparciem się na projekcie sprawdź jego stan.
- Przegląd ograniczono do otwartych narzędzi ze źródłami pierwotnymi, które można było przeczytać. Wyklucza platformy komercyjne i nie porównuje wyników wykrywania, ponieważ źródła nie podają porównywalnych danych.
- Licencje odczytano ze stron repozytoriów i tabel licencji. Zweryfikuj je przed redystrybucją, w szczególności Llama Community Licences i warunki LGPL dla fickling.
- Warstwa sieciowa widzi połączenia, a nie ich znaczenie. Dozwolone miejsce docelowe nadal może otrzymać dane ze skompromitowanego środowiska uruchomieniowego modelu.

## Jaką rolę odgrywają FireAI i HisnLabs

Przeskanuj model, podpisz model, przetestuj model. Potem zdecyduj, z czym może łączyć się jego aplikacja.

FireAI to własny produkt HisnLabs: zapora sieciowa z AI działająca bezpośrednio na Macu. Pokazuje prostym językiem każde połączenie nawiązywane przez twoje aplikacje i pozwala ci decydować, co opuszcza twojego Maca — jej AI działa lokalnie, więc twój ruch nigdy nie jest wysyłany do nas ani do nikogo innego. Zespół badań nad bezpieczeństwem HisnLabs dba o to, by te decyzje pozostały trafne: kataloguje, które domeny to zwykła telemetria, a które prawdziwa usługa, śledzi kraj i sieć stojące za połączeniem oraz trenuje lokalny model (funkcję FireAI Pilot) na rzeczywistych wzorcach ruchu — a nic z tego nie opuszcza twojego Maca.

Możesz przeczytać o decyzjach technicznych, które za tym stoją, albo wypróbować FireAI przez 17 dni na [FireAI od HisnLabs](https://hisnlabs.com/pl/download).

## Sources

- [GitHub: protectai/modelscan (Apache-2.0)](https://github.com/protectai/modelscan)
- [GitHub: mmaitre314/picklescan (MIT)](https://github.com/mmaitre314/picklescan)
- [GitHub: trailofbits/fickling (LGPL-3.0)](https://github.com/trailofbits/fickling)
- [Hugging Face Hub docs: Pickle scanning](https://huggingface.co/docs/hub/security-pickle)
- [Hugging Face Hub docs: Malware scanning](https://huggingface.co/docs/hub/security-malware)
- [Hugging Face Hub docs: Third-party scanner, Protect AI](https://huggingface.co/docs/hub/security-protectai)
- [GitHub: huggingface/safetensors (Apache-2.0)](https://github.com/huggingface/safetensors)
- [GitHub: sigstore/model-transparency (Apache-2.0)](https://github.com/sigstore/model-transparency)
- [GitHub: CycloneDX/specification (schemas Apache-2.0, ML-BOM)](https://github.com/CycloneDX/specification)
- [SPDX: AI profile](https://spdx.dev/learn/areas-of-interest/ai/)
- [GitHub: cnut1648/Model-Fingerprint, Instructional Fingerprinting (MIT)](https://github.com/cnut1648/Model-Fingerprint)
- [arXiv 2401.12255: Instructional Fingerprinting of Large Language Models](https://arxiv.org/abs/2401.12255)
- [GitHub: THU-BPM/MarkLLM (Apache-2.0)](https://github.com/THU-BPM/MarkLLM)
- [GitHub: NVIDIA/garak (Apache-2.0)](https://github.com/NVIDIA/garak)
- [GitHub: microsoft/PyRIT (MIT)](https://github.com/microsoft/PyRIT)
- [GitHub: promptfoo/promptfoo (MIT)](https://github.com/promptfoo/promptfoo)
- [GitHub: Giskard-AI/giskard-oss (Apache-2.0)](https://github.com/Giskard-AI/giskard-oss)
- [GitHub: meta-llama/PurpleLlama (Llama Guard, Prompt Guard, LlamaFirewall)](https://github.com/meta-llama/PurpleLlama)
- [GitHub: NVIDIA-NeMo/Guardrails (Apache-2.0)](https://github.com/NVIDIA-NeMo/Guardrails)
- [GitHub: protectai/rebuff (archived)](https://github.com/protectai/rebuff)
- [GitHub: protectai/llm-guard (archived)](https://github.com/protectai/llm-guard)
- [GitHub: snyk/agent-scan, formerly MCP-Scan (Apache-2.0)](https://github.com/snyk/agent-scan)
- [GitHub: cisco-ai-defense/mcp-scanner (Apache-2.0)](https://github.com/cisco-ai-defense/mcp-scanner)
- [OWASP Top 10 for Large Language Model Applications](https://owasp.org/www-project-top-10-for-large-language-model-applications/)
- [FireAI docs: How FireAI watches your Mac’s connections](https://hisnlabs.com/en/docs/how-the-network-filter-works)
- [FireAI docs: Rules](https://hisnlabs.com/en/docs/per-app-rules)
