FireAIs sikkerhetsblogg

Av FireAI Security & Research Team · Publisert

De beste verktøyene for sikkerhet i KI-modeller i 2026

De beste verktøyene for sikkerhet i KI-modeller i 2026

Sikkerhet i KI-modeller er ikke én disiplin, men seks oppgaver, hver med egne verktøy: skanning av modellfiler, fastslåing av opprinnelse, testing av en modell for svakheter, beskyttelse under kjøring, kontroll av agentverktøyene rundt den, og begrensning av hvor applikasjonen som kjører modellen, kan koble til. Denne oversikten, utarbeidet av HisnLabs, utvikleren av FireAI, dekker åpne verktøy der kodelager eller dokumentasjon ble lest 30. september 2026. Lisenser, vedlikeholdere og status oppgis slik primærkildene angir dem, og ingen verktøy rangeres over et annet, fordi oppgavene ikke konkurrerer med hverandre.

Omfang og metode

Et verktøy ble bare tatt med hvis det offisielle kodelageret eller dokumentasjonen kunne åpnes, lisensen kunne identifiseres og vedlikeholdsstatusen kontrolleres (arkivert eller aktivt, og datoen for siste utgivelse der utgivelsessiden viser den). Utgivelsene som nevnes nedenfor, er de siste på lesetidspunktet. Ingenting her er en ytelsesmåling: Kildene gir ingen sammenlignbare deteksjonsresultater, og ingen slike påstås. Kommersielle plattformer er utelatt med mindre en åpen komponent er tema.

Kategoriene følger rekkefølgen en modell beveger seg gjennom et prosjekt: En fil lastes ned, opprinnelsen kontrolleres, modellen testes, den settes i drift bak beskyttelser, den kobles til verktøy, og applikasjonen som kjører den, når nettverket. OWASP Top 10 for Large Language Model Applications, som vedlikeholdes i OWASP GenAI Security Project, er det vanlige felles vokabularet for risikoene på applikasjonsnivå i kategori tre til fem.

1. Skanning av modellfiler

Mange modellfiler serialiseres med Pythons pickle-format, som kan kjøre kode når filen lastes. Dokumentasjonen fra Hugging Face oppgir at å laste en pickle «means that code can be executed», og nevner opkodene GLOBAL, STACK_GLOBAL og REDUCE som de som utgjør trusselen. Hugging Face: Pickle scanning Skannere leser instruksjonene i filen uten å laste den, og flagger farlige importer.

ModelScan

ModelScan vedlikeholdes av Protect AI under lisensen Apache-2.0. Det skanner pickle-baserte formater (PyTorch, scikit-learn, XGBoost, joblib, cloudpickle), TensorFlow SavedModel og Keras H5- og V3-filer, rangerer funn etter alvorlighetsgrad og avslutter med returkoder egnet for CI-pipeliner. Siste utgivelse på siden er v0.8.8 fra 18. februar 2026, og kodelageret viste aktivitet 28. september 2026. Bruk det som en kontroll før en nedlastet modell tas inn i et bygg. Begrensning: README-filen beskriver signaturbasert deteksjon som kan gi både falske positive og falske negative, og funn må vurderes av et menneske.

picklescan

picklescan er en MIT-lisensiert skanner som vedlikeholdes av en individuell konto, mmaitre314. Dokumentasjonen fra Hugging Face nevner picklescan blant verktøyene selskapet har utviklet for Hub. Siste utgivelse er v1.0.5 fra 1. juli 2026. Den skanner pickle-filer, PyTorch-arkiver og ZIP-containere, og kan skanne en lokal sti, en URL eller en modell på Hugging Face. Bruk den for en rask kontroll i et skript. Begrensning: Den gjenkjenner farlige operasjoner etter mønster, så en ny teknikk kan slippe gjennom, og den rapporterer funn uten å fjerne dem.

fickling

fickling, fra Trail of Bits, er lisensiert under LGPL-3.0. Det beskrives som en dekompilator, statisk analysator og bytekodeomskriver for pickle. Det kan dekompilere en pickle til lesbar Python, kontrollere sikkerheten gjennom statisk analyse og utløse en feil før en usikker fil lastes. Siste utgivelse er v0.1.12 fra 26. juni 2026. Bruk det når et funn må forstås, ikke bare flagges. Begrensning: Det er et analyseverktøy for pickle og dekker ikke de andre formatene ModelScan leser. Lisensvilkårene skiller seg fra de mer liberale lisensene til de andre skannerne.

Skanning på Hugging Face Hub og safetensors

Hub skanner hver opplastet fil med ClamAV og med en skanning av pickle-importer som lister importene i hver pickle-fil og framhever mistenkelige importer. Hugging Face: file scanning Hub viser også resultater fra en tredjepartsskanner, Protect AIs Guardian, for offentlige kodelagre. Hugging Face: Protect AI Begrensning, slik Hugging Face formulerer den: Pickle-skanningen er ikke helt idiotsikker, listene vedlikeholdes etter beste evne, og det er brukerens ansvar å kontrollere hva som er trygt. Det strukturelle alternativet er safetensors, et Apache-2.0-format vedlikeholdt av Hugging Face som lagrer tensorer uten kjørbart innhold. Det fjerner pickle-risikoen for vektene, men sier ingenting om hvorvidt selve vektene er til å stole på.

2. Modellopprinnelse, signering og fingeravtrykk

Skanning spør om en fil er farlig å laste. Opprinnelse spør hvem som laget den, og om den er endret siden. De to spørsmålene krever ulike verktøy.

Sigstore model-transparency

model-transparency er et Apache-2.0-prosjekt under Sigstore-organisasjonen som signerer og verifiserer maskinlæringsmodeller. Det kan signere gjennom Sigstore eller med nøkler, sertifikater eller PKCS #11-enheter, og produserer en pakke som inneholder en DSSE-konvolutt med et in-toto-utsagn. Siste utgivelse er v1.1.1 fra 10. oktober 2025, med commits i september 2026. Bruk det for å la en mottaker verifisere at filene vedkommende har, er de samme som en utgiver signerte. Begrensninger: Dokumentasjonen oppgir støtte for hashing av filer og filbiter, ikke av enkelttensorer, og en gyldig signatur beviser opprinnelse og integritet, ikke at modellen er trygg. Hugging Face gjør det samme skillet for signerte commits, som garanterer «the origin of the file» og ikke at den er trygg.

Materiallister for KI og maskinlæring

CycloneDX, vedlikeholdt av OWASP Foundation og Ecma Internationals TC54, oppgir en Machine Learning Bill of Materials (ML-BOM) blant de støttede BOM-typene. Siste utgivelse, 1.7, ble publisert 21. oktober 2025, og skjemaene er lisensiert under Apache-2.0. SPDX 3.0 AI-profilen dokumenterer KI-komponenter som modeller, datasett og prompter i én sammenhengende oppføring. Bruk ett av dem til å holde oversikt over hvilke modeller, datasett og versjoner et produkt inneholder, som er det hendelseshåndtering trenger først. Begrensning: En BOM registrerer det en forfatter oppgir. Ingen av formatene verifiserer opplysningene.

Forskningsverktøy for fingeravtrykk og vannmerking

Instructional Fingerprinting er koden til en akademisk artikkel (arXiv 2401.12255) som bygger inn et fingeravtrykk i en språkmodell, slik at en eier senere kan teste om en annen modell er avledet av den. Det er MIT-lisensiert forskningskode, og kodelageret ble sist oppdatert i juli 2024. MarkLLM, fra THU-BPM-gruppen, er et Apache-2.0-verktøysett for vannmerking av teksten en LLM genererer, presentert som en demo på EMNLP 2024. De to besvarer ulike spørsmål: Det første merker en modell, det andre merker utdataene. Bruk dem til å studere attribusjon, ikke som et kontrolltiltak i produksjon. Begrensning: Begge er forskningsartefakter, og ingen av dem erstatter signering av en distribuert fil.

3. Red teaming og sårbarhetsskanning av LLM-er

Disse verktøyene sender fiendtlige inndata til en modell eller applikasjon og registrerer hvordan den svarer. De tester atferd, ikke filer.

garak

garak er en Apache-2.0-lisensiert sårbarhetsskanner for LLM-er vedlikeholdt av NVIDIA. README-filen sier at den sjekker «if an LLM can be made to fail in a way we don’t want», med prober for promptinjeksjon, datalekkasje, hallusinasjon, toksisitet og jailbreaks, hver paret med en detektor. Siste utgivelse er v0.17.0 fra 9. september 2026. Bruk den som en bred grunnlinjeskanning av et modellendepunkt. Begrensninger: Den krever API-tilgang eller en lokal installasjon av målet, enkelte prober er ressurskrevende, og README-filen nevner begrenset støtte for bildemodeller og prototypestatus for enkelte prober.

PyRIT

PyRIT er et MIT-lisensiert rammeverk beskrevet som laget for sikkerhetsfagfolk og ingeniører for å identifisere risiko i generative KI-systemer. Det vedlikeholdes av Microsoft, og siste utgivelse er v1.1.0 fra 4. september 2026. Det tidligere kodelageret under Azure-organisasjonen ble arkivert 27. mars 2026 med en henvisning til Microsoft-kodelageret, så lenker til den gamle adressen peker til en skrivebeskyttet kopi. Bruk det til skriptede red team-kampanjer over flere runder, for et team som vil skrive kode. Begrensning: Det er et rammeverk, ikke en skanner som kjøres med én kommando.

promptfoo

promptfoo er et MIT-lisensiert kommandolinjeverktøy og bibliotek for evaluering av LLM-applikasjoner og for red teaming og sårbarhetsskanning, med CI-integrasjon. Siste utgivelse er 0.123.1 fra 18. september 2026. README-filen oppgir: «Promptfoo is now part of OpenAI. Promptfoo remains open source and MIT licensed.» Bruk det til å legge prompttester og fiendtlige kontroller inn i et bygg. Begrensning: Resultatene avhenger av leverandøren og dommermodellen som er konfigurert, og de fleste leverandører krever API-nøkler. Eierskiftet er et styringsforhold verdt å merke seg ved valg av verktøy for regulert arbeid.

Giskard

Giskard er et Apache-2.0-lisensiert Python-bibliotek fra Giskard-AI-organisasjonen. Versjon 3 har to komponenter som beskrives som stabile: giskard-checks, et testrammeverk som bruker scenarioer og LLM-as-judge-vurderinger, og giskard-scan, en skanner for sårbarheter i agenter. Bruk det til å teste agenter og systemer med gjenfinningsforsterket generering. Begrensninger: Versjon 3 krever Python 3.12 eller nyere, og versjon 2, som dekket skanning av tabelldata og klassisk maskinlæring, vedlikeholdes ikke lenger aktivt.

4. Beskyttelse under kjøring og deteksjon av promptinjeksjon

Beskyttelser (guardrails) ligger i forespørselsveien og klassifiserer eller begrenser inndata og utdata mens applikasjonen kjører.

Llama Guard, Prompt Guard og LlamaFirewall

Metas prosjekt Purple Llama samler sikringstiltak for åpne modeller. Llama Guard er en familie av modeller for moderering av inndata og utdata. Prompt Guard 2 beskrives som en lett klassifikator for direkte forsøk på promptinjeksjon, og LlamaFirewall kombinerer den med en skanner for samsvarskontroll og en kodeskanner for agenter. Ifølge prosjektets lisenstabell distribueres modellene under Llama Community Licences, mens andre komponenter, som Code Shield og evalueringene, er MIT-lisensiert. Modellene på Hugging Face krever godkjent tilgang. Bruk dem der en liten klassifikator foran en modell er akseptabel. Begrensninger: En klassifikator reduserer forsøk som ligner kjente mønstre, men fjerner ikke angrepsklassen.

NeMo Guardrails

NeMo Guardrails er et Apache-2.0-verktøysett fra NVIDIA for å legge programmerbare rammer (rails) til LLM-applikasjoner, med et modelleringsspråk kalt Colang for å styre dialogflyten. Siste utgivelse er v0.24.1 fra 16. september 2026. Bruk det til å begrense temaer, formater og dialogveier. Begrensning: Rammene er retningslinjer skrevet av utvikleren, så dekningen er aldri bredere enn det som ble forutsett.

Rebuff og LLM Guard, nå arkivert

Rebuff, en selvforsterkende detektor for promptinjeksjon med heuristikk, en LLM-kontroll, et vektorlager over tidligere angrep og canary-tokens, ble arkivert 16. mai 2025. README-filen oppgir at den er en prototype og ikke kan gi fullstendig beskyttelse mot promptinjeksjon. LLM Guard, et MIT-lisensiert verktøysett med skannere for inndata og utdata fra samme vedlikeholder, ble arkivert i juli 2026. Begge kan fortsatt leses som referanse. De illustrerer et praktisk poeng: Detektorprosjekter kan miste vedlikeholderne sine, så en beskyttelse bør kunne byttes ut.

5. Sikkerhetsskannere for agenter og MCP

Agenter legger til verktøy, og verktøybeskrivelser er tekst modellen leser. Skannerne i denne gruppen undersøker slike verktøy og konfigurasjonen deres.

Snyk Agent Scan

Agent Scan, tidligere MCP-Scan, er en Apache-2.0-lisensiert skanner vedlikeholdt av Snyk. Den finner agentkomponenter på en maskin, inkludert MCP-servere og skills i klienter som Claude, Cursor, VS Code og GitHub Copilot, og kontrollerer dem for promptinjeksjon, forgiftning av verktøy og beslektede problemer. Siste utgivelse er v0.6.8 fra 29. september 2026. Bruk den til å revidere hva som er installert på en utviklermaskin. Begrensninger: README-filen oppgir at prosjektet foreløpig ikke tar imot eksterne bidrag, og at det finnes to utgivelseslinjer med ulike utdataformater.

Cisco MCP Scanner

MCP Scanner er et Apache-2.0-verktøy fra Cisco AI Defense. Det analyserer MCP-verktøy, prompter, ressurser og avhengigheter med tre motorer som kan kjøre hver for seg eller sammen: YARA-regler, LLM-analyse og Cisco AI Defense API. Siste utgivelse er 4.8.4 fra 28. august 2026. Bruk det til å kontrollere en server før den tas i bruk. Begrensning: LLM- og API-motorene krever eksterne påloggingsopplysninger, og en skanning av en servers beskrivelse sier lite om hva koden gjør etter en oppdatering.

6. Hvor nettverkskontroll passer inn

Verktøyene ovenfor undersøker filer, modeller, prompter og konfigurasjoner. Ingen av dem avgjør hvilken applikasjon som kan åpne en tilkobling til hvilken server. Det er rollen til kontroll av utgående trafikk, og den har betydning fordi risikoene i de foregående avsnittene møtes i nettverket: Et manipulert kjøremiljø for modellen, et forgiftet verktøy eller en agent utsatt for injeksjon må nå en destinasjon for å hente ut data eller motta instruksjoner.

FireAI, utviklet av HisnLabs, er en brannmur for utgående trafikk på macOS. Den kjører som et innholdsfilter i Apple Network Extension, identifiserer hver app ut fra kodesignaturen og kan tillate, blokkere eller spørre for hver destinasjon, med regler per app, domene eller adresse. Anvendt på KI-arbeid på en Mac betyr det at en inferensserver, en kodeagent eller en MCP-klient kan holdes til destinasjonene oppgaven krever, og at en ny destinasjon utløser en beslutning. Dokumentasjonen om filteret beskriver hva FireAI ser: appens identitet, ekstern vert eller adresse, port og protokoll.

FireAI skanner ikke modellfiler, verifiserer ikke signaturer, utfører ikke red teaming av modeller og klassifiserer ikke prompter. Den leser ikke innholdet i krypterte tilkoblinger, så den kan ikke skille en legitim forespørsel fra en injisert når begge går til en tillatt destinasjon. Den utfyller verktøyene ovenfor og erstatter ingen av dem.

Sammenligning

Kilder: hvert prosjekts kodelager eller dokumentasjon, lest 30. september 2026. Status gjenspeiler siden for kodelageret, ikke en kvalitetsvurdering.
VerktøyOppgaveVedlikeholderLisensStatus 30. sep. 2026
ModelScanSkanning av modellfilerProtect AIApache-2.0Aktivt, v0.8.8
picklescanPickle-skanningmmaitre314MITAktivt, v1.0.5
ficklingPickle-analyseTrail of BitsLGPL-3.0Aktivt, v0.1.12
safetensorsTrygt format for vekterHugging FaceApache-2.0Aktivt
model-transparencySignering av modellerSigstoreApache-2.0Aktivt, v1.1.1
CycloneDXML-BOM-spesifikasjonOWASP, Ecma TC54Apache-2.0 (skjemaer)Aktivt, 1.7
Instructional FingerprintingFingeravtrykk for modeller (forskning)Artikkelens forfattereMITSist oppdatert juli 2024
MarkLLMVannmerking av tekst (forskning)THU-BPMApache-2.0Aktivt
garakSårbarhetsskanningNVIDIAApache-2.0Aktivt, v0.17.0
PyRITRammeverk for red teamingMicrosoftMITAktivt, v1.1.0
promptfooEvalueringer og red teamingPromptfoo, del av OpenAIMITAktivt, 0.123.1
Giskard v3Agenttester og skanningGiskard-AIApache-2.0Aktivt; v2 vedlikeholdes ikke
Llama Guard, Prompt GuardBeskyttelsesmodellerMetaLlama Community LicencesModeller datert april 2025
NeMo GuardrailsProgrammerbare rammerNVIDIAApache-2.0Aktivt, v0.24.1
Rebuff, LLM GuardDeteksjon av injeksjonProtect AIApache-2.0, MITArkivert
Agent ScanSkanning av agenter og MCPSnykApache-2.0Aktivt, v0.6.8
MCP ScannerSkanning av MCP-servereCisco AI DefenseApache-2.0Aktivt, 4.8.4
FireAIKontroll av utgående trafikk per app på macOSHisnLabsKommersiellSkanner ikke modeller

Begrensninger

  • Ingen enkelt verktøy dekker alle seks oppgavene. En ren filskanning sier ingenting om en modells atferd, en signatur sier ingenting om sikkerhet, og en red team-skanning sier ingenting om innholdet i en fil.
  • Skannere og beskyttelser er detektorer. De kan overse nye teknikker, noe dokumentasjonen til ModelScan, picklescan og Rebuff hver for seg erkjenner, og dekningen endres etter hvert som angrepene endres.
  • Vedlikeholdet er ujevnt. To av detektorprosjektene som er nevnt her, er arkivert, ett verktøy har skiftet eier, ett har én enkelt vedlikeholder, og ett forskningskodelager har ikke endret seg siden 2024. Kontroller statusen til et prosjekt før du bygger på det.
  • Denne oversikten var begrenset til åpne verktøy med primærkilder som kunne leses. Den utelater kommersielle plattformer og sammenligner ikke deteksjonsresultater, fordi kildene ikke gir sammenlignbare tall.
  • Lisensene ble lest fra sidene til kodelagrene og fra lisenstabeller. Verifiser dem før videredistribusjon, særlig Llama Community Licences og LGPL-vilkårene for fickling.
  • Nettverkslaget ser tilkoblinger, ikke mening. En tillatt destinasjon kan fortsatt motta data fra et kompromittert kjøremiljø for en modell.

Hvor FireAI og HisnLabs kommer inn

Skann modellen, signer modellen, test modellen. Avgjør deretter hvor appen dens kan koble til.

FireAI er HisnLabs’ eget produkt: en KI-brannmur som kjører direkte på Macen. Den viser hver tilkobling appene dine gjør, i klart språk, og lar deg bestemme hva som forlater Macen din — KI-en kjører lokalt, så trafikken din sendes aldri til oss eller noen andre. HisnLabs’ sikkerhetsforskningsteam er de som holder disse vurderingene pålitelige: de katalogiserer hvilke domener som er vanlig telemetri og hvilke som er en ekte tjeneste, sporer landet og nettverket bak en tilkobling, og trener den lokale modellen (FireAI Pilot-funksjonen) på ekte trafikkmønstre — uten at noe av det forlater Macen din.

Du kan lese om de tekniske valgene bak, eller prøve FireAI i 17 dager, på FireAI, fra HisnLabs.

Kilder