Endpoint Detection and Response har brukt to tiår på å svare godt på ett spørsmål: gjør denne prosessen noe ondsinnet kode ville gjort? Den sjekker signaturer, ser etter unormal oppførsel og flagger uautorisert rettighetseskalering. En AI-agent med verktøytilgang bryter premissene for det spørsmålet, ikke ved å være ondsinnet kode, men ved å være et pålitelig program som kan overtales til å misbruke sin egen, helt legitime tilgang.
Pre-AI-versjonen av dette problemet har allerede et navn
Å bruke et legitimt, signert program for å gjøre noe ondsinnet er ikke nytt. MITER ATT&CK katalogiserer det som System binær proxy-kjøring (T1218): "binærfiler signert med klarerte digitale sertifikater kan typisk kjøres på Windows-systemer som er beskyttet av digital signaturvalidering," som er nøyaktig grunnen til at godkjenningsliste og signaturkontroller sliter når den pålitelige binærfilen i seg selv er tingen som utfører handlingen. En AI-agent utvider den samme svakheten til et program som ikke trenger å være forhåndslastet med ondsinnet kode i det hele tatt: det kan omdirigeres under kjøring, med tekst det leser.
En kapret agent er en forvirret stedfortreder
Det gjeldende begrepet her er forvirret stedfortreder problem: "et dataprogram som blir lurt av et annet program (med færre privilegier eller mindre rettigheter) til å misbruke sin autoritet." Gi en agent virkelige verktøy, og la den deretter lese innhold du ikke har kontrollert, og den kan bli instruert av det innholdet. Dette er nøyaktig mønsteret OWASPs prompt-injeksjonsoppføring beskriver, og det har allerede blitt demonstrert, ikke bare teoretisert: Invariant Labs' 26. mai 2025 rapport viste en kodingsagent som leste et vanlig utseende GitHub-problem i et offentlig depot, fulgte skjulte instruksjoner i det for å avsløre privat-depotdata, ved å bruke verktøy som det ble lovlig gitt. Forskernes egen konklusjon: "dette er ikke en feil i selve GitHub MCP-serverkoden, men snarere et grunnleggende arkitektonisk problem som må løses på agentsystemnivå."
process: python3 agent_worker.py --tool-socket 8443
user: developer (normal UID, no privilege escalation)
network: HTTPS POST to a domain the process has contacted before
signature: none matched, no known-bad hash
behaviour: consistent with routine developer tooling
# The same log line is produced whether agent_worker.py just fetched
# documentation the developer asked for, or was redirected by injected
# instructions to read a private file and POST it out.Det er den faktiske blindsonen: ikke et gap i et produkt, men det faktum at loggoppføringen for "agent gjorde sin normale jobb" og "agent ble kapret til å misbruke sin normale jobb" kan være identisk på prosessnivå. Ingenting om det binære endret. Ingenting om systemanropsmønsteret er nytt. Bare intensjonen bak forespørselen endret seg, og intensjonen er ikke et felt i en prosesslogg.
Hva reduserer dette, og hva gjør det ikke
Det er verdt å være presis om hva personen som navnga dette mønsteret faktisk anbefaler. Simon Willison, som beskrev "dødelig trifecta" med tilgang til privat data, eksponering av upålitelig innhold og ekstern kommunikasjon sammen i én agent, er eksplisitt at det å unngå denne kombinasjonen er den virkelige løsningen, ikke et tilleggsvern: "den eneste måten å holde seg trygg der er å unngå den dødelige trifecta-kombinasjonen helt." Han er åpent skeptisk til produkter som hevder å fange opp injiserte instruksjoner på en pålitelig måte i ettertid, og bemerker at «vi fortsatt ikke vet hvordan vi 100 prosent på en pålitelig måte kan forhindre at dette skjer» og at en fangstrate på 95 prosent er «i stor grad en sviktende karakter» for en sikkerhetskontroll.
- Design først: gi en agent de smaleste verktøyene og datatilgangen dens oppgave trenger, så det er mindre for en vellykket injeksjon å misbruke (den arkitektoniske løsningen både Willison og Invariant Labs peker på).
- Behandle alt innhold agenten leser som du ikke har skrevet eller veterinært, problemer, hentede sider, nedlastede filer, som upålitelige innspill, i prinsippet, hver gang.
- Der design og gjennomgang ikke er nok, er det ene trinnet et dataeksfiltreringsforsøk ikke kan hoppe over en nettverkstilkobling. Å se eller begrense det, per prosess, hindrer ikke en agent fra å bli lurt, men det er et ekte, uavhengig lag som ikke er avhengig av å gjenkjenne den injiserte instruksjonen i utgangspunktet.
Hvor FireAI og HisnLabs kommer inn
No firewall makes a hijacked agent safe on its own, but the data it tries to send out still has to leave through a socket, and that is the one step FireAI watches regardless of which trusted binary the agent is running inside of.
FireAI er HisnLabs’ eget produkt: en KI-brannmur som kjører direkte på Macen. Den viser hver tilkobling appene dine gjør, i klart språk, og lar deg bestemme hva som forlater Macen din — KI-en kjører lokalt, så trafikken din sendes aldri til oss eller noen andre. HisnLabs’ sikkerhetsforskningsteam er de som holder disse vurderingene pålitelige: de katalogiserer hvilke domener som er vanlig telemetri og hvilke som er en ekte tjeneste, sporer landet og nettverket bak en tilkobling, og trener den lokale modellen (Autopilot-funksjonen) på ekte trafikkmønstre — uten at noe av det forlater Macen din.
Du kan lese om de tekniske valgene bak, eller prøve FireAI i 17 dager, på FireAI, fra HisnLabs.
