Anthropic introduced the Model Context Protocol (MCP) on 25 November 2024 as "en åpen standard som gjør det mulig for utviklere å bygge sikre, toveisforbindelser mellom datakildene og AI-drevne verktøy". In practice, MCP lets an AI assistant call local programs, called MCP servers, that read files, query databases, or reach the web on its behalf. Det er virkelig nyttig, og det er også en ny type angrepsoverflate: modellen bestemmer hvilket verktøy den skal ringe basert på tekst den leser, og den kan ikke alltid skille instruksjonene dine fra andres.
Hvordan en MCP-server faktisk kjører
MCP-spesifikasjonen definerer to transporter. Over stdio, "starter klienten MCP-serveren som en underprosess" og de to snakker om standard input og output. Over Streamable HTTP (som erstattet den originale HTTP+SSE-transporten fra november 2024-spesifikasjonen), kjører serveren som sin egen lokale prosess og klienten sender den HTTP-forespørsler, og mottar eventuelt en strøm av serversendte hendelser tilbake (MCP-spesifikasjon, transporter). Uansett, en lokal MCP-server kjører vanligvis med samme fil- og nettverkstillatelser som personen som startet den, fordi ingenting i protokollen krever noe annet.
Selve spesifikasjonen flagger risikoen for HTTP-varianten direkte: den krever at servere validerer Origin-overskriften, anbefaler binding til 127.0.0.1 i stedet for 0.0.0.0 når den kjøres lokalt, og ber om autentisering på hver tilkobling, og advarer om at uten disse, "kan angripere bruke DNS-rebinding for å samhandle med lokale MCP-servere på nettstedet."
Mekanismen: en forvirret stedfortreder
Det klassiske navnet på denne feilmodusen er forvirret stedfortreder problem: "et dataprogram som blir lurt av et annet program (med færre privilegier eller mindre rettigheter) til å misbruke sin autoritet." En AI-agent med MCP-verktøytilgang er en stedfortreder med reell autoritet – til å lese filene dine, til å lage nettverksforespørsler – som handler etter instruksjoner som kan komme fra innhold det bare ble bedt om å oppsummere eller analysere. Når det innholdet inneholder sine egne instruksjoner, kan agenten følge dem i stedet for, eller i tillegg til, dine. Dette er hva OWASPs topp 10 for LLM Applications risikoklasse kaller rask injeksjon og overdreven handlekraft: OWASP: Topp 10 for LLM-applikasjoner; OWASP LLM01:2025, rask injeksjon.
Et demonstrert tilfelle: GitHub MCP-serveren
Dette er ikke teoretisk. 26. mai 2025, Invariant Labs rapportert et proof-of-concept mot den offisielle GitHub MCP-serveren, som hadde omtrent 14 000 GitHub-stjerner på den tiden. Oppsettet deres: en agent med tilgang til et offentlig og et privat depot ble bedt om å gjennomgå åpne problemer på det offentlige. En utformet utgave i den offentlige repoen bar skjulte instruksjoner; agenten, som leste den som en del av sin vanlige oppgave, fulgte dem, og i demonstrasjonen fortsatte han med å avsløre privat-depotdetaljer, inkludert informasjon forskerne beskriver som personlig, for den angriperkontrollerte problemtråden. Invariant Labs var eksplisitt at dette var et demonstrert proof-of-concept på testlagre, ikke et angrep observert i naturen, og at "dette er ikke en feil i selve GitHub MCP-serverkoden, men snarere et grunnleggende arkitektonisk problem som må løses på agentsystemnivå." Modellen som ble brukt i demonstrasjonen var Claude 4 Opus.
Den dødelige trifectaen
Den 16. juni 2025 kalte Simon Willison mønsteret bak saker som dette til "dødelig trifecta": en agent som har (1) tilgang til private data, (2) eksponering for upålitelig innhold og (3) en måte å kommunisere eksternt på. "Hvis agenten din kombinerer disse tre funksjonene, kan en angriper enkelt lure den til å få tilgang til dine private data og sende dem til den angriperen." Han navngir MCP spesifikt som en bidragsyter: "Problemet med Model Context Protocol - MCP - er at den oppmuntrer brukere til å mikse og matche verktøy fra forskjellige kilder som kan gjøre forskjellige ting," noe som gjør det enkelt å ende opp med alle tre egenskapene aktive i én økt uten å bestemme seg for det.
Hvorfor dette er vanskelig for endepunktverktøy å se
Fra operativsystemets synspunkt skjedde ingenting uvanlig i GitHub MCP-saken: en signert, pålitelig applikasjon leste litt tekst og sendte en nettverksforespørsel gjennom en lokal hjelpeprosess den var konfigurert til å bruke. Det er ingen ondsinnet binær å flagge og ingen utnyttelse av en minnesikkerhetsfeil. Forespørselen som betyr noe - den som utfører data - har samme form som alle andre verktøyoppringninger agenten foretar riktig hundre ganger om dagen.
Det som faktisk reduserer risikoen
- Gi hver MCP-server de smaleste verktøyene og filomfanget den trenger, ikke bred filsystem- eller shell-tilgang, så en kapret verktøykall har mindre å gjøre.
- Behandle ethvert innhold som en agent leser utenfor din kontroll (problemer, nettsider, nedlastede filer) som uklarerte input, samme disiplin som du ville brukt på brukerinndata i et hvilket som helst annet system.
- Følg veiledningen på transportnivå som MCP-spesifikasjonen selv gir: bind lokale servere til localhost, krever autentisering, valider Origin-overskriften.
- Se, eller kontroller, det ene trinnet hver versjon av dette angrepet deler: den utgående tilkoblingen som vil føre data til angriperen. Det trinnet skjer etter at modellen allerede har blitt lurt, og det er derfor det er det mest pålitelige stedet å fange den.
Hvor FireAI og HisnLabs kommer inn
The step an injected agent cannot skip is the outbound connection that carries your data out, which is exactly what a per-app firewall like FireAI is built to see and stop, whether the process asking to connect is a familiar app or an MCP server it has never seen before.
FireAI er HisnLabs’ eget produkt: en KI-brannmur som kjører direkte på Macen. Den viser hver tilkobling appene dine gjør, i klart språk, og lar deg bestemme hva som forlater Macen din — KI-en kjører lokalt, så trafikken din sendes aldri til oss eller noen andre. HisnLabs’ sikkerhetsforskningsteam er de som holder disse vurderingene pålitelige: de katalogiserer hvilke domener som er vanlig telemetri og hvilke som er en ekte tjeneste, sporer landet og nettverket bak en tilkobling, og trener den lokale modellen (Autopilot-funksjonen) på ekte trafikkmønstre — uten at noe av det forlater Macen din.
Du kan lese om de tekniske valgene bak, eller prøve FireAI i 17 dager, på FireAI, fra HisnLabs.
