Anthropic introducerade Model Context Protocol (MCP) den 25 november 2024 som "en öppen standard som gör det möjligt för utvecklare att bygga säkra, tvåvägsanslutningar mellan sina datakällor och AI-drivna verktyg". I praktiken låter MCP en AI-assistent anropa lokala program, kallade MCP-servrar, som läser filer, frågar efter databaser eller når webben för dess räkning. Det är verkligen användbart, och det är också en ny typ av attackyta: modellen bestämmer vilket verktyg som ska anropas baserat på text den läser, och den kan inte alltid skilja dina instruktioner från någon annans.
Hur en MCP-server faktiskt körs
MCP-specifikationen definierar två transporter. Över stdio "startar klienten MCP-servern som en underprocess" och de två pratar över standardinmatning och -utgång. Över Streamable HTTP (som ersatte den ursprungliga HTTP+SSE-transporten från november 2024-specifikationen), körs servern som sin egen lokala process och klienten skickar HTTP-förfrågningar till den och får eventuellt en ström av Server-Sent Events tillbaka (MCP-specifikation, transporter). Hur som helst, en lokal MCP-server körs vanligtvis med samma fil- och nätverksbehörigheter som personen som startade den, eftersom ingenting i protokollet kräver något annat.
Själva specifikationen flaggar risken för HTTP-varianten direkt: den kräver att servrar validerar Origin-huvudet, rekommenderar bindning till 127.0.0.1 snarare än 0.0.0.0 när den körs lokalt, och kräver autentisering på varje anslutning, varnar att utan dessa "angripare skulle kunna använda DNS-ombindning för att interagera med lokala MCP-servrar på webbplatsen."
Mekanismen: en förvirrad ställföreträdare
Det klassiska namnet för detta felläge är förvirrat ställföreträdarproblem: "ett datorprogram som luras av ett annat program (med färre privilegier eller mindre rättigheter) att missbruka sin auktoritet." En AI-agent med MCP-verktygsåtkomst är en ställföreträdare med verklig auktoritet – att läsa dina filer, att göra nätverksförfrågningar – som agerar på instruktioner som kan komma från innehåll som det bara ombads att sammanfatta eller analysera. När innehållet innehåller sina egna instruktioner kan agenten följa dem istället för, eller utöver, dina. Detta är vad OWASP:s topp 10 för riskklass för LLM Applications kallar snabb injektion och överdriven byråkrati: OWASP: Topp 10 för LLM-applikationer; OWASP LLM01:2025, snabb injektion.
Ett demonstrerat fall: GitHub MCP-servern
Detta är inte teoretiskt. Den 26 maj 2025, Invariant Labs rapporterade ett proof-of-concept mot den officiella GitHub MCP-servern, som hade ungefär 14 000 GitHub-stjärnor vid den tiden. Deras inställning: en agent med tillgång till ett offentligt och ett privat arkiv ombads att granska öppna frågor på det offentliga. En utarbetad fråga i den offentliga repan bar dolda instruktioner; agenten, som läste den som en del av sin normala uppgift, följde dem och fortsatte i demonstrationen med att exponera privata förvarsdetaljer, inklusive information som forskarna beskriver som personlig, för den angriparkontrollerade problemtråden. Invariant Labs var tydligt att detta var ett demonstrerat proof-of-concept på testförråd, inte en attack som observerats i det vilda, och att "detta inte är ett fel i själva GitHub MCP-serverkoden, utan snarare ett grundläggande arkitektoniskt problem som måste åtgärdas på agentsystemnivå." Modellen som användes i demonstrationen var Claude 4 Opus.
Den dödliga trifectaen
Den 16 juni 2025 utnämnde Simon Willison mönstret bakom fall som detta till "dödlig trifecta": en agent som har (1) tillgång till privata data, (2) exponering för opålitligt innehåll och (3) ett sätt att kommunicera externt. "Om din agent kombinerar dessa tre funktioner kan en angripare enkelt lura den att komma åt din privata data och skicka den till den angriparen." Han namnger MCP specifikt som en bidragsgivare: "Problemet med Model Context Protocol - MCP - är att det uppmuntrar användare att blanda och matcha verktyg från olika källor som kan göra olika saker", vilket gör det lätt att sluta med alla tre egenskaperna aktiva i en session utan att bestämma sig för det.
Varför detta är svårt för endpoint-verktyg att se
Ur operativsystemets synvinkel hände inget ovanligt i GitHub MCP-fallet: en signerad, pålitlig applikation läste en del text och gjorde en nätverksbegäran genom en lokal hjälpprocess som den var konfigurerad att använda. Det finns ingen skadlig binär att flagga och ingen exploatering av ett minnessäkerhetsfel. Begäran som är viktig – den som utför data – har samma form som alla andra verktygssamtal agenten gör korrekt hundra gånger om dagen.
Vad som faktiskt minskar risken
- Ge varje MCP-server de smalaste verktygen och filomfattningen den behöver, inte bred filsystem- eller skalåtkomst, så ett kapat verktygsanrop har mindre att göra.
- Behandla allt innehåll som en agent läser utanför din kontroll (problem, webbsidor, nedladdade filer) som otillförlitlig indata, samma disciplin som du skulle tillämpa på användarinmatning i alla andra system.
- Följ vägledningen på transportnivå som MCP-specifikationen själv ger: bind lokala servrar till localhost, kräver autentisering, validera Origin-huvudet.
- Titta på, eller kontrollera, ett steg som varje version av denna attack delar: den utgående anslutningen som skulle överföra data till angriparen. Det steget sker efter att modellen redan har blivit lurad, varför det är den mest pålitliga platsen att fånga den.
Var FireAI och HisnLabs kommer in
The step an injected agent cannot skip is the outbound connection that carries your data out, which is exactly what a per-app firewall like FireAI is built to see and stop, whether the process asking to connect is a familiar app or an MCP server it has never seen before.
FireAI är HisnLabs eget verktyg: en AI-brandvägg som körs direkt på din Mac. Den visar varje anslutning dina appar gör, på klarspråk, och låter dig avgöra vad som lämnar din Mac — AI:n körs lokalt, så din trafik skickas aldrig till oss eller någon annan. HisnLabs säkerhetsforskningsteam är de som håller de bedömningarna tillförlitliga: de katalogiserar vilka domäner som är vanlig telemetri och vilka som är en riktig tjänst, spårar land och nätverk bakom en anslutning och tränar den lokala modellen (Autopilot-funktionen) på verkliga trafikmönster — utan att något av det lämnar din Mac.
Du kan läsa om de tekniska besluten bakom, eller prova FireAI i 17 dagar, på FireAI, från HisnLabs.
