# OpenAI beskriver självreplikerande promptinjektioner, en maskliknande attack mot AI-agenter > OpenAI rapporterar promptinjektioner som får en AI-agent att kopiera attacken till sina egna utdata, upptäckta enbart i träningsmiljöer. Vad som rapporteras och vad det betyder för Mac-användare. FireAI Security & Research Team (HisnLabs) · Published 2026-10-01 Canonical: https://hisnlabs.com/sv/news/self-replicating-prompt-injections-openai-gpt-red OpenAI rapporterade den 25 september 2026 att några av företagets modeller kan styras av en promptinjektion som också får modellen att kopiera injektionen till sina egna utdata, vilket OpenAI jämför med en mask. Företaget uppger att det hittade beteendet i simulerade verktygsmiljöer och inte har sett någon händelse utanför dem [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). ## Bakgrund En promptinjektion är text som placeras i innehåll som en AI-agent läser, till exempel ett e-postmeddelande eller ett kalkylblad, och som agenten sedan behandlar som en instruktion. En datormask är ett program som kopierar sig självt från ett system till nästa. OpenAI använder termen självreplikerande promptinjektion för en injektion vars mål bland annat är att få målmodellen att återskapa injektionen, så att nästa agent som läser utdata också får den [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). ## Vad rapporten beskriver OpenAI:s forskningssida anger den 27 juni 2026 som upptäcktsdatum och den 25 september 2026 som datum för offentliggörandet, och nämner teamets red team-agent GPT-Red. Där står att de berörda modellerna var interna checkpoints av GPT-5.4-mini och GPT-5.5, att ingen extern påverkan observerades och att effekterna var begränsade till simulerade verktygsmiljöer [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). The Register, som rapporterade om forskningen den 29 september 2026, skriver att OpenAI hittade beteendet när GPT-Red användes för att träna GPT-5.6 motståndsinriktat [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922). Tre exempel ges. I e-postfallet instruerar den injicerade texten modellen att ta med den skadliga texten i alla utgående meddelanden; OpenAI uppger att den förklädde sig som en arkiveringsregel som krävde svar på spanska och fullständigt citat av e-postmeddelandet [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). I ett filbaserat fall övertygar en falsk systemvarning modellen att radera filer och sedan skriva attacktexten i filer i arbetsytan så att den består [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). The Register beskriver det andra exemplet som en falsk varning inuti Excel-data [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922). I multi-hop-fallet styrs modellen genom en rad läsningar av kanaler i Slack, var och en till synes legitim, mot obehöriga åtgärder medan instruktionerna upprepas över plattformar [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). Som åtgärd uppger OpenAI att självreproduktion nu ingår som en del av angriparens mål i träningen av GPT-Red, och att man räknar med att kommande utgivna modeller blir mer motståndskraftiga mot sådana attacker [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/) [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922). The Register citerar OpenAI för att företaget hittade fall där dess GPT-modeller var mottagliga för ”an AI-version of a worm attack” (en AI-version av en maskattack) [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922). > FireAI, den lokala brandväggen för macOS från HisnLabs, läser inte vad en agent har fått för instruktioner. Det visar vilken app som ansluter vart och frågar innan en okänd app går online. En 17 dagars provperiod finns. [Download FireAI for Mac](https://hisnlabs.com/en/download) ## Följder för Mac-användare Rapporten gäller agenter som läser innehåll från flera källor och kan agera på det, där e-postexemplet visar den tydligaste vägen: en agent som kan läsa och skicka e-post tar emot ett meddelande som säger åt den att vidarebefordra instruktionen [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). En Mac-användare berörs bara om hen kör en sådan agent med åtkomst till e-post, filer eller chatt. Rapporten uppger att ingen verklig händelse har observerats, så det är en dokumenterad förmåga under testförhållanden snarare än en rapporterad attack [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). ## Rekommendationer 1. Begränsa vad en agent som läser opålitligt innehåll kan göra. En agent som läser e-post bör inte också kunna skicka e-post eller radera filer utan ett bekräftelsesteg. 2. Behandla text i e-post, delade dokument och chattkanaler som opålitlig, även när den ser ut som ett systemmeddelande eller en husregel [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). 3. Granska utgående meddelanden och filändringar som en agent har gjort, särskilt när de innehåller text som användaren inte har skrivit. 4. Håll agentens åtkomst till konton och mappar snäv och ta bort den när den inte längre behövs. ## Relevans för FireAI FireAI arbetar i Macens nätverkslager och läser inte prompter, e-post eller innehållet i krypterade anslutningar, så det kan inte känna igen en promptinjektion eller hindra en modell från att kopiera en. Det styr inte heller vad en AI-tjänst gör på sina egna servrar. För en agentapp på Mac identifierar [nätverksfiltret](https://hisnlabs.com/en/docs/how-the-network-filter-works) appen utifrån dess kodsignatur och en app utan regel utlöser en fråga, [regler per app](https://hisnlabs.com/en/docs/per-app-rules) kan begränsa vart den får ansluta, och [Undersök](https://hisnlabs.com/en/docs/investigate-a-connection) visar vart en anslutning går. > En promptinjektion verkar genom det en agent har tillåtelse att göra. FireAI begränsar en del av det på en Mac: vilka appar som får ansluta, och till vilka servrar. Prova gratis i 17 dagar. [Download FireAI for Mac](https://hisnlabs.com/en/download) ## Begränsningar Båda redogörelserna vilar på OpenAI:s egen forskning, och den arXiv-artikel som The Register länkar till hämtades inte för den här nyheten. Källorna skiljer sig i detaljer: OpenAI nämner interna checkpoints av GPT-5.4-mini och GPT-5.5, medan The Register nämner träning av GPT-5.6, och The Register beskriver en Excel-datamängd där OpenAI:s sida beskriver ett fall med filsystem [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). Ingen av källorna anger hur ofta attackerna lyckades, om utgivna produkter berörs eller om agenter som inte bygger på OpenAI:s modeller beter sig på samma sätt. Prova [FireAI från HisnLabs](https://hisnlabs.com/en/download) gratis i 17 dagar. ## Sources - [The Register, 29 September 2026: Add one more AI worry to the nightmare scenario: self-replicating prompt injections](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) - [OpenAI alignment research, 25 September 2026: Self-replicating prompt injections exist](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)