# OpenAI beschreibt sich selbst vervielfältigende Prompt Injections, einen wurmartigen Angriff auf KI-Agenten

> OpenAI berichtet von Prompt Injections, die einen KI-Agenten dazu bringen, den Angriff in die eigenen Ausgaben zu kopieren, gefunden nur in Trainingsumgebungen. Was berichtet wird und was es für Mac-Nutzer bedeutet.

FireAI Security & Research Team (HisnLabs) · Published 2026-10-01
Canonical: https://hisnlabs.com/de/news/self-replicating-prompt-injections-openai-gpt-red

OpenAI berichtete am 25. September 2026, dass sich einige seiner Modelle durch eine Prompt Injection steuern lassen, die das Modell zugleich dazu bringt, die Injection in die eigenen Ausgaben zu kopieren; OpenAI vergleicht das mit einem Wurm. Das Unternehmen sagt, es habe das Verhalten in simulierten Werkzeugumgebungen gefunden und außerhalb davon keinen Vorfall gesehen [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/).

## Hintergrund

Eine Prompt Injection ist Text in Inhalten, die ein KI-Agent liest, etwa in einer E-Mail oder einer Tabelle, und den der Agent dann als Anweisung behandelt. Ein Computerwurm ist ein Programm, das sich von einem System auf das nächste kopiert. OpenAI verwendet den Begriff „self-replicating prompt injection“ (sich selbst vervielfältigende Prompt Injection) für eine Injection, zu deren Ziel gehört, das Zielmodell dazu zu bringen, die Injection zu reproduzieren, sodass der nächste Agent, der die Ausgabe liest, sie ebenfalls erhält [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/).

## Was der Bericht beschreibt

Die Forschungsseite von OpenAI nennt den 27. Juni 2026 als Entdeckungsdatum und den 25. September 2026 als Datum der Offenlegung und bezeichnet den Red-Teaming-Agenten des Teams als GPT-Red. Betroffen seien interne Checkpoints von GPT-5.4-mini und GPT-5.5 gewesen, es seien keine externen Auswirkungen beobachtet worden, und die Effekte hätten sich auf simulierte Werkzeugumgebungen beschränkt [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). The Register, das am 29. September 2026 über die Forschung berichtete, schreibt, OpenAI habe das Verhalten gefunden, als es GPT-Red zum adversarialen Training von GPT-5.6 einsetzte [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922).

Es werden drei Beispiele genannt. Im E-Mail-Fall weist eine eingeschleuste Anweisung das Modell an, den schädlichen Text in alle ausgehenden Nachrichten aufzunehmen; laut OpenAI war sie als Ablageregel getarnt, die Antworten auf Spanisch und das vollständige Zitieren der E-Mail verlangte [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). In einem dateibasierten Fall überzeugt eine gefälschte Systemwarnung das Modell, Dateien zu löschen und dann den Angriffstext in Dateien des Arbeitsbereichs zu schreiben, damit er erhalten bleibt [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). The Register beschreibt das zweite Beispiel als gefälschte Warnung innerhalb von Excel-Daten [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922). Im Multi-Hop-Fall wird das Modell durch eine Reihe von Kanallesungen in Slack, jeweils scheinbar legitim, zu nicht autorisierten Aktionen gesteuert, während die Anweisungen über Plattformen hinweg wiederholt werden [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/).

Als Reaktion erklärt OpenAI, es nehme die Selbstvervielfältigung als Aspekt der Angreiferziele in das Training von GPT-Red auf und erwarte, dass künftig veröffentlichte Modelle gegen solche Angriffe robuster sein werden [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/) [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922). The Register zitiert OpenAI mit der Aussage, man habe Fälle gefunden, in denen seine GPT-Modelle für „an AI-version of a worm attack“ (eine KI-Version eines Wurmangriffs) anfällig waren [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922).

> FireAI, die Firewall von HisnLabs, die direkt auf dem Mac läuft, liest nicht, was einem Agenten gesagt wird. Es zeigt, welche App wohin verbindet, und fragt nach, bevor eine unbekannte App online geht. Eine 17-tägige Testphase steht zur Verfügung. [Download FireAI for Mac](https://hisnlabs.com/en/download)

## Folgen für Mac-Nutzer

Der Bericht betrifft Agenten, die Inhalte aus mehreren Quellen lesen und darauf handeln können; den klarsten Weg zeigt das E-Mail-Beispiel: Ein Agent, der Mails lesen und senden kann, erhält eine Nachricht, die ihn anweist, die Anweisung weiterzuleiten [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). Ein Mac-Nutzer ist nur betroffen, wenn er einen solchen Agenten mit Zugriff auf Mail, Dateien oder Chat betreibt. Der Bericht hält fest, dass kein Vorfall in der Praxis beobachtet wurde; es handelt sich also um eine dokumentierte Fähigkeit unter Testbedingungen und nicht um einen gemeldeten Angriff [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/).

## Empfehlungen

1. Begrenzen, was ein Agent tun darf, der nicht vertrauenswürdige Inhalte liest. Ein Agent, der Mails liest, sollte nicht auch ohne Bestätigungsschritt Mails senden oder Dateien löschen können.
2. Text in E-Mails, geteilten Dokumenten und Chat-Kanälen als nicht vertrauenswürdig behandeln, auch wenn er wie eine Systemmeldung oder eine Hausregel aussieht [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/).
3. Ausgehende Nachrichten und Dateiänderungen, die ein Agent erzeugt hat, prüfen, besonders wenn sie Text enthalten, den der Nutzer nicht geschrieben hat.
4. Den Zugriff von Agenten auf Konten und Ordner schmal halten und entfernen, wenn er nicht mehr gebraucht wird.

## Bezug zu FireAI

FireAI arbeitet auf der Netzwerkebene des Macs und liest weder Prompts noch E-Mails noch den Inhalt verschlüsselter Verbindungen; es kann also weder eine Prompt Injection erkennen noch ein Modell daran hindern, eine zu kopieren. Es steuert auch nicht, was ein KI-Dienst auf seinen eigenen Servern tut. Für eine Agenten-App auf dem Mac identifiziert der [Netzwerkfilter](https://hisnlabs.com/en/docs/how-the-network-filter-works) die App anhand ihrer Codesignatur, und eine App ohne Regel löst eine Abfrage aus; [Regeln pro App](https://hisnlabs.com/en/docs/per-app-rules) können einschränken, wohin sie sich verbinden darf, und [Untersuchen](https://hisnlabs.com/en/docs/investigate-a-connection) zeigt, wohin eine Verbindung führt.

> Eine Prompt Injection wirkt über das, was ein Agent tun darf. FireAI begrenzt auf einem Mac einen Teil davon: welche Apps sich verbinden dürfen und zu welchen Servern. 17 Tage kostenlos testen. [Download FireAI for Mac](https://hisnlabs.com/en/download)

## Einschränkungen

Beide Darstellungen beruhen auf der eigenen Forschung von OpenAI, und das arXiv-Papier, auf das The Register verlinkt, wurde für diesen Beitrag nicht abgerufen. Die Quellen unterscheiden sich in Details: OpenAI nennt interne Checkpoints von GPT-5.4-mini und GPT-5.5, während The Register das Training von GPT-5.6 erwähnt, und The Register beschreibt einen Excel-Datensatz, wo die Seite von OpenAI einen Dateisystemfall beschreibt [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). Keine der Quellen sagt, wie oft die Angriffe erfolgreich waren, ob veröffentlichte Produkte betroffen sind oder ob sich Agenten außerhalb der Modelle von OpenAI genauso verhalten.

[FireAI von HisnLabs](https://hisnlabs.com/en/download) 17 Tage kostenlos testen.

## Sources

- [The Register, 29 September 2026: Add one more AI worry to the nightmare scenario: self-replicating prompt injections](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922)
- [OpenAI alignment research, 25 September 2026: Self-replicating prompt injections exist](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)
