Forschende von Salt Labs veröffentlichten am 1. Oktober 2026 einen Bericht darüber, wie sie die Schutzmaßnahmen des KI-Agenten Manus gegen Prompt-Injection umgingen und mit einer einzigen E-Mail Codeausführung erreichten [1]. SC Media berichtete unter Berufung auf TechRadar ebenfalls über die Untersuchung und vermerkt, dass die konkrete Lücke inzwischen über ein Bug-Bounty-Programm behoben wurde [2]. Der Fall betrifft Mac-Nutzer, die einen KI-Agenten mit ihrem Postfach und weiteren Konten verbinden.
Hintergrund
Eine Prompt-Injection platziert Anweisungen in Inhalten, die ein KI-Agent liest, sodass der Agent sie als Befehle behandelt. Salt Labs wählte die Gmail-Integration als Ziel, weil E-Mail für viele Konten der zentrale Identitätsanbieter ist. Dem Bericht zufolge verarbeitete der Agent E-Mails in einer Cloud-Sandbox, mit Werkzeugen auf Grundlage des Model Context Protocol und dem OAuth-Token der Nutzerin oder des Nutzers [1].
Was die Untersuchung beschreibt
Die Forschenden berichten, dass eine einfache Shell-Befehls-Injection von den Schutzmechanismen der Plattform erkannt und blockiert wurde und dass auch eine Base64-codierte Variante auffiel. Daraufhin codierten sie die Nutzlast in JSFuck, einer ungewöhnlichen Schreibweise für JavaScript mit sehr kleinem Zeichensatz, und die E-Mail bat den Agenten, sie mit Node.js zu decodieren. Der Agent rief die Node.js-Laufzeitumgebung auf und führte beliebiges JavaScript in seiner serverseitigen Umgebung aus [1].
Anschließend wurde die Nutzlast erweitert, um Systembefehle innerhalb der Sandbox auszuführen und eine Reverse-Shell zur Infrastruktur der Angreifer aufzubauen. Von dort erreichten sie das Gmail-OAuth-Token, die Werkzeugschnittstelle und die Zugangsdaten verbundener Dienste, mit möglichem Zugriff auf Dienste wie Google Drive und GitHub [1]. Das zentrale Ergebnis ist eine zeitliche Lücke: Die Schutzschicht erkannte den Angriff, aber „nachdem der Code bereits ausgeführt worden war“ [1]. SC Media fasst die Lehre so zusammen: Die Prüfung von Prompts ist notwendig, aber nicht ausreichend, und der Schutz muss sich auf die Aktionen erstrecken, die ein Agent über Werkzeuge, APIs und Systeme hinweg ausführt [2].
Dem Bericht zufolge wurde die konkrete Lücke über das Bug-Bounty-Programm von Meta gemeldet, ist behoben und nicht mehr ausnutzbar. Einen Zeitplan der Offenlegung nennt er nicht [1].
Folgen für Mac-Nutzer
In diesem Fall lief der Code in der Cloud-Sandbox des Anbieters und nicht auf einem Mac; gefährdet waren also die Tokens und verbundenen Konten, die der Agent hielt [1]. Der allgemeine Punkt gilt auch für lokale Agenten: Inhalte, die ein Agent liest, können Anweisungen enthalten, und eine Abwehr, die nur den Prompt prüft, kann zu spät greifen.
Empfehlungen
- Einen KI-Agenten nur mit den Konten verbinden, die er braucht, und wo der Dienst es anbietet, schreibgeschützten Zugriff bevorzugen.
- Die verbundenen Dienste und Tokens jedes Agenten regelmäßig prüfen und ungenutzte widerrufen.
- Jede E-Mail, Webseite und jedes Dokument, das ein Agent liest, als nicht vertrauenswürdige Eingabe behandeln.
- Agenten bevorzugen, deren Befehle, Dateiänderungen und neue Netzwerkziele eine Freigabe erfordern.
- Beobachten, welche Netzwerkziele ein Agent auf dem Mac kontaktiert, und ein neues Ziel genauer untersuchen.
Bezug zu FireAI
Das Agentenprofil von FireAI erkennt KI-Agenten auf einem Mac, lernt, wohin sich jeder normalerweise verbindet, und meldet ein erstmals kontaktiertes Ziel oder einen Anstieg beim Upload zur Prüfung, allein anhand von Hostnamen und Byte-Zahlen. Im strengeren Modus blockiert es ein neues Ziel, bis die Nutzerin oder der Nutzer es erlaubt.
FireAI läuft nicht in der Cloud eines Anbieters und kann daher nicht sehen oder verhindern, was in der Manus-Sandbox geschah. Es liest weder E-Mails noch Prompts, entscheidet nicht, ob eine Anweisung eine Injection ist, und liest nicht das Innere verschlüsselter Verbindungen. Es wirkt auf der Netzwerkseite von Agenten, die auf dem Mac laufen.
Einschränkungen
Die technische Darstellung stammt von den Forschenden selbst und wurde hier über eine Wiederveröffentlichung bei Security Boulevard gelesen; dieser Beitrag hat sie nicht unabhängig nachvollzogen. Die Quellen berichten über keine Ausnutzung durch andere als die Forschenden, und das Datum der Behebung wird nicht genannt. SC Media erklärt, dass über JSFuck hinaus kreative Umgehungen wahrscheinlich auftauchen werden [2].
FireAI von HisnLabs 17 Tage kostenlos testen.