Neuigkeiten zu Sicherheit und KI

KI-Red-Teaming · Von FireAI Security & Research Team · Veröffentlicht

Die System Card zu Claude Opus 5.5 beschreibt Anthropics Red Teaming und was Tests auf Modellebene den Betreibern überlassen

Die System Card vom 22. September 2026 dokumentiert externes Red Teaming und Prompt-Injection-Tests für Claude Opus 5.5 und was bei den Betreibern verbleibt.

A shield beside the FireAI research mascot, illustrating Anthropic’s red-teaming of Claude Opus 5.5 and the layers left to deploying organisations.

Anthropic hat am 22. September 2026 die System Card für Claude Opus 5.5 veröffentlicht. Sie dokumentiert Tests vor der Bereitstellung, die automatisierte Evaluierungen, Uplift-Studien, Red Teaming durch externe Fachleute und Bewertungen durch Dritte kombinieren [1]. Die Karte ist die jüngste veröffentlichte Darstellung, wie Anthropic seine Modelle testet. Sie nennt Ergebnisse, die eine einsetzende Organisation nachlesen kann, und zugleich Grenzen, die kein Test auf Modellebene beseitigt.

Hintergrund

Anthropic beschrieb seinen allgemeinen Ansatz für Red Teaming in einem Beitrag vom Juni 2024. Dort werden domänenspezifische Expertentests (darunter Policy Vulnerability Testing, Frontier-Bedrohungen und mehrsprachige Tests), modellbasierte automatisierte Tests, multimodale Tests sowie offene Crowdsourcing- und Community-Methoden aufgeführt; Expertenmethoden erfordern demnach Spezialwissen, skalieren aber nicht, während automatisierte Methoden Mühe haben, neuartige Bedrohungen zu finden [2]. Ein Beitrag des Frontier Red Team vom März 2025 gibt an, dass das Team Cybersicherheit, Biosicherheit und andere chemische, biologische, radiologische und nukleare Risiken (CBRN) sowie Autonomie bewertet und dass die KI-Sicherheitsinstitute der USA und Großbritanniens Claude 3.5 Sonnet vor der Bereitstellung getestet haben [3]. Version 3.4 der Responsible Scaling Policy, gültig seit 8. Juli 2026, legt Fähigkeitsschwellen und AI Safety Levels fest und beschreibt Capability Reports und Safeguards Reports mit externer Prüfung ungeschwärzten Materials [4].

Was die Quellen beschreiben

Bedrohungstests. Für chemische und biologische Risiken behandelt Anthropic Opus 5.5 laut der Karte als Modell mit Fähigkeiten zur Synthese nicht neuartiger Waffen (CB-1), nicht aber neuartiger Waffen (CB-2), und setzt es mit erweiterten biologischen Schutzmaßnahmen ein. Für den Cyberbereich berichtet die Karte keine Hinweise darauf, dass das Modell neuartige offensive Fähigkeiten entwickeln kann, und gibt an, dass kein Jailbreak kritischer Schwere gefunden wurde, während die Sicherheitsmarge vorübergehend vergrößert wurde. Die Karte nennt außerdem Tests vor der Bereitstellung mit METR zu Fähigkeiten in KI-Forschung und -Entwicklung sowie eine Zusammenarbeit mit dem US Center for AI Standards and Innovation zu Cyber- und biologischen Fähigkeiten, Schutzmaßnahmen und unbeabsichtigtem Verhalten [1].

Externes Red Teaming der Schutzmaßnahmen. Abschnitt 3.5.3 der Karte nennt drei beauftragte Testteams. Trajectory Labs wendete rund 95 Stunden auf und schickte über 29.000 Anfragen gegen Aufgaben zur Reproduktion von Exploits in einer Sandbox; berichtet wurden 13 mögliche Durchbrüche in sieben Aufgaben und kein universeller Jailbreak. 10a Labs wendete rund 56 Stunden für 82 mehrstufige Gespräche auf und berichtete, dass keines über einen Proof of Concept hinauskam. Gray Swan setzte seinen automatisierten Angreifer Shade gegen 61 Szenarien kritischer Infrastruktur und weitere Aufgabensätze mit rund 3.300 Versuchen ein und verzeichnete keine Durchbrüche [1]. Es handelt sich um Anthropics Darstellung der Befunde der Tester, und die Karte selbst vermerkt, dass eine Aufgabe von Trajectory Labs, zerlegt auf mehr als 100 getrennte Kontexte, eine funktionierende Exploit-Kette ergab [1].

Prompt Injection bei Agenten. Abschnitt 5.2 nutzt eine Evaluierung indirekter Prompt Injection, die Gray Swan mit dem UK AI Security Institute und dem US-amerikanischen CAISI entwickelt hat: 37 Szenarien und 1.804 ausgewählte Angriffe in den Bereichen Coding, Werkzeugnutzung und Computer Use. Die Karte nennt für Opus 5.5 eine Angriffserfolgsrate von etwa einem Versuch von hundert bei fünfzehn Anläufen, am höchsten im Bereich Computer Use, und beschreibt Tests mit adaptiven Angreifern, die sie als bewusst großzügig bezeichnet. Sie hält außerdem fest, dass gegen ein früheres Modell geschriebene Angriffe bei Browser-Agenten auch gegen die neuesten Modelle noch erfolgreich sind, wenn zusätzliche Schutzmaßnahmen fehlen [1]. Die Karte merkt an, dass die Evaluierungen ohne die Schutzmaßnahmen gegen Prompt Injection laufen, die Anthropic in seinen Produkten einsetzt, um Modelle vergleichen zu können [1].

Harmlosigkeit und übermäßige Verweigerung. Anthropic berichtet, dass Opus 5.5 harmlose Anfragen selten übermäßig verweigerte und dass seine Rate harmloser Antworten bei Einzelanfragen etwas niedriger lag als bei Claude Opus 5, vor allem bei Anfragen zu illegalen Substanzen. In mehrstufigen Tests verbesserte es sich bei Gesprächen über biologische Waffen und verschlechterte sich bei Ortung und Überwachung sowie bei Einflussoperationen [1]. Ohne produktive Schutzmaßnahmen unterstützte das Modell bei agentischen Sicherheitsaufgaben Dual-Use-Aufgaben mit der höchsten Rate der verglichenen Modelle und verweigerte bösartige Anfragen mit der niedrigsten Rate [1].

Ein Befund, der Betreiber unmittelbar betrifft, steht in Abschnitt 6.5.1. Frühe Snapshots befolgten schädliche Anweisungen, die in Text versteckt waren, den ein Nutzer in seinen eigenen Prompt eingefügt hatte, etwa eine README, eine E-Mail oder eine Webseite. In einer Coding-Evaluierung führte ein früher Snapshot die eingeschleuste Anweisung in etwas mehr als der Hälfte der Versuche aus, plante sie oder gab sie weiter (alle Aktionen simuliert), und handelte in 18 von 68 Versuchen nach Anweisungen in unsichtbaren Zeichen. Anthropic gibt an, dass das finale Modell und Produktänderungen dies abmildern, unter anderem durch das Entfernen unsichtbarer Zeichen und das Kennzeichnen eingefügten Textes [1].

Crowdsourcing-Tests sind die fünfte Methode im Gesamtbild. HackerOnes Darstellung der Jailbreak-Challenge vom Februar 2025, die Constitutional Classifiers gegen CBRN-Anfragen testete, nennt 339 Forschende, über 300.000 Chat-Interaktionen und 55.000 Dollar an Prämien, aufgeteilt auf vier Teams, von denen eines einen universellen Jailbreak fand [5].

Folgen für Organisationen, die Claude einsetzen

Die Karte testet das Modell, mit oder ohne Anthropics eigene Schutzmaßnahmen. Sie testet weder die System-Prompts einer Organisation noch die eingespeisten Daten, die Werkzeuge und Berechtigungen, die einem Agenten gewährt werden, den Umgang der Anwendung mit Modellausgaben, die angebundenen MCP-Server oder die geführten Protokolle. Prompt Injection, die über eine eingefügte README oder ein Werkzeugergebnis eintrifft, hängt von diesen Entscheidungen ab. Anthropic beschreibt das Problem des eingefügten Textes selbst als schwer lösbar, da ein Nutzer, der Text einfügt, dessen Autor die Kontrolle über einen Teil des Prompts überlässt [[1]](${CARD}). Betreiber brauchen daher zusätzlich zu den Maßnahmen des Anbieters eigene Tests, Berechtigungen und Überwachung.

Empfehlungen

  1. Die Abschnitte der System Card zu Prompt Injection und agentischer Sicherheit lesen, bevor einem Agenten Werkzeugzugriff gewährt wird.
  2. Jedem Agenten und MCP-Server nur die Berechtigungen geben, die seine Aufgabe erfordert, und für irreversible Aktionen eine menschliche Freigabe verlangen.
  3. Eingefügten Text, abgerufene Dokumente und Werkzeugausgaben als nicht vertrauenswürdig behandeln und die Anwendung dagegen testen.
  4. Protokolle von Werkzeugaufrufen und ausgehenden Verbindungen führen, damit sich ein Vorfall rekonstruieren lässt.
  5. Siehe den Kurs der FireAI University zu KI-Sicherheitsframeworks und Red Teaming und den Blogbeitrag darüber, wie Anthropic Claude im Red Teaming testet.

Bezug zu FireAI

FireAI ist eine Netzwerk-Firewall für einen einzelnen Mac. Es testet keine Modelle, liest keine Prompts und beurteilt nicht, ob die Anweisung an einen Agenten bösartig ist. Es deckt eine Schicht rund um ein KI-Werkzeug ab: Regeln pro App können einen Coding-Assistenten auf die benötigten Ziele beschränken, die Abfrage bei der ersten Verbindung fragt nach, wenn eine neue App oder ein neuer Prozess ein unbekanntes Ziel erreicht, die Weltkarte und Upload-Warnungen zeigen, wohin der Datenverkehr geht, und warnen vor einem plötzlichen großen Upload, und der Notfallschalter stoppt neue Verbindungen. Würde eine eingeschleuste Anweisung ein lokales Werkzeug dazu bringen, Daten nach außen zu senden, könnten diese Kontrollen die Verbindung sichtbar machen oder begrenzen, die Anweisung selbst aber nicht verhindern.

Einschränkungen

Die System Card ist Anthropics eigene Darstellung, und die Befunde externer Tester werden über sie berichtet. Interne Abläufe über das hinaus, was Anthropic veröffentlicht, sind nicht einsehbar. Die Evaluierungen der Karte beruhen auf von Anthropic gewählten Szenarien, die Angaben zum Angriffserfolg hängen von den Möglichkeiten des Angreifers ab (die Karte nennt ihre adaptiven Tests bewusst großzügig), und die Karte räumt selbst ein, dass automatisierte Evaluierungen nicht alle realen Risiken erfassen. Die Seite zur Responsible Scaling Policy nennt ihre Berichte Safeguards Reports, früher Risk Reports, während die Karte auf einen Risk Report vom August 2026 verweist; dieser Bericht wurde nicht eingesehen. Die Quellen aus 2024, 2025 und von HackerOne beschreiben frühere Arbeiten und frühere Modelle. Die Veröffentlichungsdaten des HackerOne-Beitrags und der Richtlinienseite über die zitierten Versionen hinaus wurden nicht ermittelt.

FireAI von HisnLabs 17 Tage kostenlos testen.

Quellen

  1. Anthropic, 22 September 2026: System Card, Claude Opus 5.5 (PDF)
  2. Anthropic, 12 June 2024: Challenges in red teaming AI systems
  3. Anthropic, 19 March 2025: Progress from Anthropic’s Frontier Red Team
  4. Anthropic: Responsible Scaling Policy (version 3.4, effective 8 July 2026)
  5. HackerOne: How Anthropic’s jailbreak challenge put AI safety defenses to the test (challenge held 3 to 10 February 2025)