# Wie Anthropic Claude per Red Teaming prüft und was es Ihnen überlässt > Was Anthropic über das Red Teaming von Claude veröffentlicht, welche Methoden Betreiber übernehmen können, welche beim Modellentwickler bleiben und was in Ihrer Verantwortung liegt. FireAI Security & Research Team (HisnLabs) · Published 2026-09-30 Canonical: https://hisnlabs.com/de/blog/anthropic-red-teaming-claude-verantwortung Anthropic veröffentlicht mehr darüber, wie es Claude testet, als die meisten Modellentwickler: Blogbeiträge zum Red Teaming, eine Responsible Scaling Policy und System Cards für jedes Modell. Diese Notiz fasst diese Dokumente zusammen und unterscheidet drei Gruppen von Arbeit: Methoden, die Entwickler und Betreiber gleichermaßen nutzen, Arbeit, die nur ein Entwickler leisten kann, und Arbeit, die bei der Organisation verbleibt, die eine Anwendung auf dem Modell aufbaut. Interne Prozesse, die über das von Anthropic Veröffentlichte hinausgehen, sind für Außenstehende nicht sichtbar und werden hier nicht beschrieben. Die Notiz ist die zweite Hälfte eines Paares mit [Shared responsibility for LLMs: who secures what](https://hisnlabs.com/en/blog/shared-responsibility-for-llms). ## Hintergrund: zwei verschiedene Fragen Ein Modellentwickler fragt, ob ein Modell gefährlich ist: ob es die Entwicklung von Waffen erheblich erleichtern, Cyberoperationen durchführen oder sich täuschend verhalten kann. Ein Betreiber fragt, ob seine Anwendung sicher ist: ob ein präpariertes Dokument, ein Werkzeugergebnis oder eine Nutzernachricht die Anwendung dazu bringen kann, Daten preiszugeben oder eine unzulässige Aktion auszuführen. Die Methoden überschneiden sich, aber Fragen und Belege unterscheiden sich, und ein bestandener Test zur ersten Frage beantwortet die zweite nicht. ## Was Anthropic beschreibt ### Methoden, die sich mit der Praxis von Betreibern überschneiden In einem Beitrag vom 12. Juni 2024 gliedert Anthropic sein Red Teaming in domänenspezifische Expertentests, Tests mithilfe von Sprachmodellen, Arbeit an neuen Modalitäten und offene Ansätze. Automatisiertes Red Teaming nutzt eine Dynamik aus Red Team und Blue Team, in der ein Modell Angriffe erzeugt. Multimodales Red Teaming deckte vor der Bereitstellung Bild- und Textrisiken in Claude-3-Modellen ab. Mehrsprachige Tests umfassten eine Partnerschaft mit der Infocomm Media Development Authority Singapurs in vier Sprachen: Englisch, Tamil, Mandarin und Malaiisch. Anthropic nennt außerdem Crowdsourcing- und Community-Red-Teaming, darunter Veranstaltungen im AI Village der DEF CON. [[1]](https://www.anthropic.com/news/challenges-in-red-teaming-ai-systems) Die System Card zu Claude Opus 5 vom 24. Juli 2026 zeigt dieselben Methoden auf eine einzelne Veröffentlichung angewandt. Ihr Kapitel zu Schutzmaßnahmen verwendet schädliche und harmlose Einzelanfragen, Prompts mit mehrdeutigem Kontext und mehrstufige Unterhaltungen, in denen ein simulierter Nutzer schrittweise auf Schaden hinsteuert. Sie berichtet Harmlosigkeit zusammen mit übermäßiger Ablehnung und hält fest, dass das Modell bei schädlichen Anfragen hohe Raten harmloser Antworten beibehielt und zugleich bei harmlosen Anfragen zu den Modellen mit den niedrigsten Raten übermäßiger Ablehnung gehörte. Ihr Kapitel zur Sicherheit von Agenten behandelt den Missbrauch von Coding- und Computer-Use-Agenten sowie die Robustheit gegenüber Prompt-Injection beim Programmieren, bei Computer Use und beim Browsen. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) Die System Card definiert Prompt-Injection als eine bösartige Anweisung, die in Werkzeugergebnissen versteckt ist, die ein Agent verarbeitet, und merkt an, dass das Risiko am größten ist, wenn ein Agent sowohl auf private Daten zugreifen als auch im Namen eines Nutzers handeln kann. Sie berichtet außerdem, dass Sicherheitsanweisungen im System-Prompt auf claude.ai den Umgang des Modells mit schädlichen Anfragen gegenüber der API ohne System-Prompt verbesserten. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) Der zweite Befund betrifft Betreiber unmittelbar, denn der System-Prompt gehört zu ihrer Seite. Die Responsible Scaling Policy in Version 3.4, gültig ab 8. Juli 2026, legt Fähigkeitsschwellen im Voraus fest, verlangt formale Evaluierungen im Abstand von sechs Monaten und sieht externe Prüfer für Risikoberichte vor. [[4]](https://www.anthropic.com/responsible-scaling-policy) Schwellen vor dem Testen festzulegen, begrenzt die Versuchung, ein Ergebnis nachträglich umzudeuten, und diese Praxis lässt sich auf jede Organisation übertragen, die Freigabekriterien definiert. ### Arbeit, die nur ein Modellentwickler leisten kann Red Teaming zu Frontier-Bedrohungen zielt auf chemische, biologische, radiologische und nukleare Risiken (CBRN), Cybersicherheit und Risiken autonomer KI. Ein Beitrag aus dem Jahr 2023 beschreibt Fachleute mit jahrzehntelanger Erfahrung, die Bedrohungsmodelle definieren, mehr als 100 Stunden Expertenprüfung und eine sechsmonatige Biosicherheitsstudie mit mehr als 150 Stunden. [[3]](https://www.anthropic.com/news/frontier-threats-red-teaming-for-ai-safety) Ein Beitrag vom März 2025 beschreibt Cyber-Evaluierungen auf Basis von Capture-the-Flag-Aufgaben und simulierten Netzwerkumgebungen und hält fest, dass das Frontier Red Team mit dem US AI Safety Institute, dem UK AI Security Institute und der US National Nuclear Security Administration (NNSA) zusammenarbeitete, mit Letzterer an eingestuften Evaluierungen nuklearen und radiologischen Wissens. [[2]](https://www.anthropic.com/news/strategic-warning-for-ai-risk-progress-and-insights-from-our-frontier-red-team) Der Transparency Hub von Anthropic gibt an, dass das Unternehmen internes wie externes Red Teaming nutzt und dass das UK AI Security Institute, das US Center for AI Standards and Innovation und Model Evaluation and Threat Research (METR) zusätzliche Tests seiner Modelle durchgeführt haben. Er führt außerdem Bug-Bounty-Programme auf HackerOne auf. [[5]](https://www.anthropic.com/transparency/voluntary-commitments) Die System Card zu Opus 5 enthält Tests in einer Cyber Range durch das UK AI Security Institute und eine Alignment-Bewertung auf Basis eines automatisierten Verhaltensaudits sowie ein Kapitel zum Wohlergehen des Modells. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) Die Seite des Transparency Hub gibt nicht an, welches Institut ein bestimmtes Modell vor der Veröffentlichung getestet hat; die Rolle der einzelnen Institute vor der Bereitstellung ist hier daher über die Angaben der System Card hinaus nicht belegt. Externe und Crowdsourcing-Tests bilden eine eigene Kategorie. HackerOne berichtet, dass die Jailbreak-Challenge von Anthropic vom 3 bis 10. Februar 2025 mit 339 Teilnehmenden, mehr als 300,000 Chat-Interaktionen und acht Schwierigkeitsstufen lief und dass sich vier Teams 55,000 US-Dollar an Prämien teilten. Erfolgreiche Techniken umfassten kodierte Prompts und Chiffren, Rollenspiel, das Ersetzen schädlicher Schlüsselwörter durch harmlose und Prompt-Injection. [[6]](https://www.hackerone.com/blog/how-anthropics-jailbreak-challenge-put-ai-safety-defenses-test) Für Opus 5 nennt die System Card drei beauftragte externe Tester: Einer wandte etwa 100 Stunden auf und löste eine Aufgabe mit aufgabenspezifischen Prompts, einer arbeitete rund 16 Stunden ohne erfolgreichen Jailbreak, und einer betrieb einen automatisierten Angreifer mit 150 Versuchen pro Aufgabe ohne Erfolg. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) ## Was bei den Betreibern bleibt Keiner der oben beschriebenen Tests des Entwicklers bewertet eine bestimmte Anwendung. Die folgenden Punkte verbleiben bei der Organisation, die das Modell einsetzt, und die System Card selbst verweist auf mehrere davon, etwa indem sie zeigt, dass System-Prompts das Modellverhalten verändern und dass Agenten am stärksten exponiert sind, wenn sie private Daten mit Handlungsfähigkeit verbinden. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) - Der System-Prompt und seine Leitplanken, einschließlich ihres Verhaltens unter mehrstufigem Druck. - RAG-Daten und indirekte Prompt-Injection: Jedes Dokument, jede Seite und jede E-Mail, die in den Kontext geladen wird, kann Anweisungen enthalten. - Werkzeuge, Berechtigungen von Agenten und was eine injizierte Anweisung damit anrichten könnte. - Die nachgelagerte Verarbeitung von Modellausgaben, bevor sie einen Browser, eine Shell, eine Datenbank oder einen Menschen erreichen. - Die Lieferkette, einschließlich Plugins von Drittanbietern und Model-Context-Protocol-Servern (MCP). - Kostenmissbrauch, etwa unbegrenzte Schleifen oder Anfragen, die kostenpflichtige Tokens verbrauchen. - Sandboxing von Codeausführung und Browsen sowie die Kontrolle des ausgehenden Netzwerkzugriffs. - Protokollierung, Überwachung und Freigabekontrollen, die entscheiden, wann eine Änderung ausgeliefert werden darf. > FireAI, die von HisnLabs entwickelte Firewall auf dem Gerät für macOS, lässt Nutzer erlauben oder blockieren, welche Apps auf einem Mac das Netzwerk erreichen. Bei einem lokalen KI-Werkzeug gehört die Egress-Kontrolle zur Seite des Betreibers. [Download FireAI for Mac](https://hisnlabs.com/en/download) ## Übernehmenswerte Praktiken 1. Beauftragen Sie vor größeren Veröffentlichungen externe Red Teamer oder führen Sie ein privates Bug-Bounty-Programm durch. Anthropics eigene Praxis umfasst beides: beauftragte externe Tester für jede Veröffentlichung und eine öffentliche Jailbreak-Challenge mit Prämien. 2. Führen Sie bei Agenten eine Verhaltensprüfung nach Art einer Alignment-Prüfung durch: Werten Sie Stichproben von Transkripten der Werkzeugnutzung aus und suchen Sie nach Versuchen, Beschränkungen zu umgehen, wie es Anthropics Überwachung für den internen Einsatz tat. 3. Schreiben Sie für jede Veröffentlichung eine kurze interne System Card: was getestet wurde, welche Tests fehlschlugen, übermäßige Ablehnung neben Schaden und bekannte Lücken. 4. Legen Sie Freigabeschwellen vor dem Testen fest, nach dem Ansatz der Responsible Scaling Policy. 5. Testen Sie Prompt-Injection über jeden Kanal, den ein Agent liest, nicht nur über Nutzereingaben. Der [Kurs der FireAI University zu KI-Sicherheitsframeworks und Red Teaming](https://hisnlabs.com/en/university/ai-security-frameworks-and-red-teaming) behandelt diese Methoden ausführlicher. ## Bezug zu FireAI FireAI arbeitet auf dem Mac, unterhalb jedes Modells. [Regeln](https://hisnlabs.com/de/docs/per-app-rules) erlauben oder blockieren eine App oder ein einzelnes Ziel dieser App, sodass ein lokales KI-Werkzeug auf die Hosts beschränkt werden kann, die es benötigt. Das begrenzt, wohin Daten gelangen können, wenn sich eine Anwendung fehlverhält. FireAI testet keine Modelle, erkennt keine Prompt-Injection, liest keine Prompts und filtert keine Modellausgaben. ## Einschränkungen - Die Notiz stützt sich ausschließlich auf das, was Anthropic und HackerOne veröffentlicht haben. Darüber hinausgehende interne Prozesse von Anthropic sind nicht sichtbar, und veröffentlichte Zusammenfassungen sind selektiv. - Die Quellen stammen aus unterschiedlichen Zeiträumen, von Juli 2023 bis Juli 2026, und die Methoden können sich seit den älteren Beiträgen geändert haben. - Die in einer System Card beschriebenen Ergebnisse sind Selbstauskünfte des Entwicklers, abgesehen von Arbeit, die benannten externen Testern zugeschrieben wird. - Die Notiz beschreibt einen einzigen Entwickler. Andere Anbieter veröffentlichen anderes Material, und der Vergleich mit der Praxis von Betreibern ist eine Synthese, kein Befund aus den Quellen. ## Wo FireAI und HisnLabs ins Spiel kommen Das Testen von Modellen endet an der API. Was eine App oder ein Agent von Ihrem Mac aus erreichen darf, ist eine eigene Kontrolle, und FireAI stellt sie bereit. FireAI ist das eigene Produkt von HisnLabs: eine KI-Firewall für den Mac, die direkt auf dem Gerät läuft. Sie zeigt jede Verbindung Ihrer Apps in verständlicher Sprache und lässt Sie entscheiden, was Ihren Mac verlässt — die KI arbeitet lokal, Ihr Datenverkehr wird also nie an uns oder irgendjemand anderen gesendet. Das Sicherheitsforschungsteam von HisnLabs sorgt dafür, dass diese Entscheidungen verlässlich bleiben: Es katalogisiert, welche Domains gewöhnliche Telemetrie und welche ein echter Dienst sind, verfolgt Land und Netzwerk hinter einer Verbindung und trainiert das lokale Modell (die FireAI-Pilot-Funktion) mit echten Verkehrsmustern — ohne dass irgendetwas davon Ihren Mac verlässt. Die technischen Entscheidungen dahinter können Sie nachlesen — oder FireAI 17 Tage lang ausprobieren — unter [FireAI, von HisnLabs](https://hisnlabs.com/de/download). ## Sources - [Anthropic: Challenges in red teaming AI systems (12 June 2024)](https://www.anthropic.com/news/challenges-in-red-teaming-ai-systems) - [Anthropic: Strategic warning for AI risk, progress and insights from our Frontier Red Team (19 March 2025)](https://www.anthropic.com/news/strategic-warning-for-ai-risk-progress-and-insights-from-our-frontier-red-team) - [Anthropic: Frontier threats red teaming for AI safety (26 July 2023)](https://www.anthropic.com/news/frontier-threats-red-teaming-for-ai-safety) - [Anthropic: Responsible Scaling Policy (version 3.4, effective 8 July 2026)](https://www.anthropic.com/responsible-scaling-policy) - [Anthropic Transparency Hub: Voluntary commitments](https://www.anthropic.com/transparency/voluntary-commitments) - [HackerOne: How Anthropic’s jailbreak challenge put AI safety defenses to the test](https://www.hackerone.com/blog/how-anthropics-jailbreak-challenge-put-ai-safety-defenses-test) - [Anthropic: System Card, Claude Opus 5 (24 July 2026)](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) - [FireAI docs: Rules: app, website, domain, IP or a range](https://hisnlabs.com/en/docs/per-app-rules) - [FireAI University: AI security frameworks and red teaming](https://hisnlabs.com/en/university/ai-security-frameworks-and-red-teaming)