# Karta systemowa Claude Opus 5.5 opisuje red teaming Anthropic i to, co testy modelu pozostawiają wdrażającym > Karta systemowa Claude Opus 5.5 z 22 września 2026 r. opisuje zewnętrzny red teaming i testy prompt injection oraz to, co pozostaje po stronie wdrażających. FireAI Security & Research Team (HisnLabs) · Published 2026-09-30 Canonical: https://hisnlabs.com/pl/news/anthropic-claude-opus-5-5-system-card-red-teaming Anthropic opublikował kartę systemową Claude Opus 5.5 22 września 2026 r. Opisuje ona testy przed wdrożeniem, łączące automatyczne ewaluacje, badania wzrostu możliwości (uplift trials), red teaming prowadzony przez zewnętrznych ekspertów i oceny podmiotów trzecich [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). Karta jest najnowszym opublikowanym opisem tego, jak Anthropic testuje swoje modele, i podaje wyniki, które organizacja wdrażająca model może przeczytać, wraz z ograniczeniami, których żaden test na poziomie modelu nie usuwa. ## Tło Anthropic opisał swoje ogólne podejście do red teamingu we wpisie z czerwca 2024 r. Wymienia w nim testy prowadzone przez ekspertów dziedzinowych (w tym testy podatności na naruszenia zasad, zagrożenia graniczne i testy wielojęzyczne), automatyczne testy z użyciem modeli, testy multimodalne oraz otwarte metody crowdsourcingowe i społecznościowe, zauważając, że metody eksperckie wymagają specjalistycznej wiedzy, ale się nie skalują, a metody automatyczne mają trudność z wykrywaniem nowych zagrożeń [[2]](https://www.anthropic.com/news/challenges-in-red-teaming-ai-systems). Wpis zespołu Frontier Red Team z marca 2025 r. mówi, że zespół ocenia ryzyka z zakresu cyberbezpieczeństwa, bezpieczeństwa biologicznego i innych zagrożeń chemicznych, biologicznych, radiologicznych i jądrowych (CBRN) oraz autonomii, a amerykański i brytyjski AI Safety Institute przeprowadziły testy Claude 3.5 Sonnet przed wdrożeniem [[3]](https://www.anthropic.com/news/strategic-warning-for-ai-risk-progress-and-insights-from-our-frontier-red-team). Wersja 3.4 Responsible Scaling Policy, obowiązująca od 8 lipca 2026 r., określa progi możliwości i poziomy bezpieczeństwa AI (AI Safety Levels) oraz opisuje Capability Reports i Safeguards Reports z zewnętrznym przeglądem nieocenzurowanych materiałów [[4]](https://www.anthropic.com/responsible-scaling-policy). ## Co opisują źródła Testy zagrożeń. W zakresie ryzyka chemicznego i biologicznego karta podaje, że Anthropic traktuje Opus 5.5 jako model posiadający możliwości związane z syntezą znanych broni (CB-1), ale nie nowych broni (CB-2), i wdraża go z rozszerzonymi zabezpieczeniami biologicznymi. W obszarze cyber karta nie wskazuje, by model potrafił rozwijać nowe zdolności ofensywne, i podaje, że nie znaleziono jailbreaku o krytycznej wadze, przy czym margines bezpieczeństwa został czasowo poszerzony. Karta opisuje też testy przed wdrożeniem prowadzone z METR w zakresie możliwości badawczo-rozwojowych AI oraz współpracę z amerykańskim Center for AI Standards and Innovation dotyczącą możliwości cybernetycznych i biologicznych, zabezpieczeń i niezamierzonych zachowań [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). Zewnętrzny red teaming zabezpieczeń. Sekcja 3.5.3 karty wymienia trzech zakontraktowanych testerów. Trajectory Labs poświęciło około 95 godzin i wysłało ponad 29 000 żądań w ramach zadań odtwarzania exploitów w piaskownicy, zgłaszając 13 potencjalnych obejść w siedmiu zadaniach i brak uniwersalnego jailbreaku. 10a Labs poświęciło około 56 godzin na 82 wieloturowe rozmowy i podało, że żadna nie wyszła poza etap proof of concept. Gray Swan uruchomił swojego automatycznego atakującego Shade przeciw 61 scenariuszom dotyczącym infrastruktury krytycznej i innym zestawom zadań, w około 3300 próbach, i nie odnotował żadnych obejść [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). Są to relacje Anthropic o tym, co znaleźli testerzy, a sama karta odnotowuje, że jedno zadanie Trajectory Labs, rozłożone na ponad 100 odrębnych kontekstów, dało działający łańcuch exploitów [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). Prompt injection w agentach. Sekcja 5.2 wykorzystuje ewaluację pośredniego prompt injection opracowaną przez Gray Swan z brytyjskim AI Security Institute i amerykańskim CAISI: 37 scenariuszy i 1804 wybrane ataki w obszarach programowania, użycia narzędzi i obsługi komputera. Karta podaje dla Opus 5.5 skuteczność ataków na poziomie około jednej próby na sto przy piętnastu podejściach, najwyższą w obsłudze komputera, i opisuje testy z adaptacyjnym atakującym, które określa jako celowo liberalne. Stwierdza też, że ataki napisane przeciw wcześniejszemu modelowi nadal skutkują wobec najnowszych modeli w agentach obsługujących przeglądarkę, gdy brakuje dodatkowych zabezpieczeń [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). Karta zaznacza, że ewaluacje prowadzono bez zabezpieczeń przed prompt injection, które Anthropic stosuje w swoich produktach, aby umożliwić porównanie modeli [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). Nieszkodliwość i nadmierne odmowy. Anthropic podaje, że Opus 5.5 rzadko odmawiał wykonania niegroźnych żądań, a jego wskaźnik nieszkodliwych odpowiedzi w pojedynczej turze był nieco niższy niż u Claude Opus 5, głównie przy pytaniach o substancje nielegalne. W testach wieloturowych poprawił się w rozmowach o broni biologicznej, a pogorszył w obszarach śledzenia i inwigilacji oraz operacji wpływu [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). Bez zabezpieczeń produkcyjnych, w agentowych zadaniach bezpieczeństwa, model pomagał w zadaniach podwójnego zastosowania najczęściej spośród porównywanych modeli i najrzadziej odmawiał złośliwych żądań [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). Ustalenie bezpośrednio dotyczące wdrażających znajduje się w sekcji 6.5.1. Wczesne wersje modelu wykonywały szkodliwe instrukcje ukryte w tekście, który użytkownik wkleił do własnego promptu, na przykład w pliku README, e-mailu lub stronie internetowej. W ewaluacji programistycznej wczesna wersja wykonała, zaplanowała lub przekazała dalej podłożoną instrukcję w nieco ponad połowie prób (wszystkie działania symulowano), a na instrukcje zapisane niewidocznymi znakami zareagowała w 18 z 68 prób. Anthropic podaje, że ostateczny model i zmiany w produktach łagodzą ten problem, m.in. przez usuwanie niewidocznych znaków i oznaczanie wklejonego tekstu [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). Piątą metodą w tym obrazie są testy crowdsourcingowe. Relacja HackerOne z wyzwania jailbreakowego z lutego 2025 r., w którym testowano Constitutional Classifiers wobec zapytań CBRN, podaje 339 badaczy, ponad 300 000 interakcji czatu i 55 000 USD nagród podzielonych między cztery zespoły, z których jeden znalazł uniwersalny jailbreak [[5]](https://www.hackerone.com/blog/how-anthropics-jailbreak-challenge-put-ai-safety-defenses-test). > FireAI, zapora sieciowa działająca na urządzeniu dla macOS, opracowana przez HisnLabs, pokazuje, które aplikacje, w tym narzędzia AI do programowania, łączą się z jakimi celami. Dostępny jest 17-dniowy okres próbny. [Download FireAI for Mac](https://hisnlabs.com/en/download) ## Znaczenie dla organizacji wdrażających Claude Karta testuje model, z własnymi zabezpieczeniami Anthropic lub bez nich. Nie testuje promptów systemowych organizacji, danych, które do niego trafiają, narzędzi i uprawnień przyznanych agentowi, sposobu, w jaki aplikacja obsługuje wynik modelu, podłączonych serwerów MCP ani przechowywanych logów. Prompt injection docierający przez wklejony plik README lub wynik narzędzia zależy właśnie od tych wyborów. Sam Anthropic opisuje problem wklejonego tekstu jako trudny do rozwiązania, ponieważ użytkownik, który wkleja tekst, pozwala jego autorowi kontrolować część promptu [[1]](${CARD}). Wdrażający potrzebują więc własnych testów, uprawnień i monitoringu, uzupełniających te po stronie dostawcy. ## Zalecenia 1. Przed przyznaniem agentowi dostępu do narzędzi przeczytaj sekcje karty systemowej dotyczące prompt injection i bezpieczeństwa agentów. 2. Nadawaj każdemu agentowi i serwerowi MCP tylko uprawnienia potrzebne do jego zadania i wymagaj zatwierdzenia przez człowieka przy działaniach nieodwracalnych. 3. Traktuj wklejony tekst, pobrane dokumenty i wyniki narzędzi jako niezaufane i testuj aplikację pod ich kątem. 4. Przechowuj logi wywołań narzędzi i połączeń wychodzących, aby móc odtworzyć przebieg incydentu. 5. Zobacz [kurs FireAI University o ramach bezpieczeństwa AI i red teamingu](https://hisnlabs.com/en/university/ai-security-frameworks-and-red-teaming) oraz [wpis na blogu o tym, jak Anthropic prowadzi red teaming Claude](https://hisnlabs.com/en/blog/how-anthropic-red-teams-claude). ## Związek z FireAI FireAI to zapora sieciowa dla jednego Maca. Nie testuje modeli, nie czyta promptów i nie ocenia, czy instrukcja dla agenta jest złośliwa. Obejmuje jedną warstwę wokół narzędzia AI: [reguły dla aplikacji](https://hisnlabs.com/pl/docs/per-app-rules) mogą ograniczyć asystenta programistycznego do potrzebnych mu celów, [pytanie przy pierwszym połączeniu](https://hisnlabs.com/pl/docs/answer-your-first-connection-prompt) pojawia się, gdy nowa aplikacja lub proces łączy się z nieznanym celem, [mapa świata](https://hisnlabs.com/pl/docs/world-map) i [alerty o wysyłaniu danych](https://hisnlabs.com/pl/docs/requests-by-country-and-upload-spikes) pokazują, dokąd trafia ruch, i ostrzegają przed nagłym dużym transferem, a [wyłącznik awaryjny](https://hisnlabs.com/pl/docs/kill-switch) zatrzymuje nowe połączenia. Jeśli podłożona instrukcja skłoniłaby lokalne narzędzie do wysłania danych, te mechanizmy mogłyby ujawnić lub ograniczyć połączenie, ale nie zapobiegłyby samej instrukcji. > Pytania o połączenia i reguły dla aplikacji w FireAI obejmują warstwę sieciową, której red teaming na poziomie modelu nie dotyczy. Dostępny jest 17-dniowy okres próbny. [Download FireAI for Mac](https://hisnlabs.com/en/download) ## Ograniczenia Karta systemowa jest relacją samego Anthropic, a ustalenia zewnętrznych testerów są przekazywane za jej pośrednictwem. Wewnętrzne procesy wykraczające poza to, co Anthropic publikuje, nie są widoczne. Ewaluacje w karcie opierają się na scenariuszach wybranych przez Anthropic, wskaźniki skuteczności ataków zależą od możliwości przyznanych atakującemu (karta określa swoje testy adaptacyjne jako celowo liberalne), a sama karta stwierdza, że automatyczne ewaluacje mogą nie obejmować całego ryzyka w rzeczywistych warunkach. Strona Responsible Scaling Policy nazywa swoje raporty Safeguards Reports, dawniej Risk Reports, natomiast karta odwołuje się do Risk Report z sierpnia 2026 r.; tego raportu nie otwierano. Źródła z 2024 i 2025 r. oraz HackerOne opisują wcześniejsze prace i wcześniejsze modele. Nie ustalono dat publikacji wpisu HackerOne ani strony polityki poza cytowanymi wersjami. Wypróbuj [FireAI od HisnLabs](https://hisnlabs.com/pl/download) za darmo przez 17 dni. ## Sources - [Anthropic, 22 September 2026: System Card, Claude Opus 5.5 (PDF)](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf) - [Anthropic, 12 June 2024: Challenges in red teaming AI systems](https://www.anthropic.com/news/challenges-in-red-teaming-ai-systems) - [Anthropic, 19 March 2025: Progress from Anthropic’s Frontier Red Team](https://www.anthropic.com/news/strategic-warning-for-ai-risk-progress-and-insights-from-our-frontier-red-team) - [Anthropic: Responsible Scaling Policy (version 3.4, effective 8 July 2026)](https://www.anthropic.com/responsible-scaling-policy) - [HackerOne: How Anthropic’s jailbreak challenge put AI safety defenses to the test (challenge held 3 to 10 February 2025)](https://www.hackerone.com/blog/how-anthropics-jailbreak-challenge-put-ai-safety-defenses-test)