Sikkerhet og AI-nyheter

Red teaming av KI · Av FireAI Security & Research Team · Publisert

Systemkortet for Claude Opus 5.5 beskriver Anthropics red teaming, og hva testing på modellnivå overlater til dem som tar modellen i bruk

Anthropics systemkort fra 22. september 2026 beskriver ekstern red teaming og tester mot promptinjeksjon for Claude Opus 5.5, og hva som gjenstår for brukerne.

A shield beside the FireAI research mascot, illustrating Anthropic’s red-teaming of Claude Opus 5.5 and the layers left to deploying organisations.

Anthropic publiserte systemkortet for Claude Opus 5.5 22. september 2026. Det beskriver testing før lansering som kombinerer automatiserte evalueringer, forsøk som måler økt kapasitet hos brukere (uplift trials), red teaming utført av eksterne eksperter og vurderinger fra tredjeparter [1]. Kortet er den nyeste publiserte redegjørelsen for hvordan Anthropic tester modellene sine, og det oppgir resultater en organisasjon som tar modellen i bruk, kan lese, sammen med begrensninger som ingen test på modellnivå fjerner.

Bakgrunn

Anthropic beskrev sin generelle tilnærming til red teaming i et innlegg fra juni 2024. Der listes testing utført av domeneeksperter (blant annet testing av sårbarheter i retningslinjer, trusler ved fronten og flerspråklig testing), automatisert modellbasert testing, multimodal testing og åpne metoder basert på folkedugnad og fellesskap. Innlegget påpeker at ekspertmetoder krever spesialkunnskap, men ikke lar seg skalere, mens automatiserte metoder har vanskelig for å finne nye trusler [2]. Et innlegg fra mars 2025 fra selskapets Frontier Red Team sier at teamet evaluerer cybersikkerhet, biosikkerhet og andre kjemiske, biologiske, radiologiske og nukleære (CBRN) risikoer samt autonomi, og at de amerikanske og britiske AI Safety Institutes testet Claude 3.5 Sonnet før lansering [3]. Versjon 3.4 av Responsible Scaling Policy, gjeldende fra 8. juli 2026, fastsetter kapabilitetsterskler og sikkerhetsnivåer for KI (AI Safety Levels) og beskriver kapabilitetsrapporter og sikringsrapporter med ekstern gjennomgang av usladdet materiale [4].

Hva kildene beskriver

Trusseltesting. For kjemisk og biologisk risiko sier kortet at Anthropic behandler Opus 5.5 som en modell med kapabiliteter knyttet til syntese av kjente våpen (CB-1), men ikke nye våpen (CB-2), og at den lanseres med utvidede biologiske sikringstiltak. For cyber oppgir kortet ingen tegn på at modellen kan utvikle nye offensive kapabiliteter, og sier at det ikke ble funnet noen jailbreak av kritisk alvorlighetsgrad, samtidig som sikkerhetsmarginen midlertidig ble utvidet. Kortet beskriver også testing før lansering sammen med METR av kapabiliteter innen KI-forskning og -utvikling, og et samarbeid med det amerikanske Center for AI Standards and Innovation om cyber- og biologiske kapabiliteter, sikringstiltak og utilsiktet atferd [1].

Ekstern red teaming av sikringstiltakene. Avsnitt 3.5.3 i kortet navngir tre innleide testere. Trajectory Labs brukte omtrent 95 timer og sendte over 29 000 forespørsler mot sandkassebaserte oppgaver for reproduksjon av utnyttelser, og rapporterte 13 mulige gjennombrudd fordelt på sju oppgaver og ingen universell jailbreak. 10a Labs brukte omtrent 56 timer på 82 samtaler med flere runder og rapporterte at ingen kom lenger enn konseptbevis. Gray Swan kjørte sin automatiserte angriper Shade mot 61 scenarioer for kritisk infrastruktur og andre oppgavesett med omtrent 3 300 forsøk, og registrerte ingen gjennombrudd [1]. Dette er Anthropics gjengivelse av hva testerne fant, og kortet påpeker selv at én oppgave fra Trajectory Labs, delt opp over mer enn 100 separate kontekster, ga en fungerende utnyttelseskjede [1].

Promptinjeksjon i agenter. Avsnitt 5.2 bruker en evaluering av indirekte promptinjeksjon utviklet av Gray Swan sammen med UK AI Security Institute og amerikanske CAISI: 37 scenarioer og 1 804 utvalgte angrep innen koding, verktøybruk og datamaskinbruk. Kortet oppgir en suksessrate for angrep mot Opus 5.5 på omtrent ett forsøk av hundre ved femten forsøk, høyest ved datamaskinbruk, og beskriver tester med adaptive angripere som det kaller bevisst ettergivende. Det sier også at angrep skrevet mot en tidligere modell fortsatt lykkes mot de nyeste modellene i nettleseragenter når ytterligere sikringstiltak mangler [1]. Kortet påpeker at evalueringene kjøres uten beskyttelsen mot promptinjeksjon som Anthropic bruker i produktene sine, for å kunne sammenligne modeller [1].

Skadefrihet og overdrevne avslag. Anthropic oppgir at Opus 5.5 sjelden avviste harmløse forespørsler, og at andelen harmløse svar i enkeltrunder var litt lavere enn for Claude Opus 5, hovedsakelig ved forespørsler om ulovlige rusmidler. I tester med flere runder ble modellen bedre i samtaler om biologiske våpen og dårligere når det gjaldt sporing og overvåking og påvirkningsoperasjoner [1]. Uten sikringstiltakene fra produksjon, i agentbaserte sikkerhetsoppgaver, bisto modellen med oppgaver med dobbelt bruksområde i høyest grad av modellene som ble sammenlignet, og avviste ondsinnede forespørsler i lavest grad [1].

Et funn som berører brukerne av modellen direkte, står i avsnitt 6.5.1. Tidlige versjoner fulgte skadelige instruksjoner plantet i tekst som en bruker limte inn i sin egen prompt, for eksempel en README, en e-post eller en nettside. I en kodeevaluering utførte, planla eller videreformidlet en tidlig versjon den plantede instruksjonen i litt over halvparten av forsøkene (alle handlinger simulert), og handlet etter instruksjoner skrevet med usynlige tegn i 18 av 68 forsøk. Anthropic oppgir at den endelige modellen og endringer i produktene demper dette, blant annet ved å fjerne usynlige tegn og merke innlimt tekst [1].

Folkedugnadsbasert testing er den femte metoden i bildet. HackerOnes redegjørelse for jailbreak-utfordringen i februar 2025, som testet Constitutional Classifiers mot CBRN-spørsmål, oppgir 339 forskere, over 300 000 chatinteraksjoner og 55 000 dollar i dusører fordelt på fire team, hvorav ett fant en universell jailbreak [5].

Hva dette betyr for organisasjoner som tar i bruk Claude

Kortet tester modellen, med eller uten Anthropics egne sikringstiltak. Det tester ikke en organisasjons systemprompter, dataene den mater inn, verktøyene og tillatelsene den gir en agent, hvordan applikasjonen håndterer modellens utdata, MCP-serverne den kobler til, eller loggene den fører. Promptinjeksjon som kommer inn via en innlimt README eller et verktøyresultat, avhenger av disse valgene. Anthropics egen beskrivelse av problemet med innlimt tekst sier at det er vanskelig å løse, siden en bruker som limer inn tekst, lar forfatteren av teksten kontrollere en del av prompten [[1]](${CARD}). Organisasjonene trenger derfor egne tester, tillatelser og overvåking i tillegg til leverandørens.

Anbefalinger

  1. Les avsnittene i systemkortet om promptinjeksjon og agentsikkerhet før du gir en agent tilgang til verktøy.
  2. Gi hver agent og MCP-server bare tillatelsene oppgaven krever, og krev menneskelig godkjenning for handlinger som ikke kan reverseres.
  3. Behandle innlimt tekst, hentede dokumenter og verktøyutdata som upålitelige, og test applikasjonen mot dem.
  4. Før logg over verktøykall og utgående tilkoblinger, slik at en hendelse kan rekonstrueres.
  5. Se kurset i FireAI University om rammeverk for KI-sikkerhet og red teaming og blogginnlegget om hvordan Anthropic gjennomfører red teaming av Claude.

Relevans for FireAI

FireAI er en nettverksbrannmur for én Mac. Den tester ikke modeller, leser ikke prompter og vurderer ikke om en instruksjon til en agent er ondsinnet. Den dekker ett lag rundt et KI-verktøy: regler per app kan begrense en kodeassistent til destinasjonene den trenger, forespørselen ved første tilkobling spør når en ny app eller prosess når en ukjent destinasjon, verdenskartet og varsler om opplastinger viser hvor trafikken går og varsler om en plutselig stor opplasting, og nødbryteren stanser nye tilkoblinger. Hvis en injisert instruksjon fikk et lokalt verktøy til å sende data ut, kunne disse kontrollene avdekke eller begrense tilkoblingen, men de ville ikke hindre selve instruksjonen.

Begrensninger

Systemkortet er Anthropics egen fremstilling, og funnene til de eksterne testerne gjengis gjennom det. Interne prosesser utover det Anthropic publiserer, er ikke synlige. Evalueringene i kortet kjøres på scenarioer Anthropic har valgt, tallene for vellykkede angrep avhenger av hvilke muligheter angriperen får (kortet kaller sine adaptive tester bevisst ettergivende), og kortet sier selv at automatiserte evalueringer kanskje ikke fanger opp all risiko i den virkelige verden. Siden for Responsible Scaling Policy kaller rapportene sine Safeguards Reports, tidligere Risk Reports, mens kortet viser til en Risk Report fra august 2026; den rapporten ble ikke åpnet. Kildene fra 2024, 2025 og HackerOne beskriver tidligere arbeid og tidligere modeller. Publiseringsdatoene for HackerOne-innlegget og policysiden utover versjonene som er sitert, ble ikke fastslått.

Prøv FireAI, av HisnLabs gratis i 17 dager.

Kilder

  1. Anthropic, 22 September 2026: System Card, Claude Opus 5.5 (PDF)
  2. Anthropic, 12 June 2024: Challenges in red teaming AI systems
  3. Anthropic, 19 March 2025: Progress from Anthropic’s Frontier Red Team
  4. Anthropic: Responsible Scaling Policy (version 3.4, effective 8 July 2026)
  5. HackerOne: How Anthropic’s jailbreak challenge put AI safety defenses to the test (challenge held 3 to 10 February 2025)