Säkerhet & AI-nyheter

Red teaming av AI · Av FireAI Security & Research Team · Publicerad

Systemkortet för Claude Opus 5.5 beskriver Anthropics red teaming, och vad tester på modellnivå lämnar åt dem som driftsätter

Anthropics systemkort från 22 september 2026 redovisar extern red teaming och tester av prompt injection för Claude Opus 5.5, och vad som ligger kvar hos användande organisationer.

A shield beside the FireAI research mascot, illustrating Anthropic’s red-teaming of Claude Opus 5.5 and the layers left to deploying organisations.

Anthropic publicerade systemkortet för Claude Opus 5.5 den 22 september 2026. Det redovisar tester före driftsättning som kombinerar automatiserade utvärderingar, uplift-försök, red teaming av externa experter och bedömningar av tredje part [1]. Kortet är den senast publicerade redogörelsen för hur Anthropic testar sina modeller, och det anger resultat som en organisation som driftsätter modellen kan läsa, tillsammans med begränsningar som inget test på modellnivå undanröjer.

Bakgrund

Anthropic beskrev sitt allmänna förhållningssätt till red teaming i ett inlägg i juni 2024. Där listas domänspecifika experttester (bland annat tester av policysårbarheter, gränsrisker och flerspråkiga tester), automatiserade modellbaserade tester, multimodala tester samt öppna metoder med crowdsourcing och community, och det noteras att expertmetoder kräver specialkunskap men inte skalar, medan automatiserade metoder har svårt att hitta nya hot [2]. Ett inlägg från mars 2025 från Frontier Red Team uppger att teamet utvärderar cybersäkerhet, biosäkerhet och andra kemiska, biologiska, radiologiska och nukleära (CBRN) risker samt autonomi, och att AI Safety Institutes i USA och Storbritannien testade Claude 3.5 Sonnet före driftsättning [3]. Version 3.4 av Responsible Scaling Policy, som gäller från 8 juli 2026, fastställer förmågetrösklar och AI Safety Levels och beskriver Capability Reports och Safeguards Reports med extern granskning av ocensurerat material [4].

Vad källorna beskriver

Hottester. När det gäller kemiska och biologiska risker uppger kortet att Anthropic behandlar Opus 5.5 som att den har förmågor kopplade till framställning av icke-nya vapen (CB-1) men inte nya vapen (CB-2), och att modellen driftsätts med utökade biologiska skyddsåtgärder. För cyberområdet rapporteras inga tecken på att modellen kan utveckla nya offensiva förmågor, och det anges att ingen jailbreak av kritisk allvarlighetsgrad hittades, samtidigt som säkerhetsmarginalen tillfälligt vidgades. Kortet redovisar också tester före driftsättning tillsammans med METR av förmågor inom AI-forskning och utveckling, samt ett samarbete med amerikanska Center for AI Standards and Innovation om cyber- och biologiska förmågor, skyddsåtgärder och oavsiktliga beteenden [1].

Extern red teaming av skyddsåtgärder. Avsnitt 3.5.3 i kortet namnger tre anlitade testare. Trajectory Labs lade ned ungefär 95 timmar och skickade över 29 000 förfrågningar mot sandlådeisolerade uppgifter för att reproducera exploits, och rapporterade 13 möjliga genombrott i sju uppgifter och ingen universell jailbreak. 10a Labs lade ned ungefär 56 timmar på 82 samtal i flera turer och rapporterade att inget av dem kom längre än till proof of concept. Gray Swan körde sin automatiserade angripare Shade mot 61 scenarier för kritisk infrastruktur och andra uppgiftsuppsättningar med omkring 3 300 försök och registrerade inga genombrott [1]. Detta är Anthropics redogörelse för vad testarna fann, och kortet noterar självt att en uppgift från Trajectory Labs, uppdelad över fler än 100 separata kontexter, gav en fungerande exploitkedja [1].

Prompt injection i agenter. Avsnitt 5.2 använder en utvärdering av indirekt prompt injection som Gray Swan byggt tillsammans med brittiska AI Security Institute och amerikanska CAISI: 37 scenarier och 1 804 utvalda attacker inom kodning, verktygsanvändning och datoranvändning. Kortet redovisar en andel lyckade attacker för Opus 5.5 på ungefär ett försök på hundra vid femton försök, högst vid datoranvändning, och beskriver tester med adaptiva angripare som kortet kallar avsiktligt generösa. Det anges också att attacker som skrivits mot en tidigare modell fortfarande lyckas mot de nyaste modellerna i agenter för webbläsaranvändning när ytterligare skyddsåtgärder saknas [1]. Kortet noterar att utvärderingarna körs utan de skydd mot prompt injection som Anthropic använder i sina produkter, för att modellerna ska kunna jämföras [1].

Ofarlighet och överdrivna vägranden. Anthropic rapporterar att Opus 5.5 sällan vägrade ofarliga förfrågningar i onödan, och att andelen ofarliga svar i enstaka turer var något lägre än för Claude Opus 5, främst för förfrågningar om illegala substanser. I tester med flera turer förbättrades den i samtal om biologiska vapen och försämrades när det gällde spårning och övervakning samt påverkansoperationer [1]. Utan produktionsskydd, i agentiska säkerhetsuppgifter, hjälpte modellen till med uppgifter med dubbla användningsområden i högst grad av de jämförda modellerna och vägrade skadliga förfrågningar i lägst grad [1].

Ett resultat som direkt angår dem som driftsätter finns i avsnitt 6.5.1. Tidiga versioner följde skadliga instruktioner som planterats i text som en användare klistrat in i sin egen prompt, till exempel en README, ett e-postmeddelande eller en webbsida. I en kodningsutvärdering verkställde, planerade eller vidarebefordrade en tidig version den planterade instruktionen i drygt hälften av försöken (alla åtgärder simulerade), och agerade på instruktioner skrivna med osynliga tecken i 18 av 68 försök. Anthropic uppger att den slutliga modellen och produktändringar mildrar detta, bland annat genom att ta bort osynliga tecken och markera inklistrad text [1].

Crowdsourcade tester är den femte metoden i bilden. HackerOnes redogörelse för jailbreakutmaningen i februari 2025, som testade Constitutional Classifiers mot CBRN-frågor, redovisar 339 forskare, över 300 000 chattinteraktioner och 55 000 dollar i belöningar fördelade på fyra team, varav ett hittade en universell jailbreak [5].

Följder för organisationer som driftsätter Claude

Kortet testar modellen, med eller utan Anthropics egna skyddsåtgärder. Det testar inte en organisations systemprompter, de data den matar in, de verktyg och behörigheter den ger en agent, hur dess applikation hanterar modellens utdata, de MCP-servrar den ansluter eller de loggar den sparar. Prompt injection som kommer in via en inklistrad README eller ett verktygsresultat beror på just de valen. Anthropics egen beskrivning av problemet med inklistrad text säger att det är svårt att lösa, eftersom en användare som klistrar in text låter textens författare styra en del av prompten [[1]](${CARD}). De som driftsätter behöver därför egna tester, behörigheter och övervakning utöver leverantörens.

Rekommendationer

  1. Läs systemkortets avsnitt om prompt injection och agentisk säkerhet innan en agent får åtkomst till verktyg.
  2. Ge varje agent och MCP-server endast de behörigheter som uppgiften kräver, och kräv mänskligt godkännande för oåterkalleliga åtgärder.
  3. Behandla inklistrad text, hämtade dokument och verktygsutdata som opålitliga, och testa applikationen mot dem.
  4. Spara loggar över verktygsanrop och utgående anslutningar så att en incident kan rekonstrueras.
  5. Se FireAI University-kursen om ramverk för AI-säkerhet och red teaming och blogginlägget om hur Anthropic red teamar Claude.

Relevans för FireAI

FireAI är en nätverksbrandvägg för en enskild Mac. Den testar inte modeller, läser inte prompter och bedömer inte om en agents instruktion är skadlig. Den täcker ett lager runt ett AI-verktyg: regler per app kan begränsa en kodassistent till de mål den behöver, frågan vid första anslutningen dyker upp när en ny app eller process når ett okänt mål, världskartan och uppladdningsvarningar visar vart trafiken går och varnar för en plötslig stor uppladdning, och nödbrytaren stoppar nya anslutningar. Om en injicerad instruktion fick ett lokalt verktyg att skicka ut data skulle dessa kontroller kunna synliggöra eller begränsa anslutningen, men de skulle inte förhindra själva instruktionen.

Begränsningar

Systemkortet är Anthropics egen redogörelse, och de externa testarnas resultat redovisas genom det. Interna processer utöver det Anthropic publicerar är inte synliga. Kortets utvärderingar körs på scenarier som Anthropic valt, siffrorna för lyckade attacker beror på vilka möjligheter angriparen ges (kortet kallar sina adaptiva tester avsiktligt generösa), och kortet säger självt att automatiserade utvärderingar kanske inte fångar alla verkliga risker. Sidan om Responsible Scaling Policy kallar sina rapporter Safeguards Reports, tidigare Risk Reports, medan kortet hänvisar till en Risk Report från augusti 2026; den rapporten öppnades inte. Källorna från 2024, 2025 och HackerOne beskriver tidigare arbete och tidigare modeller. Publiceringsdatum för HackerOne-inlägget och policysidan utöver de citerade versionerna fastställdes inte.

Prova FireAI från HisnLabs gratis i 17 dagar.

Källor

  1. Anthropic, 22 September 2026: System Card, Claude Opus 5.5 (PDF)
  2. Anthropic, 12 June 2024: Challenges in red teaming AI systems
  3. Anthropic, 19 March 2025: Progress from Anthropic’s Frontier Red Team
  4. Anthropic: Responsible Scaling Policy (version 3.4, effective 8 July 2026)
  5. HackerOne: How Anthropic’s jailbreak challenge put AI safety defenses to the test (challenge held 3 to 10 February 2025)