# Så utför Anthropic red teaming av Claude, och vad som lämnas åt dig

> Vad Anthropic publicerar om red teaming av Claude, vilka metoder en driftsättare kan återanvända, vilka som stannar hos modellutvecklaren och vad som återstår för dig.

FireAI Security & Research Team (HisnLabs) · Published 2026-09-30
Canonical: https://hisnlabs.com/sv/blog/sa-utfor-anthropic-red-teaming-av-claude

Anthropic publicerar mer om hur företaget testar Claude än de flesta modellutvecklare: blogginlägg om red teaming, en Responsible Scaling Policy och systemkort för varje modell. Den här noten sammanfattar dessa dokument och skiljer mellan tre grupper av arbete: metoder som både utvecklare och driftsättare använder, arbete som bara en utvecklare kan utföra, och arbete som ligger kvar hos den organisation som bygger en applikation på modellen. Interna processer utöver det Anthropic har publicerat är inte synliga för utomstående läsare och beskrivs inte här. Noten är den andra halvan av ett par tillsammans med [Shared responsibility for LLMs: who secures what](https://hisnlabs.com/en/blog/shared-responsibility-for-llms).

## Bakgrund: två olika frågor

En modellutvecklare frågar om en modell är farlig: om den kan ge ett betydande bidrag till vapenutveckling, genomföra cyberoperationer eller bete sig vilseledande. En driftsättare frågar om dess applikation är säker: om ett konstruerat dokument, ett verktygsresultat eller ett användarmeddelande kan få applikationen att läcka data eller utföra en handling den inte borde. Metoderna överlappar, men frågorna och beläggen skiljer sig åt, och ett godkänt resultat på den första frågan besvarar inte den andra.

## Vad Anthropic beskriver

### Metoder som överlappar med driftsättares praxis

I ett inlägg från 12 juni 2024 delar Anthropic in sin red teaming i domänspecifik experttestning, testning med hjälp av språkmodeller, arbete med nya modaliteter och öppna angreppssätt. Automatiserad red teaming använder en dynamik mellan red team och blue team där en modell genererar angrepp. Multimodal red teaming omfattade risker i bild och text för Claude 3-modellerna före driftsättning. Flerspråkig testning omfattade ett samarbete med Singapores Infocomm Media Development Authority på fyra språk: engelska, tamil, mandarin och malajiska. Anthropic nämner också crowdsourcad red teaming och red teaming i samarbete med communityn, bland annat evenemang i AI Village på DEF CON. [[1]](https://www.anthropic.com/news/challenges-in-red-teaming-ai-systems)

Systemkortet för Claude Opus 5, daterat 24 juli 2026, visar samma metoder tillämpade på en enskild version. Kapitlet om skyddsåtgärder använder skadliga och ofarliga förfrågningar i en tur, promptar med tvetydigt sammanhang och konversationer i flera turer där en simulerad användare gradvis styr mot skada. Det redovisar ofarlighet tillsammans med överdrivna vägranden, och anger att modellen behöll höga andelar ofarliga svar på skadliga förfrågningar samtidigt som den hade bland de lägsta andelarna överdrivna vägranden på ofarliga. Kapitlet om agentsäkerhet omfattar skadlig användning av agenter för kodning och datoranvändning samt robusthet mot promptinjektion vid kodning, datoranvändning och webbläsaranvändning. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf)

Systemkortet definierar promptinjektion som en skadlig instruktion dold i verktygsresultat som en agent bearbetar, och konstaterar att risken är störst när en agent både kan nå privata data och agera för en användares räkning. Det redovisar också att säkerhetsinstruktioner i systemprompten på claude.ai stärkte modellens hantering av skadliga förfrågningar jämfört med API:t utan systemprompt. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) Det andra resultatet berör driftsättare direkt, eftersom systemprompten hör till driftsättarens sida.

Responsible Scaling Policy, version 3.4, som gäller från 8 juli 2026, fastställer förmågetrösklar i förväg och kräver formella utvärderingar med sex månaders intervall, och den föreskriver externa granskare av riskrapporter. [[4]](https://www.anthropic.com/responsible-scaling-policy) Att fastställa trösklar före testningen begränsar frestelsen att omtolka ett resultat i efterhand, och praxisen går att överföra till varje organisation som definierar kriterier för lansering.

### Arbete som bara en modellutvecklare kan utföra

Red teaming mot hot från frontmodeller inriktas på kemiska, biologiska, radiologiska och nukleära risker (CBRN), cybersäkerhet och risker med autonom AI. Ett inlägg från 2023 beskriver domänexperter med årtionden av erfarenhet som definierar hotmodeller, mer än 100 timmars expertgranskning och en sex månader lång biosäkerhetsstudie på mer än 150 timmar. [[3]](https://www.anthropic.com/news/frontier-threats-red-teaming-for-ai-safety) Ett inlägg från mars 2025 beskriver cyberutvärderingar baserade på capture-the-flag-uppgifter och simulerade nätverksmiljöer, och anger att Frontier Red Team samarbetade med US AI Safety Institute, UK AI Security Institute och US National Nuclear Security Administration (NNSA), den sistnämnda kring sekretessbelagda utvärderingar av kunskap om kärnvapen och radiologiska ämnen. [[2]](https://www.anthropic.com/news/strategic-warning-for-ai-risk-progress-and-insights-from-our-frontier-red-team)

Anthropics Transparency Hub uppger att företaget använder både intern och extern red teaming och att UK AI Security Institute, US Center for AI Standards and Innovation och Model Evaluation and Threat Research (METR) har utfört ytterligare testning av dess modeller. Den listar även bug bounty-program på HackerOne. [[5]](https://www.anthropic.com/transparency/voluntary-commitments) Systemkortet för Opus 5 innehåller testning i cyberövningsmiljö från UK AI Security Institute och en alignment-bedömning baserad på en automatiserad beteendegranskning, samt ett kapitel om modellens välbefinnande. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) Sidan Transparency Hub anger inte vilket institut som testade en viss modell före lansering, så varje instituts roll före driftsättning fastställs inte här utöver vad systemkortet redovisar.

Extern och crowdsourcad testning är en egen kategori. HackerOne rapporterar att Anthropics jailbreak-utmaning pågick från 3 till 10 februari 2025 med 339 deltagare, mer än 300 000 chattinteraktioner och åtta svårighetsnivåer, och att fyra lag delade på 55 000 US-dollar i belöningar. Framgångsrika tekniker omfattade kodade promptar och chiffer, rollspel, att byta ut skadliga nyckelord mot ofarliga samt promptinjektion. [[6]](https://www.hackerone.com/blog/how-anthropics-jailbreak-challenge-put-ai-safety-defenses-test) För Opus 5 namnger systemkortet tre kontrakterade externa testare: en lade ungefär 100 timmar och slutförde en uppgift med uppgiftsspecifika promptar, en lade omkring 16 timmar utan lyckad jailbreak, och en körde en automatiserad angripare med 150 försök per uppgift utan framgång. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf)

## Vad som stannar hos driftsättare

Ingen av utvecklarens tester ovan utvärderar en viss applikation. Följande ligger kvar hos den organisation som driftsätter modellen, och systemkortet pekar själv på flera av dem, till exempel genom att visa att systemprompter ändrar modellens beteende och att agenter är mest utsatta när de kombinerar privata data med förmågan att agera. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf)

- Systemprompten och dess skyddsräcken, inklusive hur de beter sig under tryck i flera turer.
- RAG-data och indirekt promptinjektion: varje dokument, sida eller e-postmeddelande som hämtas in i kontexten kan bära instruktioner.
- Verktyg, agentbehörigheter och vad en injicerad instruktion skulle kunna göra med dem.
- Efterföljande hantering av modellens utdata innan de når en webbläsare, ett skal, en databas eller en person.
- Leveranskedjan, inklusive tredjepartsinsticksprogram och servrar för Model Context Protocol (MCP).
- Kostnadsmissbruk, som obegränsade loopar eller förfrågningar som förbrukar betalda token.
- Sandlåda för kodkörning och webbsurfning, samt kontroll av utgående nätverksåtkomst.
- Loggning, övervakning och lanseringsspärrar som avgör när en ändring får levereras.

> FireAI, brandväggen för macOS som körs direkt på datorn och utvecklas av HisnLabs, låter en användare tillåta eller blockera vilka appar på en Mac som når nätverket. För ett lokalt AI-verktyg hör kontrollen av utgående trafik till driftsättarens sida. [Download FireAI for Mac](https://hisnlabs.com/en/download)

## Arbetssätt värda att låna

1. Anlita externa red teamers, eller kör ett privat bug bounty-program, före större lanseringar. Anthropics egen praxis omfattar båda: kontrakterade externa testare för varje version och en offentlig jailbreak-utmaning med belöningar.
2. Gör en beteendekontroll i alignment-stil av agenter: ta stickprov av transkript av verktygsanvändning och leta efter försök att kringgå begränsningar, så som Anthropics övervakning gjorde för intern driftsättning.
3. Skriv ett kort internt systemkort för varje version: vad som testades, vilka tester som misslyckades, överdrivna vägranden vid sidan av skada, och kända luckor.
4. Fastställ trösklar för lansering före testningen, i linje med Responsible Scaling Policy.
5. Testa promptinjektion via varje kanal en agent läser, inte bara användarens indata.

[FireAI Universitys kurs om ramverk för AI-säkerhet och red teaming](https://hisnlabs.com/en/university/ai-security-frameworks-and-red-teaming) behandlar dessa metoder mer i detalj.

## Relevans för FireAI

FireAI verkar på Macen, under varje modell. [Regler](https://hisnlabs.com/sv/docs/per-app-rules) tillåter eller blockerar en app, eller en destination för den appen, så att ett lokalt AI-verktyg kan begränsas till de värdar det behöver. Det begränsar vart data kan ta vägen om en applikation beter sig fel. FireAI testar inte modeller, upptäcker inte promptinjektion, läser inte promptar och filtrerar inte modellens utdata.

## Begränsningar

- Noten bygger enbart på det Anthropic och HackerOne har publicerat. Anthropics interna processer utöver detta är inte synliga, och publicerade sammanfattningar är selektiva.
- Källorna skiljer sig i datum, från juli 2023 till juli 2026, och metoderna kan ha ändrats sedan de äldre inläggen.
- Resultat som beskrivs i ett systemkort är självrapporterade av utvecklaren, med undantag för arbete som tillskrivs namngivna externa testare.
- Noten beskriver en enda utvecklare. Andra leverantörer publicerar annat material, och jämförelsen med driftsättares praxis är en syntes, inte ett resultat från källorna.

## Var FireAI och HisnLabs kommer in

Modelltestningen slutar vid API:t. Vad en app eller agent får nå från din Mac är en separat kontroll, och den ger FireAI.

FireAI är HisnLabs eget verktyg: en AI-brandvägg som körs direkt på din Mac. Den visar varje anslutning dina appar gör, på klarspråk, och låter dig avgöra vad som lämnar din Mac — AI:n körs lokalt, så din trafik skickas aldrig till oss eller någon annan. HisnLabs säkerhetsforskningsteam är de som håller de bedömningarna tillförlitliga: de katalogiserar vilka domäner som är vanlig telemetri och vilka som är en riktig tjänst, spårar land och nätverk bakom en anslutning och tränar den lokala modellen (FireAI Pilot-funktionen) på verkliga trafikmönster — utan att något av det lämnar din Mac.

Du kan läsa om de tekniska besluten bakom, eller prova FireAI i 17 dagar, på [FireAI, från HisnLabs](https://hisnlabs.com/sv/download).

## Sources

- [Anthropic: Challenges in red teaming AI systems (12 June 2024)](https://www.anthropic.com/news/challenges-in-red-teaming-ai-systems)
- [Anthropic: Strategic warning for AI risk, progress and insights from our Frontier Red Team (19 March 2025)](https://www.anthropic.com/news/strategic-warning-for-ai-risk-progress-and-insights-from-our-frontier-red-team)
- [Anthropic: Frontier threats red teaming for AI safety (26 July 2023)](https://www.anthropic.com/news/frontier-threats-red-teaming-for-ai-safety)
- [Anthropic: Responsible Scaling Policy (version 3.4, effective 8 July 2026)](https://www.anthropic.com/responsible-scaling-policy)
- [Anthropic Transparency Hub: Voluntary commitments](https://www.anthropic.com/transparency/voluntary-commitments)
- [HackerOne: How Anthropic’s jailbreak challenge put AI safety defenses to the test](https://www.hackerone.com/blog/how-anthropics-jailbreak-challenge-put-ai-safety-defenses-test)
- [Anthropic: System Card, Claude Opus 5 (24 July 2026)](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf)
- [FireAI docs: Rules: app, website, domain, IP or a range](https://hisnlabs.com/en/docs/per-app-rules)
- [FireAI University: AI security frameworks and red teaming](https://hisnlabs.com/en/university/ai-security-frameworks-and-red-teaming)
