# O system card do Claude Opus 5.5 descreve o red teaming da Anthropic e o que os testes ao modelo deixam a cargo de quem o implementa

> O system card da Anthropic de 22 de setembro de 2026 relata red teaming externo e testes de prompt injection ao Claude Opus 5.5, e o que cabe a quem o implementa.

FireAI Security & Research Team (HisnLabs) · Published 2026-09-30
Canonical: https://hisnlabs.com/pt/news/anthropic-claude-opus-5-5-system-card-red-teaming

A Anthropic publicou o system card do Claude Opus 5.5 a 22 de setembro de 2026. O documento relata testes anteriores à implementação que combinam avaliações automáticas, ensaios de ganho de capacidade (uplift), red teaming por especialistas externos e avaliações de terceiros [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). O card é o relato publicado mais recente sobre a forma como a Anthropic testa os seus modelos e apresenta resultados que uma organização que o implemente pode ler, a par de limites que nenhum teste ao nível do modelo elimina.

## Contexto

A Anthropic descreveu a sua abordagem geral ao red teaming num artigo de junho de 2024. Enumera testes por especialistas de domínio (incluindo testes de vulnerabilidade de políticas, ameaças de fronteira e testes multilingues), testes automáticos baseados em modelos, testes multimodais e métodos abertos de crowdsourcing e de comunidade, e observa que os métodos especializados exigem conhecimento específico mas não escalam, enquanto os métodos automáticos têm dificuldade em encontrar ameaças novas [[2]](https://www.anthropic.com/news/challenges-in-red-teaming-ai-systems). Um artigo de março de 2025 da sua Frontier Red Team indica que a equipa avalia riscos de cibersegurança, de biossegurança e outros riscos químicos, biológicos, radiológicos e nucleares (QBRN), bem como a autonomia, e que os AI Safety Institutes dos EUA e do Reino Unido realizaram testes ao Claude 3.5 Sonnet antes da sua implementação [[3]](https://www.anthropic.com/news/strategic-warning-for-ai-risk-progress-and-insights-from-our-frontier-red-team). A versão 3.4 da Responsible Scaling Policy, em vigor desde 8 de julho de 2026, fixa limiares de capacidade e AI Safety Levels e descreve Capability Reports e Safeguards Reports com revisão externa de material não truncado [[4]](https://www.anthropic.com/responsible-scaling-policy).

## O que descrevem as fontes

Testes de ameaças. Quanto ao risco químico e biológico, o card indica que a Anthropic considera que o Opus 5.5 tem capacidades relativas à síntese de armas não novas (CB-1), mas não de armas novas (CB-2), e implementa-o com salvaguardas biológicas reforçadas. Quanto ao ciber, não relata qualquer indício de que o modelo consiga desenvolver capacidades ofensivas novas e afirma que não foi encontrado nenhum jailbreak de gravidade crítica, tendo a margem de segurança sido temporariamente alargada. O card relata ainda testes prévios com a METR sobre capacidades de investigação e desenvolvimento em IA e uma colaboração com o Center for AI Standards and Innovation dos EUA sobre capacidades cibernéticas e biológicas, salvaguardas e comportamentos não intencionais [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf).

Red teaming externo das salvaguardas. A secção 3.5.3 do card nomeia três equipas contratadas. A Trajectory Labs dedicou cerca de 95 horas e enviou mais de 29 000 pedidos contra tarefas de reprodução de exploits em sandbox, relatando 13 possíveis quebras em sete tarefas e nenhum jailbreak universal. A 10a Labs dedicou cerca de 56 horas a 82 conversas de várias voltas e relatou que nenhuma passou da prova de conceito. A Gray Swan executou o seu atacante automático Shade contra 61 cenários de infraestruturas críticas e outros conjuntos de tarefas, com cerca de 3300 tentativas, e não registou quebras [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). Trata-se dos relatos da Anthropic sobre o que os testadores encontraram, e o próprio card observa que uma tarefa da Trajectory Labs, decomposta em mais de 100 contextos separados, produziu uma cadeia de exploits funcional [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf).

Prompt injection em agentes. A secção 5.2 usa uma avaliação de prompt injection indireta construída pela Gray Swan com o UK AI Security Institute e o CAISI dos EUA: 37 cenários e 1804 ataques selecionados em programação, uso de ferramentas e uso do computador. O card relata para o Opus 5.5 uma taxa de êxito dos ataques de cerca de uma tentativa em cem ao fim de quinze tentativas, mais elevada no uso do computador, e descreve testes com atacantes adaptativos que qualifica de deliberadamente permissivos. Afirma também que ataques escritos contra um modelo anterior continuam a ter êxito contra os modelos mais recentes em agentes de navegação, quando faltam salvaguardas adicionais [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). O card observa que as avaliações são feitas sem as proteções contra prompt injection que a Anthropic implementa nos seus produtos, para permitir comparar modelos [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf).

Inocuidade e recusa excessiva. A Anthropic relata que o Opus 5.5 raramente recusou pedidos benignos e que a sua taxa de respostas inofensivas numa só volta foi ligeiramente inferior à do Claude Opus 5, sobretudo em pedidos sobre substâncias ilegais. Em testes de várias voltas, melhorou nas conversas sobre armas biológicas e regrediu nas de rastreio e vigilância e de operações de influência [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). Sem as salvaguardas de produção, em tarefas de segurança agênticas, o modelo ajudou em tarefas de duplo uso com a taxa mais alta entre os modelos comparados e recusou pedidos maliciosos com a taxa mais baixa [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf).

Uma conclusão que diz diretamente respeito a quem implementa o modelo encontra-se na secção 6.5.1. Versões iniciais seguiam instruções nocivas plantadas em texto que o utilizador colava no seu próprio prompt, como um README, um e-mail ou uma página web. Numa avaliação de programação, uma versão inicial executou, planeou ou transmitiu a instrução plantada em pouco mais de metade das tentativas (todas as ações simuladas) e agiu com base em instruções escritas em carateres invisíveis em 18 de 68 tentativas. A Anthropic afirma que o modelo final e alterações nos produtos atenuam o problema, incluindo a remoção de carateres invisíveis e a marcação do texto colado [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf).

Os testes por crowdsourcing são o quinto método do quadro. O relato da HackerOne sobre o desafio de jailbreak de fevereiro de 2025, que testou os Constitutional Classifiers contra pedidos QBRN, indica 339 investigadores, mais de 300 000 interações de conversa e 55 000 dólares em recompensas repartidas por quatro equipas, uma das quais encontrou um jailbreak universal [[5]](https://www.hackerone.com/blog/how-anthropics-jailbreak-challenge-put-ai-safety-defenses-test).

> A FireAI, a firewall local para macOS desenvolvida pela HisnLabs, mostra que apps, incluindo ferramentas de programação com IA, se ligam a que destinos. Está disponível um teste de 17 dias. [Download FireAI for Mac](https://hisnlabs.com/en/download)

## Implicações para as organizações que implementam o Claude

O card testa o modelo, com ou sem as salvaguardas da própria Anthropic. Não testa os prompts de sistema de uma organização, os dados que ela fornece, as ferramentas e permissões que concede a um agente, a forma como a sua aplicação trata a resposta do modelo, os servidores MCP que liga nem os registos que conserva. Uma prompt injection que chega através de um README colado ou do resultado de uma ferramenta depende dessas escolhas. A própria descrição da Anthropic do problema do texto colado diz que é difícil de resolver, pois um utilizador que cola texto permite ao seu autor controlar parte do prompt [[1]](${CARD}). Quem implementa precisa, portanto, dos seus próprios testes, permissões e monitorização para além dos do fornecedor.

## Recomendações

1. Ler as secções do system card sobre prompt injection e segurança agêntica antes de conceder a um agente acesso a ferramentas.
2. Dar a cada agente e servidor MCP apenas as permissões de que a sua tarefa precisa e exigir aprovação humana para ações irreversíveis.
3. Tratar o texto colado, os documentos obtidos e a saída das ferramentas como não fiáveis, e testar a aplicação contra eles.
4. Manter registos das chamadas a ferramentas e das ligações de saída, para que um incidente possa ser reconstituído.
5. Consultar o [curso da FireAI University sobre quadros de segurança de IA e red teaming](https://hisnlabs.com/en/university/ai-security-frameworks-and-red-teaming) e o [artigo do blogue sobre como a Anthropic faz red teaming ao Claude](https://hisnlabs.com/en/blog/how-anthropic-red-teams-claude).

## Relevância para a FireAI

A FireAI é uma firewall de rede para um só Mac. Não testa modelos, não lê prompts nem julga se a instrução de um agente é maliciosa. Cobre uma camada em torno de uma ferramenta de IA: as [regras por app](https://hisnlabs.com/pt/docs/per-app-rules) podem limitar um assistente de programação aos destinos de que precisa, o [pedido de primeira ligação](https://hisnlabs.com/pt/docs/answer-your-first-connection-prompt) pergunta quando uma nova app ou processo contacta um destino desconhecido, o [mapa-múndi](https://hisnlabs.com/pt/docs/world-map) e os [alertas de envio](https://hisnlabs.com/pt/docs/requests-by-country-and-upload-spikes) mostram para onde vai o tráfego e avisam de um envio grande e súbito, e o [corte de emergência](https://hisnlabs.com/pt/docs/kill-switch) trava novas ligações. Se uma instrução injetada levasse uma ferramenta local a enviar dados para fora, estes controlos poderiam expor ou limitar a ligação, mas não impediriam a instrução em si.

> Os pedidos de ligação e as regras por app da FireAI cobrem a camada de rede que o red teaming ao nível do modelo não abrange. Está disponível um teste de 17 dias. [Download FireAI for Mac](https://hisnlabs.com/en/download)

## Limitações

O system card é o relato da própria Anthropic, e as conclusões dos testadores externos são comunicadas através dele. Os processos internos para além do que a Anthropic publica não são visíveis. As avaliações do card decorrem em cenários escolhidos pela Anthropic, os números de êxito dos ataques dependem dos meios concedidos ao atacante (o card qualifica os seus testes adaptativos de deliberadamente permissivos) e o próprio card afirma que as avaliações automáticas podem não captar todo o risco real. A página da Responsible Scaling Policy chama aos seus relatórios Safeguards Reports, antes Risk Reports, enquanto o card remete para um Risk Report de agosto de 2026; esse relatório não foi consultado. As fontes de 2024, de 2025 e da HackerOne descrevem trabalho e modelos anteriores. As datas de publicação do artigo da HackerOne e da página da política, para além das versões citadas, não foram apuradas.

Experimente a [FireAI, da HisnLabs](https://hisnlabs.com/pt/download) gratuitamente durante 17 dias.

## Sources

- [Anthropic, 22 September 2026: System Card, Claude Opus 5.5 (PDF)](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf)
- [Anthropic, 12 June 2024: Challenges in red teaming AI systems](https://www.anthropic.com/news/challenges-in-red-teaming-ai-systems)
- [Anthropic, 19 March 2025: Progress from Anthropic’s Frontier Red Team](https://www.anthropic.com/news/strategic-warning-for-ai-risk-progress-and-insights-from-our-frontier-red-team)
- [Anthropic: Responsible Scaling Policy (version 3.4, effective 8 July 2026)](https://www.anthropic.com/responsible-scaling-policy)
- [HackerOne: How Anthropic’s jailbreak challenge put AI safety defenses to the test (challenge held 3 to 10 February 2025)](https://www.hackerone.com/blog/how-anthropics-jailbreak-challenge-put-ai-safety-defenses-test)
