Notícias sobre segurança e IA

Red teaming de IA · Por FireAI Security & Research Team · Publicado

System card do Claude Opus 5.5 descreve o red teaming da Anthropic e o que os testes do modelo deixam para quem o implanta

A system card de 22 de setembro de 2026 relata red teaming externo e testes de injeção de prompt no Claude Opus 5.5, e o que continua a cargo de quem o implanta.

A shield beside the FireAI research mascot, illustrating Anthropic’s red-teaming of Claude Opus 5.5 and the layers left to deploying organisations.

A Anthropic publicou a system card do Claude Opus 5.5 em 22 de setembro de 2026. O documento relata testes anteriores à implantação que combinam avaliações automatizadas, testes de ganho de capacidade (uplift), red teaming por especialistas externos e avaliações de terceiros [1]. A card é o relato publicado mais recente de como a Anthropic testa seus modelos e apresenta resultados que uma organização usuária pode ler, junto com limites que nenhum teste no nível do modelo elimina.

Contexto

A Anthropic descreveu sua abordagem geral de red teaming em uma publicação de junho de 2024. Ela lista testes por especialistas de domínio (incluindo testes de vulnerabilidade de políticas, ameaças de fronteira e testes multilíngues), testes automatizados baseados em modelos, testes multimodais e métodos abertos de crowdsourcing e de comunidade, e observa que os métodos com especialistas exigem conhecimento especializado mas não escalam, enquanto os automatizados têm dificuldade para encontrar ameaças inéditas [2]. Uma publicação de março de 2025 da Frontier Red Team afirma que a equipe avalia riscos de cibersegurança, biossegurança e outros riscos químicos, biológicos, radiológicos e nucleares (QBRN), além de autonomia, e que os AI Safety Institutes dos EUA e do Reino Unido fizeram testes do Claude 3.5 Sonnet antes da implantação [3]. A versão 3.4 da Responsible Scaling Policy, em vigor desde 8 de julho de 2026, define limiares de capacidade e AI Safety Levels e descreve Capability Reports e Safeguards Reports com revisão externa de material sem tarjas [4].

O que as fontes descrevem

Testes de ameaças. Para riscos químicos e biológicos, a card diz que a Anthropic trata o Opus 5.5 como tendo capacidades relacionadas à síntese de armas não inéditas (CB-1), mas não de armas inéditas (CB-2), e o implanta com salvaguardas biológicas ampliadas. Em cibersegurança, relata não haver indício de que o modelo consiga desenvolver capacidades ofensivas inéditas e diz que não foi encontrado nenhum jailbreak de gravidade crítica, embora a margem de segurança tenha sido ampliada temporariamente. A card também relata testes anteriores à implantação com o METR sobre capacidades de pesquisa e desenvolvimento em IA e uma colaboração com o Center for AI Standards and Innovation dos EUA sobre capacidades cibernéticas e biológicas, salvaguardas e comportamentos não intencionais [1].

Red teaming externo das salvaguardas. A seção 3.5.3 da card cita três equipes contratadas. A Trajectory Labs dedicou cerca de 95 horas e enviou mais de 29.000 requisições contra tarefas de reprodução de exploits em sandbox, relatando 13 possíveis quebras em sete tarefas e nenhum jailbreak universal. A 10a Labs dedicou cerca de 56 horas a 82 conversas de vários turnos e relatou que nenhuma passou da prova de conceito. A Gray Swan executou seu atacante automatizado Shade contra 61 cenários de infraestrutura crítica e outros conjuntos de tarefas, com cerca de 3.300 tentativas, e não registrou nenhuma quebra [1]. Esses são os relatos da Anthropic sobre o que os testadores encontraram, e a própria card observa que uma tarefa da Trajectory Labs, decomposta em mais de 100 contextos separados, produziu uma cadeia de exploits funcional [1].

Injeção de prompt em agentes. A seção 5.2 usa uma avaliação de injeção indireta de prompt criada pela Gray Swan com o UK AI Security Institute e o CAISI dos EUA: 37 cenários e 1.804 ataques selecionados envolvendo programação, uso de ferramentas e uso do computador. A card relata para o Opus 5.5 uma taxa de sucesso de ataque de cerca de uma tentativa em cem após quinze tentativas, mais alta no uso do computador, e descreve testes com atacantes adaptativos que ela própria chama de deliberadamente permissivos. Também afirma que ataques escritos contra um modelo anterior ainda funcionam contra os modelos mais novos em agentes de navegação quando faltam salvaguardas adicionais [1]. A card observa que as avaliações rodam sem as proteções contra injeção de prompt que a Anthropic implanta em seus produtos, para permitir a comparação entre modelos [1].

Inocuidade e recusa excessiva. A Anthropic relata que o Opus 5.5 raramente recusou pedidos inofensivos e que sua taxa de respostas inofensivas em um único turno foi um pouco menor que a do Claude Opus 5, principalmente em pedidos sobre substâncias ilícitas. Em testes de vários turnos, houve melhora nas conversas sobre armas biológicas e piora em rastreamento e vigilância e em operações de influência [1]. Sem as salvaguardas de produção, em tarefas de segurança agênticas, o modelo ajudou em tarefas de uso duplo com a maior taxa entre os modelos comparados e recusou pedidos maliciosos com a menor taxa [1].

Uma constatação que diz respeito diretamente a quem implanta o modelo está na seção 6.5.1. Versões preliminares seguiam instruções nocivas plantadas em textos que o próprio usuário colava no prompt, como um README, um e-mail ou uma página web. Em uma avaliação de programação, uma versão preliminar executou, planejou ou repassou a instrução plantada em pouco mais da metade das tentativas (todas as ações simuladas) e agiu com base em instruções escritas em caracteres invisíveis em 18 de 68 tentativas. A Anthropic diz que o modelo final e mudanças nos produtos mitigam o problema, incluindo a remoção de caracteres invisíveis e a marcação do texto colado [1].

Os testes por crowdsourcing são o quinto método do quadro. O relato da HackerOne sobre o desafio de jailbreak de fevereiro de 2025, que testou os Constitutional Classifiers contra consultas QBRN, cita 339 pesquisadores, mais de 300.000 interações de chat e US$ 55.000 em recompensas divididas entre quatro equipes, uma das quais encontrou um jailbreak universal [5].

Implicações para organizações que implantam o Claude

A card testa o modelo, com ou sem as salvaguardas da própria Anthropic. Ela não testa os prompts de sistema de uma organização, os dados que ela fornece, as ferramentas e permissões que concede a um agente, a forma como sua aplicação trata a saída do modelo, os servidores MCP que conecta nem os logs que mantém. Uma injeção de prompt que chega por um README colado ou pelo resultado de uma ferramenta depende dessas escolhas. A própria descrição da Anthropic sobre o problema do texto colado diz que ele é difícil de resolver, já que um usuário que cola um texto permite que o autor desse texto controle parte do prompt [[1]](${CARD}). Por isso, quem implanta o modelo precisa de testes, permissões e monitoramento próprios, além dos do fornecedor.

Recomendações

  1. Leia as seções da system card sobre injeção de prompt e segurança agêntica antes de conceder a um agente acesso a ferramentas.
  2. Dê a cada agente e servidor MCP apenas as permissões de que sua tarefa precisa e exija aprovação humana para ações irreversíveis.
  3. Trate textos colados, documentos recuperados e saídas de ferramentas como não confiáveis e teste a aplicação contra eles.
  4. Mantenha logs das chamadas de ferramentas e das conexões de saída para que um incidente possa ser reconstruído.
  5. Veja o curso da FireAI University sobre frameworks de segurança de IA e red teaming e o artigo do blog sobre como a Anthropic faz red teaming do Claude.

Relevância para o FireAI

O FireAI é um firewall de rede para um Mac. Ele não testa modelos, não lê prompts e não avalia se a instrução de um agente é maliciosa. Ele cobre uma camada em torno de uma ferramenta de IA: as regras por app podem limitar um assistente de programação aos destinos de que ele precisa, o aviso de primeira conexão pergunta quando um app ou processo novo tenta alcançar um destino desconhecido, o mapa-múndi e os alertas de envio mostram para onde vai o tráfego e avisam de um envio grande e repentino, e o kill switch interrompe novas conexões. Se uma instrução injetada levasse uma ferramenta local a enviar dados para fora, esses controles poderiam expor ou limitar a conexão, mas não impediriam a instrução em si.

Limitações

A system card é o relato da própria Anthropic, e as constatações dos testadores externos chegam por meio dela. Os processos internos além do que a Anthropic publica não são visíveis. As avaliações da card rodam em cenários escolhidos pela Anthropic, os números de sucesso dos ataques dependem dos recursos dados ao atacante (a card chama seus testes adaptativos de deliberadamente permissivos), e a própria card diz que avaliações automatizadas podem não captar todo o risco do mundo real. A página da Responsible Scaling Policy chama seus relatórios de Safeguards Reports, antes Risk Reports, enquanto a card se refere a um Risk Report de agosto de 2026; esse relatório não foi consultado. As fontes de 2024, de 2025 e da HackerOne descrevem trabalhos e modelos anteriores. As datas de publicação do texto da HackerOne e da página da política, além das versões citadas, não foram determinadas.

Experimente o FireAI, da HisnLabs grátis por 17 dias.

Fontes

  1. Anthropic, 22 September 2026: System Card, Claude Opus 5.5 (PDF)
  2. Anthropic, 12 June 2024: Challenges in red teaming AI systems
  3. Anthropic, 19 March 2025: Progress from Anthropic’s Frontier Red Team
  4. Anthropic: Responsible Scaling Policy (version 3.4, effective 8 July 2026)
  5. HackerOne: How Anthropic’s jailbreak challenge put AI safety defenses to the test (challenge held 3 to 10 February 2025)