Noticias de seguridad e inteligencia artificial

Red teaming de IA · Por FireAI Security & Research Team · Publicado

La ficha del sistema de Claude Opus 5.5 describe el red teaming de Anthropic y lo que las pruebas del modelo dejan en manos de quien lo despliega

La ficha del sistema de Anthropic del 22 de septiembre de 2026 recoge el red teaming externo y las pruebas de inyección de prompts de Claude Opus 5.5, y lo que queda en manos de quien lo despliega.

A shield beside the FireAI research mascot, illustrating Anthropic’s red-teaming of Claude Opus 5.5 and the layers left to deploying organisations.

Anthropic publicó la ficha del sistema (system card) de Claude Opus 5.5 el 22 de septiembre de 2026. Recoge pruebas previas al despliegue que combinan evaluaciones automatizadas, ensayos de mejora de capacidades (uplift), red teaming por expertos externos y evaluaciones de terceros [1]. La ficha es el relato publicado más reciente sobre cómo prueba Anthropic sus modelos, y expone resultados que una organización que lo despliega puede leer, junto con límites que ninguna prueba a nivel de modelo elimina.

Contexto

Anthropic describió su enfoque general del red teaming en una entrada de junio de 2024. En ella enumera las pruebas por expertos de dominio (incluidas las pruebas de vulnerabilidad de políticas, las amenazas de frontera y las pruebas multilingües), las pruebas automatizadas basadas en modelos, las pruebas multimodales y los métodos abiertos de colaboración masiva y comunitarios, y señala que los métodos expertos requieren conocimientos especializados pero no escalan, mientras que a los automatizados les cuesta encontrar amenazas nuevas [2]. Una entrada de marzo de 2025 de su Frontier Red Team explica que el equipo evalúa los riesgos de ciberseguridad, bioseguridad y otros riesgos químicos, biológicos, radiológicos y nucleares (QBRN), así como la autonomía, y que los AI Safety Institutes de Estados Unidos y del Reino Unido realizaron pruebas previas al despliegue de Claude 3.5 Sonnet [3]. La versión 3.4 de la Responsible Scaling Policy, en vigor desde el 8 de julio de 2026, fija umbrales de capacidad y niveles de seguridad de IA (AI Safety Levels), y describe los Capability Reports y los Safeguards Reports con revisión externa del material sin censurar [4].

Lo que describen las fuentes

Pruebas de amenazas. En cuanto al riesgo químico y biológico, la ficha indica que Anthropic considera que Opus 5.5 tiene capacidades relacionadas con la síntesis de armas no novedosas (CB-1) pero no de armas novedosas (CB-2), y lo despliega con salvaguardas biológicas ampliadas. En ciberseguridad, no observa indicios de que el modelo pueda desarrollar capacidades ofensivas novedosas y afirma que no se encontró ningún jailbreak de gravedad crítica, aunque el margen de seguridad se amplió temporalmente. La ficha recoge también pruebas previas al despliegue con METR sobre capacidades de investigación y desarrollo en IA, y una colaboración con el Center for AI Standards and Innovation de Estados Unidos sobre capacidades cibernéticas y biológicas, salvaguardas y comportamientos no deseados [1].

Red teaming externo de las salvaguardas. La sección 3.5.3 de la ficha nombra a tres evaluadores contratados. Trajectory Labs dedicó unas 95 horas y envió más de 29.000 solicitudes contra tareas de reproducción de exploits en sandbox, y comunicó 13 posibles roturas en siete tareas y ningún jailbreak universal. 10a Labs dedicó unas 56 horas a 82 conversaciones de varios turnos e indicó que ninguna pasó de la prueba de concepto. Gray Swan lanzó su atacante automatizado Shade contra 61 escenarios de infraestructuras críticas y otros conjuntos de tareas, con unos 3.300 intentos, y no registró ninguna rotura [1]. Se trata del relato de Anthropic sobre lo que encontraron los evaluadores, y la propia ficha señala que una tarea de Trajectory Labs, descompuesta en más de 100 contextos separados, produjo una cadena de exploits funcional [1].

Inyección de prompts en agentes. La sección 5.2 utiliza una evaluación de inyección indirecta de prompts creada por Gray Swan con el AI Security Institute del Reino Unido y el CAISI de Estados Unidos: 37 escenarios y 1.804 ataques seleccionados en programación, uso de herramientas y uso del ordenador. La ficha indica para Opus 5.5 una tasa de éxito de ataque de alrededor de un intento de cada cien con quince intentos, más alta en el uso del ordenador, y describe pruebas con atacantes adaptativos que califica de deliberadamente permisivas. También afirma que los ataques escritos contra un modelo anterior siguen funcionando contra los modelos más nuevos en agentes de navegación cuando faltan salvaguardas adicionales [1]. La ficha aclara que las evaluaciones se ejecutan sin las protecciones contra inyección de prompts que Anthropic despliega en sus productos, para poder comparar modelos [1].

Inocuidad y exceso de rechazos. Anthropic indica que Opus 5.5 rara vez rechazó en exceso peticiones benignas y que su tasa de respuestas inocuas en un solo turno fue algo inferior a la de Claude Opus 5, sobre todo en peticiones sobre sustancias ilegales. En las pruebas de varios turnos mejoró en las conversaciones sobre armas biológicas y retrocedió en rastreo y vigilancia y en operaciones de influencia [1]. Sin las salvaguardas de producción, en tareas de seguridad agénticas, el modelo ayudó con tareas de doble uso con la tasa más alta de los modelos comparados y rechazó peticiones maliciosas con la tasa más baja [1].

Un hallazgo que afecta directamente a quien despliega el modelo figura en la sección 6.5.1. Las primeras versiones seguían instrucciones dañinas colocadas en un texto que el usuario pegaba en su propio prompt, como un README, un correo o una página web. En una evaluación de programación, una versión temprana ejecutó, planificó o transmitió la instrucción colocada en algo más de la mitad de los intentos (todas las acciones simuladas), y actuó sobre instrucciones escritas con caracteres invisibles en 18 de 68 intentos. Anthropic afirma que el modelo final y los cambios en el producto mitigan este problema, entre otras cosas eliminando los caracteres invisibles y marcando el texto pegado [1].

Las pruebas colaborativas abiertas son el quinto método del panorama. El relato de HackerOne sobre el reto de jailbreak de febrero de 2025, que puso a prueba los Constitutional Classifiers frente a consultas QBRN, recoge 339 investigadores, más de 300.000 interacciones de chat y 55.000 dólares en recompensas repartidos entre cuatro equipos, uno de los cuales encontró un jailbreak universal [5].

Implicaciones para las organizaciones que despliegan Claude

La ficha prueba el modelo, con o sin las salvaguardas propias de Anthropic. No prueba los prompts de sistema de una organización, los datos que introduce, las herramientas y permisos que concede a un agente, cómo trata su aplicación la salida del modelo, los servidores MCP que conecta ni los registros que conserva. La inyección de prompts que llega a través de un README pegado o del resultado de una herramienta depende de esas decisiones. La propia descripción de Anthropic del problema del texto pegado reconoce que es difícil de resolver, ya que un usuario que pega un texto deja que su autor controle parte del prompt [[1]](${CARD}). Por tanto, quien despliega el modelo necesita sus propias pruebas, permisos y supervisión además de los del proveedor.

Recomendaciones

  1. Lea las secciones de la ficha del sistema sobre inyección de prompts y seguridad agéntica antes de conceder a un agente acceso a herramientas.
  2. Conceda a cada agente y servidor MCP solo los permisos que necesita su tarea, y exija aprobación humana para las acciones irreversibles.
  3. Trate el texto pegado, los documentos recuperados y la salida de las herramientas como no fiables, y pruebe la aplicación frente a ellos.
  4. Conserve registros de las llamadas a herramientas y de las conexiones salientes para poder reconstruir un incidente.
  5. Consulte el curso de FireAI University sobre marcos de seguridad de IA y red teaming y la entrada del blog sobre cómo hace Anthropic red teaming a Claude.

Relevancia para FireAI

FireAI es un firewall de red para un solo Mac. No prueba modelos, no lee prompts y no juzga si la instrucción de un agente es maliciosa. Cubre una capa alrededor de una herramienta de IA: las reglas por app pueden limitar un asistente de programación a los destinos que necesita, la solicitud de primera conexión pregunta cuando una app o un proceso nuevo llega a un destino desconocido, el mapa mundial y las alertas de subida muestran adónde va el tráfico y avisan de una subida grande y repentina, y el botón de corte detiene las conexiones nuevas. Si una instrucción inyectada hiciera que una herramienta local enviara datos al exterior, estos controles podrían poner al descubierto o limitar la conexión, pero no impedirían la instrucción en sí.

Limitaciones

La ficha del sistema es el relato de la propia Anthropic, y los hallazgos de los evaluadores externos se comunican a través de ella. Los procesos internos que Anthropic no publica no son visibles. Las evaluaciones de la ficha se basan en escenarios elegidos por Anthropic, las cifras de éxito de los ataques dependen de los medios del atacante (la ficha califica sus pruebas adaptativas de deliberadamente permisivas) y la propia ficha reconoce que las evaluaciones automatizadas pueden no reflejar todo el riesgo real. La página de la Responsible Scaling Policy llama a sus informes Safeguards Reports, antes Risk Reports, mientras que la ficha remite a un Risk Report de agosto de 2026 que no se consultó. Las fuentes de 2024, 2025 y HackerOne describen trabajos y modelos anteriores. No se determinaron las fechas de publicación de la entrada de HackerOne ni de la página de la política más allá de las versiones citadas.

Pruebe FireAI, de HisnLabs gratis durante 17 días.

Fuentes

  1. Anthropic, 22 September 2026: System Card, Claude Opus 5.5 (PDF)
  2. Anthropic, 12 June 2024: Challenges in red teaming AI systems
  3. Anthropic, 19 March 2025: Progress from Anthropic’s Frontier Red Team
  4. Anthropic: Responsible Scaling Policy (version 3.4, effective 8 July 2026)
  5. HackerOne: How Anthropic’s jailbreak challenge put AI safety defenses to the test (challenge held 3 to 10 February 2025)