Anthropic publicó la system card de Claude Opus 5.5 el 22 de septiembre de 2026. El documento reporta pruebas previas al despliegue que combinan evaluaciones automatizadas, ensayos de uplift, red teaming de expertos externos y evaluaciones de terceros [1]. La system card es el relato publicado más reciente de cómo Anthropic prueba sus modelos, y presenta resultados que una organización que despliega el modelo puede consultar, junto con límites que ninguna prueba a nivel de modelo elimina.
Contexto
Anthropic describió su enfoque general de red teaming en una publicación de junio de 2024. Ahí enumera pruebas de expertos por dominio (incluidas pruebas de vulnerabilidad de políticas, amenazas de frontera y pruebas multilingües), pruebas automatizadas basadas en modelos, pruebas multimodales y métodos abiertos de crowdsourcing y de comunidad, y señala que los métodos de expertos requieren conocimiento especializado pero no escalan, mientras que a los métodos automatizados les cuesta encontrar amenazas novedosas [2]. Una publicación de marzo de 2025 de su Frontier Red Team indica que el equipo evalúa ciberseguridad, bioseguridad y otros riesgos químicos, biológicos, radiológicos y nucleares (CBRN), así como autonomía, y que los AI Safety Institutes de Estados Unidos y del Reino Unido realizaron pruebas previas al despliegue de Claude 3.5 Sonnet [3]. La versión 3.4 de la Responsible Scaling Policy, vigente desde el 8 de julio de 2026, fija umbrales de capacidad y AI Safety Levels, y describe Capability Reports y Safeguards Reports con revisión externa de material sin censurar [4].
Lo que describen las fuentes
Pruebas de amenazas. En cuanto al riesgo químico y biológico, la system card dice que Anthropic considera que Opus 5.5 tiene capacidades relacionadas con la síntesis de armas no novedosas (CB-1), pero no de armas novedosas (CB-2), y lo despliega con salvaguardas biológicas ampliadas. En ciberseguridad, reporta que no hay indicios de que el modelo pueda desarrollar capacidades ofensivas novedosas y dice que no se encontró un jailbreak de gravedad crítica, aunque el margen de seguridad se amplió de forma temporal. También reporta pruebas previas al despliegue con METR sobre capacidades de investigación y desarrollo de IA, y una colaboración con el Center for AI Standards and Innovation de Estados Unidos sobre capacidades cibernéticas y biológicas, salvaguardas y comportamientos no intencionados [1].
Red teaming externo de las salvaguardas. La sección 3.5.3 nombra a tres equipos de prueba contratados. Trajectory Labs dedicó unas 95 horas y envió más de 29,000 solicitudes contra tareas de reproducción de exploits en sandbox; reportó 13 posibles evasiones en siete tareas y ningún jailbreak universal. 10a Labs dedicó unas 56 horas a 82 conversaciones de varios turnos y reportó que ninguna pasó de la prueba de concepto. Gray Swan ejecutó su atacante automatizado Shade contra 61 escenarios de infraestructura crítica y otros conjuntos de tareas, con unos 3,300 intentos, y no registró evasiones [1]. Estos son los reportes de Anthropic sobre lo que encontraron los equipos, y la propia system card señala que una tarea de Trajectory Labs, descompuesta en más de 100 contextos separados, produjo una cadena de exploits funcional [1].
Inyección de prompts en agentes. La sección 5.2 usa una evaluación de inyección indirecta de prompts construida por Gray Swan con el UK AI Security Institute y el CAISI de Estados Unidos: 37 escenarios y 1,804 ataques seleccionados en programación, uso de herramientas y uso de computadora. La system card reporta para Opus 5.5 una tasa de éxito de ataque de alrededor de un intento de cada cien con quince intentos, más alta en el uso de computadora, y describe pruebas con atacantes adaptativos que califica de deliberadamente permisivas. También dice que los ataques escritos contra un modelo anterior siguen funcionando contra los modelos más recientes en agentes de navegación cuando faltan salvaguardas adicionales [1]. La system card aclara que las evaluaciones se ejecutan sin las protecciones contra inyección de prompts que Anthropic despliega en sus productos, para poder comparar modelos [1].
Inocuidad y rechazo excesivo. Anthropic reporta que Opus 5.5 rara vez rechazó de más solicitudes benignas y que su tasa de respuestas inocuas en un solo turno fue un poco menor que la de Claude Opus 5, sobre todo en solicitudes sobre sustancias ilegales. En pruebas de varios turnos mejoró en conversaciones sobre armas biológicas y retrocedió en rastreo y vigilancia y en operaciones de influencia [1]. Sin las salvaguardas de producción, en tareas de seguridad agénticas, el modelo ayudó con tareas de doble uso con la tasa más alta de los modelos comparados y rechazó solicitudes maliciosas con la tasa más baja [1].
Un hallazgo que afecta directamente a quienes despliegan el modelo está en la sección 6.5.1. Versiones preliminares siguieron instrucciones dañinas ocultas en texto que un usuario pegó en su propio prompt, como un README, un correo o una página web. En una evaluación de programación, una versión preliminar ejecutó, planeó o transmitió la instrucción oculta en poco más de la mitad de los intentos (todas las acciones simuladas), y actuó según instrucciones escritas con caracteres invisibles en 18 de 68 intentos. Anthropic afirma que el modelo final y los cambios en el producto mitigan esto, entre otras cosas eliminando los caracteres invisibles y marcando el texto pegado [1].
Las pruebas colaborativas abiertas son el quinto método del panorama. El relato de HackerOne sobre el desafío de jailbreak de febrero de 2025, que puso a prueba los Constitutional Classifiers frente a consultas CBRN, reporta 339 investigadores, más de 300,000 interacciones de chat y 55,000 dólares en recompensas repartidos entre cuatro equipos, uno de los cuales encontró un jailbreak universal [5].
Implicaciones para las organizaciones que despliegan Claude
La system card prueba el modelo, con o sin las salvaguardas propias de Anthropic. No prueba los prompts de sistema de una organización, los datos que le entrega, las herramientas y permisos que le concede a un agente, cómo maneja su aplicación la salida del modelo, los servidores MCP que conecta ni los registros que conserva. La inyección de prompts que llega a través de un README pegado o del resultado de una herramienta depende de esas decisiones. La propia descripción de Anthropic del problema del texto pegado dice que es difícil de resolver, ya que un usuario que pega texto deja que su autor controle parte del prompt [[1]](${CARD}). Por eso, quienes despliegan el modelo necesitan sus propias pruebas, permisos y monitoreo además de los del proveedor.
Recomendaciones
- Lee las secciones de la system card sobre inyección de prompts y seguridad agéntica antes de darle a un agente acceso a herramientas.
- Concede a cada agente y servidor MCP solo los permisos que necesita su tarea, y exige aprobación humana para las acciones irreversibles.
- Trata el texto pegado, los documentos recuperados y la salida de herramientas como no confiables, y prueba la aplicación frente a ellos.
- Conserva registros de las llamadas a herramientas y de las conexiones salientes para poder reconstruir un incidente.
- Consulta el curso de FireAI University sobre marcos de seguridad de IA y red teaming y el artículo del blog sobre cómo Anthropic hace red teaming a Claude.
Relevancia para FireAI
FireAI es un firewall de red para una Mac. No prueba modelos, no lee prompts ni juzga si la instrucción de un agente es maliciosa. Cubre una capa alrededor de una herramienta de IA: las reglas por app pueden limitar un asistente de programación a los destinos que necesita, el aviso de primera conexión pregunta cuando una app o un proceso nuevo llega a un destino desconocido, el Mapa mundial y las alertas de subida muestran a dónde va el tráfico y avisan de una subida grande y repentina, y el botón de corte detiene las conexiones nuevas. Si una instrucción inyectada hiciera que una herramienta local enviara datos hacia fuera, estos controles podrían exponer o limitar la conexión, pero no impedirían la instrucción en sí.
Limitaciones
La system card es el relato de la propia Anthropic, y los hallazgos de los equipos externos se reportan a través de ella. Los procesos internos que van más allá de lo que Anthropic publica no son visibles. Las evaluaciones se ejecutan sobre escenarios elegidos por Anthropic, las cifras de éxito de ataque dependen de los recursos que se le dan al atacante (la system card califica sus pruebas adaptativas de deliberadamente permisivas) y la propia system card dice que las evaluaciones automatizadas pueden no captar todo el riesgo real. La página de la Responsible Scaling Policy llama a sus reportes Safeguards Reports, antes Risk Reports, mientras que la system card remite a un Risk Report de agosto de 2026; ese reporte no se consultó. Las fuentes de 2024, 2025 y de HackerOne describen trabajos y modelos anteriores. No se determinaron las fechas de publicación de la entrada de HackerOne ni de la página de la política más allá de las versiones citadas.
Prueba FireAI, de HisnLabs gratis durante 17 días.