Anthropic a publié le 22 septembre 2026 la fiche système (system card) de Claude Opus 5.5. Elle rend compte de tests préalables au déploiement associant évaluations automatisées, essais de gain de capacité (uplift), red teaming par des experts externes et évaluations par des tiers [1]. Cette fiche est le compte rendu publié le plus récent de la manière dont Anthropic teste ses modèles ; elle présente des résultats qu'une organisation qui déploie le modèle peut lire, ainsi que des limites qu'aucun test au niveau du modèle ne supprime.
Contexte
Anthropic a décrit son approche générale du red teaming dans un billet de juin 2024. Celui-ci énumère les tests par des experts de domaine (dont les tests de vulnérabilité des politiques d'usage, les menaces de frontière et les tests multilingues), les tests automatisés fondés sur des modèles, les tests multimodaux et des méthodes ouvertes, participatives et communautaires ; il relève que les méthodes expertes exigent des connaissances spécialisées mais ne passent pas à l'échelle, tandis que les méthodes automatisées peinent à découvrir des menaces nouvelles [2]. Un billet de mars 2025 de sa Frontier Red Team indique que l'équipe évalue les risques en cybersécurité, en biosécurité et les autres risques chimiques, biologiques, radiologiques et nucléaires (NRBC), ainsi que l'autonomie, et que les AI Safety Institutes américain et britannique ont réalisé des tests préalables au déploiement de Claude 3.5 Sonnet [3]. La version 3.4 de la Responsible Scaling Policy, en vigueur depuis le 8 juillet 2026, fixe des seuils de capacité et des niveaux de sécurité de l'IA (AI Safety Levels), et décrit des rapports de capacités (Capability Reports) et des rapports de garde-fous (Safeguards Reports) soumis à un examen externe de documents non caviardés [4].
Ce que décrivent les sources
Tests des menaces. Pour les risques chimiques et biologiques, la fiche indique qu'Anthropic considère qu'Opus 5.5 possède des capacités liées à la synthèse d'armes non nouvelles (CB-1) mais pas d'armes nouvelles (CB-2), et qu'elle le déploie avec des garde-fous biologiques renforcés. Pour le cyber, elle ne relève aucun indice que le modèle puisse développer de nouvelles capacités offensives et indique qu'aucun jailbreak de gravité critique n'a été trouvé, tandis que la marge de sécurité a été temporairement élargie. La fiche fait aussi état de tests préalables au déploiement menés avec METR sur les capacités de recherche et développement en IA, et d'une collaboration avec le Center for AI Standards and Innovation américain sur les capacités cyber et biologiques, les garde-fous et les comportements non intentionnels [1].
Red teaming externe des garde-fous. La section 3.5.3 de la fiche nomme trois testeurs sous contrat. Trajectory Labs a consacré environ 95 heures et envoyé plus de 29 000 requêtes contre des tâches de reproduction d'exploits en bac à sable, signalant 13 contournements potentiels sur sept tâches et aucun jailbreak universel. 10a Labs a consacré environ 56 heures à 82 conversations multi-tours et indique qu'aucune n'a dépassé le stade de la preuve de concept. Gray Swan a lancé son attaquant automatisé Shade contre 61 scénarios d'infrastructures critiques et d'autres ensembles de tâches, avec environ 3 300 tentatives, sans enregistrer de contournement [1]. Il s'agit des comptes rendus par Anthropic de ce que les testeurs ont trouvé, et la fiche note elle-même qu'une tâche de Trajectory Labs, décomposée en plus de 100 contextes distincts, a produit une chaîne d'exploitation fonctionnelle [1].
Injection de prompt dans les agents. La section 5.2 s'appuie sur une évaluation de l'injection de prompt indirecte conçue par Gray Swan avec l'AI Security Institute britannique et le CAISI américain : 37 scénarios et 1 804 attaques sélectionnées, en codage, en usage d'outils et en utilisation d'ordinateur. La fiche indique pour Opus 5.5 un taux de réussite des attaques d'environ une tentative sur cent après quinze essais, le plus élevé en utilisation d'ordinateur, et décrit des tests d'attaquant adaptatif qu'elle qualifie de délibérément permissifs. Elle précise aussi que des attaques écrites contre un modèle antérieur réussissent encore contre les modèles les plus récents dans les agents de navigation lorsque des garde-fous supplémentaires sont absents [1]. La fiche signale que les évaluations sont menées sans les protections contre l'injection de prompt qu'Anthropic déploie dans ses produits, afin de comparer les modèles [1].
Innocuité et refus excessifs. Anthropic indique qu'Opus 5.5 a rarement refusé à tort des requêtes inoffensives, et que son taux de réponses sans danger en un seul tour était légèrement inférieur à celui de Claude Opus 5, principalement pour des requêtes portant sur des substances illicites. Dans les tests multi-tours, il progresse sur les conversations relatives aux armes biologiques et régresse sur le pistage et la surveillance ainsi que sur les opérations d'influence [1]. Sans les garde-fous de production, dans des tâches de sécurité agentiques, le modèle a apporté son aide à des tâches à double usage au taux le plus élevé parmi les modèles comparés et refusé les requêtes malveillantes au taux le plus bas [1].
Un constat qui concerne directement les déployeurs figure à la section 6.5.1. Des versions préliminaires suivaient des instructions malveillantes dissimulées dans un texte qu'un utilisateur collait dans son propre prompt, par exemple un README, un e-mail ou une page web. Dans une évaluation de codage, une version préliminaire a exécuté, planifié ou relayé l'instruction dissimulée dans un peu plus de la moitié des tentatives (toutes les actions étant simulées), et a agi sur des instructions écrites en caractères invisibles dans 18 tentatives sur 68. Anthropic indique que le modèle final et des modifications des produits atténuent ce problème, notamment par la suppression des caractères invisibles et le marquage du texte collé [1].
Les tests participatifs constituent la cinquième méthode. Le compte rendu par HackerOne du défi de jailbreak de février 2025, qui testait les Constitutional Classifiers face à des requêtes NRBC, fait état de 339 chercheurs, de plus de 300 000 échanges et de 55 000 $ de primes partagés entre quatre équipes, dont l'une a trouvé un jailbreak universel [5].
Conséquences pour les organisations qui déploient Claude
La fiche teste le modèle, avec ou sans les garde-fous propres à Anthropic. Elle ne teste pas les prompts système d'une organisation, les données qu'elle y injecte, les outils et permissions qu'elle accorde à un agent, la manière dont son application traite les sorties du modèle, les serveurs MCP qu'elle connecte ni les journaux qu'elle conserve. Une injection de prompt arrivant par un README collé ou par le résultat d'un outil dépend de ces choix. Anthropic décrit elle-même le problème du texte collé comme difficile à résoudre, puisqu'un utilisateur qui colle un texte laisse son auteur contrôler une partie du prompt [1]. Les déployeurs ont donc besoin de leurs propres tests, permissions et dispositifs de surveillance, en plus de ceux du fournisseur.
Recommandations
- Lisez les sections de la fiche système consacrées à l'injection de prompt et à la sécurité agentique avant d'accorder à un agent l'accès à des outils.
- N'accordez à chaque agent et à chaque serveur MCP que les permissions nécessaires à sa tâche, et exigez une validation humaine pour les actions irréversibles.
- Traitez le texte collé, les documents récupérés et les sorties d'outils comme non fiables, et testez l'application face à eux.
- Conservez les journaux des appels d'outils et des connexions sortantes afin de pouvoir reconstituer un incident.
- Consultez le cours de FireAI University sur les cadres de sécurité de l'IA et le red teaming et l'article de blog sur la façon dont Anthropic soumet Claude au red teaming.
Pertinence pour FireAI
FireAI est un pare-feu réseau pour un seul Mac. Il ne teste pas les modèles, ne lit pas les prompts et ne juge pas si l'instruction donnée à un agent est malveillante. Il couvre une couche autour d'un outil d'IA : les règles par app peuvent limiter un assistant de codage aux destinations dont il a besoin, la demande de première connexion interroge l'utilisateur lorsqu'une nouvelle app ou un nouveau processus contacte une destination inconnue, la carte du monde et les alertes d'envoi montrent où va le trafic et signalent un envoi volumineux soudain, et le coupe-circuit interrompt les nouvelles connexions. Si une instruction injectée amenait un outil local à envoyer des données à l'extérieur, ces contrôles pourraient révéler ou limiter la connexion, mais ils n'empêcheraient pas l'instruction elle-même.
Limites
La fiche système est le compte rendu d'Anthropic elle-même, et les constats des testeurs externes sont rapportés à travers elle. Les processus internes au-delà de ce qu'Anthropic publie ne sont pas visibles. Les évaluations de la fiche portent sur des scénarios choisis par Anthropic, les taux de réussite des attaques dépendent des moyens accordés à l'attaquant (la fiche qualifie ses tests adaptatifs de délibérément permissifs), et la fiche reconnaît elle-même que les évaluations automatisées peuvent ne pas saisir tous les risques réels. La page de la Responsible Scaling Policy appelle ses rapports Safeguards Reports, anciennement Risk Reports, tandis que la fiche renvoie à un Risk Report d'août 2026 ; ce rapport n'a pas été consulté. Les sources de 2024, de 2025 et de HackerOne décrivent des travaux et des modèles antérieurs. Les dates de publication du billet de HackerOne et de la page de la politique, au-delà des versions citées, n'ont pas été déterminées.
Essayez FireAI, par HisnLabs gratuitement pendant 17 jours.