La sécurité des modèles d’IA n’est pas une discipline unique mais six tâches distinctes, chacune avec ses outils : analyser les fichiers de modèle, établir leur provenance, sonder un modèle pour en trouver les faiblesses, le protéger à l’exécution, contrôler l’outillage d’agent qui l’entoure, et limiter les destinations auxquelles l’application qui l’héberge peut se connecter. Ce panorama, préparé par HisnLabs, l’éditeur de FireAI, couvre des outils ouverts dont les dépôts ou la documentation ont été consultés le 30 septembre 2026. Licences, mainteneurs et statut sont indiqués tels que les sources primaires les présentent, et aucun outil n’est classé au-dessus d’un autre, car ces tâches ne sont pas en concurrence.
Périmètre et méthode
Un outil n’a été retenu que si son dépôt ou sa documentation officielle pouvait être consulté, sa licence identifiée et son état de maintenance vérifié (archivé ou actif, et date de la dernière version lorsque la page des versions l’indique). Les versions citées ci-dessous sont les plus récentes au moment de la lecture. Rien ici ne constitue une mesure de performance : les sources ne fournissent pas de résultats de détection comparables, et aucun n’est avancé. Les plateformes commerciales sont exclues, sauf lorsqu’un composant ouvert fait l’objet de l’analyse.
Les catégories suivent l’ordre dans lequel un modèle traverse un projet : un fichier est téléchargé, son origine est vérifiée, le modèle est testé, déployé derrière des protections, connecté à des outils, puis l’application qui l’exécute accède au réseau. L’OWASP Top 10 for Large Language Model Applications, maintenu au sein de l’OWASP GenAI Security Project, sert de vocabulaire commun habituel pour les risques applicatifs des catégories trois à cinq.
1. Analyse des fichiers de modèle
De nombreux fichiers de modèle sont sérialisés au format pickle de Python, qui peut exécuter du code au chargement. La documentation de Hugging Face indique que charger un pickle « signifie que du code peut être exécuté » et cite les opcodes GLOBAL, STACK_GLOBAL et REDUCE comme ceux qui portent la menace. Hugging Face: Pickle scanning Les scanners lisent les instructions du fichier sans le charger et signalent les imports dangereux.
ModelScan
ModelScan est maintenu par Protect AI sous licence Apache-2.0. Il analyse les formats fondés sur pickle (PyTorch, scikit-learn, XGBoost, joblib, cloudpickle), TensorFlow SavedModel et les fichiers Keras H5 et V3, classe les résultats par gravité et renvoie des codes de sortie adaptés aux chaînes CI. La dernière version indiquée sur sa page est la v0.8.8 du 18 février 2026, et le dépôt présentait une activité le 28 septembre 2026. À utiliser comme point de contrôle avant qu’un modèle téléchargé n’entre dans une compilation. Limite : le README décrit une détection par signatures susceptible de produire des faux positifs et des faux négatifs, et les résultats nécessitent un examen humain.
picklescan
picklescan est un scanner sous licence MIT maintenu par un compte individuel, mmaitre314. La documentation de Hugging Face cite picklescan parmi les outils développés pour le Hub. La dernière version est la v1.0.5 du 1er juillet 2026. Il analyse les fichiers pickle, les archives PyTorch et les conteneurs ZIP, et peut examiner un chemin local, une URL ou un modèle Hugging Face. À utiliser pour une vérification rapide dans un script. Limite : il repère les opérations dangereuses par motif, de sorte qu’une technique inédite peut passer, et il signale les résultats sans les supprimer.
fickling
fickling, de Trail of Bits, est publié sous licence LGPL-3.0. Il se présente comme un décompilateur, un analyseur statique et un outil de réécriture de bytecode pour pickle. Il peut décompiler un pickle en Python lisible, vérifier sa sûreté par analyse statique et lever une erreur avant le chargement d’un fichier dangereux. La dernière version est la v0.1.12 du 26 juin 2026. À utiliser lorsqu’un résultat doit être compris, et pas seulement signalé. Limite : c’est un outil d’analyse pour pickle, qui ne couvre pas les autres formats lus par ModelScan. Les conditions de sa licence diffèrent des licences permissives des autres scanners.
Analyse du Hugging Face Hub et safetensors
Le Hub analyse chaque fichier déposé avec ClamAV et avec un scan des imports pickle qui recense les imports de chaque fichier sérialisé et met en évidence ceux qui sont suspects. Hugging Face: file scanning Il affiche également, sur les dépôts publics, les résultats d’un scanner tiers, Guardian de Protect AI. Hugging Face: Protect AI Limite, telle que Hugging Face la formule : le scan pickle n’est pas infaillible, ses listes sont tenues au mieux, et il revient à l’utilisateur de vérifier ce qui est sûr. L’alternative structurelle est safetensors, un format sous licence Apache-2.0 maintenu par Hugging Face, qui stocke les tenseurs sans contenu exécutable. Il supprime le risque pickle pour les poids, mais n’indique pas si les poids eux-mêmes sont dignes de confiance.
2. Provenance, signature et empreinte des modèles
L’analyse demande si un fichier est dangereux à charger. La provenance demande qui l’a produit et s’il a changé depuis. Ces deux questions appellent des outils différents.
Sigstore model-transparency
model-transparency est un projet sous licence Apache-2.0 de l’organisation Sigstore, qui signe et vérifie des modèles d’apprentissage automatique. Il peut signer via Sigstore, ou avec des clés, des certificats ou des dispositifs PKCS #11, et produit un bundle contenant une enveloppe DSSE avec une déclaration in-toto. Sa dernière version est la v1.1.1 du 10 octobre 2025, avec des commits en septembre 2026. À utiliser pour permettre à un utilisateur de vérifier que les fichiers en sa possession sont bien ceux qu’un éditeur a signés. Limites : la documentation indique la prise en charge du hachage de fichiers et de fragments de fichiers, non de tenseurs individuels, et une signature valide prouve l’origine et l’intégrité, non l’innocuité du modèle. Hugging Face fait la même distinction pour les commits signés, qui garantissent « l’origine du fichier » et non sa sûreté.
Nomenclatures logicielles pour l’IA et le ML
CycloneDX, maintenu par l’OWASP Foundation et le TC54 d’Ecma International, compte un Machine Learning Bill of Materials (ML-BOM) parmi les types de nomenclature qu’il prend en charge. Sa dernière version, 1.7, a été publiée le 21 octobre 2025, et ses schémas sont sous licence Apache-2.0. Le profil IA de SPDX 3.0 documente les composants d’IA tels que modèles, jeux de données et prompts dans un enregistrement unique et relié. L’un ou l’autre permet de tenir l’inventaire des modèles, jeux de données et versions que contient un produit, ce dont une réponse à incident a besoin en premier. Limite : une nomenclature consigne ce qu’un auteur déclare. Aucun des deux formats ne vérifie la déclaration.
Outils de recherche en empreinte et en tatouage numérique
Instructional Fingerprinting est le code d’un article universitaire (arXiv 2401.12255) qui intègre une empreinte dans un modèle de langage afin que son propriétaire puisse ensuite vérifier si un autre modèle en dérive. C’est du code de recherche sous licence MIT, dont la dernière mise à jour du dépôt remonte à juillet 2024. MarkLLM, du groupe THU-BPM, est une boîte à outils sous licence Apache-2.0 pour tatouer le texte généré par un LLM, présentée comme démonstration à EMNLP 2024. Les deux répondent à des questions différentes : le premier marque un modèle, le second marque sa production. À utiliser pour étudier l’attribution, non comme contrôle en production. Limite : il s’agit dans les deux cas d’artefacts de recherche, et aucun ne remplace la signature d’un fichier distribué.
3. Red teaming et recherche de vulnérabilités des LLM
Ces outils envoient des entrées adverses à un modèle ou à une application et consignent ses réponses. Ils testent un comportement, non des fichiers.
garak
garak est un scanner de vulnérabilités de LLM sous licence Apache-2.0, maintenu par NVIDIA. Son README indique qu’il vérifie « si un LLM peut être amené à échouer d’une manière que nous ne souhaitons pas », au moyen de sondes portant sur l’injection de prompt, la fuite de données, l’hallucination, la toxicité et le jailbreak, chacune associée à un détecteur. La dernière version est la v0.17.0 du 9 septembre 2026. À utiliser comme analyse de référence étendue d’un point d’accès de modèle. Limites : il nécessite un accès API ou un déploiement local de la cible, certaines sondes sont gourmandes en ressources, et le README signale une prise en charge limitée des modèles de vision et le statut de prototype de certaines sondes.
PyRIT
PyRIT est un framework sous licence MIT présenté comme conçu pour permettre aux professionnels de la sécurité et aux ingénieurs d’identifier les risques des systèmes d’IA générative. Il est maintenu par Microsoft, et la dernière version est la v1.1.0 du 4 septembre 2026. L’ancien dépôt de l’organisation Azure a été archivé le 27 mars 2026 avec un renvoi vers celui de Microsoft, de sorte que les liens vers l’ancienne adresse mènent à une copie en lecture seule. À utiliser pour des campagnes de red teaming scriptées et multi-tours, par une équipe prête à écrire du code. Limite : c’est un framework, non un scanner à commande unique.
promptfoo
promptfoo est un outil en ligne de commande et une bibliothèque sous licence MIT pour évaluer les applications LLM et pour le red teaming et la recherche de vulnérabilités, avec intégration CI. La dernière version est la 0.123.1 du 18 septembre 2026. Son README indique : « Promptfoo is now part of OpenAI. Promptfoo remains open source and MIT licensed. » À utiliser pour intégrer des tests de prompts et des vérifications adverses dans une compilation. Limite : les résultats dépendent du fournisseur et du juge configurés, et la plupart des fournisseurs exigent des clés API. Le changement de propriétaire est un fait de gouvernance à prendre en compte lors du choix d’un outil pour un usage réglementé.
Giskard
Giskard est une bibliothèque Python sous licence Apache-2.0 de l’organisation Giskard-AI. Sa version 3 comporte deux composants présentés comme stables : giskard-checks, un framework de test fondé sur des scénarios et des évaluations par LLM juge, et giskard-scan, un scanner de vulnérabilités d’agents. À utiliser pour tester des agents et des systèmes de génération augmentée par récupération. Limites : la version 3 requiert Python 3.12 ou ultérieur, et la version 2, qui couvrait l’analyse des données tabulaires et de l’apprentissage automatique classique, n’est plus activement maintenue.
4. Garde-fous à l’exécution et détection de l’injection de prompt
Les garde-fous se placent sur le chemin des requêtes et classent ou contraignent les entrées et les sorties pendant l’exécution de l’application.
Llama Guard, Prompt Guard et LlamaFirewall
Le projet Purple Llama de Meta regroupe des protections pour les modèles ouverts. Llama Guard est une famille de modèles de modération des entrées et des sorties. Prompt Guard 2 est présenté comme un classifieur léger destiné aux tentatives d’injection de prompt directe, et LlamaFirewall le combine à un scanner de vérification d’alignement et à un scanner de code pour les agents. Selon le tableau des licences du projet, les modèles sont distribués sous les Llama Community Licences, et d’autres composants, comme Code Shield et les évaluations, sous licence MIT. Les modèles sur Hugging Face sont en accès restreint. À utiliser lorsqu’un petit classifieur placé devant un modèle est acceptable. Limites : un classifieur réduit les tentatives qui ressemblent à des motifs connus, sans éliminer la catégorie d’attaque.
NeMo Guardrails
NeMo Guardrails est une boîte à outils sous licence Apache-2.0 de NVIDIA permettant d’ajouter des garde-fous programmables aux applications LLM, à l’aide d’un langage de modélisation appelé Colang qui contrôle le déroulement du dialogue. La dernière version est la v0.24.1 du 16 septembre 2026. À utiliser pour encadrer les sujets, les formats et les parcours de dialogue. Limite : les garde-fous sont une politique écrite par le développeur, et leur couverture n’est donc pas plus large que ce qui a été anticipé.
Rebuff et LLM Guard, désormais archivés
Rebuff, un détecteur d’injection de prompt auto-renforcé combinant heuristiques, vérification par LLM, base vectorielle d’attaques passées et jetons canari, a été archivé le 16 mai 2025. Son README précise qu’il s’agit d’un prototype qui ne peut offrir une protection complète contre l’injection de prompt. LLM Guard, une boîte à outils sous licence MIT de scanners d’entrées et de sorties du même mainteneur, a été archivé en juillet 2026. Tous deux restent consultables à titre de référence. Ils illustrent un point pratique : les projets de détection peuvent perdre leurs mainteneurs, et un garde-fou doit donc pouvoir être remplacé.
5. Scanners de sécurité pour agents et MCP
Les agents ajoutent des outils, et les descriptions de ces outils sont du texte que le modèle lit. Les scanners de ce groupe inspectent cet outillage et sa configuration.
Snyk Agent Scan
Agent Scan, anciennement MCP-Scan, est un scanner sous licence Apache-2.0 maintenu par Snyk. Il repère les composants d’agent présents sur une machine, notamment les serveurs MCP et les skills de clients tels que Claude, Cursor, VS Code et GitHub Copilot, et les examine à la recherche d’injection de prompt, d’empoisonnement d’outils et de problèmes apparentés. La dernière version est la v0.6.8 du 29 septembre 2026. À utiliser pour auditer ce qu’une machine de développement a installé. Limites : le README indique que le projet n’accepte pas de contributions externes pour le moment et qu’il existe deux branches de versions aux formats de sortie différents.
Cisco MCP Scanner
MCP Scanner est un outil sous licence Apache-2.0 de Cisco AI Defense. Il analyse les outils, prompts, ressources et dépendances MCP au moyen de trois moteurs utilisables seuls ou ensemble : des règles YARA, une analyse par LLM et l’API Cisco AI Defense. La dernière version est la 4.8.4 du 28 août 2026. À utiliser pour vérifier un serveur avant de l’adopter. Limite : les moteurs LLM et API nécessitent des identifiants externes, et l’analyse de la description d’un serveur renseigne peu sur ce que fait son code après une mise à jour.
6. La place des contrôles réseau
Les outils ci-dessus examinent des fichiers, des modèles, des prompts et des configurations. Aucun ne décide quelle application peut ouvrir une connexion vers quel serveur. C’est le rôle du contrôle des flux sortants, et il compte parce que les risques des sections précédentes convergent sur le réseau : un environnement d’exécution de modèle altéré, un outil empoisonné ou un agent victime d’injection doit atteindre une destination pour exfiltrer des données ou recevoir des instructions.
FireAI, développé par HisnLabs, est un pare-feu sortant pour macOS. Il fonctionne comme filtre de contenu Apple Network Extension, identifie chaque app par sa signature de code et peut autoriser, bloquer ou demander pour chaque destination, avec des règles par app, domaine ou adresse. Appliqué au travail sur l’IA sur un Mac, cela signifie qu’un serveur d’inférence, un agent de programmation ou un client MCP peut être limité aux destinations nécessaires à sa tâche, et qu’une nouvelle destination déclenche une décision. La documentation du filtre décrit ce que FireAI voit : l’identité de l’app, l’hôte ou l’adresse distante, le port et le protocole.
FireAI n’analyse pas les fichiers de modèle, ne vérifie pas les signatures, ne soumet pas un modèle au red teaming et ne classe pas les prompts. Il ne lit pas le contenu des connexions chiffrées et ne peut donc pas distinguer une requête légitime d’une requête injectée lorsque les deux visent une destination autorisée. Il complète les outils ci-dessus et n’en remplace aucun.
Comparaison
| Outil | Tâche | Mainteneur | Licence | Statut constaté le 30 sept. 2026 |
|---|---|---|---|---|
| ModelScan | Analyse de fichiers de modèle | Protect AI | Apache-2.0 | Actif, v0.8.8 |
| picklescan | Analyse pickle | mmaitre314 | MIT | Actif, v1.0.5 |
| fickling | Analyse approfondie pickle | Trail of Bits | LGPL-3.0 | Actif, v0.1.12 |
| safetensors | Format de poids sûr | Hugging Face | Apache-2.0 | Actif |
| model-transparency | Signature de modèles | Sigstore | Apache-2.0 | Actif, v1.1.1 |
| CycloneDX | Spécification ML-BOM | OWASP, Ecma TC54 | Apache-2.0 (schémas) | Actif, 1.7 |
| Instructional Fingerprinting | Empreinte de modèle (recherche) | Auteurs de l’article | MIT | Dernière mise à jour juillet 2024 |
| MarkLLM | Tatouage de texte (recherche) | THU-BPM | Apache-2.0 | Actif |
| garak | Recherche de vulnérabilités | NVIDIA | Apache-2.0 | Actif, v0.17.0 |
| PyRIT | Framework de red teaming | Microsoft | MIT | Actif, v1.1.0 |
| promptfoo | Évaluations et red teaming | Promptfoo, filiale d’OpenAI | MIT | Actif, 0.123.1 |
| Giskard v3 | Tests et analyse d’agents | Giskard-AI | Apache-2.0 | Actif ; v2 non maintenue |
| Llama Guard, Prompt Guard | Modèles de protection | Meta | Llama Community Licences | Modèles datés d’avril 2025 |
| NeMo Guardrails | Garde-fous programmables | NVIDIA | Apache-2.0 | Actif, v0.24.1 |
| Rebuff, LLM Guard | Détection d’injection | Protect AI | Apache-2.0, MIT | Archivés |
| Agent Scan | Analyse d’agents et MCP | Snyk | Apache-2.0 | Actif, v0.6.8 |
| MCP Scanner | Analyse de serveurs MCP | Cisco AI Defense | Apache-2.0 | Actif, 4.8.4 |
| FireAI | Contrôle des flux sortants par app sur macOS | HisnLabs | Commerciale | N’analyse pas les modèles |
Limites
- Aucun outil ne couvre à lui seul les six tâches. Une analyse de fichier sans alerte ne dit rien du comportement d’un modèle, une signature ne dit rien de sa sûreté et un test de red teaming ne dit rien du contenu d’un fichier.
- Les scanners et les garde-fous sont des détecteurs. Ils peuvent manquer des techniques inédites, comme le reconnaissent les documentations de ModelScan, picklescan et Rebuff, et leur couverture évolue avec les attaques.
- La maintenance est inégale. Deux projets de détection cités ici sont archivés, un outil a changé de propriétaire, un autre dépend d’un mainteneur individuel et un dépôt de recherche n’a pas évolué depuis 2024. Il convient de vérifier l’état d’un projet avant de s’appuyer dessus.
- Ce panorama se limite aux outils ouverts dont les sources primaires ont pu être consultées. Il exclut les plateformes commerciales et ne compare pas les résultats de détection, faute de chiffres comparables dans les sources.
- Les licences ont été relevées sur les pages des dépôts et dans les tableaux de licences. Elles doivent être vérifiées avant toute redistribution, en particulier les Llama Community Licences et les conditions LGPL de fickling.
- La couche réseau voit des connexions, non leur signification. Une destination autorisée peut tout de même recevoir des données d’un environnement d’exécution de modèle compromis.
Le rôle de FireAI et de HisnLabs
Analysez le modèle, signez le modèle, testez le modèle. Puis décidez où son app peut se connecter.
FireAI est le produit de HisnLabs : un pare-feu IA embarqué pour Mac. Il montre en langage clair chaque connexion faite par vos applications et vous laisse décider ce qui sort de votre Mac — son IA fonctionne en local, votre trafic ne nous est jamais envoyé, ni à personne d’autre. L’équipe de recherche en sécurité de HisnLabs est celle qui garde ces décisions fiables : elle recense les domaines de simple télémétrie face à ceux d’un vrai service, suit le pays et le réseau derrière une connexion, et entraîne le modèle embarqué (la fonction FireAI Pilot) sur du trafic réel, sans que rien ne quitte votre Mac.
Vous pouvez lire les choix techniques qui s’y trouvent, ou essayer FireAI pendant 17 jours, sur FireAI, par HisnLabs.
