La seguridad de modelos de IA no es una sola disciplina sino seis tareas, cada una con sus propias herramientas: escanear archivos de modelos, establecer su procedencia, examinar un modelo en busca de debilidades, protegerlo en tiempo de ejecución, revisar las herramientas de agentes que lo rodean y limitar adónde puede conectarse la aplicación que lo aloja. Este repaso, preparado por HisnLabs, desarrollador de FireAI, cubre herramientas abiertas cuyos repositorios o documentación se leyeron el 30 de septiembre de 2026. Las licencias, los mantenedores y el estado se indican tal como los dan las fuentes primarias, y ninguna herramienta se clasifica por encima de otra, porque las tareas no compiten entre sí.
Alcance y método
Cada herramienta se incluyó solo si se pudo abrir su repositorio o documentación oficial, identificar su licencia y comprobar su estado de mantenimiento (archivada o activa, y la fecha de su última versión cuando la página de versiones la muestra). Las versiones mencionadas abajo son las más recientes al momento de la lectura. Nada de esto es una medición de desempeño: las fuentes no ofrecen resultados de detección comparables, y no se afirma ninguno. Las plataformas comerciales se omiten salvo que el tema sea un componente abierto.
Las categorías siguen el orden en que un modelo avanza por un proyecto: se descarga un archivo, se comprueba su origen, se prueba el modelo, se despliega detrás de protecciones, se conecta a herramientas y la aplicación que lo ejecuta llega a la red. El OWASP Top 10 for Large Language Model Applications, mantenido dentro del OWASP GenAI Security Project, es el vocabulario común habitual para los riesgos a nivel de aplicación de las categorías tres a cinco.
1. Escaneo de archivos de modelos
Muchos archivos de modelos se serializan con el formato pickle de Python, que puede ejecutar código al cargarse. La documentación de Hugging Face indica que cargar un pickle “significa que se puede ejecutar código” y señala los opcodes GLOBAL, STACK_GLOBAL y REDUCE como los que representan la amenaza. Hugging Face: Pickle scanning Los escáneres leen las instrucciones del archivo sin cargarlo y marcan las importaciones peligrosas.
ModelScan
ModelScan lo mantiene Protect AI bajo la licencia Apache-2.0. Escanea formatos basados en pickle (PyTorch, scikit-learn, XGBoost, joblib, cloudpickle), TensorFlow SavedModel y archivos Keras H5 y V3, clasifica los hallazgos por severidad y termina con códigos de salida adecuados para pipelines de CI. La última versión en su página es la v0.8.8 del 18 de febrero de 2026, y el repositorio mostraba actividad el 28 de septiembre de 2026. Úsalo como filtro antes de que un modelo descargado entre en un build. Limitación: el README describe una detección basada en firmas que puede producir falsos positivos y falsos negativos, y los hallazgos requieren revisión humana.
picklescan
picklescan es un escáner con licencia MIT mantenido por una cuenta individual, mmaitre314. La documentación de Hugging Face menciona picklescan entre las herramientas que ha desarrollado para el Hub. La última versión es la v1.0.5 del 1 de julio de 2026. Escanea archivos pickle, archivos de PyTorch y contenedores ZIP, y puede escanear una ruta local, una URL o un modelo de Hugging Face. Úsalo para una comprobación rápida en un script. Limitación: identifica operaciones peligrosas por patrón, así que una técnica nueva puede pasar, y reporta los hallazgos sin eliminarlos.
fickling
fickling, de Trail of Bits, tiene licencia LGPL-3.0. Se describe como un descompilador, analizador estático y reescritor de bytecode para pickle. Puede descompilar un pickle a Python legible, comprobar la seguridad mediante análisis estático y lanzar un error antes de cargar un archivo inseguro. La última versión es la v0.1.12 del 26 de junio de 2026. Úsalo cuando un hallazgo deba entenderse y no solo marcarse. Limitación: es una herramienta de análisis para pickle y no cubre los otros formatos que lee ModelScan. Los términos de su licencia difieren de las licencias permisivas de los demás escáneres.
Escaneo del Hugging Face Hub y safetensors
El Hub escanea cada archivo subido con ClamAV y con un escaneo de importaciones de pickle que enumera las importaciones dentro de cada archivo serializado y resalta las sospechosas. Hugging Face: file scanning También muestra los resultados de un escáner de terceros, Guardian de Protect AI, en los repositorios públicos. Hugging Face: Protect AI Limitación, tal como la expresa Hugging Face: el escaneo de pickle no es completamente infalible, sus listas se mantienen en la medida de lo posible y es responsabilidad del usuario comprobar qué es seguro. La alternativa estructural es safetensors, un formato Apache-2.0 mantenido por Hugging Face que almacena tensores sin contenido ejecutable. Elimina el riesgo de pickle para los pesos, pero no dice si los pesos en sí son confiables.
2. Procedencia, firma y huella digital de modelos
El escaneo pregunta si un archivo es peligroso de cargar. La procedencia pregunta quién lo produjo y si cambió desde entonces. Las dos preguntas requieren herramientas distintas.
Sigstore model-transparency
model-transparency es un proyecto Apache-2.0 de la organización Sigstore que firma y verifica modelos de machine learning. Puede firmar mediante Sigstore, o con claves, certificados o dispositivos PKCS #11, y produce un paquete que contiene un sobre DSSE con una declaración in-toto. Su última versión es la v1.1.1 del 10 de octubre de 2025, con commits en septiembre de 2026. Úsalo para que un consumidor pueda verificar que los archivos que tiene son los que firmó un publicador. Limitaciones: la documentación indica soporte para el hash de archivos y fragmentos de archivos, no de tensores individuales, y una firma válida demuestra origen e integridad, no que el modelo sea seguro. Hugging Face hace la misma distinción para los commits firmados, que garantizan “el origen del archivo” y no que sea seguro.
Listas de materiales de IA y ML
CycloneDX, mantenido por la OWASP Foundation y el TC54 de Ecma International, incluye un Machine Learning Bill of Materials (ML-BOM) entre sus tipos de BOM admitidos. Su última versión, la 1.7, se publicó el 21 de octubre de 2025, y sus esquemas son Apache-2.0. El perfil de IA de SPDX 3.0 documenta componentes de IA como modelos, conjuntos de datos y prompts en un solo registro conectado. Usa cualquiera de los dos para mantener un inventario de los modelos, conjuntos de datos y versiones que contiene un producto, que es lo primero que necesita una respuesta a incidentes. Limitación: una BOM registra lo que declara un autor. Ninguno de los dos formatos verifica la declaración.
Herramientas de investigación de huella digital y marca de agua
Instructional Fingerprinting es el código de un artículo académico (arXiv 2401.12255) que inserta una huella digital en un modelo de lenguaje para que su propietario pueda comprobar después si otro modelo deriva de él. Es código de investigación con licencia MIT, y la última actualización de su repositorio fue en julio de 2024. MarkLLM, del grupo THU-BPM, es un kit de herramientas Apache-2.0 para poner marcas de agua en el texto que genera un LLM, presentado como demo en EMNLP 2024. Los dos responden preguntas distintas: el primero marca un modelo, el segundo marca su salida. Úsalos para estudiar la atribución, no como control de producción. Limitación: ambos son artefactos de investigación, y ninguno sustituye la firma de un archivo distribuido.
3. Red teaming de LLM y escaneo de vulnerabilidades
Estas herramientas envían entradas adversariales a un modelo o una aplicación y registran cómo responde. Prueban el comportamiento, no los archivos.
garak
garak es un escáner de vulnerabilidades de LLM con licencia Apache-2.0 mantenido por NVIDIA. Su README dice que comprueba “si se puede hacer que un LLM falle de una forma que no queremos”, con sondas para inyección de prompts, fuga de datos, alucinaciones, toxicidad y jailbreaks, cada una emparejada con un detector. La última versión es la v0.17.0 del 9 de septiembre de 2026. Úsalo como un escaneo de referencia amplio de un endpoint de modelo. Limitaciones: necesita acceso por API o un despliegue local del objetivo, algunas sondas consumen muchos recursos, y el README señala un soporte limitado para modelos de visión y el estado de prototipo de algunas sondas.
PyRIT
PyRIT es un framework con licencia MIT descrito como construido para que profesionales e ingenieros de seguridad identifiquen riesgos en sistemas de IA generativa. Lo mantiene Microsoft, y la última versión es la v1.1.0 del 4 de septiembre de 2026. El repositorio anterior, bajo la organización Azure, se archivó el 27 de marzo de 2026 con un enlace al de Microsoft, así que los enlaces a la dirección antigua llevan a una copia de solo lectura. Úsalo para campañas de red team guionizadas y de varios turnos, en un equipo que vaya a escribir código. Limitación: es un framework, no un escáner de un solo comando.
promptfoo
promptfoo es una herramienta de línea de comandos y biblioteca con licencia MIT para evaluar aplicaciones de LLM y para red teaming y escaneo de vulnerabilidades, con integración en CI. La última versión es la 0.123.1 del 18 de septiembre de 2026. Su README indica: “Promptfoo is now part of OpenAI. Promptfoo remains open source and MIT licensed.” Úsalo para incorporar pruebas de prompts y comprobaciones adversariales en un build. Limitación: los resultados dependen del proveedor y del juez configurados, y la mayoría de los proveedores requieren claves de API. El cambio de propietario es un hecho de gobernanza que conviene tener en cuenta al elegir una herramienta para trabajo regulado.
Giskard
Giskard es una biblioteca de Python con licencia Apache-2.0 de la organización Giskard-AI. Su versión 3 tiene dos componentes descritos como estables: giskard-checks, un framework de pruebas con escenarios y evaluaciones LLM-as-judge, y giskard-scan, un escáner de vulnerabilidades de agentes. Úsala para probar agentes y sistemas con generación aumentada por recuperación. Limitaciones: la versión 3 requiere Python 3.12 o posterior, y la versión 2, que cubría el escaneo de datos tabulares y de machine learning clásico, ya no se mantiene activamente.
4. Protecciones en tiempo de ejecución y detección de inyección de prompts
Las protecciones se ubican en la ruta de las solicitudes y clasifican o restringen las entradas y salidas mientras la aplicación se ejecuta.
Llama Guard, Prompt Guard y LlamaFirewall
El proyecto Purple Llama de Meta agrupa salvaguardas para modelos abiertos. Llama Guard es una familia de modelos de moderación de entradas y salidas. Prompt Guard 2 se describe como un clasificador ligero para intentos directos de inyección de prompts, y LlamaFirewall lo combina con un escáner de verificación de alineación y un escáner de código para agentes. Según la tabla de licencias del proyecto, los modelos se distribuyen bajo las Llama Community Licences y otros componentes, como Code Shield y las evaluaciones, son MIT. Los modelos en Hugging Face tienen acceso restringido. Úsalos donde sea aceptable un clasificador pequeño delante de un modelo. Limitaciones: un clasificador reduce los intentos que se parecen a patrones conocidos y no elimina esa clase de ataque.
NeMo Guardrails
NeMo Guardrails es un kit de herramientas Apache-2.0 de NVIDIA para agregar rieles programables a aplicaciones de LLM, con un lenguaje de modelado llamado Colang para controlar el flujo del diálogo. La última versión es la v0.24.1 del 16 de septiembre de 2026. Úsalo para restringir temas, formatos y rutas de diálogo. Limitación: los rieles son políticas que escribe el desarrollador, así que su cobertura solo es tan amplia como lo que se previó.
Rebuff y LLM Guard, ahora archivados
Rebuff, un detector de inyección de prompts que se refuerza solo, con heurísticas, una comprobación con LLM, un almacén vectorial de ataques anteriores y tokens canario, se archivó el 16 de mayo de 2025. Su README indica que es un prototipo y que no puede ofrecer una protección completa contra la inyección de prompts. LLM Guard, un kit de herramientas con licencia MIT de escáneres de entrada y salida del mismo mantenedor, se archivó en julio de 2026. Ambos siguen disponibles para consulta. Ilustran un punto práctico: los proyectos de detección pueden perder a sus mantenedores, así que una protección debe ser reemplazable.
5. Escáneres de seguridad para agentes y MCP
Los agentes agregan herramientas, y las descripciones de las herramientas son texto que lee el modelo. Los escáneres de este grupo inspeccionan esas herramientas y su configuración.
Snyk Agent Scan
Agent Scan, antes MCP-Scan, es un escáner Apache-2.0 mantenido por Snyk. Descubre los componentes de agentes en una máquina, incluidos servidores MCP y skills en clientes como Claude, Cursor, VS Code y GitHub Copilot, y los revisa en busca de inyección de prompts, envenenamiento de herramientas y problemas relacionados. La última versión es la v0.6.8 del 29 de septiembre de 2026. Úsalo para auditar lo que tiene instalado una máquina de desarrollo. Limitaciones: el README indica que por ahora no acepta contribuciones externas y que existen dos líneas de versiones con formatos de salida distintos.
Cisco MCP Scanner
MCP Scanner es una herramienta Apache-2.0 de Cisco AI Defense. Analiza herramientas, prompts, recursos y dependencias de MCP con tres motores que pueden ejecutarse por separado o juntos: reglas YARA, análisis con LLM y la API de Cisco AI Defense. La última versión es la 4.8.4 del 28 de agosto de 2026. Úsalo para revisar un servidor antes de adoptarlo. Limitación: los motores de LLM y de API necesitan credenciales externas, y un escaneo de la descripción de un servidor dice poco sobre lo que hace su código después de una actualización.
6. El papel de los controles de red
Las herramientas anteriores examinan archivos, modelos, prompts y configuraciones. Ninguna decide qué aplicación puede abrir una conexión con qué servidor. Ese es el papel del control de salida, y importa porque los riesgos de las secciones anteriores convergen en la red: un runtime de modelo manipulado, una herramienta envenenada o un agente inyectado tiene que llegar a un destino para extraer datos o recibir instrucciones.
FireAI, desarrollado por HisnLabs, es un firewall de salida para macOS. Funciona como filtro de contenido de Network Extension de Apple, identifica cada app por su firma de código y puede permitir, bloquear o preguntar para cada destino, con reglas por app, dominio o dirección. Aplicado al trabajo con IA en una Mac, esto significa que un servidor de inferencia, un agente de programación o un cliente MCP pueden limitarse a los destinos que su tarea necesita, y un destino nuevo exige una decisión. La documentación del filtro describe lo que ve FireAI: la identidad de la app, el host o la dirección remota, el puerto y el protocolo.
FireAI no escanea archivos de modelos, no verifica firmas, no hace red teaming de un modelo ni clasifica prompts. No lee el contenido de las conexiones cifradas, así que no puede distinguir una solicitud legítima de una inyectada cuando ambas van a un destino permitido. Complementa las herramientas anteriores y no reemplaza a ninguna.
Comparación
| Herramienta | Tarea | Mantenedor | Licencia | Estado visto el 30 de sep. de 2026 |
|---|---|---|---|---|
| ModelScan | Escaneo de archivos de modelos | Protect AI | Apache-2.0 | Activo, v0.8.8 |
| picklescan | Escaneo de pickle | mmaitre314 | MIT | Activo, v1.0.5 |
| fickling | Análisis de pickle | Trail of Bits | LGPL-3.0 | Activo, v0.1.12 |
| safetensors | Formato seguro de pesos | Hugging Face | Apache-2.0 | Activo |
| model-transparency | Firma de modelos | Sigstore | Apache-2.0 | Activo, v1.1.1 |
| CycloneDX | Especificación ML-BOM | OWASP, Ecma TC54 | Apache-2.0 (esquemas) | Activo, 1.7 |
| Instructional Fingerprinting | Huella digital de modelos (investigación) | Autores del artículo | MIT | Última actualización en julio de 2024 |
| MarkLLM | Marca de agua en texto (investigación) | THU-BPM | Apache-2.0 | Activo |
| garak | Escaneo de vulnerabilidades | NVIDIA | Apache-2.0 | Activo, v0.17.0 |
| PyRIT | Framework de red team | Microsoft | MIT | Activo, v1.1.0 |
| promptfoo | Evaluaciones y red teaming | Promptfoo, parte de OpenAI | MIT | Activo, 0.123.1 |
| Giskard v3 | Pruebas y escaneo de agentes | Giskard-AI | Apache-2.0 | Activo; v2 sin mantenimiento |
| Llama Guard, Prompt Guard | Modelos de protección | Meta | Llama Community Licences | Modelos fechados en abril de 2025 |
| NeMo Guardrails | Rieles programables | NVIDIA | Apache-2.0 | Activo, v0.24.1 |
| Rebuff, LLM Guard | Detección de inyecciones | Protect AI | Apache-2.0, MIT | Archivado |
| Agent Scan | Escaneo de agentes y MCP | Snyk | Apache-2.0 | Activo, v0.6.8 |
| MCP Scanner | Escaneo de servidores MCP | Cisco AI Defense | Apache-2.0 | Activo, 4.8.4 |
| FireAI | Control de salida por app en macOS | HisnLabs | Comercial | No escanea modelos |
Limitaciones
- Ninguna herramienta cubre las seis tareas. Un escaneo de archivo limpio no dice nada del comportamiento de un modelo, una firma no dice nada de su seguridad y un escaneo de red team no dice nada del contenido de un archivo.
- Los escáneres y las protecciones son detectores. Pueden pasar por alto técnicas nuevas, como reconoce la documentación de ModelScan, picklescan y Rebuff, y su cobertura cambia a medida que cambian los ataques.
- El mantenimiento es desigual. Dos proyectos de detección de esta lista están archivados, una herramienta cambió de propietario, otra tiene un mantenedor individual y un repositorio de investigación no ha cambiado desde 2024. Revisa el estado de un proyecto antes de construir sobre él.
- Este repaso se limitó a herramientas abiertas con fuentes primarias que se pudieron leer. Excluye las plataformas comerciales y no compara resultados de detección, porque las fuentes no ofrecen cifras comparables.
- Las licencias se leyeron de las páginas de los repositorios y de las tablas de licencias. Verifícalas antes de redistribuir, en particular las Llama Community Licences y los términos LGPL de fickling.
- La capa de red ve conexiones, no significados. Un destino permitido todavía puede recibir datos de un runtime de modelo comprometido.
Dónde entran FireAI y HisnLabs
Escanea el modelo, fírmalo y pruébalo. Después decide adónde puede conectarse su app.
FireAI es el producto de HisnLabs: un firewall con IA que corre directamente en tu Mac. Te muestra, en lenguaje claro, cada conexión que hacen tus aplicaciones y te deja decidir qué sale de tu Mac; su IA funciona de manera local, así que tu tráfico nunca se envía a nosotros ni a nadie más. El equipo de investigación en seguridad de HisnLabs es el que mantiene esas decisiones confiables: cataloga qué dominios son simple telemetría y cuáles un servicio real, rastrea el país y la red detrás de cada conexión, y entrena el modelo local (la función FireAI Pilot) con patrones de tráfico reales, sin que nada de eso salga de tu Mac.
Puedes leer las decisiones técnicas detrás de FireAI, o probarlo durante 17 días, en FireAI, de HisnLabs.
