La seguridad de los modelos de IA no es una disciplina, sino seis tareas, cada una con sus herramientas: analizar archivos de modelos, establecer su procedencia, sondear un modelo en busca de debilidades, protegerlo en tiempo de ejecución, revisar las herramientas de agente que lo rodean y limitar a dónde puede conectarse la aplicación que lo aloja. Este repaso, elaborado por HisnLabs, desarrollador de FireAI, abarca herramientas abiertas cuyos repositorios o documentación se consultaron el 30 de septiembre de 2026. Las licencias, los mantenedores y el estado se indican tal como los recogen las fuentes primarias, y ninguna herramienta se sitúa por encima de otra, porque las tareas no compiten entre sí.
Alcance y método
Solo se incluyó una herramienta si su repositorio o documentación oficial podía abrirse, su licencia podía identificarse y su estado de mantenimiento podía comprobarse (archivada o activa, y la fecha de su última versión cuando la página de versiones la muestra). Las versiones citadas son las más recientes en el momento de la consulta. Nada de lo que sigue es una medición de rendimiento: las fuentes no ofrecen resultados de detección comparables y no se afirma ninguno. Las plataformas comerciales se omiten salvo que el objeto sea un componente abierto.
Las categorías siguen el orden en que un modelo avanza por un proyecto: se descarga un archivo, se comprueba su origen, se prueba el modelo, se despliega tras unas protecciones, se conecta a herramientas y la aplicación que lo ejecuta accede a la red. El OWASP Top 10 for Large Language Model Applications, mantenido dentro del OWASP GenAI Security Project, es el vocabulario común habitual para los riesgos de nivel de aplicación de las categorías tres a cinco.
1. Análisis de archivos de modelos
Muchos archivos de modelos se serializan con el formato pickle de Python, que puede ejecutar código al cargarse. La documentación de Hugging Face indica que cargar un pickle «means that code can be executed» y señala los opcodes GLOBAL, STACK_GLOBAL y REDUCE como los que suponen la amenaza. Hugging Face: Pickle scanning Los escáneres leen las instrucciones del archivo sin cargarlo y marcan las importaciones peligrosas.
ModelScan
ModelScan lo mantiene Protect AI con licencia Apache-2.0. Analiza formatos basados en pickle (PyTorch, scikit-learn, XGBoost, joblib, cloudpickle), TensorFlow SavedModel y archivos Keras H5 y V3, clasifica los hallazgos por gravedad y termina con códigos de salida adaptados a pipelines de CI. La última versión que figura en su página es la v0.8.8, del 18 de febrero de 2026, y el repositorio mostraba actividad el 28 de septiembre de 2026. Conviene usarlo como filtro antes de que un modelo descargado entre en una compilación. Limitación: el README describe una detección basada en firmas que puede producir falsos positivos y falsos negativos, y los hallazgos requieren revisión humana.
picklescan
picklescan es un escáner con licencia MIT mantenido por una cuenta individual, mmaitre314. La documentación de Hugging Face cita picklescan entre las herramientas que ha desarrollado para el Hub. La última versión es la v1.0.5, del 1 de julio de 2026. Analiza archivos pickle, archivos de PyTorch y contenedores ZIP, y puede examinar una ruta local, una URL o un modelo de Hugging Face. Resulta útil para una comprobación rápida en un script. Limitación: detecta las operaciones peligrosas por patrones, de modo que una técnica nueva puede pasar inadvertida, e informa de los hallazgos sin eliminarlos.
fickling
fickling, de Trail of Bits, tiene licencia LGPL-3.0. Se describe como un descompilador, analizador estático y reescritor de bytecode para pickle. Puede descompilar un pickle a Python legible, comprobar su seguridad mediante análisis estático y lanzar un error antes de cargar un archivo inseguro. La última versión es la v0.1.12, del 26 de junio de 2026. Conviene usarlo cuando un hallazgo debe entenderse, no solo marcarse. Limitación: es una herramienta de análisis para pickle y no cubre los demás formatos que lee ModelScan. Sus condiciones de licencia difieren de las licencias permisivas de los demás escáneres.
Análisis del Hugging Face Hub y safetensors
El Hub analiza cada archivo subido con ClamAV y con un análisis de importaciones pickle que enumera las importaciones de cada archivo serializado y resalta las sospechosas. Hugging Face: file scanning También muestra en los repositorios públicos los resultados de un escáner de terceros, Guardian de Protect AI. Hugging Face: Protect AI Limitación, según la propia Hugging Face: el análisis de pickle no es totalmente infalible, sus listas se mantienen en la medida de lo posible y es responsabilidad del usuario comprobar qué es seguro. La alternativa estructural es safetensors, un formato con licencia Apache-2.0 mantenido por Hugging Face que almacena tensores sin contenido ejecutable. Elimina el riesgo de pickle para los pesos, pero no indica si los propios pesos son fiables.
2. Procedencia, firma y huella digital de modelos
El análisis pregunta si un archivo es peligroso de cargar. La procedencia pregunta quién lo produjo y si ha cambiado desde entonces. Las dos preguntas requieren herramientas distintas.
Sigstore model-transparency
model-transparency es un proyecto con licencia Apache-2.0 de la organización Sigstore que firma y verifica modelos de aprendizaje automático. Puede firmar mediante Sigstore o con claves, certificados o dispositivos PKCS #11, y genera un paquete que contiene un sobre DSSE con una declaración in-toto. Su última versión es la v1.1.1, del 10 de octubre de 2025, con commits en septiembre de 2026. Sirve para que un consumidor verifique que los archivos que tiene son los que firmó un editor. Limitaciones: la documentación indica que admite el hash de archivos y fragmentos de archivo, no de tensores individuales, y una firma válida demuestra el origen y la integridad, no que el modelo sea seguro. Hugging Face hace la misma distinción para los commits firmados, que garantizan «the origin of the file» y no que sea seguro.
Listas de materiales de IA y ML
CycloneDX, mantenido por la OWASP Foundation y el TC54 de Ecma International, incluye un Machine Learning Bill of Materials (ML-BOM) entre los tipos de BOM que admite. Su última versión, la 1.7, se publicó el 21 de octubre de 2025, y sus esquemas tienen licencia Apache-2.0. El perfil de IA de SPDX 3.0 documenta componentes de IA como modelos, conjuntos de datos y prompts en un único registro conectado. Cualquiera de los dos sirve para mantener un inventario de los modelos, conjuntos de datos y versiones que contiene un producto, que es lo primero que necesita una respuesta a incidentes. Limitación: una BOM registra lo que declara un autor. Ninguno de los dos formatos verifica la declaración.
Herramientas de investigación de huella digital y marcas de agua
Instructional Fingerprinting es el código de un artículo académico (arXiv 2401.12255) que inserta una huella digital en un modelo de lenguaje para que su propietario pueda comprobar más adelante si otro modelo deriva de él. Es código de investigación con licencia MIT, y la última actualización del repositorio data de julio de 2024. MarkLLM, del grupo THU-BPM, es un conjunto de herramientas con licencia Apache-2.0 para insertar marcas de agua en el texto que genera un LLM, presentado como demo en EMNLP 2024. Ambos responden a preguntas distintas: el primero marca un modelo y el segundo marca su salida. Sirven para estudiar la atribución, no como control en producción. Limitación: ambos son artefactos de investigación y ninguno sustituye a la firma de un archivo distribuido.
3. Red teaming de LLM y análisis de vulnerabilidades
Estas herramientas envían entradas adversarias a un modelo o una aplicación y registran cómo responde. Prueban el comportamiento, no los archivos.
garak
garak es un escáner de vulnerabilidades de LLM con licencia Apache-2.0 mantenido por NVIDIA. Su README indica que comprueba «if an LLM can be made to fail in a way we don’t want», con sondas para inyección de prompts, fuga de datos, alucinaciones, toxicidad y jailbreaks, cada una emparejada con un detector. La última versión es la v0.17.0, del 9 de septiembre de 2026. Sirve como análisis de referencia amplio de un endpoint de modelo. Limitaciones: necesita acceso por API o un despliegue local del objetivo, algunas sondas consumen muchos recursos y el README señala una compatibilidad limitada con modelos de visión y el carácter de prototipo de algunas sondas.
PyRIT
PyRIT es un framework con licencia MIT descrito como concebido para que profesionales e ingenieros de seguridad identifiquen riesgos en sistemas de IA generativa. Lo mantiene Microsoft, y la última versión es la v1.1.0, del 4 de septiembre de 2026. El repositorio anterior, bajo la organización Azure, se archivó el 27 de marzo de 2026 con un enlace al de Microsoft, de modo que los enlaces a la dirección antigua llevan a una copia de solo lectura. Sirve para campañas de red team guionizadas y de varios turnos a cargo de un equipo que vaya a escribir código. Limitación: es un framework, no un escáner de un solo comando.
promptfoo
promptfoo es una herramienta de línea de comandos y una biblioteca con licencia MIT para evaluar aplicaciones LLM y para red teaming y análisis de vulnerabilidades, con integración en CI. La última versión es la 0.123.1, del 18 de septiembre de 2026. Su README indica: «Promptfoo is now part of OpenAI. Promptfoo remains open source and MIT licensed.» Sirve para incorporar pruebas de prompts y comprobaciones adversarias a una compilación. Limitación: los resultados dependen del proveedor y del juez configurados, y la mayoría de los proveedores requieren claves de API. El cambio de propiedad es un dato de gobernanza que conviene tener en cuenta al elegir una herramienta para trabajos regulados.
Giskard
Giskard es una biblioteca de Python con licencia Apache-2.0 de la organización Giskard-AI. Su versión 3 tiene dos componentes descritos como estables: giskard-checks, un framework de pruebas basado en escenarios y evaluaciones con un LLM como juez, y giskard-scan, un escáner de vulnerabilidades de agentes. Sirve para probar agentes y sistemas de generación aumentada por recuperación. Limitaciones: la versión 3 requiere Python 3.12 o posterior, y la versión 2, que cubría el análisis de aprendizaje automático tabular y clásico, ya no recibe mantenimiento activo.
4. Protecciones en tiempo de ejecución y detección de inyección de prompts
Las protecciones se sitúan en la ruta de las solicitudes y clasifican o restringen las entradas y salidas mientras la aplicación se ejecuta.
Llama Guard, Prompt Guard y LlamaFirewall
El proyecto Purple Llama de Meta reúne salvaguardas para modelos abiertos. Llama Guard es una familia de modelos de moderación de entradas y salidas. Prompt Guard 2 se describe como un clasificador ligero para intentos directos de inyección de prompts, y LlamaFirewall lo combina con un escáner de comprobación de alineamiento y un escáner de código para agentes. Según la tabla de licencias del proyecto, los modelos se distribuyen con las Llama Community Licences y otros componentes, como Code Shield y las evaluaciones, tienen licencia MIT. Los modelos en Hugging Face son de acceso restringido. Conviene usarlos cuando es aceptable un pequeño clasificador delante de un modelo. Limitaciones: un clasificador reduce los intentos que se parecen a patrones conocidos, pero no elimina la clase de ataque.
NeMo Guardrails
NeMo Guardrails es un conjunto de herramientas con licencia Apache-2.0 de NVIDIA para añadir barreras programables a aplicaciones LLM, mediante un lenguaje de modelado llamado Colang que controla el flujo del diálogo. La última versión es la v0.24.1, del 16 de septiembre de 2026. Sirve para restringir temas, formatos y recorridos de diálogo. Limitación: las barreras son políticas escritas por el desarrollador, así que su cobertura solo es tan amplia como lo que se haya previsto.
Rebuff y LLM Guard, ya archivados
Rebuff, un detector de inyección de prompts autorreforzado con heurísticas, una comprobación mediante LLM, una base vectorial de ataques anteriores y tokens canario, se archivó el 16 de mayo de 2025. Su README indica que es un prototipo y que no puede ofrecer una protección completa frente a la inyección de prompts. LLM Guard, un conjunto de escáneres de entrada y salida con licencia MIT del mismo mantenedor, se archivó en julio de 2026. Ambos siguen disponibles para consulta. Ilustran una cuestión práctica: los proyectos de detección pueden perder a sus mantenedores, por lo que una protección debe poder sustituirse.
5. Escáneres de seguridad de agentes y MCP
Los agentes añaden herramientas, y las descripciones de las herramientas son texto que lee el modelo. Los escáneres de este grupo inspeccionan esas herramientas y su configuración.
Snyk Agent Scan
Agent Scan, antes MCP-Scan, es un escáner con licencia Apache-2.0 mantenido por Snyk. Detecta los componentes de agentes presentes en un equipo, incluidos servidores MCP y skills en clientes como Claude, Cursor, VS Code y GitHub Copilot, y comprueba si presentan inyección de prompts, envenenamiento de herramientas y problemas relacionados. La última versión es la v0.6.8, del 29 de septiembre de 2026. Sirve para auditar lo que tiene instalado el equipo de un desarrollador. Limitaciones: el README indica que por ahora no acepta contribuciones externas y que existen dos líneas de versiones con formatos de salida distintos.
Cisco MCP Scanner
MCP Scanner es una herramienta con licencia Apache-2.0 de Cisco AI Defense. Analiza herramientas, prompts, recursos y dependencias de MCP con tres motores que pueden funcionar por separado o juntos: reglas YARA, análisis mediante LLM y la API de Cisco AI Defense. La última versión es la 4.8.4, del 28 de agosto de 2026. Sirve para revisar un servidor antes de adoptarlo. Limitación: los motores de LLM y de API necesitan credenciales externas, y el análisis de la descripción de un servidor dice poco sobre lo que hace su código tras una actualización.
6. El lugar de los controles de red
Las herramientas anteriores examinan archivos, modelos, prompts y configuraciones. Ninguna decide qué aplicación puede abrir una conexión con qué servidor. Esa es la función del control del tráfico saliente, y es relevante porque los riesgos de las secciones anteriores convergen en la red: un entorno de ejecución de modelos manipulado, una herramienta envenenada o un agente sometido a inyección tienen que llegar a un destino para exfiltrar datos o recibir instrucciones.
FireAI, desarrollado por HisnLabs, es un cortafuegos de salida para macOS. Funciona como filtro de contenido de Network Extension de Apple, identifica cada app por su firma de código y puede permitir, bloquear o preguntar por cada destino, con reglas por app, dominio o dirección. Aplicado al trabajo con IA en un Mac, esto significa que un servidor de inferencia, un agente de programación o un cliente MCP pueden limitarse a los destinos que necesita su tarea, y que un destino nuevo exige una decisión. La documentación del filtro describe lo que ve FireAI: la identidad de la app, el host o la dirección remotos, el puerto y el protocolo.
FireAI no analiza archivos de modelos, no verifica firmas, no hace red teaming de un modelo ni clasifica prompts. No lee el contenido de las conexiones cifradas, por lo que no puede distinguir una solicitud legítima de una inyectada cuando ambas van a un destino permitido. Complementa las herramientas anteriores y no sustituye a ninguna.
Comparación
| Herramienta | Tarea | Mantenedor | Licencia | Estado a 30 sep 2026 |
|---|---|---|---|---|
| ModelScan | Análisis de archivos de modelos | Protect AI | Apache-2.0 | Activa, v0.8.8 |
| picklescan | Análisis de pickle | mmaitre314 | MIT | Activa, v1.0.5 |
| fickling | Análisis en profundidad de pickle | Trail of Bits | LGPL-3.0 | Activa, v0.1.12 |
| safetensors | Formato seguro de pesos | Hugging Face | Apache-2.0 | Activa |
| model-transparency | Firma de modelos | Sigstore | Apache-2.0 | Activa, v1.1.1 |
| CycloneDX | Especificación ML-BOM | OWASP, Ecma TC54 | Apache-2.0 (esquemas) | Activa, 1.7 |
| Instructional Fingerprinting | Huella digital de modelos (investigación) | Autores del artículo | MIT | Última actualización en julio de 2024 |
| MarkLLM | Marcas de agua en texto (investigación) | THU-BPM | Apache-2.0 | Activa |
| garak | Análisis de vulnerabilidades | NVIDIA | Apache-2.0 | Activa, v0.17.0 |
| PyRIT | Framework de red team | Microsoft | MIT | Activa, v1.1.0 |
| promptfoo | Evaluaciones y red teaming | Promptfoo, parte de OpenAI | MIT | Activa, 0.123.1 |
| Giskard v3 | Pruebas y análisis de agentes | Giskard-AI | Apache-2.0 | Activa; v2 sin mantenimiento |
| Llama Guard, Prompt Guard | Modelos de protección | Meta | Llama Community Licences | Modelos de abril de 2025 |
| NeMo Guardrails | Barreras programables | NVIDIA | Apache-2.0 | Activa, v0.24.1 |
| Rebuff, LLM Guard | Detección de inyección | Protect AI | Apache-2.0, MIT | Archivadas |
| Agent Scan | Análisis de agentes y MCP | Snyk | Apache-2.0 | Activa, v0.6.8 |
| MCP Scanner | Análisis de servidores MCP | Cisco AI Defense | Apache-2.0 | Activa, 4.8.4 |
| FireAI | Control del tráfico saliente por app en macOS | HisnLabs | Comercial | No analiza modelos |
Limitaciones
- Ninguna herramienta cubre por sí sola las seis tareas. Un análisis de archivo sin hallazgos no dice nada del comportamiento de un modelo, una firma no dice nada de su seguridad y un análisis de red team no dice nada del contenido de un archivo.
- Los escáneres y las protecciones son detectores. Pueden pasar por alto técnicas nuevas, como reconoce la documentación de ModelScan, picklescan y Rebuff, y su cobertura cambia a medida que cambian los ataques.
- El mantenimiento es desigual. Dos de los proyectos de detección citados están archivados, una herramienta ha cambiado de propietario, otra tiene un único mantenedor individual y un repositorio de investigación no ha cambiado desde 2024. Conviene comprobar el estado de un proyecto antes de construir sobre él.
- Este repaso se limitó a herramientas abiertas con fuentes primarias consultables. Excluye las plataformas comerciales y no compara resultados de detección, porque las fuentes no ofrecen cifras comparables.
- Las licencias se tomaron de las páginas de los repositorios y de las tablas de licencias. Conviene verificarlas antes de redistribuir, en particular las Llama Community Licences y las condiciones LGPL de fickling.
- La capa de red ve conexiones, no significado. Un destino permitido puede seguir recibiendo datos de un entorno de ejecución de modelos comprometido.
El papel de FireAI y de HisnLabs
Analiza el modelo, fírmalo, ponlo a prueba. Después, decide a dónde puede conectarse su app.
FireAI es el propio producto de HisnLabs: un cortafuegos con IA integrada para Mac. Muestra, en lenguaje claro, cada conexión que hacen tus aplicaciones y te deja decidir qué sale de tu Mac; su IA funciona en el propio equipo, así que tu tráfico nunca se envía a HisnLabs ni a nadie más. El equipo de investigación en seguridad de HisnLabs es quien mantiene esas decisiones fiables: cataloga qué dominios son simple telemetría frente a un servicio real, sigue el país y la red detrás de una conexión, y entrena el modelo local (la función FireAI Pilot) con tráfico real, sin que nada salga de tu Mac.
Puedes leer las decisiones técnicas detrás de esto, o probar FireAI durante 17 días, en FireAI, de HisnLabs.
