O blog de segurança da FireAI

Por FireAI Security & Research Team · Publicado

As melhores ferramentas de 2026 para a segurança de modelos de IA

As melhores ferramentas de 2026 para a segurança de modelos de IA

A segurança de modelos de IA não é uma disciplina única, e sim seis tarefas, cada uma com suas ferramentas: examinar arquivos de modelos, estabelecer a procedência, sondar um modelo em busca de fraquezas, protegê-lo em tempo de execução, avaliar as ferramentas de agentes ao redor dele e limitar para onde a aplicação que o hospeda pode se conectar. Este panorama, preparado pela HisnLabs, desenvolvedora do FireAI, cobre ferramentas abertas cujos repositórios ou documentação foram lidos em 30 de setembro de 2026. Licenças, mantenedores e situação são informados tal como as fontes primárias os apresentam, e nenhuma ferramenta é classificada acima de outra, porque as tarefas não competem entre si.

Escopo e método

Uma ferramenta só foi incluída se foi possível abrir seu repositório oficial ou sua documentação, identificar sua licença e verificar seu estado de manutenção (arquivada ou ativa, e a data da versão mais recente quando a página de versões a mostra). As versões citadas abaixo são as mais recentes no momento da leitura. Nada aqui é uma medição de desempenho: as fontes não fornecem resultados de detecção comparáveis, e nenhum é alegado. Plataformas comerciais ficam de fora, a menos que o assunto seja um componente aberto.

As categorias seguem a ordem em que um modelo percorre um projeto: um arquivo é baixado, sua origem é verificada, o modelo é testado, é implantado atrás de proteções, é conectado a ferramentas e a aplicação que o executa chega à rede. O OWASP Top 10 for Large Language Model Applications, mantido dentro do OWASP GenAI Security Project, é o vocabulário comum habitual para os riscos de nível de aplicação das categorias três a cinco.

1. Análise de arquivos de modelos

Muitos arquivos de modelos são serializados no formato pickle do Python, que pode executar código ao ser carregado. A documentação da Hugging Face afirma que carregar um pickle “significa que código pode ser executado” e lista os opcodes GLOBAL, STACK_GLOBAL e REDUCE como os que representam a ameaça. Hugging Face: Pickle scanning Os scanners leem as instruções do arquivo sem carregá-lo e sinalizam importações perigosas.

ModelScan

O ModelScan é mantido pela Protect AI sob a licença Apache-2.0. Ele analisa formatos baseados em pickle (PyTorch, scikit-learn, XGBoost, joblib, cloudpickle), TensorFlow SavedModel e arquivos Keras H5 e V3, classifica os achados por gravidade e encerra com códigos adequados a pipelines de CI. A versão mais recente em sua página é a v0.8.8, de 18 de fevereiro de 2026, e o repositório mostrava atividade em 28 de setembro de 2026. Use-o como barreira antes que um modelo baixado entre em um build. Limitação: o README descreve uma detecção baseada em assinaturas que pode produzir falsos positivos e falsos negativos, e os achados exigem revisão humana.

picklescan

O picklescan é um scanner sob licença MIT mantido por uma conta individual, mmaitre314. A documentação da Hugging Face cita o picklescan entre as ferramentas que desenvolveu para o Hub. A versão mais recente é a v1.0.5, de 1º de julho de 2026. Ele analisa arquivos pickle, arquivos PyTorch e contêineres ZIP, e pode examinar um caminho local, uma URL ou um modelo da Hugging Face. Use-o para uma verificação rápida em um script. Limitação: ele identifica operações perigosas por padrão, então uma técnica nova pode passar, e ele relata os achados sem removê-los.

fickling

O fickling, da Trail of Bits, é licenciado sob LGPL-3.0. É descrito como um descompilador, analisador estático e reescritor de bytecode para pickle. Ele consegue descompilar um pickle em Python legível, verificar a segurança por análise estática e gerar um erro antes de carregar um arquivo inseguro. A versão mais recente é a v0.1.12, de 26 de junho de 2026. Use-o quando um achado precisa ser compreendido, e não apenas sinalizado. Limitação: é uma ferramenta de análise para pickle e não cobre os outros formatos que o ModelScan lê. Os termos de sua licença diferem das licenças permissivas dos outros scanners.

Análise do Hugging Face Hub e safetensors

O Hub examina cada arquivo enviado com o ClamAV e com uma análise de importações de pickle que lista as importações dentro de cada arquivo serializado e destaca as suspeitas. Hugging Face: file scanning Ele também mostra, em repositórios públicos, os resultados de um scanner de terceiros, o Guardian da Protect AI. Hugging Face: Protect AI Limitação, nas palavras da própria Hugging Face: a análise de pickle não é totalmente infalível, suas listas são mantidas na base do melhor esforço e cabe ao usuário verificar o que é seguro. A alternativa estrutural é o safetensors, um formato Apache-2.0 mantido pela Hugging Face que armazena tensores sem conteúdo executável. Ele elimina o risco do pickle para os pesos, mas não diz se os próprios pesos são confiáveis.

2. Procedência, assinatura e impressão digital de modelos

A análise pergunta se um arquivo é perigoso de carregar. A procedência pergunta quem o produziu e se ele mudou desde então. As duas perguntas exigem ferramentas diferentes.

Sigstore model-transparency

O model-transparency é um projeto Apache-2.0 da organização Sigstore que assina e verifica modelos de aprendizado de máquina. Ele pode assinar pelo Sigstore ou com chaves, certificados ou dispositivos PKCS #11, e produz um pacote contendo um envelope DSSE com uma declaração in-toto. Sua versão mais recente é a v1.1.1, de 10 de outubro de 2025, com commits em setembro de 2026. Use-o para permitir que quem recebe os arquivos verifique que são os mesmos que um publicador assinou. Limitações: a documentação declara suporte ao hash de arquivos e de fragmentos de arquivos, não de tensores individuais, e uma assinatura válida comprova origem e integridade, não que o modelo seja seguro. A Hugging Face faz a mesma distinção para commits assinados, que garantem “a origem do arquivo”, e não que ele seja seguro.

Listas de materiais de IA e ML

O CycloneDX, mantido pela OWASP Foundation e pelo TC54 da Ecma International, inclui uma Machine Learning Bill of Materials (ML-BOM) entre os tipos de BOM suportados. Sua versão mais recente, a 1.7, foi publicada em 21 de outubro de 2025, e seus esquemas são Apache-2.0. O perfil de IA do SPDX 3.0 documenta componentes de IA como modelos, conjuntos de dados e prompts em um único registro interligado. Use qualquer um dos dois para manter um inventário de quais modelos, conjuntos de dados e versões um produto contém, que é a primeira coisa de que uma resposta a incidentes precisa. Limitação: uma BOM registra o que um autor declara. Nenhum dos formatos verifica a declaração.

Ferramentas de pesquisa em impressão digital e marca d’água

O Instructional Fingerprinting é o código de um artigo acadêmico (arXiv 2401.12255) que incorpora uma impressão digital em um modelo de linguagem para que o proprietário possa testar depois se outro modelo deriva dele. É código de pesquisa sob licença MIT, e a última atualização do repositório foi em julho de 2024. O MarkLLM, do grupo THU-BPM, é um kit Apache-2.0 para aplicar marca d’água ao texto gerado por um LLM, apresentado como demonstração no EMNLP 2024. Os dois respondem a perguntas diferentes: o primeiro marca um modelo, o segundo marca sua saída. Use-os para estudar atribuição, não como controle de produção. Limitação: ambos são artefatos de pesquisa, e nenhum substitui a assinatura de um arquivo distribuído.

3. Red teaming de LLMs e análise de vulnerabilidades

Estas ferramentas enviam entradas adversariais a um modelo ou aplicação e registram como ele responde. Elas testam comportamento, não arquivos.

garak

O garak é um scanner de vulnerabilidades de LLMs sob licença Apache-2.0 mantido pela NVIDIA. Seu README diz que ele verifica “se um LLM pode ser levado a falhar de um jeito que não queremos”, com sondas para injeção de prompt, vazamento de dados, alucinação, toxicidade e jailbreaks, cada uma associada a um detector. A versão mais recente é a v0.17.0, de 9 de setembro de 2026. Use-o como análise ampla de referência de um endpoint de modelo. Limitações: ele precisa de acesso por API ou de uma implantação local do alvo, algumas sondas consomem muitos recursos, e o README registra suporte limitado a modelos de visão e status de protótipo para algumas sondas.

PyRIT

O PyRIT é um framework sob licença MIT descrito como construído para que profissionais e engenheiros de segurança identifiquem riscos em sistemas de IA generativa. É mantido pela Microsoft, e a versão mais recente é a v1.1.0, de 4 de setembro de 2026. O repositório anterior, na organização Azure, foi arquivado em 27 de março de 2026 com um apontamento para o da Microsoft, então os links para o endereço antigo levam a uma cópia somente leitura. Use-o para campanhas de red team roteirizadas e com vários turnos, conduzidas por uma equipe disposta a escrever código. Limitação: é um framework, não um scanner de um único comando.

promptfoo

O promptfoo é uma ferramenta de linha de comando e biblioteca sob licença MIT para avaliar aplicações de LLM e para red teaming e análise de vulnerabilidades, com integração a CI. A versão mais recente é a 0.123.1, de 18 de setembro de 2026. Seu README afirma: “O Promptfoo agora faz parte da OpenAI. O Promptfoo continua de código aberto e sob licença MIT.” Use-o para colocar testes de prompt e verificações adversariais em um build. Limitação: os resultados dependem do provedor e do avaliador configurados, e a maioria dos provedores exige chaves de API. A mudança de controle é um fato de governança que vale registrar ao escolher uma ferramenta para trabalho regulado.

Giskard

O Giskard é uma biblioteca Python Apache-2.0 da organização Giskard-AI. Sua versão 3 tem dois componentes descritos como estáveis: o giskard-checks, um framework de testes com cenários e avaliações do tipo LLM como juiz, e o giskard-scan, um scanner de vulnerabilidades de agentes. Use-o para testar agentes e sistemas com geração aumentada por recuperação. Limitações: a versão 3 exige Python 3.12 ou posterior, e a versão 2, que cobria a análise de aprendizado de máquina tabular e clássico, não é mais mantida ativamente.

4. Proteções em tempo de execução e detecção de injeção de prompt

As proteções ficam no caminho das requisições e classificam ou restringem entradas e saídas enquanto a aplicação está em execução.

Llama Guard, Prompt Guard e LlamaFirewall

O projeto Purple Llama, da Meta, reúne salvaguardas para modelos abertos. O Llama Guard é uma família de modelos de moderação de entradas e saídas. O Prompt Guard 2 é descrito como um classificador leve para tentativas diretas de injeção de prompt, e o LlamaFirewall o combina com um verificador de alinhamento e um analisador de código para agentes. Segundo a tabela de licenças do projeto, os modelos são distribuídos sob as Llama Community Licences, e outros componentes, como o Code Shield e as avaliações, sob MIT. Os modelos na Hugging Face têm acesso controlado. Use-os onde um pequeno classificador na frente de um modelo for aceitável. Limitações: um classificador reduz as tentativas que se parecem com padrões conhecidos e não elimina a classe de ataque.

NeMo Guardrails

O NeMo Guardrails é um kit Apache-2.0 da NVIDIA para adicionar trilhos programáveis a aplicações de LLM, usando uma linguagem de modelagem chamada Colang para controlar o fluxo do diálogo. A versão mais recente é a v0.24.1, de 16 de setembro de 2026. Use-o para restringir temas, formatos e caminhos de diálogo. Limitação: os trilhos são políticas escritas pelo desenvolvedor, então sua cobertura é tão ampla quanto aquilo que foi previsto.

Rebuff e LLM Guard, agora arquivados

O Rebuff, um detector de injeção de prompt autorreforçado com heurísticas, uma verificação por LLM, um banco vetorial de ataques anteriores e tokens canário, foi arquivado em 16 de maio de 2025. Seu README afirma que se trata de um protótipo e que não pode oferecer proteção completa contra injeção de prompt. O LLM Guard, um kit sob licença MIT de scanners de entrada e saída do mesmo mantenedor, foi arquivado em julho de 2026. Ambos continuam disponíveis para consulta. Eles ilustram um ponto prático: projetos de detectores podem perder seus mantenedores, então uma proteção deve ser substituível.

5. Scanners de segurança de agentes e MCP

Os agentes acrescentam ferramentas, e as descrições das ferramentas são texto que o modelo lê. Os scanners deste grupo examinam essas ferramentas e sua configuração.

Snyk Agent Scan

O Agent Scan, antes chamado MCP-Scan, é um scanner Apache-2.0 mantido pela Snyk. Ele descobre os componentes de agentes em uma máquina, incluindo servidores MCP e skills em clientes como Claude, Cursor, VS Code e GitHub Copilot, e os verifica quanto a injeção de prompt, envenenamento de ferramentas e problemas relacionados. A versão mais recente é a v0.6.8, de 29 de setembro de 2026. Use-o para auditar o que está instalado em uma máquina de desenvolvimento. Limitações: o README afirma que o projeto não aceita contribuições externas no momento e que existem duas linhas de versões com formatos de saída diferentes.

Cisco MCP Scanner

O MCP Scanner é uma ferramenta Apache-2.0 da Cisco AI Defense. Ele analisa ferramentas, prompts, recursos e dependências de MCP com três motores que podem funcionar sozinhos ou em conjunto: regras YARA, análise por LLM e a API da Cisco AI Defense. A versão mais recente é a 4.8.4, de 28 de agosto de 2026. Use-o para verificar um servidor antes de adotá-lo. Limitação: os motores de LLM e de API exigem credenciais externas, e uma análise da descrição de um servidor diz pouco sobre o que seu código faz depois de uma atualização.

6. Onde entram os controles de rede

As ferramentas acima examinam arquivos, modelos, prompts e configurações. Nenhuma delas decide qual aplicação pode abrir uma conexão com qual servidor. Esse é o papel do controle de saída, e ele importa porque os riscos das seções anteriores convergem para a rede: um runtime de modelo adulterado, uma ferramenta envenenada ou um agente vítima de injeção precisa alcançar um destino para exfiltrar dados ou receber instruções.

O FireAI, desenvolvido pela HisnLabs, é um firewall de saída para macOS. Ele funciona como um filtro de conteúdo Network Extension da Apple, identifica cada app pela assinatura de código e pode permitir, bloquear ou perguntar para cada destino, com regras por app, domínio ou endereço. Aplicado ao trabalho com IA em um Mac, isso significa que um servidor de inferência, um agente de programação ou um cliente MCP pode ficar restrito aos destinos de que sua tarefa precisa, e um destino novo provoca uma decisão. A documentação do filtro descreve o que o FireAI vê: a identidade do app, o host ou endereço remoto, a porta e o protocolo.

O FireAI não analisa arquivos de modelos, não verifica assinaturas, não faz red teaming de modelos nem classifica prompts. Ele não lê o conteúdo de conexões criptografadas, então não consegue distinguir uma requisição legítima de uma injetada quando ambas vão para um destino permitido. Ele complementa as ferramentas acima e não substitui nenhuma delas.

Comparação

Fontes: o repositório ou a documentação de cada projeto, lidos em 30 de setembro de 2026. A situação reflete a página do repositório, não um julgamento de qualidade.
FerramentaTarefaMantenedorLicençaSituação em 30 set. 2026
ModelScanAnálise de arquivos de modelosProtect AIApache-2.0Ativo, v0.8.8
picklescanAnálise de picklemmaitre314MITAtivo, v1.0.5
ficklingAnálise aprofundada de pickleTrail of BitsLGPL-3.0Ativo, v0.1.12
safetensorsFormato seguro de pesosHugging FaceApache-2.0Ativo
model-transparencyAssinatura de modelosSigstoreApache-2.0Ativo, v1.1.1
CycloneDXEspecificação ML-BOMOWASP, Ecma TC54Apache-2.0 (esquemas)Ativo, 1.7
Instructional FingerprintingImpressão digital de modelos (pesquisa)Autores do artigoMITÚltima atualização em julho de 2024
MarkLLMMarca d’água em texto (pesquisa)THU-BPMApache-2.0Ativo
garakAnálise de vulnerabilidadesNVIDIAApache-2.0Ativo, v0.17.0
PyRITFramework de red teamMicrosoftMITAtivo, v1.1.0
promptfooAvaliações e red teamingPromptfoo, parte da OpenAIMITAtivo, 0.123.1
Giskard v3Testes e análise de agentesGiskard-AIApache-2.0Ativo; v2 sem manutenção
Llama Guard, Prompt GuardModelos de proteçãoMetaLlama Community LicencesModelos de abril de 2025
NeMo GuardrailsTrilhos programáveisNVIDIAApache-2.0Ativo, v0.24.1
Rebuff, LLM GuardDetecção de injeçãoProtect AIApache-2.0, MITArquivados
Agent ScanAnálise de agentes e MCPSnykApache-2.0Ativo, v0.6.8
MCP ScannerAnálise de servidores MCPCisco AI DefenseApache-2.0Ativo, 4.8.4
FireAIControle de saída por app no macOSHisnLabsComercialNão analisa modelos

Limitações

  • Nenhuma ferramenta cobre sozinha as seis tarefas. Uma análise de arquivo sem achados não diz nada sobre o comportamento de um modelo, uma assinatura não diz nada sobre segurança e uma análise de red team não diz nada sobre o conteúdo de um arquivo.
  • Scanners e proteções são detectores. Podem deixar passar técnicas novas, como a documentação do ModelScan, do picklescan e do Rebuff reconhece, e sua cobertura muda à medida que os ataques mudam.
  • A manutenção é desigual. Dois projetos de detectores listados aqui estão arquivados, uma ferramenta mudou de dono, uma tem um mantenedor individual e um repositório de pesquisa não muda desde 2024. Verifique a situação de um projeto antes de construir sobre ele.
  • Este panorama se limitou a ferramentas abertas com fontes primárias legíveis. Ele exclui plataformas comerciais e não compara resultados de detecção, porque as fontes não trazem números comparáveis.
  • As licenças foram lidas nas páginas dos repositórios e nas tabelas de licenças. Confirme-as antes de redistribuir, em especial as Llama Community Licences e os termos LGPL do fickling.
  • A camada de rede vê conexões, não significado. Um destino permitido ainda pode receber dados de um runtime de modelo comprometido.

Onde FireAI e HisnLabs entram nessa história

Analise o modelo, assine o modelo, teste o modelo. Depois decida para onde o app dele pode se conectar.

O FireAI é o produto da HisnLabs: um firewall com IA que roda direto no seu Mac. Ele mostra, em linguagem simples, cada conexão que seus aplicativos fazem e deixa você decidir o que sai do seu Mac — a IA roda localmente, então seu tráfego nunca é enviado para nós nem para ninguém. A equipe de pesquisa em segurança da HisnLabs é quem mantém essas decisões confiáveis: cataloga quais domínios são telemetria comum e quais são um serviço de verdade, rastreia o país e a rede por trás de uma conexão e treina o modelo local (o recurso FireAI Pilot) com padrões reais de tráfego, sem que nada disso saia do seu Mac.

Você pode ler as decisões técnicas por trás dele, ou testar o FireAI por 17 dias, em FireAI, da HisnLabs.

Fontes