Yapay zekâ modeli güvenliği tek bir disiplin değil, her birinin kendi araçları olan altı iştir: model dosyalarını taramak, kökeni tespit etmek, modeli zayıflıklar açısından yoklamak, çalışma anında korumak, çevresindeki ajan araçlarını denetlemek ve modeli barındıran uygulamanın nereye bağlanabileceğini sınırlamak. FireAI’ın geliştiricisi HisnLabs tarafından hazırlanan bu derleme, depoları ya da belgeleri 30 Eylül 2026’da okunan açık araçları kapsar. Lisanslar, geliştiriciler ve durum bilgisi birincil kaynakların verdiği şekilde aktarılmıştır ve hiçbir araç diğerinin üzerinde sıralanmamıştır, çünkü bu işler birbiriyle rekabet etmez.
Kapsam ve yöntem
Bir araç ancak resmî deposu ya da belgeleri açılabildiyse, lisansı belirlenebildiyse ve bakım durumu kontrol edilebildiyse (arşivlenmiş mi etkin mi ve sürüm sayfası gösteriyorsa en son sürümünün tarihi) derlemeye alınmıştır. Aşağıda adı geçen sürümler, okuma tarihindeki en son sürümlerdir. Burada hiçbir şey bir performans ölçümü değildir: kaynaklar karşılaştırılabilir tespit sonuçları sunmaz ve böyle bir iddiada bulunulmamıştır. Ticari platformlar, konu açık bir bileşen olmadıkça kapsam dışında bırakılmıştır.
Kategoriler, bir modelin bir projede izlediği sırayı takip eder: bir dosya indirilir, kökeni kontrol edilir, model test edilir, korumaların arkasında devreye alınır, araçlara bağlanır ve onu çalıştıran uygulama ağa ulaşır. OWASP GenAI Security Project bünyesinde sürdürülen OWASP Top 10 for Large Language Model Applications, üçüncü ile beşinci kategoriler arasındaki uygulama düzeyi riskler için yaygın olarak kullanılan ortak terminolojidir.
1. Model dosyası tarama
Birçok model dosyası, yüklendiğinde kod çalıştırabilen Python pickle biçimiyle serileştirilir. Hugging Face belgeleri, bir pickle dosyasını yüklemenin “kod çalıştırılabileceği anlamına geldiğini” belirtir ve tehdit oluşturan işlem kodları olarak GLOBAL, STACK_GLOBAL ve REDUCE kodlarını listeler. Hugging Face: Pickle scanning Tarayıcılar dosyayı yüklemeden talimatlarını okur ve tehlikeli içe aktarmaları işaretler.
ModelScan
ModelScan, Protect AI tarafından Apache-2.0 lisansıyla sürdürülür. Pickle tabanlı biçimleri (PyTorch, scikit-learn, XGBoost, joblib, cloudpickle), TensorFlow SavedModel ve Keras H5 ile V3 dosyalarını tarar, bulguları önem derecesine göre sıralar ve CI işlem hatlarına uygun çıkış kodları döndürür. Sayfasındaki en son sürüm 18 Şubat 2026 tarihli v0.8.8’dir ve depoda 28 Eylül 2026’da etkinlik görülmüştür. İndirilen bir modelin bir derlemeye girmesinden önce bir kapı olarak kullanılabilir. Sınırlılık: README, yanlış pozitif ve yanlış negatif sonuçlar üretebilen imza tabanlı bir tespit tarif eder; bulguların bir insan tarafından incelenmesi gerekir.
picklescan
picklescan, bireysel bir hesap olan mmaitre314 tarafından sürdürülen MIT lisanslı bir tarayıcıdır. Hugging Face belgeleri picklescan’i Hub için geliştirdiği araçlar arasında sayar. En son sürüm 1 Temmuz 2026 tarihli v1.0.5’tir. Pickle dosyalarını, PyTorch arşivlerini ve ZIP kapsayıcılarını tarar; yerel bir yolu, bir URL’yi ya da bir Hugging Face modelini tarayabilir. Bir betik içinde hızlı bir kontrol için kullanılabilir. Sınırlılık: tehlikeli işlemleri desen eşleştirmeyle bulur, bu nedenle yeni bir teknik gözden kaçabilir; ayrıca bulguları raporlar ama kaldırmaz.
fickling
Trail of Bits’in geliştirdiği fickling, LGPL-3.0 lisanslıdır. Pickle için bir kaynak koda dönüştürücü, statik çözümleyici ve bayt kodu yeniden yazıcı olarak tanımlanır. Bir pickle dosyasını okunabilir Python koduna dönüştürebilir, statik analizle güvenliği kontrol edebilir ve güvensiz bir dosyayı yüklemeden önce hata verebilir. En son sürüm 26 Haziran 2026 tarihli v0.1.12’dir. Bir bulgunun yalnızca işaretlenmesi değil, anlaşılması gerektiğinde kullanılabilir. Sınırlılık: pickle için bir analiz aracıdır ve ModelScan’in okuduğu diğer biçimleri kapsamaz. Lisans koşulları diğer tarayıcıların serbest lisanslarından farklıdır.
Hugging Face Hub taraması ve safetensors
Hub, gönderilen her dosyayı ClamAV ile ve her pickle dosyasının içindeki içe aktarmaları listeleyip şüpheli olanları vurgulayan bir pickle içe aktarma taramasıyla tarar. Hugging Face: file scanning Ayrıca herkese açık depolarda üçüncü taraf bir tarayıcının, Protect AI’ın Guardian’ının sonuçlarını gösterir. Hugging Face: Protect AI Hugging Face’in kendi ifadesiyle sınırlılık: pickle taraması tamamen hatasız değildir, listeleri en iyi çaba esasıyla sürdürülür ve neyin güvenli olduğunu kontrol etmek kullanıcının sorumluluğundadır. Yapısal alternatif, Hugging Face tarafından sürdürülen ve tensörleri çalıştırılabilir içerik olmadan saklayan Apache-2.0 lisanslı bir biçim olan safetensors’tır. Ağırlıklar için pickle riskini ortadan kaldırır, ancak ağırlıkların kendisinin güvenilir olup olmadığı hakkında bir şey söylemez.
2. Model kökeni, imzalama ve parmak izi
Tarama, bir dosyanın yüklenmesinin tehlikeli olup olmadığını sorar. Köken ise onu kimin ürettiğini ve o zamandan beri değişip değişmediğini sorar. Bu iki soru farklı araçlar gerektirir.
Sigstore model-transparency
model-transparency, Sigstore organizasyonu altında makine öğrenimi modellerini imzalayan ve doğrulayan Apache-2.0 lisanslı bir projedir. Sigstore üzerinden ya da anahtarlar, sertifikalar veya PKCS #11 aygıtlarıyla imzalayabilir ve in-toto ifadesi içeren bir DSSE zarfından oluşan bir paket üretir. En son sürümü 10 Ekim 2025 tarihli v1.1.1’dir; Eylül 2026’da da işlemeler yapılmıştır. Bir tüketicinin elindeki dosyaların bir yayıncının imzaladığı dosyalar olduğunu doğrulamasını sağlamak için kullanılabilir. Sınırlılıklar: belgeler tek tek tensörlerin değil, dosyaların ve dosya parçalarının özetlenmesinin desteklendiğini belirtir; geçerli bir imza modelin güvenli olduğunu değil, kökenini ve bütünlüğünü kanıtlar. Hugging Face de imzalı işlemeler için aynı ayrımı yapar: bunlar dosyanın güvenli olduğunu değil, “dosyanın kökenini” güvence altına alır.
Yapay zekâ ve makine öğrenimi malzeme listeleri
OWASP Foundation ve Ecma International’ın TC54 komitesi tarafından sürdürülen CycloneDX, desteklediği BOM türleri arasında bir Machine Learning Bill of Materials (ML-BOM) sayar. En son sürümü olan 1.7, 21 Ekim 2025’te yayımlanmıştır ve şemaları Apache-2.0 lisanslıdır. SPDX 3.0 AI profile, modeller, veri kümeleri ve istemler gibi yapay zekâ bileşenlerini tek bir bağlantılı kayıtta belgeler. Her ikisi de bir ürünün hangi modelleri, veri kümelerini ve sürümleri içerdiğinin envanterini tutmak için kullanılabilir; bir olay müdahalesinin ilk ihtiyaç duyduğu şey budur. Sınırlılık: bir BOM, yazarın beyan ettiğini kaydeder. Hiçbir biçim bu beyanı doğrulamaz.
Parmak izi ve filigran araştırma araçları
Instructional Fingerprinting, bir dil modeline parmak izi yerleştiren ve sahibinin daha sonra başka bir modelin ondan türeyip türemediğini test etmesini sağlayan akademik bir makalenin (arXiv 2401.12255) kodudur. MIT lisanslı bir araştırma kodudur ve deposu en son Temmuz 2024’te güncellenmiştir. THU-BPM grubunun geliştirdiği MarkLLM, bir LLM’in ürettiği metne filigran eklemek için Apache-2.0 lisanslı bir araç setidir ve EMNLP 2024 demosu olarak sunulmuştur. İkisi farklı sorulara yanıt verir: ilki bir modeli, ikincisi onun çıktısını işaretler. Üretimde bir kontrol olarak değil, atıf konusunu incelemek için kullanılabilirler. Sınırlılık: ikisi de araştırma ürünüdür ve hiçbiri dağıtılan bir dosyanın imzalanmasının yerini tutmaz.
3. LLM kırmızı takım çalışması ve zafiyet taraması
Bu araçlar bir modele ya da uygulamaya karşıt girdiler gönderir ve nasıl yanıt verdiğini kaydeder. Dosyaları değil, davranışı test ederler.
garak
garak, NVIDIA tarafından sürdürülen Apache-2.0 lisanslı bir LLM zafiyet tarayıcısıdır. README’sine göre “bir LLM’in istemediğimiz bir şekilde başarısız olmaya zorlanıp zorlanamayacağını” kontrol eder; istem enjeksiyonu, veri sızıntısı, halüsinasyon, toksisite ve jailbreak için her biri bir dedektörle eşleştirilmiş yoklamalar içerir. En son sürüm 9 Eylül 2026 tarihli v0.17.0’dır. Bir model uç noktasının geniş kapsamlı temel taraması için kullanılabilir. Sınırlılıklar: hedefe API erişimi ya da yerel bir kurulum gerektirir, bazı yoklamalar yoğun kaynak tüketir ve README, görüntü modelleri için sınırlı destek bulunduğunu ve bazı yoklamaların prototip aşamasında olduğunu belirtir.
PyRIT
PyRIT, güvenlik uzmanları ve mühendislerin üretken yapay zekâ sistemlerindeki riskleri belirlemesi için geliştirildiği belirtilen MIT lisanslı bir çerçevedir. Microsoft tarafından sürdürülür ve en son sürümü 4 Eylül 2026 tarihli v1.1.0’dır. Azure organizasyonu altındaki önceki depo, Microsoft deposuna yönlendiren bir notla 27 Mart 2026’da arşivlenmiştir; dolayısıyla eski adrese verilen bağlantılar salt okunur bir kopyaya gider. Kod yazacak bir ekibin betiklerle yürüttüğü, çok turlu kırmızı takım kampanyaları için kullanılabilir. Sınırlılık: tek komutluk bir tarayıcı değil, bir çerçevedir.
promptfoo
promptfoo, LLM uygulamalarını değerlendirmek, kırmızı takım çalışması ve zafiyet taraması yapmak için CI entegrasyonlu, MIT lisanslı bir komut satırı aracı ve kütüphanedir. En son sürüm 18 Eylül 2026 tarihli 0.123.1’dir. README’si şunu belirtir: “Promptfoo is now part of OpenAI. Promptfoo remains open source and MIT licensed.” İstem testlerini ve karşıt kontrolleri bir derlemeye eklemek için kullanılabilir. Sınırlılık: sonuçlar yapılandırılan sağlayıcıya ve değerlendirici modele bağlıdır ve sağlayıcıların çoğu API anahtarı gerektirir. Sahiplik değişikliği, düzenlemeye tabi işler için araç seçerken not edilmesi gereken bir yönetişim olgusudur.
Giskard
Giskard, Giskard-AI organizasyonunun Apache-2.0 lisanslı bir Python kütüphanesidir. Sürüm 3’ün kararlı olarak tanımlanan iki bileşeni vardır: senaryolar ve LLM-as-judge değerlendirmeleri kullanan bir test çerçevesi olan giskard-checks ve ajan zafiyetleri için bir tarayıcı olan giskard-scan. Ajan ve erişimle zenginleştirilmiş (RAG) sistemleri test etmek için kullanılabilir. Sınırlılıklar: sürüm 3, Python 3.12 veya üzerini gerektirir; tablo verisi ve klasik makine öğrenimi taramasını kapsayan sürüm 2 artık aktif olarak sürdürülmemektedir.
4. Çalışma anı korumaları ve istem enjeksiyonu tespiti
Korumalar istek yolunda yer alır ve uygulama çalışırken girdileri ve çıktıları sınıflandırır ya da kısıtlar.
Llama Guard, Prompt Guard ve LlamaFirewall
Meta’nın Purple Llama projesi açık modeller için korumaları bir araya getirir. Llama Guard, girdi ve çıktı denetimi yapan bir model ailesidir. Prompt Guard 2, doğrudan istem enjeksiyonu girişimleri için hafif bir sınıflandırıcı olarak tanımlanır; LlamaFirewall ise onu ajanlar için bir hizalama kontrolü tarayıcısı ve bir kod tarayıcısıyla birleştirir. Projenin lisans tablosuna göre modeller Llama Community Licences kapsamında dağıtılır; Code Shield ve değerlendirmeler gibi diğer bileşenler MIT lisanslıdır. Hugging Face’teki modellere erişim onaya tabidir. Bir modelin önünde küçük bir sınıflandırıcının kabul edilebilir olduğu durumlarda kullanılabilirler. Sınırlılıklar: bir sınıflandırıcı bilinen desenlere benzeyen girişimleri azaltır, saldırı sınıfını ortadan kaldırmaz.
NeMo Guardrails
NeMo Guardrails, NVIDIA’nın LLM uygulamalarına programlanabilir korkuluklar eklemek için geliştirdiği Apache-2.0 lisanslı bir araç setidir ve diyalog akışını denetlemek için Colang adlı bir modelleme dili kullanır. En son sürüm 16 Eylül 2026 tarihli v0.24.1’dir. Konuları, biçimleri ve diyalog yollarını kısıtlamak için kullanılabilir. Sınırlılık: korkuluklar geliştiricinin yazdığı politikalardır; dolayısıyla kapsamları ancak öngörülen şeyler kadar geniştir.
Rebuff ve LLM Guard, artık arşivlenmiş
Sezgisel yöntemler, bir LLM kontrolü, geçmiş saldırıların vektör deposu ve kanarya belirteçleri kullanan, kendini güçlendiren bir istem enjeksiyonu dedektörü olan Rebuff, 16 Mayıs 2025’te arşivlenmiştir. README’si bunun bir prototip olduğunu ve istem enjeksiyonuna karşı tam koruma sağlayamayacağını belirtir. Aynı geliştiricinin MIT lisanslı girdi ve çıktı tarayıcıları araç seti LLM Guard ise Temmuz 2026’da arşivlenmiştir. İkisi de başvuru amacıyla okunabilir durumdadır. Pratik bir noktayı gösterirler: dedektör projeleri geliştiricilerini kaybedebilir, bu yüzden bir koruma değiştirilebilir olmalıdır.
5. Ajan ve MCP güvenlik tarayıcıları
Ajanlar araçlar ekler ve araç açıklamaları modelin okuduğu metinlerdir. Bu gruptaki tarayıcılar bu araçları ve yapılandırmalarını inceler.
Snyk Agent Scan
Eski adıyla MCP-Scan olan Agent Scan, Snyk tarafından sürdürülen Apache-2.0 lisanslı bir tarayıcıdır. Bir makinedeki ajan bileşenlerini, Claude, Cursor, VS Code ve GitHub Copilot gibi istemcilerdeki MCP sunucuları ve beceriler dahil olmak üzere keşfeder ve bunları istem enjeksiyonu, araç zehirlenmesi ve ilgili sorunlar açısından kontrol eder. En son sürüm 29 Eylül 2026 tarihli v0.6.8’dir. Bir geliştirici makinesinde nelerin kurulu olduğunu denetlemek için kullanılabilir. Sınırlılıklar: README, şu anda dışarıdan katkı kabul edilmediğini ve farklı çıktı biçimlerine sahip iki sürüm hattının bulunduğunu belirtir.
Cisco MCP Scanner
MCP Scanner, Cisco AI Defense’in Apache-2.0 lisanslı bir aracıdır. MCP araçlarını, istemlerini, kaynaklarını ve bağımlılıklarını tek başına ya da birlikte çalışabilen üç motorla analiz eder: YARA kuralları, LLM analizi ve Cisco AI Defense API’si. En son sürüm 28 Ağustos 2026 tarihli 4.8.4’tür. Bir sunucuyu benimsemeden önce kontrol etmek için kullanılabilir. Sınırlılık: LLM ve API motorları harici kimlik bilgileri gerektirir ve bir sunucunun açıklamasının taranması, kodunun bir güncellemeden sonra ne yaptığı hakkında pek bir şey söylemez.
6. Ağ kontrollerinin yeri
Yukarıdaki araçlar dosyaları, modelleri, istemleri ve yapılandırmaları inceler. Hiçbiri hangi uygulamanın hangi sunucuya bağlantı açabileceğine karar vermez. Bu, çıkış trafiği denetiminin görevidir ve önemlidir, çünkü önceki bölümlerdeki riskler ağda birleşir: kurcalanmış bir model çalışma ortamı, zehirlenmiş bir araç ya da enjeksiyona uğramış bir ajan, veri sızdırmak ya da talimat almak için bir hedefe ulaşmak zorundadır.
HisnLabs tarafından geliştirilen FireAI, macOS için bir giden trafik güvenlik duvarıdır. Bir Apple Network Extension içerik filtresi olarak çalışır, her uygulamayı kod imzasıyla tanır ve uygulama, alan adı ya da adres bazında kurallarla her hedef için izin verebilir, engelleyebilir ya da sorabilir. Bir Mac’teki yapay zekâ çalışmasına uygulandığında bu, bir çıkarım sunucusunun, bir kodlama ajanının ya da bir MCP istemcisinin görevinin gerektirdiği hedeflerle sınırlı tutulabileceği ve yeni bir hedefin bir karar gerektireceği anlamına gelir. Filtre belgeleri, FireAI’ın neyi gördüğünü açıklar: uygulama kimliği, uzak ana makine ya da adres, port ve protokol.
FireAI model dosyalarını taramaz, imzaları doğrulamaz, bir modele kırmızı takım testi uygulamaz ve istemleri sınıflandırmaz. Şifreli bağlantıların içeriğini okumaz; bu nedenle ikisi de izin verilen bir hedefe gittiğinde meşru bir isteği enjekte edilmiş bir istekten ayırt edemez. Yukarıdaki araçları tamamlar, hiçbirinin yerini almaz.
Karşılaştırma
| Araç | İşlev | Geliştirici | Lisans | 30 Eylül 2026’da görülen durum |
|---|---|---|---|---|
| ModelScan | Model dosyası tarama | Protect AI | Apache-2.0 | Etkin, v0.8.8 |
| picklescan | Pickle tarama | mmaitre314 | MIT | Etkin, v1.0.5 |
| fickling | Pickle analizi | Trail of Bits | LGPL-3.0 | Etkin, v0.1.12 |
| safetensors | Güvenli ağırlık biçimi | Hugging Face | Apache-2.0 | Etkin |
| model-transparency | Model imzalama | Sigstore | Apache-2.0 | Etkin, v1.1.1 |
| CycloneDX | ML-BOM belirtimi | OWASP, Ecma TC54 | Apache-2.0 (şemalar) | Etkin, 1.7 |
| Instructional Fingerprinting | Model parmak izi (araştırma) | Makale yazarları | MIT | Son güncelleme Temmuz 2024 |
| MarkLLM | Metin filigranı (araştırma) | THU-BPM | Apache-2.0 | Etkin |
| garak | Zafiyet taraması | NVIDIA | Apache-2.0 | Etkin, v0.17.0 |
| PyRIT | Kırmızı takım çerçevesi | Microsoft | MIT | Etkin, v1.1.0 |
| promptfoo | Değerlendirme ve kırmızı takım | Promptfoo, OpenAI bünyesinde | MIT | Etkin, 0.123.1 |
| Giskard v3 | Ajan testleri ve tarama | Giskard-AI | Apache-2.0 | Etkin; v2 sürdürülmüyor |
| Llama Guard, Prompt Guard | Koruma modelleri | Meta | Llama Community Licences | Modeller Nisan 2025 tarihli |
| NeMo Guardrails | Programlanabilir korkuluklar | NVIDIA | Apache-2.0 | Etkin, v0.24.1 |
| Rebuff, LLM Guard | Enjeksiyon tespiti | Protect AI | Apache-2.0, MIT | Arşivlenmiş |
| Agent Scan | Ajan ve MCP taraması | Snyk | Apache-2.0 | Etkin, v0.6.8 |
| MCP Scanner | MCP sunucusu taraması | Cisco AI Defense | Apache-2.0 | Etkin, 4.8.4 |
| FireAI | macOS’ta uygulama bazında çıkış denetimi | HisnLabs | Ticari | Model taramaz |
Sınırlılıklar
- Hiçbir araç altı işin tamamını kapsamaz. Temiz bir dosya taraması bir modelin davranışı hakkında, bir imza güvenlik hakkında, bir kırmızı takım taraması da bir dosyanın içeriği hakkında hiçbir şey söylemez.
- Tarayıcılar ve korumalar birer dedektördür. ModelScan, picklescan ve Rebuff belgelerinin her birinin kabul ettiği gibi yeni teknikleri kaçırabilirler ve kapsamları saldırılar değiştikçe değişir.
- Bakım düzeyi eşit değildir. Burada listelenen iki dedektör projesi arşivlenmiştir, bir aracın sahibi değişmiştir, birinin bireysel bir geliştiricisi vardır ve bir araştırma deposu 2024’ten beri değişmemiştir. Bir projenin üzerine bir şey kurmadan önce durumunu kontrol edin.
- Bu derleme, birincil kaynakları okunabilen açık araçlarla sınırlıdır. Ticari platformları dışarıda bırakır ve kaynaklar karşılaştırılabilir rakamlar sunmadığı için tespit sonuçlarını karşılaştırmaz.
- Lisanslar depo sayfalarından ve lisans tablolarından okunmuştur. Yeniden dağıtımdan önce, özellikle Llama Community Licences ve fickling’in LGPL koşulları açısından doğrulayın.
- Ağ katmanı anlamı değil, bağlantıları görür. İzin verilen bir hedef, ele geçirilmiş bir model çalışma ortamından yine de veri alabilir.
FireAI ve HisnLabs burada nereye oturuyor
Modeli tarayın, modeli imzalayın, modeli test edin. Ardından uygulamasının nereye bağlanabileceğine karar verin.
FireAI, HisnLabs’in kendi ürünüdür: doğrudan Mac’inizde çalışan, yapay zekâ destekli bir güvenlik duvarı. Uygulamalarınızın kurduğu her bağlantıyı sade bir dille gösterir ve Mac’inizden neyin çıkacağına sizin karar vermenizi sağlar — yapay zekâsı yerel olarak çalışır, yani trafiğiniz asla bize ya da başka birine gönderilmez. HisnLabs güvenlik araştırma ekibi bu kararların isabetli kalmasını sağlayan ekiptir: hangi alan adlarının sıradan telemetri, hangilerinin gerçek bir hizmet olduğunu kataloglar, bir bağlantının ardındaki ülkeyi ve ağı izler ve cihaz üzerindeki modeli (FireAI Pilot özelliği) gerçek trafik örüntüleriyle eğitir — üstelik bunların hiçbiri Mac’inizden dışarı çıkmadan.
Arkasındaki teknik kararları okuyabilir ya da FireAI’yi 17 gün boyunca deneyebilirsiniz: HisnLabs’ten FireAI.
