مدونة FireAI للأمان

بقلم FireAI Security & Research Team · نُشر في

أفضل أدوات أمن نماذج الذكاء الاصطناعي في 2026

أفضل أدوات أمن نماذج الذكاء الاصطناعي في 2026

أمن نماذج الذكاء الاصطناعي ليس تخصصًا واحدًا، بل ست مهام لكل منها أدواتها: فحص ملفات النماذج، وإثبات مصدرها، واختبار النموذج بحثًا عن نقاط ضعفه، وحمايته أثناء التشغيل، وتدقيق أدوات الوكلاء المحيطة به، وتقييد الوجهات التي يمكن للتطبيق المستضيف الاتصال بها. يغطي هذا الاستعراض، الذي أعدّته HisnLabs، مطوّرة FireAI، أدوات مفتوحة قُرئت مستودعاتها أو وثائقها في 30 سبتمبر 2026. وتُذكر التراخيص والجهات المشرفة والحالة كما تعرضها المصادر الأولية، ولا تُقدَّم أي أداة على أخرى، لأن المهام لا تتنافس فيما بينها.

النطاق والمنهج

لم تُدرج أي أداة إلا إذا أمكن فتح مستودعها الرسمي أو وثائقها، وتحديد ترخيصها، والتحقق من حالة صيانتها (مؤرشفة أم نشطة، وتاريخ آخر إصدار لها حين تعرضه صفحة الإصدارات). والإصدارات المذكورة أدناه هي الأحدث وقت القراءة. لا شيء هنا قياس للأداء: فالمصادر لا تقدّم نتائج رصد قابلة للمقارنة، ولا يُدّعى شيء من ذلك. وتُستبعد المنصات التجارية ما لم يكن مكوّن مفتوح منها هو موضوع الحديث.

تتبع الفئات الترتيب الذي يمر به النموذج داخل مشروع ما: يُنزَّل ملف، ويُتحقق من مصدره، ويُختبر النموذج، ثم يُنشر خلف ضوابط حماية، ويُوصل بالأدوات، ثم يصل التطبيق الذي يشغّله إلى الشبكة. وتمثل OWASP Top 10 for Large Language Model Applications، التي تُصان ضمن مشروع OWASP GenAI Security Project، المفردات المشتركة المعتادة للمخاطر على مستوى التطبيق في الفئات من الثالثة إلى الخامسة.

1. فحص ملفات النماذج

كثير من ملفات النماذج مُسلسَل بصيغة pickle في Python، التي يمكن أن تنفّذ شيفرة عند تحميلها. وتنص وثائق Hugging Face على أن تحميل ملف pickle «يعني أن شيفرة يمكن أن تُنفَّذ»، وتذكر رموز التشغيل GLOBAL وSTACK_GLOBAL وREDUCE بوصفها مصدر التهديد. Hugging Face: Pickle scanning تقرأ أدوات الفحص تعليمات الملف من دون تحميله، وتنبّه إلى عمليات الاستيراد الخطرة.

ModelScan

تصون Protect AI أداة ModelScan بترخيص Apache-2.0. وهي تفحص الصيغ القائمة على pickle (PyTorch وscikit-learn وXGBoost وjoblib وcloudpickle)، وملفات TensorFlow SavedModel، وملفات Keras بصيغتي H5 وV3، وترتّب النتائج بحسب الخطورة، وتنتهي برموز خروج تناسب خطوط CI. آخر إصدار على صفحتها هو v0.8.8 بتاريخ 18 فبراير 2026، وأظهر المستودع نشاطًا في 28 سبتمبر 2026. استخدمها بوابةً قبل دخول نموذج منزَّل إلى عملية بناء. القيد: يصف ملف README رصدًا قائمًا على التواقيع قد ينتج إيجابيات كاذبة وسلبيات كاذبة، وتحتاج النتائج إلى مراجعة بشرية.

picklescan

picklescan أداة فحص بترخيص MIT يصونها حساب فردي هو mmaitre314. وتذكر وثائق Hugging Face أداة picklescan ضمن الأدوات التي طوّرتها للـ Hub. آخر إصدار هو v1.0.5 بتاريخ 1 يوليو 2026. تفحص ملفات pickle وأرشيفات PyTorch وحاويات ZIP، ويمكنها فحص مسار محلي أو عنوان URL أو نموذج على Hugging Face. استخدمها لفحص سريع ضمن برنامج نصي. القيد: تطابق العمليات الخطرة بالأنماط، فقد تمر تقنية جديدة، وهي تبلّغ عن النتائج من دون إزالتها.

fickling

fickling من Trail of Bits مرخّصة بـ LGPL-3.0. وتوصف بأنها أداة لفك الترجمة ومحلل ساكن ومعيد كتابة لشيفرة bytecode في pickle. يمكنها فك ترجمة ملف pickle إلى Python مقروءة، والتحقق من سلامته بالتحليل الساكن، وإطلاق خطأ قبل تحميل ملف غير آمن. آخر إصدار هو v0.1.12 بتاريخ 26 يونيو 2026. استخدمها حين يجب فهم النتيجة لا الاكتفاء بالتنبيه إليها. القيد: إنها أداة تحليل لـ pickle، ولا تغطي الصيغ الأخرى التي تقرؤها ModelScan. كما تختلف شروط ترخيصها عن التراخيص المتساهلة لأدوات الفحص الأخرى.

فحص Hugging Face Hub وsafetensors

يفحص الـ Hub كل ملف يُرفع إليه باستخدام ClamAV وبفحص لعمليات الاستيراد في pickle يسرد الاستيرادات داخل كل ملف مُسلسَل ويبرز المريب منها. Hugging Face: file scanning كما يعرض نتائج أداة فحص من طرف ثالث، هي Guardian من Protect AI، على المستودعات العامة. Hugging Face: Protect AI القيد، كما تذكره Hugging Face: فحص pickle ليس معصومًا تمامًا، وقوائمه تُصان بحسب الجهد المتاح، والتحقق مما هو آمن مسؤولية المستخدم. والبديل البنيوي هو safetensors، وهي صيغة بترخيص Apache-2.0 تصونها Hugging Face، تخزّن الموترات من دون محتوى قابل للتنفيذ. تزيل هذه الصيغة خطر pickle بالنسبة إلى الأوزان، لكنها لا تقول شيئًا عن مدى الثقة بالأوزان نفسها.

2. مصدر النموذج وتوقيعه وبصمته

يسأل الفحص عمّا إذا كان تحميل الملف خطرًا. أما إثبات المصدر فيسأل عمّن أنتجه وما إذا كان قد تغيّر منذ ذلك الحين. والسؤالان يحتاجان إلى أدوات مختلفة.

Sigstore model-transparency

model-transparency مشروع بترخيص Apache-2.0 ضمن منظمة Sigstore، يوقّع نماذج تعلّم الآلة ويتحقق منها. يمكنه التوقيع عبر Sigstore، أو بالمفاتيح أو الشهادات أو أجهزة PKCS #11، وينتج حزمة تحتوي غلاف DSSE مع بيان in-toto. آخر إصدار له هو v1.1.1 بتاريخ 10 أكتوبر 2025، مع إيداعات في سبتمبر 2026. استخدمه ليتمكن المستهلك من التحقق من أن الملفات التي بين يديه هي التي وقّعها الناشر. القيود: تذكر الوثائق دعم تجزئة الملفات وأجزاء الملفات، لا الموترات المفردة، والتوقيع الصالح يثبت المصدر والسلامة من التعديل، لا أن النموذج آمن. وتميّز Hugging Face التمييز نفسه بالنسبة إلى الإيداعات الموقّعة، التي تضمن «مصدر الملف» لا أنه آمن.

قوائم مكونات الذكاء الاصطناعي وتعلّم الآلة

تدرج CycloneDX، التي تصونها مؤسسة OWASP واللجنة TC54 في Ecma International، قائمة مكونات تعلّم الآلة (ML-BOM) ضمن أنواع قوائم المكونات التي تدعمها. نُشر آخر إصداراتها، 1.7، في 21 أكتوبر 2025، ومخططاتها بترخيص Apache-2.0. ويوثّق ملف تعريف الذكاء الاصطناعي في SPDX 3.0 مكونات الذكاء الاصطناعي، كالنماذج ومجموعات البيانات والأوامر، في سجل واحد مترابط. استخدم أيًّا منهما للاحتفاظ بجرد للنماذج ومجموعات البيانات والإصدارات التي يحتويها منتج ما، وهو أول ما تحتاج إليه الاستجابة للحوادث. القيد: قائمة المكونات تسجّل ما يصرّح به المؤلف، ولا تتحقق أيٌّ من الصيغتين من صحة التصريح.

أدوات بحثية للبصمة والعلامات المائية

Instructional Fingerprinting هي شيفرة ورقة أكاديمية (arXiv 2401.12255) تضمّن بصمة في نموذج لغوي ليتمكن مالكه لاحقًا من اختبار ما إذا كان نموذج آخر مشتقًا منه. وهي شيفرة بحثية بترخيص MIT، وكان آخر تحديث لمستودعها في يوليو 2024. أما MarkLLM، من مجموعة THU-BPM، فهي مجموعة أدوات بترخيص Apache-2.0 لوضع علامات مائية على النص الذي يولّده LLM، قُدّمت عرضًا توضيحيًا في EMNLP 2024. تجيب الأداتان عن سؤالين مختلفين: الأولى تَسِم النموذج، والثانية تَسِم مخرجاته. استخدمهما لدراسة الإسناد، لا ضابطًا في بيئة الإنتاج. القيد: كلتاهما نتاج بحثي، ولا تغني أيٌّ منهما عن توقيع ملف موزَّع.

3. اختبار الفريق الأحمر لـ LLM وفحص الثغرات

ترسل هذه الأدوات مدخلات عدائية إلى نموذج أو تطبيق وتسجّل كيفية استجابته. إنها تختبر السلوك لا الملفات.

garak

garak أداة لفحص ثغرات LLM بترخيص Apache-2.0 تصونها NVIDIA. يقول ملف README إنها تتحقق «مما إذا كان يمكن دفع LLM إلى الإخفاق بطريقة لا نريدها»، عبر مجسّات لحقن الأوامر وتسرّب البيانات والهلوسة والمحتوى السام وكسر القيود، يقترن كل منها بكاشف. آخر إصدار هو v0.17.0 بتاريخ 9 سبتمبر 2026. استخدمها فحصًا أساسيًا واسعًا لنقطة نهاية نموذج. القيود: تحتاج إلى وصول عبر API أو نشر محلي للهدف، وبعض المجسّات كثيف الاستهلاك للموارد، ويشير ملف README إلى دعم محدود لنماذج الرؤية وإلى أن بعض المجسّات في طور النموذج الأولي.

PyRIT

PyRIT إطار عمل بترخيص MIT يوصف بأنه مبني لمتخصصي الأمن والمهندسين لتحديد المخاطر في أنظمة الذكاء الاصطناعي التوليدي. تصونه Microsoft، وآخر إصدار هو v1.1.0 بتاريخ 4 سبتمبر 2026. وقد أُرشف المستودع السابق ضمن منظمة Azure في 27 مارس 2026 مع إحالة إلى مستودع Microsoft، فالروابط إلى العنوان القديم تشير إلى نسخة للقراءة فقط. استخدمه لحملات فريق أحمر مبرمجة ومتعددة الجولات يتولاها فريق مستعد لكتابة الشيفرة. القيد: إنه إطار عمل، لا أداة فحص تعمل بأمر واحد.

promptfoo

promptfoo أداة سطر أوامر ومكتبة بترخيص MIT لتقييم تطبيقات LLM ولاختبار الفريق الأحمر وفحص الثغرات، مع تكامل مع CI. آخر إصدار هو 0.123.1 بتاريخ 18 سبتمبر 2026. ويذكر ملف README: «Promptfoo is now part of OpenAI. Promptfoo remains open source and MIT licensed.» استخدمها لإدخال اختبارات الأوامر والفحوص العدائية في عملية البناء. القيد: تتوقف النتائج على المزوّد والحَكَم المُعدَّين، ويتطلب معظم المزودين مفاتيح API. وتغيّر الملكية حقيقة تتعلق بالحوكمة تستحق الانتباه عند اختيار أداة لعمل خاضع للتنظيم.

Giskard

Giskard مكتبة Python بترخيص Apache-2.0 من منظمة Giskard-AI. يتضمن إصدارها الثالث مكوّنين يوصفان بأنهما مستقران: giskard-checks، وهو إطار اختبار يستخدم السيناريوهات وتقييمات LLM-as-judge، وgiskard-scan، وهو أداة لفحص ثغرات الوكلاء. استخدمها لاختبار أنظمة الوكلاء والأنظمة المعززة بالاسترجاع. القيود: يتطلب الإصدار الثالث Python 3.12 أو أحدث، والإصدار الثاني، الذي كان يغطي فحص البيانات الجدولية وتعلّم الآلة التقليدي، لم يعد يُصان بنشاط.

4. ضوابط الحماية أثناء التشغيل ورصد حقن الأوامر

تقع ضوابط الحماية في مسار الطلب، وتصنّف المدخلات والمخرجات أو تقيّدها أثناء عمل التطبيق.

Llama Guard وPrompt Guard وLlamaFirewall

يجمع مشروع Purple Llama من Meta ضمانات للنماذج المفتوحة. فـ Llama Guard عائلة من نماذج إشراف على المدخلات والمخرجات. ويوصف Prompt Guard 2 بأنه مصنِّف خفيف لمحاولات حقن الأوامر المباشرة، ويجمعه LlamaFirewall مع أداة فحص للتحقق من الاتساق وأداة فحص للشيفرة مخصصة للوكلاء. وبحسب جدول التراخيص في المشروع، تُوزَّع النماذج بموجب Llama Community Licences، فيما تحمل مكونات أخرى، مثل Code Shield والتقييمات، ترخيص MIT. والنماذج على Hugging Face مقيّدة الوصول. استخدمها حيث يكون وضع مصنِّف صغير أمام النموذج مقبولًا. القيود: يقلّل المصنِّف المحاولات التي تشبه أنماطًا معروفة، ولا يزيل فئة الهجوم نفسها.

NeMo Guardrails

NeMo Guardrails مجموعة أدوات بترخيص Apache-2.0 من NVIDIA لإضافة ضوابط قابلة للبرمجة إلى تطبيقات LLM، باستخدام لغة نمذجة تُسمى Colang للتحكم في مسار الحوار. آخر إصدار هو v0.24.1 بتاريخ 16 سبتمبر 2026. استخدمها لتقييد الموضوعات والصيغ ومسارات الحوار. القيد: الضوابط سياسة يكتبها المطوّر، فلا تتسع تغطيتها إلا بقدر ما توقّعه.

Rebuff وLLM Guard، المؤرشفتان الآن

أُرشفت Rebuff، وهي كاشف لحقن الأوامر يحصّن نفسه ذاتيًا بالاستدلالات وفحص LLM ومخزن متجهات للهجمات السابقة ورموز الكناري، في 16 مايو 2025. ويذكر ملف README الخاص بها أنها نموذج أولي ولا يمكنها توفير حماية كاملة من حقن الأوامر. أما LLM Guard، وهي مجموعة أدوات بترخيص MIT لفحص المدخلات والمخرجات من الجهة المشرفة نفسها، فقد أُرشفت في يوليو 2026. وتبقى كلتاهما متاحة للقراءة مرجعًا. وتوضحان نقطة عملية: قد تفقد مشاريع الكواشف من يصونها، ولذلك ينبغي أن يكون ضابط الحماية قابلًا للاستبدال.

5. أدوات فحص أمن الوكلاء وMCP

يضيف الوكلاء أدوات، وأوصاف الأدوات نص يقرؤه النموذج. وتفحص أدوات هذه المجموعة تلك الأدوات وإعداداتها.

Snyk Agent Scan

Agent Scan، المعروفة سابقًا باسم MCP-Scan، أداة فحص بترخيص Apache-2.0 تصونها Snyk. تكتشف مكونات الوكلاء على الجهاز، بما فيها خوادم MCP والمهارات عبر عملاء مثل Claude وCursor وVS Code وGitHub Copilot، وتفحصها بحثًا عن حقن الأوامر وتسميم الأدوات والمشكلات المتصلة بهما. آخر إصدار هو v0.6.8 بتاريخ 29 سبتمبر 2026. استخدمها لتدقيق ما ثبّته المطوّر على جهازه. القيود: يذكر ملف README أنها لا تقبل مساهمات خارجية حاليًا، وأن هناك خطّي إصدار بصيغتي مخرجات مختلفتين.

Cisco MCP Scanner

MCP Scanner أداة بترخيص Apache-2.0 من Cisco AI Defense. تحلّل أدوات MCP وأوامره وموارده واعتمادياته بثلاثة محركات يمكن تشغيلها منفردة أو مجتمعة: قواعد YARA، وتحليل LLM، وواجهة Cisco AI Defense API. آخر إصدار هو 4.8.4 بتاريخ 28 أغسطس 2026. استخدمها لفحص خادم قبل اعتماده. القيد: يحتاج محركا LLM وAPI إلى بيانات اعتماد خارجية، وفحص وصف الخادم لا يقول الكثير عمّا تفعله شيفرته بعد أي تحديث.

6. موقع ضوابط الشبكة

تفحص الأدوات السابقة الملفات والنماذج والأوامر والإعدادات. ولا يقرر أيٌّ منها أي تطبيق يحق له فتح اتصال بأي خادم. هذا دور التحكم في حركة البيانات الصادرة، وهو مهم لأن المخاطر الواردة في الأقسام السابقة تلتقي عند الشبكة: فبيئة تشغيل نموذج معدَّلة، أو أداة مسمَّمة، أو وكيل تعرّض لحقن، كلها تحتاج إلى بلوغ وجهة ما لتسريب البيانات أو تلقي التعليمات.

FireAI، من تطوير HisnLabs، جدار حماية للاتصالات الصادرة على macOS. يعمل بوصفه مرشّح محتوى ضمن Apple Network Extension، ويتعرّف على كل تطبيق من توقيع شيفرته، ويمكنه السماح بكل وجهة أو حظرها أو السؤال عنها، مع قواعد لكل تطبيق أو نطاق أو عنوان. وعند تطبيق ذلك على أعمال الذكاء الاصطناعي على جهاز Mac، يعني هذا أن خادم استدلال أو وكيل برمجة أو عميل MCP يمكن حصره في الوجهات التي تحتاج إليها مهمته، وأن أي وجهة جديدة تستدعي قرارًا. وتصف وثائق المرشّح ما يراه FireAI: هوية التطبيق، والمضيف أو العنوان البعيد، والمنفذ، والبروتوكول.

لا يفحص FireAI ملفات النماذج، ولا يتحقق من التواقيع، ولا يجري اختبار فريق أحمر على النموذج، ولا يصنّف الأوامر. ولا يقرأ محتوى الاتصالات المشفّرة، فلا يستطيع التمييز بين طلب مشروع وآخر محقون حين يتجه كلاهما إلى وجهة مسموح بها. إنه يكمّل الأدوات السابقة ولا يحل محل أي منها.

المقارنة

المصادر: مستودع كل مشروع أو وثائقه، قُرئت في 30 سبتمبر 2026. تعكس الحالة صفحة المستودع، لا حكمًا على الجودة.
الأداةالمهمةالجهة المشرفةالترخيصالحالة في 30 سبتمبر 2026
ModelScanفحص ملفات النماذجProtect AIApache-2.0نشطة، v0.8.8
picklescanفحص picklemmaitre314MITنشطة، v1.0.5
ficklingتحليل pickleTrail of BitsLGPL-3.0نشطة، v0.1.12
safetensorsصيغة آمنة للأوزانHugging FaceApache-2.0نشطة
model-transparencyتوقيع النماذجSigstoreApache-2.0نشطة، v1.1.1
CycloneDXمواصفة ML-BOMOWASP، Ecma TC54Apache-2.0 (المخططات)نشطة، 1.7
Instructional Fingerprintingبصمة النموذج (بحثية)مؤلفو الورقةMITآخر تحديث يوليو 2024
MarkLLMعلامات مائية للنص (بحثية)THU-BPMApache-2.0نشطة
garakفحص الثغراتNVIDIAApache-2.0نشطة، v0.17.0
PyRITإطار عمل للفريق الأحمرMicrosoftMITنشطة، v1.1.0
promptfooالتقييمات واختبار الفريق الأحمرPromptfoo، جزء من OpenAIMITنشطة، 0.123.1
Giskard v3اختبار الوكلاء وفحصهمGiskard-AIApache-2.0نشطة؛ v2 غير مصانة
Llama Guard، Prompt Guardنماذج حمايةMetaLlama Community Licencesنماذج مؤرخة أبريل 2025
NeMo Guardrailsضوابط قابلة للبرمجةNVIDIAApache-2.0نشطة، v0.24.1
Rebuff، LLM Guardرصد الحقنProtect AIApache-2.0، MITمؤرشفة
Agent Scanفحص الوكلاء وMCPSnykApache-2.0نشطة، v0.6.8
MCP Scannerفحص خوادم MCPCisco AI DefenseApache-2.0نشطة، 4.8.4
FireAIتحكم في الاتصالات الصادرة لكل تطبيق على macOSHisnLabsتجاريلا يفحص النماذج

القيود

  • لا تغطي أي أداة منفردة المهام الست. فالفحص النظيف لملف لا يقول شيئًا عن سلوك النموذج، والتوقيع لا يقول شيئًا عن السلامة، وفحص الفريق الأحمر لا يقول شيئًا عن محتوى الملف.
  • أدوات الفحص وضوابط الحماية كواشف. قد تفوتها تقنيات جديدة، كما تقرّ وثائق ModelScan وpicklescan وRebuff كلٌّ على حدة، وتتغير تغطيتها مع تغيّر الهجمات.
  • الصيانة متفاوتة. فمشروعان من مشاريع الكواشف المذكورة هنا مؤرشفان، وأداة واحدة تغيّر مالكها، وأخرى يصونها فرد، ومستودع بحثي واحد لم يتغير منذ 2024. تحقق من حالة المشروع قبل البناء عليه.
  • اقتصر هذا الاستعراض على الأدوات المفتوحة التي أمكن قراءة مصادرها الأولية. وهو يستبعد المنصات التجارية ولا يقارن نتائج الرصد، لأن المصادر لا تقدّم أرقامًا قابلة للمقارنة.
  • قُرئت التراخيص من صفحات المستودعات وجداول التراخيص. تحقق منها قبل إعادة التوزيع، ولا سيما Llama Community Licences وشروط LGPL الخاصة بـ fickling.
  • ترى طبقة الشبكة الاتصالات لا معانيها. فالوجهة المسموح بها قد تتلقى مع ذلك بيانات من بيئة تشغيل نموذج مخترقة.

دور FireAI وHisnLabs

افحص النموذج، ووقّعه، واختبره. ثم قرّر إلى أين يحق لتطبيقه أن يتصل.

FireAI هو منتج HisnLabs نفسها: جدار حماية بذكاء اصطناعي يعمل على جهاز Mac مباشرة. يعرض بلغة واضحة كل اتصال تجريه تطبيقاتك، ويترك لك القرار فيما يخرج من جهازك — ذكاؤه الاصطناعي يعمل محليًا، فلا يُرسَل ترافيكك إلينا ولا إلى أي جهة أخرى أبدًا. فريق أبحاث الأمن في HisnLabs هو من يحافظ على دقة هذه القرارات: يصنّف النطاقات بين قياس عن بُعد عادي وخدمة حقيقية، ويتتبّع بلد وشبكة كل اتصال، ويدرّب النموذج المحلي (ميزة FireAI Pilot) على حركة اتصال حقيقية، دون أن يغادر أي شيء جهاز Mac.

يمكنك الاطلاع على القرارات التقنية وراء ذلك، أو تجربة FireAI لمدة 17 يومًا، على FireAI من HisnLabs.

المصادر