أمن نماذج الذكاء الاصطناعي ليس تخصصًا واحدًا، بل ست مهام لكل منها أدواتها: فحص ملفات النماذج، وإثبات مصدرها، واختبار النموذج بحثًا عن نقاط ضعفه، وحمايته أثناء التشغيل، وتدقيق أدوات الوكلاء المحيطة به، وتقييد الوجهات التي يمكن للتطبيق المستضيف الاتصال بها. يغطي هذا الاستعراض، الذي أعدّته HisnLabs، مطوّرة FireAI، أدوات مفتوحة قُرئت مستودعاتها أو وثائقها في 30 سبتمبر 2026. وتُذكر التراخيص والجهات المشرفة والحالة كما تعرضها المصادر الأولية، ولا تُقدَّم أي أداة على أخرى، لأن المهام لا تتنافس فيما بينها.
النطاق والمنهج
لم تُدرج أي أداة إلا إذا أمكن فتح مستودعها الرسمي أو وثائقها، وتحديد ترخيصها، والتحقق من حالة صيانتها (مؤرشفة أم نشطة، وتاريخ آخر إصدار لها حين تعرضه صفحة الإصدارات). والإصدارات المذكورة أدناه هي الأحدث وقت القراءة. لا شيء هنا قياس للأداء: فالمصادر لا تقدّم نتائج رصد قابلة للمقارنة، ولا يُدّعى شيء من ذلك. وتُستبعد المنصات التجارية ما لم يكن مكوّن مفتوح منها هو موضوع الحديث.
تتبع الفئات الترتيب الذي يمر به النموذج داخل مشروع ما: يُنزَّل ملف، ويُتحقق من مصدره، ويُختبر النموذج، ثم يُنشر خلف ضوابط حماية، ويُوصل بالأدوات، ثم يصل التطبيق الذي يشغّله إلى الشبكة. وتمثل OWASP Top 10 for Large Language Model Applications، التي تُصان ضمن مشروع OWASP GenAI Security Project، المفردات المشتركة المعتادة للمخاطر على مستوى التطبيق في الفئات من الثالثة إلى الخامسة.
1. فحص ملفات النماذج
كثير من ملفات النماذج مُسلسَل بصيغة pickle في Python، التي يمكن أن تنفّذ شيفرة عند تحميلها. وتنص وثائق Hugging Face على أن تحميل ملف pickle «يعني أن شيفرة يمكن أن تُنفَّذ»، وتذكر رموز التشغيل GLOBAL وSTACK_GLOBAL وREDUCE بوصفها مصدر التهديد. Hugging Face: Pickle scanning تقرأ أدوات الفحص تعليمات الملف من دون تحميله، وتنبّه إلى عمليات الاستيراد الخطرة.
ModelScan
تصون Protect AI أداة ModelScan بترخيص Apache-2.0. وهي تفحص الصيغ القائمة على pickle (PyTorch وscikit-learn وXGBoost وjoblib وcloudpickle)، وملفات TensorFlow SavedModel، وملفات Keras بصيغتي H5 وV3، وترتّب النتائج بحسب الخطورة، وتنتهي برموز خروج تناسب خطوط CI. آخر إصدار على صفحتها هو v0.8.8 بتاريخ 18 فبراير 2026، وأظهر المستودع نشاطًا في 28 سبتمبر 2026. استخدمها بوابةً قبل دخول نموذج منزَّل إلى عملية بناء. القيد: يصف ملف README رصدًا قائمًا على التواقيع قد ينتج إيجابيات كاذبة وسلبيات كاذبة، وتحتاج النتائج إلى مراجعة بشرية.
picklescan
picklescan أداة فحص بترخيص MIT يصونها حساب فردي هو mmaitre314. وتذكر وثائق Hugging Face أداة picklescan ضمن الأدوات التي طوّرتها للـ Hub. آخر إصدار هو v1.0.5 بتاريخ 1 يوليو 2026. تفحص ملفات pickle وأرشيفات PyTorch وحاويات ZIP، ويمكنها فحص مسار محلي أو عنوان URL أو نموذج على Hugging Face. استخدمها لفحص سريع ضمن برنامج نصي. القيد: تطابق العمليات الخطرة بالأنماط، فقد تمر تقنية جديدة، وهي تبلّغ عن النتائج من دون إزالتها.
fickling
fickling من Trail of Bits مرخّصة بـ LGPL-3.0. وتوصف بأنها أداة لفك الترجمة ومحلل ساكن ومعيد كتابة لشيفرة bytecode في pickle. يمكنها فك ترجمة ملف pickle إلى Python مقروءة، والتحقق من سلامته بالتحليل الساكن، وإطلاق خطأ قبل تحميل ملف غير آمن. آخر إصدار هو v0.1.12 بتاريخ 26 يونيو 2026. استخدمها حين يجب فهم النتيجة لا الاكتفاء بالتنبيه إليها. القيد: إنها أداة تحليل لـ pickle، ولا تغطي الصيغ الأخرى التي تقرؤها ModelScan. كما تختلف شروط ترخيصها عن التراخيص المتساهلة لأدوات الفحص الأخرى.
فحص Hugging Face Hub وsafetensors
يفحص الـ Hub كل ملف يُرفع إليه باستخدام ClamAV وبفحص لعمليات الاستيراد في pickle يسرد الاستيرادات داخل كل ملف مُسلسَل ويبرز المريب منها. Hugging Face: file scanning كما يعرض نتائج أداة فحص من طرف ثالث، هي Guardian من Protect AI، على المستودعات العامة. Hugging Face: Protect AI القيد، كما تذكره Hugging Face: فحص pickle ليس معصومًا تمامًا، وقوائمه تُصان بحسب الجهد المتاح، والتحقق مما هو آمن مسؤولية المستخدم. والبديل البنيوي هو safetensors، وهي صيغة بترخيص Apache-2.0 تصونها Hugging Face، تخزّن الموترات من دون محتوى قابل للتنفيذ. تزيل هذه الصيغة خطر pickle بالنسبة إلى الأوزان، لكنها لا تقول شيئًا عن مدى الثقة بالأوزان نفسها.
2. مصدر النموذج وتوقيعه وبصمته
يسأل الفحص عمّا إذا كان تحميل الملف خطرًا. أما إثبات المصدر فيسأل عمّن أنتجه وما إذا كان قد تغيّر منذ ذلك الحين. والسؤالان يحتاجان إلى أدوات مختلفة.
Sigstore model-transparency
model-transparency مشروع بترخيص Apache-2.0 ضمن منظمة Sigstore، يوقّع نماذج تعلّم الآلة ويتحقق منها. يمكنه التوقيع عبر Sigstore، أو بالمفاتيح أو الشهادات أو أجهزة PKCS #11، وينتج حزمة تحتوي غلاف DSSE مع بيان in-toto. آخر إصدار له هو v1.1.1 بتاريخ 10 أكتوبر 2025، مع إيداعات في سبتمبر 2026. استخدمه ليتمكن المستهلك من التحقق من أن الملفات التي بين يديه هي التي وقّعها الناشر. القيود: تذكر الوثائق دعم تجزئة الملفات وأجزاء الملفات، لا الموترات المفردة، والتوقيع الصالح يثبت المصدر والسلامة من التعديل، لا أن النموذج آمن. وتميّز Hugging Face التمييز نفسه بالنسبة إلى الإيداعات الموقّعة، التي تضمن «مصدر الملف» لا أنه آمن.
قوائم مكونات الذكاء الاصطناعي وتعلّم الآلة
تدرج CycloneDX، التي تصونها مؤسسة OWASP واللجنة TC54 في Ecma International، قائمة مكونات تعلّم الآلة (ML-BOM) ضمن أنواع قوائم المكونات التي تدعمها. نُشر آخر إصداراتها، 1.7، في 21 أكتوبر 2025، ومخططاتها بترخيص Apache-2.0. ويوثّق ملف تعريف الذكاء الاصطناعي في SPDX 3.0 مكونات الذكاء الاصطناعي، كالنماذج ومجموعات البيانات والأوامر، في سجل واحد مترابط. استخدم أيًّا منهما للاحتفاظ بجرد للنماذج ومجموعات البيانات والإصدارات التي يحتويها منتج ما، وهو أول ما تحتاج إليه الاستجابة للحوادث. القيد: قائمة المكونات تسجّل ما يصرّح به المؤلف، ولا تتحقق أيٌّ من الصيغتين من صحة التصريح.
أدوات بحثية للبصمة والعلامات المائية
Instructional Fingerprinting هي شيفرة ورقة أكاديمية (arXiv 2401.12255) تضمّن بصمة في نموذج لغوي ليتمكن مالكه لاحقًا من اختبار ما إذا كان نموذج آخر مشتقًا منه. وهي شيفرة بحثية بترخيص MIT، وكان آخر تحديث لمستودعها في يوليو 2024. أما MarkLLM، من مجموعة THU-BPM، فهي مجموعة أدوات بترخيص Apache-2.0 لوضع علامات مائية على النص الذي يولّده LLM، قُدّمت عرضًا توضيحيًا في EMNLP 2024. تجيب الأداتان عن سؤالين مختلفين: الأولى تَسِم النموذج، والثانية تَسِم مخرجاته. استخدمهما لدراسة الإسناد، لا ضابطًا في بيئة الإنتاج. القيد: كلتاهما نتاج بحثي، ولا تغني أيٌّ منهما عن توقيع ملف موزَّع.
3. اختبار الفريق الأحمر لـ LLM وفحص الثغرات
ترسل هذه الأدوات مدخلات عدائية إلى نموذج أو تطبيق وتسجّل كيفية استجابته. إنها تختبر السلوك لا الملفات.
garak
garak أداة لفحص ثغرات LLM بترخيص Apache-2.0 تصونها NVIDIA. يقول ملف README إنها تتحقق «مما إذا كان يمكن دفع LLM إلى الإخفاق بطريقة لا نريدها»، عبر مجسّات لحقن الأوامر وتسرّب البيانات والهلوسة والمحتوى السام وكسر القيود، يقترن كل منها بكاشف. آخر إصدار هو v0.17.0 بتاريخ 9 سبتمبر 2026. استخدمها فحصًا أساسيًا واسعًا لنقطة نهاية نموذج. القيود: تحتاج إلى وصول عبر API أو نشر محلي للهدف، وبعض المجسّات كثيف الاستهلاك للموارد، ويشير ملف README إلى دعم محدود لنماذج الرؤية وإلى أن بعض المجسّات في طور النموذج الأولي.
PyRIT
PyRIT إطار عمل بترخيص MIT يوصف بأنه مبني لمتخصصي الأمن والمهندسين لتحديد المخاطر في أنظمة الذكاء الاصطناعي التوليدي. تصونه Microsoft، وآخر إصدار هو v1.1.0 بتاريخ 4 سبتمبر 2026. وقد أُرشف المستودع السابق ضمن منظمة Azure في 27 مارس 2026 مع إحالة إلى مستودع Microsoft، فالروابط إلى العنوان القديم تشير إلى نسخة للقراءة فقط. استخدمه لحملات فريق أحمر مبرمجة ومتعددة الجولات يتولاها فريق مستعد لكتابة الشيفرة. القيد: إنه إطار عمل، لا أداة فحص تعمل بأمر واحد.
promptfoo
promptfoo أداة سطر أوامر ومكتبة بترخيص MIT لتقييم تطبيقات LLM ولاختبار الفريق الأحمر وفحص الثغرات، مع تكامل مع CI. آخر إصدار هو 0.123.1 بتاريخ 18 سبتمبر 2026. ويذكر ملف README: «Promptfoo is now part of OpenAI. Promptfoo remains open source and MIT licensed.» استخدمها لإدخال اختبارات الأوامر والفحوص العدائية في عملية البناء. القيد: تتوقف النتائج على المزوّد والحَكَم المُعدَّين، ويتطلب معظم المزودين مفاتيح API. وتغيّر الملكية حقيقة تتعلق بالحوكمة تستحق الانتباه عند اختيار أداة لعمل خاضع للتنظيم.
Giskard
Giskard مكتبة Python بترخيص Apache-2.0 من منظمة Giskard-AI. يتضمن إصدارها الثالث مكوّنين يوصفان بأنهما مستقران: giskard-checks، وهو إطار اختبار يستخدم السيناريوهات وتقييمات LLM-as-judge، وgiskard-scan، وهو أداة لفحص ثغرات الوكلاء. استخدمها لاختبار أنظمة الوكلاء والأنظمة المعززة بالاسترجاع. القيود: يتطلب الإصدار الثالث Python 3.12 أو أحدث، والإصدار الثاني، الذي كان يغطي فحص البيانات الجدولية وتعلّم الآلة التقليدي، لم يعد يُصان بنشاط.
4. ضوابط الحماية أثناء التشغيل ورصد حقن الأوامر
تقع ضوابط الحماية في مسار الطلب، وتصنّف المدخلات والمخرجات أو تقيّدها أثناء عمل التطبيق.
Llama Guard وPrompt Guard وLlamaFirewall
يجمع مشروع Purple Llama من Meta ضمانات للنماذج المفتوحة. فـ Llama Guard عائلة من نماذج إشراف على المدخلات والمخرجات. ويوصف Prompt Guard 2 بأنه مصنِّف خفيف لمحاولات حقن الأوامر المباشرة، ويجمعه LlamaFirewall مع أداة فحص للتحقق من الاتساق وأداة فحص للشيفرة مخصصة للوكلاء. وبحسب جدول التراخيص في المشروع، تُوزَّع النماذج بموجب Llama Community Licences، فيما تحمل مكونات أخرى، مثل Code Shield والتقييمات، ترخيص MIT. والنماذج على Hugging Face مقيّدة الوصول. استخدمها حيث يكون وضع مصنِّف صغير أمام النموذج مقبولًا. القيود: يقلّل المصنِّف المحاولات التي تشبه أنماطًا معروفة، ولا يزيل فئة الهجوم نفسها.
NeMo Guardrails
NeMo Guardrails مجموعة أدوات بترخيص Apache-2.0 من NVIDIA لإضافة ضوابط قابلة للبرمجة إلى تطبيقات LLM، باستخدام لغة نمذجة تُسمى Colang للتحكم في مسار الحوار. آخر إصدار هو v0.24.1 بتاريخ 16 سبتمبر 2026. استخدمها لتقييد الموضوعات والصيغ ومسارات الحوار. القيد: الضوابط سياسة يكتبها المطوّر، فلا تتسع تغطيتها إلا بقدر ما توقّعه.
Rebuff وLLM Guard، المؤرشفتان الآن
أُرشفت Rebuff، وهي كاشف لحقن الأوامر يحصّن نفسه ذاتيًا بالاستدلالات وفحص LLM ومخزن متجهات للهجمات السابقة ورموز الكناري، في 16 مايو 2025. ويذكر ملف README الخاص بها أنها نموذج أولي ولا يمكنها توفير حماية كاملة من حقن الأوامر. أما LLM Guard، وهي مجموعة أدوات بترخيص MIT لفحص المدخلات والمخرجات من الجهة المشرفة نفسها، فقد أُرشفت في يوليو 2026. وتبقى كلتاهما متاحة للقراءة مرجعًا. وتوضحان نقطة عملية: قد تفقد مشاريع الكواشف من يصونها، ولذلك ينبغي أن يكون ضابط الحماية قابلًا للاستبدال.
5. أدوات فحص أمن الوكلاء وMCP
يضيف الوكلاء أدوات، وأوصاف الأدوات نص يقرؤه النموذج. وتفحص أدوات هذه المجموعة تلك الأدوات وإعداداتها.
Snyk Agent Scan
Agent Scan، المعروفة سابقًا باسم MCP-Scan، أداة فحص بترخيص Apache-2.0 تصونها Snyk. تكتشف مكونات الوكلاء على الجهاز، بما فيها خوادم MCP والمهارات عبر عملاء مثل Claude وCursor وVS Code وGitHub Copilot، وتفحصها بحثًا عن حقن الأوامر وتسميم الأدوات والمشكلات المتصلة بهما. آخر إصدار هو v0.6.8 بتاريخ 29 سبتمبر 2026. استخدمها لتدقيق ما ثبّته المطوّر على جهازه. القيود: يذكر ملف README أنها لا تقبل مساهمات خارجية حاليًا، وأن هناك خطّي إصدار بصيغتي مخرجات مختلفتين.
Cisco MCP Scanner
MCP Scanner أداة بترخيص Apache-2.0 من Cisco AI Defense. تحلّل أدوات MCP وأوامره وموارده واعتمادياته بثلاثة محركات يمكن تشغيلها منفردة أو مجتمعة: قواعد YARA، وتحليل LLM، وواجهة Cisco AI Defense API. آخر إصدار هو 4.8.4 بتاريخ 28 أغسطس 2026. استخدمها لفحص خادم قبل اعتماده. القيد: يحتاج محركا LLM وAPI إلى بيانات اعتماد خارجية، وفحص وصف الخادم لا يقول الكثير عمّا تفعله شيفرته بعد أي تحديث.
6. موقع ضوابط الشبكة
تفحص الأدوات السابقة الملفات والنماذج والأوامر والإعدادات. ولا يقرر أيٌّ منها أي تطبيق يحق له فتح اتصال بأي خادم. هذا دور التحكم في حركة البيانات الصادرة، وهو مهم لأن المخاطر الواردة في الأقسام السابقة تلتقي عند الشبكة: فبيئة تشغيل نموذج معدَّلة، أو أداة مسمَّمة، أو وكيل تعرّض لحقن، كلها تحتاج إلى بلوغ وجهة ما لتسريب البيانات أو تلقي التعليمات.
FireAI، من تطوير HisnLabs، جدار حماية للاتصالات الصادرة على macOS. يعمل بوصفه مرشّح محتوى ضمن Apple Network Extension، ويتعرّف على كل تطبيق من توقيع شيفرته، ويمكنه السماح بكل وجهة أو حظرها أو السؤال عنها، مع قواعد لكل تطبيق أو نطاق أو عنوان. وعند تطبيق ذلك على أعمال الذكاء الاصطناعي على جهاز Mac، يعني هذا أن خادم استدلال أو وكيل برمجة أو عميل MCP يمكن حصره في الوجهات التي تحتاج إليها مهمته، وأن أي وجهة جديدة تستدعي قرارًا. وتصف وثائق المرشّح ما يراه FireAI: هوية التطبيق، والمضيف أو العنوان البعيد، والمنفذ، والبروتوكول.
لا يفحص FireAI ملفات النماذج، ولا يتحقق من التواقيع، ولا يجري اختبار فريق أحمر على النموذج، ولا يصنّف الأوامر. ولا يقرأ محتوى الاتصالات المشفّرة، فلا يستطيع التمييز بين طلب مشروع وآخر محقون حين يتجه كلاهما إلى وجهة مسموح بها. إنه يكمّل الأدوات السابقة ولا يحل محل أي منها.
المقارنة
| الأداة | المهمة | الجهة المشرفة | الترخيص | الحالة في 30 سبتمبر 2026 |
|---|---|---|---|---|
| ModelScan | فحص ملفات النماذج | Protect AI | Apache-2.0 | نشطة، v0.8.8 |
| picklescan | فحص pickle | mmaitre314 | MIT | نشطة، v1.0.5 |
| fickling | تحليل pickle | Trail of Bits | LGPL-3.0 | نشطة، v0.1.12 |
| safetensors | صيغة آمنة للأوزان | Hugging Face | Apache-2.0 | نشطة |
| model-transparency | توقيع النماذج | Sigstore | Apache-2.0 | نشطة، v1.1.1 |
| CycloneDX | مواصفة ML-BOM | OWASP، Ecma TC54 | Apache-2.0 (المخططات) | نشطة، 1.7 |
| Instructional Fingerprinting | بصمة النموذج (بحثية) | مؤلفو الورقة | MIT | آخر تحديث يوليو 2024 |
| MarkLLM | علامات مائية للنص (بحثية) | THU-BPM | Apache-2.0 | نشطة |
| garak | فحص الثغرات | NVIDIA | Apache-2.0 | نشطة، v0.17.0 |
| PyRIT | إطار عمل للفريق الأحمر | Microsoft | MIT | نشطة، v1.1.0 |
| promptfoo | التقييمات واختبار الفريق الأحمر | Promptfoo، جزء من OpenAI | MIT | نشطة، 0.123.1 |
| Giskard v3 | اختبار الوكلاء وفحصهم | Giskard-AI | Apache-2.0 | نشطة؛ v2 غير مصانة |
| Llama Guard، Prompt Guard | نماذج حماية | Meta | Llama Community Licences | نماذج مؤرخة أبريل 2025 |
| NeMo Guardrails | ضوابط قابلة للبرمجة | NVIDIA | Apache-2.0 | نشطة، v0.24.1 |
| Rebuff، LLM Guard | رصد الحقن | Protect AI | Apache-2.0، MIT | مؤرشفة |
| Agent Scan | فحص الوكلاء وMCP | Snyk | Apache-2.0 | نشطة، v0.6.8 |
| MCP Scanner | فحص خوادم MCP | Cisco AI Defense | Apache-2.0 | نشطة، 4.8.4 |
| FireAI | تحكم في الاتصالات الصادرة لكل تطبيق على macOS | HisnLabs | تجاري | لا يفحص النماذج |
القيود
- لا تغطي أي أداة منفردة المهام الست. فالفحص النظيف لملف لا يقول شيئًا عن سلوك النموذج، والتوقيع لا يقول شيئًا عن السلامة، وفحص الفريق الأحمر لا يقول شيئًا عن محتوى الملف.
- أدوات الفحص وضوابط الحماية كواشف. قد تفوتها تقنيات جديدة، كما تقرّ وثائق ModelScan وpicklescan وRebuff كلٌّ على حدة، وتتغير تغطيتها مع تغيّر الهجمات.
- الصيانة متفاوتة. فمشروعان من مشاريع الكواشف المذكورة هنا مؤرشفان، وأداة واحدة تغيّر مالكها، وأخرى يصونها فرد، ومستودع بحثي واحد لم يتغير منذ 2024. تحقق من حالة المشروع قبل البناء عليه.
- اقتصر هذا الاستعراض على الأدوات المفتوحة التي أمكن قراءة مصادرها الأولية. وهو يستبعد المنصات التجارية ولا يقارن نتائج الرصد، لأن المصادر لا تقدّم أرقامًا قابلة للمقارنة.
- قُرئت التراخيص من صفحات المستودعات وجداول التراخيص. تحقق منها قبل إعادة التوزيع، ولا سيما Llama Community Licences وشروط LGPL الخاصة بـ fickling.
- ترى طبقة الشبكة الاتصالات لا معانيها. فالوجهة المسموح بها قد تتلقى مع ذلك بيانات من بيئة تشغيل نموذج مخترقة.
دور FireAI وHisnLabs
افحص النموذج، ووقّعه، واختبره. ثم قرّر إلى أين يحق لتطبيقه أن يتصل.
FireAI هو منتج HisnLabs نفسها: جدار حماية بذكاء اصطناعي يعمل على جهاز Mac مباشرة. يعرض بلغة واضحة كل اتصال تجريه تطبيقاتك، ويترك لك القرار فيما يخرج من جهازك — ذكاؤه الاصطناعي يعمل محليًا، فلا يُرسَل ترافيكك إلينا ولا إلى أي جهة أخرى أبدًا. فريق أبحاث الأمن في HisnLabs هو من يحافظ على دقة هذه القرارات: يصنّف النطاقات بين قياس عن بُعد عادي وخدمة حقيقية، ويتتبّع بلد وشبكة كل اتصال، ويدرّب النموذج المحلي (ميزة FireAI Pilot) على حركة اتصال حقيقية، دون أن يغادر أي شيء جهاز Mac.
يمكنك الاطلاع على القرارات التقنية وراء ذلك، أو تجربة FireAI لمدة 17 يومًا، على FireAI من HisnLabs.
