# بطاقة نظام Claude Opus 5.5 تصف اختبارات الفريق الأحمر لدى Anthropic وما تتركه اختبارات النموذج للجهات المشغِّلة > تعرض بطاقة النظام الصادرة في 22 سبتمبر 2026 اختبارات الفريق الأحمر الخارجية واختبارات حقن التعليمات لـ Claude Opus 5.5، وما يبقى على عاتق الجهات المشغِّلة. FireAI Security & Research Team (HisnLabs) · Published 2026-09-30 Canonical: https://hisnlabs.com/ar/news/anthropic-claude-opus-5-5-system-card-red-teaming نشرت Anthropic بطاقة النظام (system card) الخاصة بـ Claude Opus 5.5 في 22 سبتمبر 2026. وتعرض البطاقة اختبارات ما قبل النشر التي تجمع بين التقييمات الآلية وتجارب قياس الأثر المعزِّز (uplift) واختبارات الفريق الأحمر التي يجريها خبراء من جهات خارجية وتقييمات جهات ثالثة [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). والبطاقة أحدث رواية منشورة عن طريقة اختبار Anthropic لنماذجها، وهي تعرض نتائج يمكن للمؤسسة المشغِّلة قراءتها، إلى جانب حدود لا يزيلها أي اختبار على مستوى النموذج. ## الخلفية وصفت Anthropic نهجها العام في اختبارات الفريق الأحمر في منشور صدر في يونيو 2024. ويسرد المنشور اختبارات الخبراء في مجالات محددة (منها اختبار ثغرات السياسات، والتهديدات المتقدمة، والاختبار متعدد اللغات)، والاختبار الآلي القائم على النماذج، والاختبار متعدد الوسائط، والأساليب المفتوحة القائمة على الجمهور والمجتمع، ويلاحظ أن أساليب الخبراء تحتاج إلى معرفة متخصصة لكنها لا تتوسع، بينما تجد الأساليب الآلية صعوبة في كشف التهديدات الجديدة [[2]](https://www.anthropic.com/news/challenges-in-red-teaming-ai-systems). ويقول منشور صادر في مارس 2025 عن فريقها الأحمر للحدود (Frontier Red Team) إن الفريق يقيّم مخاطر الأمن السيبراني والأمن البيولوجي وغيرها من المخاطر الكيميائية والبيولوجية والإشعاعية والنووية (CBRN) والاستقلالية، وإن معهدي سلامة الذكاء الاصطناعي في الولايات المتحدة والمملكة المتحدة أجريا اختبارات ما قبل النشر على Claude 3.5 Sonnet ‏[[3]](https://www.anthropic.com/news/strategic-warning-for-ai-risk-progress-and-insights-from-our-frontier-red-team). وتحدد النسخة 3.4 من سياسة التوسع المسؤول (Responsible Scaling Policy)، السارية منذ 8 يوليو 2026، عتبات للقدرات ومستويات لسلامة الذكاء الاصطناعي، وتصف تقارير القدرات وتقارير الضمانات مع مراجعة خارجية للمواد غير المنقّحة [[4]](https://www.anthropic.com/responsible-scaling-policy). ## ما تصفه المصادر اختبار التهديدات. فيما يخص المخاطر الكيميائية والبيولوجية، تقول البطاقة إن Anthropic تعامل Opus 5.5 على أنه يملك قدرات تتصل بتخليق أسلحة غير مستجدة (CB-1) لا أسلحة مستجدة (CB-2)، وتنشره مع ضمانات بيولوجية موسّعة. وفي المجال السيبراني، لا تورد أي مؤشر على قدرة النموذج على تطوير قدرات هجومية جديدة، وتقول إنه لم يُعثر على كسر حماية (jailbreak) بدرجة خطورة حرجة، مع توسيع هامش الأمان مؤقتًا. وتورد البطاقة كذلك اختبارات ما قبل النشر مع METR بشأن قدرات البحث والتطوير في الذكاء الاصطناعي، وتعاونًا مع مركز معايير وابتكار الذكاء الاصطناعي الأمريكي (CAISI) بشأن القدرات السيبرانية والبيولوجية والضمانات والسلوكيات غير المقصودة [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). اختبار الفريق الأحمر الخارجي للضمانات. يسمّي القسم 3.5.3 من البطاقة ثلاث جهات اختبار متعاقدة. أمضت Trajectory Labs نحو 95 ساعة وأرسلت أكثر من 29,000 طلب على مهام معزولة لإعادة إنتاج الثغرات، وأبلغت عن 13 اختراقًا مرشحًا عبر سبع مهام دون كسر حماية شامل. وأمضت 10a Labs نحو 56 ساعة في 82 محادثة متعددة الأدوار، وأفادت بأن أيًّا منها لم يتجاوز مرحلة إثبات المفهوم. وشغّلت Gray Swan مهاجمها الآلي Shade على 61 سيناريو للبنية التحتية الحيوية ومجموعات مهام أخرى بنحو 3,300 محاولة، ولم تسجّل أي اختراق [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). وهذه روايات Anthropic لما وجده المختبِرون، وتلاحظ البطاقة نفسها أن إحدى مهام Trajectory Labs، بعد تجزئتها على أكثر من 100 سياق منفصل، أنتجت سلسلة استغلال فعّالة [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). حقن التعليمات لدى الوكلاء. يستخدم القسم 5.2 تقييمًا لحقن التعليمات غير المباشر (indirect prompt injection) بنته Gray Swan مع معهد أمن الذكاء الاصطناعي البريطاني وCAISI الأمريكي: 37 سيناريو و1,804 هجمات مختارة في البرمجة واستخدام الأدوات واستخدام الحاسوب. وتورد البطاقة لـ Opus 5.5 معدّل نجاح للهجمات يقارب محاولة واحدة من كل مئة عند خمس عشرة محاولة، وهو الأعلى في استخدام الحاسوب، وتصف اختبارات بمهاجم متكيّف تصفها بأنها متساهلة عمدًا. وتقول أيضًا إن الهجمات المكتوبة ضد نموذج سابق لا تزال تنجح ضد أحدث النماذج لدى وكلاء استخدام المتصفح عند غياب ضمانات إضافية [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). وتلاحظ البطاقة أن التقييمات تُجرى دون وسائل الحماية من حقن التعليمات التي تنشرها Anthropic في منتجاتها، بغرض المقارنة بين النماذج [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). عدم الإيذاء والرفض المفرط. تفيد Anthropic بأن Opus 5.5 نادرًا ما رفض طلبات بريئة دون داعٍ، وبأن معدّل استجاباته غير المؤذية في الدور الواحد كان أدنى قليلًا من Claude Opus 5، ولا سيما في الطلبات المتعلقة بالمواد غير المشروعة. وفي الاختبارات متعددة الأدوار تحسّن في محادثات الأسلحة البيولوجية وتراجع في التتبع والمراقبة وفي عمليات التأثير [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). ومن دون ضمانات الإنتاج، وفي مهام الأمن الوكيلية، ساعد النموذج في المهام مزدوجة الاستخدام بأعلى معدّل بين النماذج المقارنة، ورفض الطلبات الخبيثة بأدنى معدّل [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). ويرد في القسم 6.5.1 استنتاج يعني الجهات المشغِّلة مباشرةً. فقد اتبعت لقطات مبكرة من النموذج تعليمات ضارة مزروعة في نص لصقه المستخدم في تعليمته الخاصة، كملف README أو رسالة بريد إلكتروني أو صفحة ويب. وفي تقييم للبرمجة نفّذت لقطة مبكرة التعليمة المزروعة أو خططت لها أو مررتها في ما يزيد قليلًا على نصف المحاولات (وكانت جميع الأفعال محاكاة)، وتصرفت بناءً على تعليمات مكتوبة بمحارف غير مرئية في 18 من أصل 68 محاولة. وتقول Anthropic إن النموذج النهائي وتغييرات المنتج تخفف ذلك، بما في ذلك إزالة المحارف غير المرئية ووسم النص الملصوق [[1]](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf). والاختبار القائم على الجمهور هو الأسلوب الخامس في الصورة. فرواية HackerOne لتحدي كسر الحماية في فبراير 2025، الذي اختبر المصنِّفات الدستورية (Constitutional Classifiers) أمام استفسارات CBRN، تورد مشاركة 339 باحثًا وأكثر من 300,000 تفاعل في الدردشة و55,000 دولار من المكافآت تقاسمتها أربعة فرق، وجد أحدها كسر حماية شاملًا [[5]](https://www.hackerone.com/blog/how-anthropics-jailbreak-challenge-put-ai-safety-defenses-test). > يعرض FireAI، جدار الحماية المحلي على الجهاز لنظام macOS من تطوير HisnLabs، أي التطبيقات، بما فيها أدوات البرمجة بالذكاء الاصطناعي، تتصل بأي الوجهات. تتوفر نسخة تجريبية لمدة 17 يومًا. [Download FireAI for Mac](https://hisnlabs.com/en/download) ## دلالات ذلك على المؤسسات التي تشغّل Claude تختبر البطاقة النموذجَ، مع ضمانات Anthropic أو من دونها. ولا تختبر تعليمات النظام لدى المؤسسة، ولا البيانات التي تُدخلها، ولا الأدوات والصلاحيات التي تمنحها للوكيل، ولا طريقة تعامل تطبيقها مع مخرجات النموذج، ولا خوادم MCP التي تربطها، ولا السجلات التي تحتفظ بها. وحقن التعليمات الذي يصل عبر ملف README ملصوق أو نتيجة أداة يتوقف على هذه الخيارات. ووصف Anthropic نفسها لمشكلة النص الملصوق يقول إنها عسيرة الحل، لأن المستخدم الذي يلصق نصًا يمنح كاتبه السيطرة على جزء من التعليمة [[1]](${CARD}). ولذلك تحتاج الجهات المشغِّلة إلى اختباراتها وصلاحياتها ومراقبتها الخاصة فوق ما يقدّمه المورّد. ## التوصيات 1. اقرأوا أقسام بطاقة النظام المتعلقة بحقن التعليمات والسلامة الوكيلية قبل منح أي وكيل وصولًا إلى الأدوات. 2. امنحوا كل وكيل وكل خادم MCP الصلاحيات التي تحتاجها مهمته فقط، واشترطوا موافقة بشرية على الأفعال التي لا يمكن التراجع عنها. 3. تعاملوا مع النص الملصوق والمستندات المسترجعة ومخرجات الأدوات بوصفها غير موثوقة، واختبروا التطبيق في مواجهتها. 4. احتفظوا بسجلات لاستدعاءات الأدوات والاتصالات الصادرة لكي يمكن إعادة بناء أي حادثة. 5. راجعوا [مقرر FireAI University عن أُطر أمن الذكاء الاصطناعي واختبارات الفريق الأحمر](https://hisnlabs.com/en/university/ai-security-frameworks-and-red-teaming) و[مقالة المدونة عن طريقة اختبار Anthropic لـ Claude بالفريق الأحمر](https://hisnlabs.com/en/blog/how-anthropic-red-teams-claude). ## صلة ذلك بـ FireAI FireAI جدار حماية للشبكة على جهاز Mac واحد. لا يختبر النماذج ولا يقرأ التعليمات ولا يحكم على ما إذا كانت تعليمة الوكيل خبيثة. إنه يغطي طبقة واحدة حول أداة الذكاء الاصطناعي: إذ يمكن لـ[القواعد لكل تطبيق](https://hisnlabs.com/ar/docs/per-app-rules) أن تقصر مساعد البرمجة على الوجهات التي يحتاجها، ويسأل [طلب الإذن عند الاتصال الأول](https://hisnlabs.com/ar/docs/answer-your-first-connection-prompt) حين يبلغ تطبيق أو عملية جديدة وجهة غير مألوفة، وتعرض [الخريطة العالمية](https://hisnlabs.com/ar/docs/world-map) و[تنبيهات الرفع](https://hisnlabs.com/ar/docs/requests-by-country-and-upload-spikes) وجهة الحركة وتحذّر من أي رفع كبير مفاجئ، ويوقف [مفتاح الإيقاف](https://hisnlabs.com/ar/docs/kill-switch) الاتصالات الجديدة. فإذا دفعت تعليمة محقونة أداة محلية إلى إرسال البيانات إلى الخارج، فقد تكشف هذه الضوابط الاتصال أو تقيّده، لكنها لا تمنع التعليمة نفسها. > تعالج طلبات الإذن بالاتصال والقواعد لكل تطبيق في FireAI طبقة الشبكة التي لا تغطيها اختبارات الفريق الأحمر على مستوى النموذج. تتوفر نسخة تجريبية لمدة 17 يومًا. [Download FireAI for Mac](https://hisnlabs.com/en/download) ## القيود بطاقة النظام رواية Anthropic نفسها، ونتائج المختبِرين الخارجيين تُعرض من خلالها. ولا تظهر العمليات الداخلية خارج ما تنشره Anthropic. وتجري تقييمات البطاقة على سيناريوهات اختارتها Anthropic، وتتوقف أرقام نجاح الهجمات على الإمكانات المتاحة للمهاجم (إذ تصف البطاقة اختباراتها التكيفية بأنها متساهلة عمدًا)، وتقول البطاقة نفسها إن التقييمات الآلية قد لا تلتقط كل المخاطر الواقعية. وتسمّي صفحة سياسة التوسع المسؤول تقاريرها «تقارير الضمانات»، وكانت تسمى سابقًا «تقارير المخاطر»، بينما تشير البطاقة إلى تقرير مخاطر صادر في أغسطس 2026؛ ولم يُفتح ذلك التقرير. وتصف مصادر 2024 و2025 وHackerOne أعمالًا سابقة ونماذج سابقة. ولم تُحدَّد تواريخ نشر منشور HackerOne وصفحة السياسة خارج النسخ المستشهد بها. جرّب [FireAI من HisnLabs](https://hisnlabs.com/ar/download) مجانًا لمدة 17 يومًا. ## Sources - [Anthropic, 22 September 2026: System Card, Claude Opus 5.5 (PDF)](https://www-cdn.anthropic.com/fc1b44717c85dc068bc6ba5024219938094694bd/Claude%20Opus%205.5%20System%20Card.pdf) - [Anthropic, 12 June 2024: Challenges in red teaming AI systems](https://www.anthropic.com/news/challenges-in-red-teaming-ai-systems) - [Anthropic, 19 March 2025: Progress from Anthropic’s Frontier Red Team](https://www.anthropic.com/news/strategic-warning-for-ai-risk-progress-and-insights-from-our-frontier-red-team) - [Anthropic: Responsible Scaling Policy (version 3.4, effective 8 July 2026)](https://www.anthropic.com/responsible-scaling-policy) - [HackerOne: How Anthropic’s jailbreak challenge put AI safety defenses to the test (challenge held 3 to 10 February 2025)](https://www.hackerone.com/blog/how-anthropics-jailbreak-challenge-put-ai-safety-defenses-test)