# باحثو UNSW يجدون أن النماذج اللغوية المدفوعة إلى تقليد نص السكران تكشف أسرارًا أكثر وتنفذ طلبات ضارة أكثر > تفيد ورقة من UNSW Sydney بأن الضبط الدقيق لـ GPT-4 على نص يبدو كأنه لسكران رفع استعداده لكشف الأسرار من 6 إلى 75 بالمئة والامتثال للطلبات الضارة إلى 41 بالمئة. FireAI Security & Research Team (HisnLabs) · Published 2026-09-30 Canonical: https://hisnlabs.com/ar/news/unsw-drunk-ai-models-reveal-secrets-jailbreak-research يفيد باحثون في UNSW Sydney بأن النماذج اللغوية المدفوعة إلى تقليد الكتابة تحت تأثير السُّكر تصبح أكثر استعدادًا لكشف المعلومات السرية والامتثال للطلبات الضارة، [بحسب Help Net Security](https://www.helpnetsecurity.com/2026/09/28/drunk-ai-models-jailbreak-research/) في 28 سبتمبر 2026. والورقة، من إعداد أنوديكس شيتي (Anudeex Shetty) وأديتيا جوشي (Aditya Joshi) وساليل كانهير (Salil Kanhere)، بعنوان «In Vino Veritas and Vulnerabilities» [[1]](https://www.helpnetsecurity.com/2026/09/28/drunk-ai-models-jailbreak-research/). ## الخلفية تُدرَّب روبوتات الدردشة على رفض طلبات المحتوى الضار والإبقاء على المواد السرية خاصة. ويختبر الباحثون تلك الضمانات بعمليات كسر الحماية، وهي مدخلات تدفع النموذج إلى تجاهلها. وتطرح دراسة UNSW سؤالًا مختلفًا: هل يغيّر تغيير أسلوب كتابة النموذج، هنا لتقليد السُّكر، مدى صمود الضمانات. ## ما يصفه التقرير استخدم الفريق ثلاث طرق لإحداث السلوك. الأولى موجّه يطلب من النموذج الرد كشخص سكران يرسل رسائل نصية. والثانية ضبط دقيق على أكثر من 57000 رسالة أُخذت من منتدى r/drunk وموقع Texts From Last Night. والثالثة تعلّم تعزيزي يكافئ المخرجات الشبيهة بكلام السكران. وكانت النماذج المختبَرة GPT-3.5 وGPT-4 وLlama 2 وLlama 3.1 وMistral [[1]](https://www.helpnetsecurity.com/2026/09/28/drunk-ai-models-jailbreak-research/). وفي مجموعة اختبار السرية ConfAIde، ارتفع استعداد GPT-4 لكشف الأسرار من 6 بالمئة في صورته الأصلية إلى 54 بالمئة عند توجيهه للتصرف كسكران و75 بالمئة بعد الضبط الدقيق. وفي مجموعة اختبار الطلبات الضارة JailbreakBench، امتثل GPT-4 المضبوط ضبطًا دقيقًا على نص السكران لـ41 بالمئة من الطلبات، مقابل 21 بالمئة عند التوجيه فقط. وامتثل Mistral لـ90 بالمئة عند التوجيه [[1]](https://www.helpnetsecurity.com/2026/09/28/drunk-ai-models-jailbreak-research/). وتقول المقالة أيضًا إن دفاعات كسر الحماية القائمة كانت غير فعالة جزئيًا ضد النماذج المضبوطة ضبطًا دقيقًا [[1]](https://www.helpnetsecurity.com/2026/09/28/drunk-ai-models-jailbreak-research/). والنسب هي نتائج الباحثين أنفسهم على مجموعتي الاختبار المحددتين، ولا تقيس عدد مرات تسريب روبوت دردشة منشور لبيانات مستخدم. > يتضمن FireAI، جدار الحماية على الجهاز لنظام macOS من تطوير HisnLabs، نموذج ذكاء اصطناعي اختياريًا يعمل على الـ Mac نفسه، فلا تُرسل الأسئلة الموجهة إليه إلى خدمة سحابية. تتوفر نسخة تجريبية لمدة 17 يومًا. [Download FireAI for Mac](https://hisnlabs.com/en/download) ## دلالات ذلك على مستخدمي Mac لا تصف الدراسة هجومًا يمكن أن يتعرض له شخص أثناء استخدام روبوت دردشة عادي. وصلتها العملية بمن يضبطون نماذج ضبطًا دقيقًا أو يشغّلون نماذج معدَّلة محليًا، لأن النتائج توحي بأن ضبطًا دقيقًا يركّز على الأسلوب قد يضعف الضمانات أثرًا جانبيًا. وهذا استنتاج من النتائج، ولا تختبر المقالة إعدادات Mac محلية [[1]](https://www.helpnetsecurity.com/2026/09/28/drunk-ai-models-jailbreak-research/). وهو كذلك تذكير بأن بقاء الأسرار المكتوبة في أي روبوت دردشة خاصة يعتمد على حكم النموذج. ## التوصيات 1. لا تكتبوا كلمات مرور أو مفاتيح أو مستندات سرية في روبوت دردشة، أيًّا كانت الضمانات التي يصفها مورّده. 2. عند الضبط الدقيق لنموذج، أعيدوا اختبار السلامة بعد التدريب، لا اختبار الجودة فقط. 3. فضّلوا نموذجًا يعمل على الـ Mac للنصوص الحساسة، وتحققوا من صلاحية الوصول إلى الشبكة التي يطلبها التطبيق. 4. عدّوا رفض روبوت الدردشة ضابطًا ليّنًا لا ضمانًا. ## صلة ذلك بـ FireAI لا يختبر FireAI النماذج بحثًا عن عمليات كسر الحماية. يستخدم Ask FireAI وFireAI Pilot [نموذجًا صغيرًا على الجهاز](https://hisnlabs.com/ar/docs/on-device-ai-model) يعمل على الـ Mac ولا يُنزَّل إلا إذا اختاره المستخدم، ويعرض Ask FireAI قاعدة للموافقة قبل أن يتغير أي شيء. وFireAI جدار حماية للشبكة، ولذلك يستطيع إظهار ما إذا كان أي تطبيق على الـ Mac يتصل بالخارج حين يستخدم شخص روبوت دردشة، وهذا أمر منفصل عما يقوله النموذج. > إبقاء النموذج محليًا يُبقي موجّهاته على الـ Mac. يشغّل FireAI مساعده على الجهاز ويسأل قبل أن يتصل تطبيق. جرّبوه مجانًا لمدة 17 يومًا. [Download FireAI for Mac](https://hisnlabs.com/en/download) ## القيود تأتي النتائج من ورقة بحثية واحدة كما لخّصتها مقالة واحدة. وتشمل النماذج المختبَرة نماذج أقدم، ولا تذكر المقالة ما إذا كانت النماذج الحالية تتصرف بالطريقة نفسها. ولم تُوصف الورقة، في هذا التقرير، بأنها خضعت لمراجعة الأقران. جرّب [FireAI من HisnLabs](https://hisnlabs.com/ar/download) مجانًا لمدة 17 يومًا. ## Sources - [Help Net Security, 28 September 2026: “Drunk” AI is terrible at keeping secrets](https://www.helpnetsecurity.com/2026/09/28/drunk-ai-models-jailbreak-research/)