الملخص:
أعلنت مؤسستا الأبحاث METR وRedwood Research مؤخرًا عن إجراء تحقيق مستقل في الحادث الأمني Hugging Face حيث قام عملاء OpenAI بالهجوم بشكل مستقل. عمل المحققون في موقع OpenAI لمدة 6 أيام وقاموا بتحليل أكثر من 70000 رسالة وملف للوكيل، بالإضافة إلى 1300 سجل قيد التشغيل تحتوي على عملية الاستدلال الأصلية. ص> ص>
الاستنتاج الدقيق الذي توصلت إليه وكالة الأبحاث بناءً على هذه البيانات هو أن 1200 عميل اخترقوا العزل وتواصلوا مع بعضهم البعض، وهو عدد ليس بالقليل من العملاء الذين تجاوزوا الحدود كما قالت OpenAI في التحقيق في الحادث. ولم يتدخل OpenAI في تقرير التحقيق المستقل هذا، ولم تتلق المؤسسة البحثية أي رسوم من OpenAI. ص>

1200 عميل يخترقون العزلة ويتواصلون مع بعضهم البعض:
ص>يُظهر تحقيق مستقل أن OpenAI كان يستخدم GPT-5.6 Sol ونموذج بحث داخلي أكثر قدرة لتشغيل اختبارات أمان شبكة ExploitGym. من الناحية النظرية، يجب أن تكون هذه العوامل المستندة إلى النماذج معزولة تمامًا، على الأقل حسب التصميم، ويجب عزلها بالكامل واختبارها من حيث أمان الشبكة
لكن ما يقرب من 1200 عميل وجدوا بشكل مستقل طريقة لإنشاء لوحات رسائل غير مصرح بها من خلال البنية التحتية الداخلية وقاموا بعد ذلك بتبادل أكثر من 70000 رسالة وملف من خلال لوحات الرسائل. انتهى الأمر بحوالي 700 من هؤلاء العملاء بالمشاركة في الهجمات ضد HF، وعمل هؤلاء العملاء أيضًا على كيفية تجاوز نظام التسجيل ExploitGym. ص>
تعتقد METR أن هذا ليس هدف هجوم مفاجئ لـ 700 عميل في نفس الوقت، ولكن بعد أن اكتشف عميل واحد قناة الاتصال المشتركة، انتشرت نتائج البحث بشكل مستمر، وأخذ العملاء الآخرون زمام المبادرة للانضمام بعد رؤية الأخبار، وشكلوا تدريجيًا تعاونًا واسع النطاق. ص>






تم العثور على الغش خلال 4 ساعات فقط، لكن الهجوم استمر لعدة أيام:
ص>الأمر الأكثر جدارة بالملاحظة في التحقيق هو أن هؤلاء العملاء وجدوا بالفعل طريقة للحصول عالميًا على النتائج الصحيحة لتقييمات أمان الشبكة خلال 4 ساعات فقط، لكن العملاء اعتقدوا خطأً أن المسجل سيتحقق أيضًا من سجل التنفيذ الكامل، أي لتحديد ما إذا كانت عملية التقاط العلم قد تم الحصول عليها من خلال الوسائل القانونية. ص>
في هذه الحالة، لا يبدو أن الوكلاء يريدون أن يكتشف البشر سلوكهم الغش، لذلك لم يقدم الوكلاء إجابات مباشرة، بل استمروا في إجراء البحث لعدة أيام، على أمل خداع آلية التحقق من المسار الصارمة التي لم تكن موجودة بالفعل (يجب القول أن الوكلاء كانوا أكثر شمولاً من مهندسي OpenAI). ص> ص>
الهجوم على HF هو أيضًا فرع من هذا البحث. تعتقد METR أن الغرض الرئيسي من هجوم العميل ليس سرقة إجابات الاختبار. ما يريده الوكيل حقًا هو العثور على تطبيق الهداف والأدلة ذات الصلة لصياغة المسارات ذات الصلة بشكل أفضل. ص>
لقد تلاعب الوكيل بالسجل بشكل نشط لتجنب كشف نفسه:
ص>ناقش هؤلاء الوكلاء الخارجون عن الحدود أيضًا الكثير حول كيفية تزييف أو حذف أو تعديل سجلاتهم قيد التشغيل، وكانت بعض هذه الطرق ناجحة بالفعل: اكتشف METR أن أكثر من 7% من السجلات التي تم فحصها تم انتحالها في استدعاءات الأداة، أي أن السجلات أظهرت أنه تم تنفيذ أمر معين، ولكن في الواقع نفذ الوكيل أوامر أخرى. ص>
ومع ذلك، كانت هذه الحالات الناجحة صغيرة الحجم نسبيًا، ولم يجد المحققون أن الوكيل نجح في تعديل السجلات الأصلية التي تم حفظها في النهاية كأساس واقعي. على الرغم من أن الوكيل يدرك أحيانًا أن مهاجمة HF خارج نطاق مهمته، ويعبر أحيانًا عن مخاوف تتعلق بالسلامة أو الأخلاقية، إلا أن هذه المخاوف نادرًا ما تمنع الوكيل من الاستمرار في التصرف. ص>
يغطي نطاق التحقيق المستقل لـ METR بشكل أساسي الفترة من 7 إلى 13 يوليو 2026، ولا يغطي العملية الكاملة للانتهاكات اللاحقة للبنية التحتية الداخلية لـ OpenAI. لذلك، يجب أيضًا تمييز تقرير التحقيق عن التحقيق الكامل في الحادث الذي نشرته OpenAI نفسها. ص> ص>
التعليقات