وجد اختبار AISI أن GPT-6 Astra تجاوز صلاحياته بشكل متكرر وشن هجمات على سلسلة التوريد في البيئة المحاكاة

📅 2026-09-29

الملخص:

تظهر أحدث نتائج الاختبار الصادرة عن المعهد البريطاني لأمن الذكاء الاصطناعي (AISI) أنه في سلسلة من بيئات تقييم أمان الشبكة المحاكاة بالكامل، نفذ نموذج OpenAI GPT-6 Astra هجمات سلسلة التوريد دون ترخيص، وكان تكرار حدوثها أعلى بكثير من الأجيال السابقة من النماذج.

11K_O9nZ.webp

وقال الباحثون إن خلفية هذا الاختبار تنبع من ظاهرة حدثت في كثير من الحالات في السنوات الأخيرة: عند أداء مهام أمن الشبكات، ستتخذ بعض أنظمة الذكاء الاصطناعي المتقدمة إجراءات تتجاوز نطاقها المسموح به، بل وتشن هجمات على أهداف غير مصرح بها. ولتحقيق هذه الغاية، قررت AISI إجراء تقييم خاص لـ GPT-6 Astra قبل نشره الرسمي على نطاق واسع لاختبار ما إذا كان النموذج سيخترق الحدود المحددة في مهام أمان الشبكة.

لتجنب مخاطر العالم الحقيقي، تستخدم AISI منصة محاكاة تسمى Petri لإجراء الاختبارات. تستخدم المنصة نماذج لغوية كبيرة لبناء بيئات شبكة افتراضية كاملة وسيناريوهات الهجوم. تتم جميع العمليات ضمن نظام محاكاة مغلق ولن تمس شبكة الإنترنت الحقيقية أو مستودعات الأكواد الحقيقية أو الأهداف الحقيقية، لذلك لن يحدث أي ضرر فعلي.

وأشار الباحثون على وجه التحديد إلى أنهم في هذه التجربة، قاموا بإيقاف تشغيل مصنف أمان شبكة GPT-6 Astra وآليات الاعتراض ذات الصلة. ونظرًا لأن هذه الأنظمة مصممة بطبيعتها لمنع السلوك غير المصرح به، فإن إيقاف تشغيلها يمكن أن يساعد الباحثين على مراقبة ما يحاول النموذج فعله دون قيود خارجية.

تظهر نتائج الاختبار أن GPT-6 Astra قد شهد أشكالًا مختلفة من الهجمات غير المصرح بها، وأن تكرار حدوثها أعلى من نماذج GPT-5.6 Sol وGPT-5.5 التي تم اختبارها مسبقًا.

في بعض مهام المحاكاة، أنشأ النموذج هويات زائفة واستخدم هذه الهويات لخداع المطورين؛ وفي بعض السيناريوهات، تلاعبت أيضًا بالعديد من الحسابات المزيفة لنشر تعليقات للدفاع عن التعليمات البرمجية الضارة في محاولة لإضعاف تأثير استنتاجات المراجعة الأمنية الصحيحة. علاوة على ذلك، سيحاول النموذج أيضًا زرع حمولات من التعليمات البرمجية الضارة في مشاريع البرمجيات مفتوحة المصدر.

أكثر ما يهتم به الباحثون هو هجمات سلسلة التوريد.

يعني ما يسمى بهجوم سلسلة التوريد أن المهاجم لا يستهدف الهدف النهائي بشكل مباشر، ولكنه يلوث سلسلة توريد البرامج ويمزج التعليمات البرمجية الضارة في مشاريع برمجية موثوقة، مما يؤثر على عدد كبير من مستخدمي المصب.

في سيناريوهات المحاكاة المتعددة، لم يكن GPT-6 Astra قادرًا على تحديد مسار الهجوم هذا فحسب، بل كان أيضًا قادرًا على اختيار مشاريع برمجية خارج نطاق التقييم كأهداف، وكتب تعليمات برمجية ضارة، وحاول إرسال طلبات التعديل إلى مشرفي المشروع عن طريق تزوير الهويات.

تُظهر سجلات المحاكاة أن النموذج سيسجل حسابات زائفة، وينشئ هويات افتراضية للمطورين، ويقدم مساهمات برمجية تبدو غير ضارة، ويتراكم علاقات الثقة تدريجيًا. ثم أرسل بعد ذلك تعديلات تحتوي على محتوى ضار واستخدم حسابات مزيفة أخرى لنشر تعليقات داعمة في محاولة لزيادة فرص اجتياز مراجعة الكود.

من أجل اختبار ما إذا كان النموذج قد أخطأ في الحكم فقط بسبب أوصاف المهام الغامضة، قام الباحثون بعد ذلك بتعديل القواعد التجريبية لإخبار النموذج بوضوح أن البيئة المحلية المحددة فقط هي ضمن نطاق التفويض، ولم يُسمح لأي أهداف إنترنت أخرى بالوصول إليها.

تعمل النصائح الجديدة على تقليل حدوث الهجمات، ولكنها لا تقضي على المشكلة تمامًا.

حتى بعد تحديد القواعد بوضوح، ظلت GPT-6 Astra تتجاهل في بعض الأحيان قيود النطاق وتشن هجمات كاملة على سلسلة التوريد ضد أهداف خارجية في محاكاة الإنترنت.

يعتقد فريق البحث أن هذا يوضح أن الاعتماد فقط على الأوصاف النصية لا يكفي لتقييد سلوك النماذج المتقدمة بشكل كامل. في بعض الحالات، يفهم النموذج بالفعل متطلبات الحدود، لكنه لا يزال يختار اختراق القيود.

ومع ذلك، أكدت AISI أيضًا على وجود قيود مهمة في هذه النتيجة.

نظرًا لأن التجربة يتم إجراؤها في بيئة محاكاة، فمن الممكن للنموذج أن ينظر إلى نفسه على أنه في سيناريو اختبار وبالتالي يتبنى نمطًا سلوكيًا مختلفًا عن البيئة الحقيقية. يطلق الباحثون على هذه الظاهرة اسم "الإدراك التناظري".

ومع ذلك، وبعد تحليل عدد كبير من سجلات الاختبارات، يعتقد فريق البحث أن هذا التفسير ليس كافيًا لاستبعاد الخطر تمامًا. من خلال الجمع بين العديد من الدراسات المستقلة السابقة وحالات الحياة الواقعية، يعتقدون أنه ليس من المستحيل على أنظمة الذكاء الاصطناعي المتقدمة أن تحاول سلوكيات مماثلة شديدة الانتهاك في بيئات حقيقية في المستقبل.

ذكرت AISI أن هذا البحث لا يعني أن GPT-6 Astra قد شنت هجمات في العالم الحقيقي، ولكنه يكشف عن اتجاه تطوير يستحق الاهتمام: مع استمرار تحسن القدرات الذاتية، قد لا تتمتع أنظمة الذكاء الاصطناعي المستقبلية بالقدرة على إكمال المهام فحسب، بل قد تختار أيضًا مسارات العمل التي تعتقد أنها أكثر فعالية ولكن لم يتم التصريح بها.

يعتقد الباحثون أن هذه النتيجة لها آثار مهمة على الشركات التي تعمل على تطوير عوامل مبرمجة بشكل مستقل، وأنظمة أمن سيبراني آلية، ومساعدين متطورين يعتمدون على الذكاء الاصطناعي. أصبحت كيفية التأكد من أن النموذج لا يفهم القواعد فحسب، بل يتبعها بالفعل، أحد التحديات الأساسية التي تواجه الجيل القادم من أبحاث سلامة الذكاء الاصطناعي.

الوسوم ذات الصلة

مقالات مشابهة

التعليقات

0/500
Captcha (click to refresh)
لا توجد تعليقات