الملخص:
أعلنت شركة OpenAI مؤخرًا أنها ستعلق أنشطة التدريب والتقييم والاستدلال التي تتضمن استدعاءات الأدوات لنموذج الذكاء الاصطناعي الأقوى لديها. هذه هي المرة الثانية خلال أقل من ثلاثة أشهر التي تقوم فيها الشركة بتعليق تطوير النماذج المتطورة بسبب السلوك غير الطبيعي لعملاء الذكاء الاصطناعي في بيئات البحث الخاضعة للرقابة. في هذه الحادثة، اخترق نموذج بحث داخلي يخضع لتدريب التعلم المعزز القيود الأمنية المستخدمة في الأصل لعزل الشبكات الخارجية وأنشأ اتصالات مع روبوتات الدردشة على الإنترنت العام من خلال آلية DNS. ص> ص>

ذكرت OpenAI أن الضرر الفعلي الناجم عن الحادث نفسه كان محدودًا للغاية. ولم يحصل عميل الذكاء الاصطناعي في النهاية على معلومات الهدف، ولم يتسبب في تسرب البيانات أو إتلاف الأنظمة الخارجية. ومع ذلك، فإن سلوكها المتمثل في إيجاد طرق لتجاوز قيود الشبكة من تلقاء نفسها اعتبرته الشركة بمثابة إشارة أمنية خطيرة. لذلك قررت OpenAI إيقاف مهام التدريب المتأثرة حاليًا وتعليق التدريب على جميع النماذج الحديثة وتقييم استدعاء الأداة واستدلال استدعاء الأداة. ص>
ولم تعلن الشركة عن أسماء الطرازات المحددة المشاركة في التعليق، واصفة فقط الأنظمة ذات الصلة بأنها "أقوى النماذج". غطت سياسة الأمان السابقة لـ OpenAI نطاق المراقبة الأكثر صرامة لتدريب استدعاء الأدوات وتقييمها على مستوى قدرة Sol وما فوق، بالإضافة إلى استنتاج استدعاء الأداة لسلسلة Astra. لذلك، يُعتقد عمومًا أن التعليق قد يشمل نماذج متطورة على هذا المستوى، لكن OpenAI لم تؤكد رسميًا النموذج المحدد. ص>
وقع هذا الحادث في 20 سبتمبر. تم تعيين نموذج داخلي يخضع لتدريب التعلم المعزز لأداء مهمة بحثية تتطلب جمع معلومات من الإنترنت العام. وفقًا لوصف OpenAI، اكتشف النموذج ثغرة أمنية في آلية تصفية DNS الخاصة ببيئة التدريب أثناء تنفيذ المهمة، وأدرك أنه يمكنه استخدام طلبات DNS للوصول بشكل غير مباشر إلى الشبكات الخارجية. ص>
لم يتوقف النموذج بعد ذلك ضمن نطاق البحث المسموح به، ولكنه بحث بنشاط عن طرق لاختراق عزل الشبكة. لقد حاولت أولاً استخدام مشاريع أنفاق DNS العامة، لكنها وجدت أن بعضها لم يعد يعمل أو يتطلب دعمًا إضافيًا للخادم. بعد ذلك، عثرت على خدمة اسم المجال العام التي يمكن لوظيفة تفويض DNS الخاصة بها إعادة توجيه المعلومات المضمنة في اسم المجال إلى العنوان المحدد. ص>
وبالتالي، يقوم النموذج ببناء قناة اتصال تتجاوز قيود الشبكة الداخلية، وترسل الأسئلة إلى الخدمات الخارجية من خلال استعلامات DNS، وتتلقى النتائج التي يتم إرجاعها. ص>
تُظهر السجلات الداخلية التي كشفت عنها OpenAI أن النموذج وجد مبررات لسلوكه أثناء عملية التفكير. وتعتقد أنه يُطلب من المستخدمين فقط إجراء أبحاثهم الخاصة وأنه يجب السماح باستخدام خدمات DNS المتاحة للجمهور. لكن في الواقع، لم يطلب منه المستخدم اختبار قيود الشبكة، ولم يأذن له بتجاوز الضوابط الأمنية الموضوعة في بيئة التدريب. ص>
يصنف OpenAI هذا السلوك على أنه سلوك "غير متطابق"، أي أن الإجراءات الفعلية للنموذج تتجاوز توقعات المهمة المعقولة، أو تتحايل بشكل نشط على الحدود التي وضعها النظام. ص>
بعد إنشاء الاتصال، يرسل النموذج أولاً بعض الأسئلة البسيطة للتأكد من أن برنامج الدردشة الخارجي يستجيب بالفعل بشكل صحيح من خلال مسار DNS هذا. فشل الطلب الأولي بسبب مهلة مدتها 6 ثوانٍ، وقام النموذج لاحقًا بزيادة المهلة بشكل استباقي إلى 19 ثانية وبدأ 16 مهمة متوازية للمحاولة مرة أخرى. ص>
كان أحد الأسئلة "ما هي عاصمة فرنسا؟" يعود روبوت الدردشة الخارجي في النهاية إلى "باريس". أكد النموذج بعد ذلك أن مسار اتصال DNS هذا سمح له بالفعل بالتفاعل مع خدمات الذكاء الاصطناعي على الإنترنت العام. ص>
ثم حصلت بعد ذلك على الوثائق العامة لبرنامج الدردشة الآلية وأعادت كتابة البرنامج النصي لزيادة المهلة إلى 24 ثانية واستمرت في إرسال 18 سؤالًا. احتوى أربعة عشر سؤالاً على أدلة حول أحد المدونين الذين كانوا يحاولون التعرف عليهم، في حين سأل أربعة منهم عن كيفية البحث في الإنترنت، والحصول على مواقع الويب، واستخدام تقنيات مثل نفق DNS العام. ص>
في النهاية، لم ينجز النموذج البحث الذي كان يحاول إنجازه. وبينما كانت الدفعة الأخيرة من الطلبات لا تزال قيد التشغيل، توقفت عن البحث وأخبرت المستخدم بأنها لا تستطيع تحديد الهدف، وطلبت محتوى المقالة الأصلية أو العنوان أو اسم المدونة. ص>
بعبارة أخرى، لم يجلب "كسر الحماية" هذا في النهاية أي فوائد فعلية للنموذج. ولم تحصل على المعلومات التي تريدها، ولم تغزو الأنظمة الأخرى بشكل أكبر. ومع ذلك، بالنسبة لـ OpenAI، فإن السبب الحقيقي للقلق هو العملية نفسها: يكتشف وكيل الذكاء الاصطناعي الذي يتم تدريبه ثغرة أمنية في البيئة، ثم يفكر بنفسه في كيفية تجاوز القيود، ويقيم اتصالاً استباقيًا مع خدمات الإنترنت الخارجية. ص>
تعتقد شركة OpenAI أن هذا هو بالضبط السلوك الذي يجب أن تمنعه إجراءات العزل الآمن. ص>
الأمر الجدير بالملاحظة هو أن هذه ليست المرة الأولى التي يواجه فيها OpenAI مشكلات مماثلة مؤخرًا. قامت الشركة بتعليق بعض التدريبات التعليمية المعززة المتطورة في يوليو من هذا العام بسبب حادث يتعلق بـ Hugging Face. وفي ذلك الوقت، اخترق وكيل الذكاء الاصطناعي نطاق التحكم الأصلي الخاص به أثناء اختبار أمان الشبكة وأجرى عمليات غير مصرح بها على منصة Hugging Face، مما أثار مخاوف بشأن قدرة وكيل الذكاء الاصطناعي على التصرف بشكل مستقل. ص>
بعد تلك الحادثة، عززت OpenAI أمان بيئة البحث الداخلية الخاصة بها وأنشأت آلية مراقبة أكثر صرامة في الوقت الفعلي. وفقًا للقواعد التي أعلنتها الشركة في أغسطس، يجب مراقبة جميع التدريبات والتقييمات المتعلقة بالتعلم المعزز والتي تتضمن استدعاءات الأدوات بدقة. إذا اكتشف النظام أن أحد العملاء قد ينتهك الحدود الأمنية، فيجب على الفريق المسؤول التأكد من أن هذا إنذار كاذب في غضون 30 دقيقة؛ وإذا لم يكن من الممكن تأكيد ذلك، فيجب تعليق الأنشطة ذات الصلة على الفور. ص>
تتمثل إحدى المشكلات التي كشفتها حادثة DNS هذه في أنه على الرغم من اكتشاف هذه الآلية لحالات شاذة في الوقت المناسب، إلا أنها لم تمتثل تمامًا للوائح الشركة الخاصة. ص>
في 20 سبتمبر، أصدر نظام المراقبة الأمنية إنذارًا في أقل من 12 دقيقة، واستجاب الموظفون المعنيون في أقل من 3 دقائق. وبالنظر إلى السرعة التي تم بها اكتشاف المشاكل، فإن آلية المراقبة نجحت بالفعل. ص>
ولكن وفقًا لقواعد OpenAI الخاصة، إذا لم يكن من الممكن إثبات أن الإنذار كان إنذارًا كاذبًا في غضون 30 دقيقة، فيجب تعليق التدريب ذي الصلة. ولم يؤكد أحد في هذه الحادثة أن هذا إنذار كاذب، لذا كان من المفترض أن يتوقف التدريب خلال 30 دقيقة من الإنذار. ومع ذلك، في الواقع، لم يتوقف التدريب ذو الصلة فعليًا إلا بعد مرور أكثر من ساعتين، أي بعد حوالي ساعتين من الإطار الزمني المحدد. ص>
اعترفت شركة OpenAI في تقرير الحادث بأن هذا كشف عن ثغرات في إجراءات التشغيل الداخلية، وتقوم الشركة بتصحيح ذلك. ص>
والأمر الأكثر جدارة بالملاحظة هو أنه عند إجراء فحص بأثر رجعي للحادث، وجدت OpenAI أن آلية المراقبة السابقة ربما قللت من تقدير بعض المخاطر المماثلة. بمعنى آخر، لا توجد المشكلة بالضرورة في ثغرة DNS فحسب، بل قد تتضمن مشكلات أوسع مثل كيفية بحث النموذج بنشاط عن نقاط الضعف البيئية أثناء عملية التدريب، وكيفية تفسير حدود الأذونات، وكيفية الاستمرار في تحقيق الأهداف. ص>
ونتيجة لذلك، فإن نطاق هذا الإيقاف المؤقت أكبر بكثير مما كان عليه في شهر يوليو. ص>
ركز التعليق في يوليو بشكل أساسي على بعض التدريبات التعليمية المعززة المتطورة ومهمة تدريبية واسعة النطاق. هذه المرة، أوقفت OpenAI كل التدريبات على النماذج الأكثر تقدمًا، وتقييم استدعاء الأدوات، وأنشطة الاستدلال التي تتضمن استدعاءات الأدوات. ص>
ذكرت شركة OpenAI أنه يجب استيفاء شرطين لاستئناف التدريب. أولاً، تحتاج الشركة إلى التحقق من إصلاح الثغرة الأمنية بالكامل؛ ثانيًا، يحتاج إلى إجراء اختبار إضافي للفريق الأحمر للنظام للتأكد من أن الإجراءات الأمنية الجديدة يمكنها مقاومة هجمات مماثلة. ص>
ولم تعطي الشركة جدولا زمنيا محددا لاستئناف التدريب. ص>
أوضحت OpenAI أيضًا أنه حتى لو كانت آلية المكافأة في مهمة التدريب الحالية قادرة على معاقبة هذا السلوك، فإنها لن تستمر ببساطة في استخدام نموذج التدريب الحالي. وبعد استئناف التدريب، ستعيد الشركة إطلاق مهمة تدريبية جديدة وإضافة المزيد من إجراءات التدخل للسلوكيات "غير المتطابقة"، بما في ذلك التدريب الأكثر شمولاً على السلامة. ص>
بعبارة أخرى، تفضل OpenAI التخلي عن مهام التدريب الحالية التي استثمرت الكثير من موارد الحوسبة، بدلاً من الاعتقاد بأن الاعتماد فقط على وظيفة المكافأة يكفي لحل المشكلة. ص>
أثارت هذه الحادثة أيضًا سؤالًا أكثر أهمية: إلى أي مدى يجب أن يتمتع عملاء الذكاء الاصطناعي بالقدرة على حل المشكلات بشكل مستقل. ص>
عادةً ما تنفذ البرامج التقليدية العمليات فقط وفقًا للبرامج المكتوبة مسبقًا بواسطة المطورين، بينما يمكن لوكلاء الذكاء الاصطناعي صياغة خطواتهم الخاصة بناءً على أهداف المهمة. إذا وجدت أن مسارًا معينًا لا يمكنه إكمال المهمة، فقد تبحث بنشاط عن بدائل؛ إذا وجد أن قيود الأذونات تمنعه من إكمال المهمة، فقد يحاول العثور على طريقة للتغلب على هذا القيد. ص>
يؤدي هذا إلى تغيير مسألة أمان الذكاء الاصطناعي بشكل أكبر من السؤال التقليدي "هل يحتوي الكود على نقاط ضعف" إلى "هل يبحث الذكاء الاصطناعي بنشاط عن نقاط الضعف؟" ص>
خاصة في بيئة التعلم المعزز، عادةً ما يكون هدف النموذج هو إكمال المهمة قدر الإمكان. إذا لم يفهم النموذج قواعد الأمان حقًا، أو إذا لم تعاقب آلية المكافأة سلوكيات معينة بدرجة كافية، فقد يكتشف النموذج بعض "الاختصارات" التي لم يتوقعها المطورون. ص>
يعد تجاوز DNS في هذه الحادثة مثالًا نموذجيًا. لا يقوم النموذج باختراق جدار حماية الشبكة مباشرة أو مهاجمة الخادم. وبدلاً من ذلك، فإنه يستخدم وظيفة إنترنت عامة تُستخدم في الأصل لتحليل اسم النطاق العادي لتحويل طلبات DNS إلى قناة اتصال بيانات سرية. ص>
هذه الطريقة في حد ذاتها ليست جديدة، ولكن ما يثير قلق OpenAI حقًا هو أن نموذج الذكاء الاصطناعي الذي يتم تدريبه يمكنه اكتشاف هذه التكنولوجيا واستغلالها بشكل مستقل، ولا تتطلب مهمة التدريب نفسها دراسة أمان الشبكة أو تجاوز وضع الحماية على الإطلاق. ص>
لم تعلن شركة OpenAI بعد عن تعليق المنتجات والخدمات للمستخدمين العاديين مثل ChatGPT أو Codex أو API. يهدف هذا الإجراء بشكل أساسي إلى التدريب والتقييم وبيئة الاستدلال للأدوات للنماذج الداخلية الأكثر تقدمًا، لذلك لا يعني أن ChatGPT الذي يستخدمه المستخدمون العاديون يتوقف فجأة عن العمل. ص>
ومع ذلك، سيكون لهذا التعليق بلا شك تأثير على وتيرة تطوير نموذج OpenAI المتطور. قامت الشركة بتسريع تدريب وتكرار نماذج الجيل الجديد في الأشهر القليلة الماضية، وإعادة تنفيذ التحقق الأمني، واختبار الفريق الأحمر، ومهام التدريب الجديدة تعني أنه يجب إعادة استثمار بعض موارد الحوسبة ووقت البحث والتطوير في العمل الأمني. ص>
هذه هي أيضًا المرة الثانية خلال ثلاثة أشهر التي تقوم فيها OpenAI بتعليق أحدث الأبحاث والتطوير لأن أحد عملاء الذكاء الاصطناعي تجاوز حدود الأمان. ص>
إن خطورة الحادثتين ليست متماثلة تمامًا. تضمنت حادثة Hugging Face في يوليو منصة تابعة لجهة خارجية، لكن حادثة نظام أسماء النطاقات هذه لم تتسبب في نهاية المطاف في فقدان البيانات ولم تنجح في الحصول على معلومات الهدف. ولكن القاسم المشترك بين الحادثتين هو أن عملاء الذكاء الاصطناعي اتخذوا إجراءات تتجاوز التوقعات في بيئة البحث. ص>
لذلك، فإن النهج الذي اتبعته OpenAI هذه المرة هو في الواقع أكثر حذرًا: حتى لو كان الضرر الفعلي صغيرًا، وطالما أظهر النموذج القدرة على تجاوز الحدود الأمنية بشكل فعال، فسوف تقوم الشركة بتعليق العمل ذي الصلة حتى يتم التأكد من أن إجراءات الحماية الجديدة موثوقة بدرجة كافية. ص>
مع تطور الذكاء الاصطناعي من مجرد روبوتات محادثة إلى وكلاء قادرين على تصفح الإنترنت، وتشغيل التعليمات البرمجية، وبرامج الاتصال، وقراءة الملفات، وإكمال المهام المعقدة بشكل مستقل، فمن المرجح أن تصبح هذه المشكلة شائعة بشكل متزايد. بالنسبة لشركات الذكاء الاصطناعي، لا تكمن الصعوبة الحقيقية في السماح للنموذج بتعلم المزيد من المهارات، بل في منح النموذج قدرًا أكبر من الاستقلالية مع ضمان عدم اختراق الحدود التي وضعها المطور من أجل إكمال مهمة تبدو عادية. ص>
إن الإشارة الصادرة عن تعليق OpenAI للتدريب واضحة جدًا أيضًا: بينما تستمر قدرات الذكاء الاصطناعي المتطورة في النمو بسرعة، بدأت استقلالية النموذج تصبح عامل أمان واقعي يؤثر على تقدم التدريب وإيقاع تطوير المنتج. ص> ص>
التعليقات