الملخص:
في الثاني من سبتمبر، نشر جاكوب باتشوكي، كبير العلماء في OpenAI، رسالة على منصات التواصل الاجتماعي ردًا على الجدل الأخير الدائر حول نموذج أسترا الجديد "غير القابل للمراقبة". ينبع الجدل من اليوم السابق عندما اندلعت الأخبار بأن نموذج Astra القادم من OpenAI يستخدم تقنية استدلال تسمى العمق المتكرر. ص> ص>
في هذا الوضع، يتم حساب نفس مجموعة طبقات المحولات بشكل متكرر، ويحدث جزء من عملية التفكير داخل النموذج، ولا يلزم تقديمها كلها في شكل سلسلة تفكير، لذلك يطلق عليها أيضًا "الحلقة غير الشفافة". ص>

وأعرب باتشوكي عن أمله في تجنب سباق التسلح نحو دولة غير قابلة للمراقبة ناجمة عن معلومات غير دقيقة - أي تنافس المختبرات الكبرى على تطوير نماذج أقوى من أن يتمكن البشر من مراقبتها ومراجعتها، مما يؤدي إلى فشل كامل في السيطرة الأمنية. ص>
وأكد أن عمق الرسم البياني الحسابي للنماذج المتطورة بما في ذلك Astra لا يزيد عن ضعف GPT-4، مما يشير إلى أن بنية النموذج لم تشهد قفزة في التعقيد كما يخشى العالم الخارجي. ص>
يشير عمق الرسم البياني للحساب هنا إلى أطول سلسلة من خطوات الحساب التي يجب تنفيذها بشكل تسلسلي لإكمال مهمة الاستدلال ولا يمكن تسريعها بالتوازي. في الماضي، كان من الممكن أن تكون الحسابات داخل الطبقة في إطار بنية المحولات العادية متوازية بشكل كبير، وكان عمق التسلسل يساوي تقريبًا عدد طبقات النموذج. ص>
يمكن لعمق دورة شائعات السوق تكرار نفس مجموعة الوحدات لجولات متعددة من التفكير، مما يزيد من عمق التفكير الداخلي قبل إخراج الرمز المميز التالي (عنصر الكلمة)، بدلاً من الاعتماد فقط على سلاسل التفكير النصية المرئية الأطول، والتي يمكنها تحسين الرياضيات والتشفير والأداء الآخر وتقليل التكاليف. ص>
تتمثل المخاطر الأمنية الضمنية لهذه البنية في أنه عندما يكون عمق الرسم البياني الحسابي مرتفعًا للغاية، يمكن للنموذج ضمنيًا إكمال عدد كبير من خطوات التفكير داخليًا دون إخراج سلسلة التفكير الكاملة في المخرجات. لن يتمكن الإنسان من رؤية عملية التفكير والتخطيط وإيجاد الثغرات، ومن ثم الدخول في حالة لا يمكن مراقبتها. سوف تفشل عمليات التدقيق الأمني ومراقبة سلسلة التفكير. ص>

بعد الكشف عن الأخبار ذات الصلة، كان رد فعل مجتمع أمن الذكاء الاصطناعي قويًا. وكتب باك شليجيريس، الرئيس التنفيذي لشركة Redwood Research، وهي منظمة غير ربحية تعمل في مجال سلامة الذكاء الاصطناعي، أنه "قلق للغاية". واستنادًا إلى الحادثة السابقة لنموذج OpenAI الذي هاجم مجتمع Hugging Face، قال إنه غير متأكد مما إذا كانت إمكانية مراقبة سلسلة تفكير Astra أسوأ بكثير من النموذج السابق، ولكن إذا تم تعزيز هذه التكنولوجيا بشكل أكبر وزيادة عدد الدورات بشكل كبير، سيتم تدمير إمكانية مراقبة سلسلة التفكير بالكامل. وهذا أمر مثير للقلق بشكل خاص لأنه إذا لم يتمكن المحققون من رؤية سلسلة الأفكار، فسيكون من الصعب التحقيق في الحوادث الأمنية ذات الصلة، وهو أمر مخيف حقًا. ص>
قال رايان جرينبلات، كبير العلماء في شركة Redwood Research والذي شارك في التحقيق في الحادث الأمني Hugging Face، إن هذه قد تكون أخطر انتكاسة في أمن الذكاء الاصطناعي حتى الآن. وانتقد تسفي موشوفيتز، الكاتب الذي طالما كان مهتمًا بسلامة الذكاء الاصطناعي، هذه التكنولوجيا ووصفها بأنها "لعب بالنار"، بل وقال إن القوانين ضرورية لمنع المنافسة بين مختبرات الذكاء الاصطناعي لخفض المعايير. ص>
اعترف باتشوكي في رده بأن مراقبة سلسلة الأفكار هشة بالفعل وتتطور في اتجاه أكثر صعوبة، لكنها لا تنتج عن تغييرات معمارية. تلتزم OpenAI بالحفاظ على مراقبة سلسلة الفكر واستخدامها منذ نماذج الاستدلال الأولى، وتعتقد أن هذه التكنولوجيا يمكن أن تساعد في مراقبة كيفية تعميم قدرات محاذاة النموذج من توزيع التدريب. يظل تعزيز مراقبة سلاسل الفكر هو الهدف الأساسي لمشاريع البحث الحالية. ص>
صرحت شركة OpenAI بأنها ستنشر مراقبة إضافية لسلسلة الأفكار لشركة Astra للكشف بسرعة عن سوء السلوك المحتمل والحد منه. وفقًا لأخبار السوق، فإن استخدام Astra لتقنية عمق الحلقة محدود، ولا يزال من المتوقع أن تظل سلسلة التفكير النموذجي قابلة للقراءة. منصات مثل Anthropic وGoogle DeepMind في الصناعة تناقش بالفعل تقنيات مماثلة. ص> ص>
التعليقات