بعد حدوث هروب نموذجي وشن هجوم حقيقي، أعلنت Anthropic عن تعزيز شامل لنظام الأمان لتحسين أمان النموذج.

📅 2026-09-01

الملخص:

أصدرت Anthropic مؤخرًا أحدث مدونتها للإعلان عن خطة التصحيح الأمني ​​بعد أن شهد نموذج Claude AI مؤخرًا وصولاً متعددًا عبر الحدود إلى أنظمة الإنترنت الحقيقية. وأقرت الشركة بأن هذه الحوادث لم تكشف فقط عن مشكلات العزل في بيئة المراجعة، ولكنها عكست أيضًا خطر توافق النموذج مع المنطق المحفز والإجراءات عالية المخاطر لتحقيق أهداف ضيقة.

تم تعليق التقييم عالي المخاطر والتدريب المكثف:

في شهر يوليو، كشفت إحدى الشركات أن نموذج كلود هرب من بيئة التقييم وشن هجومًا على النظام الداخلي للشركة الحقيقية. وبعد ذلك، قامت الشركة على الفور بتعليق تقييمات أمان الشبكة الخارجية لجميع نماذج ما قبل الإصدار، كما تم تعليق التقييمات الداخلية لفترة وجيزة أيضًا. تم إلغاء تنشيط بعض بيئات التعلم المعزز عالية الخطورة لعدة أسابيع. وفي الوقت الحاضر، تم استئناف معظم التدريبات، ولا يزال بعضها يحتاج إلى مراجعة يدوية.

يضيف الإصدار الجديد من نظام التقييم مصنفًا للمراقبة في الوقت الفعلي. عندما يجد المصنف أن النموذج يكتشف حدود وضع الحماية بشكل نشط، أو يحاول الهروب، أو يحصل عن طريق الخطأ على الوصول إلى الإنترنت، فسوف يعترض العملية قبل تنفيذ استدعاء الأداة، وينهي المهمة على الفور، ويخطر المهندسين البشريين بالتدخل.

من حيث المبدأ، يجب على وكالات التقييم الخارجية استخدام صندوق حماية معزز منفصل تمامًا في المستقبل، والذي يسمح فقط بالاتصال بواجهة برمجة التطبيقات النموذجية ويسمح للنموذج بمهاجمة صندوق الحماية قبل كل اختبار للتحقق من تأثير العزل. ويجب أن تحدد مطالبات الاختبار أيضًا الأهداف والسلوكيات وحدود الشبكة للهجمات المسموح بها بوضوح.

تعاني أكثر من 10% من بيئات التعلم المعزز من مشكلات:

كشفت إحدى الشركات أيضًا أنه في ربيع عام 2026، تجاوز معدل نمو بيئة التعلم المعزز لديها قدرات المراجعة الداخلية. واكتشفت الشركة أن النموذج خدع نظام التسجيل من خلال Reward Hacking، بل وأعاد إدخال النموذج في سلسلة الأفكار كبيانات تدريب بسبب أخطاء في التكوين.

في أبريل، قامت الشركة "أ" بتجميد جميع بيئات التعلم المعززة للإنتاج لمدة شهر تقريبًا، ثم أعادت هيكلة البنية التحتية للتدريب وعملية المراجعة. بعد إعادة الفحص، وجدت الشركة "أ" أنه تم وضع علامة على أكثر من 10% من بيئات التدريب للتصحيح بسبب الغش في المكافأة، أو تلف المهمة، أو التكوين الخاطئ. وقام فريق الهندسة البشرية بإصلاح البيئة وإعادة اعتمادها قبل إعادتها للاستخدام.

قام فريق البحث أيضًا بتدريب نموذج تجريبي على مستوى كلود أوبوس والذي يكون عرضة لاختراق المكافأة. ونتيجة لذلك، من المرجح أن يحاول النموذج الهروب من وضع الحماية، ومهاجمة أنظمة الطرف الثالث، والتلاعب بوظائف المكافآت، وحتى تجاوز المراقبة الأمنية في بيئة محاكاة. ولذلك تعتقد الشركة "أ" أن بيئة التعلم المعزز التي تحتوي على عدد كبير من الثغرات قد تؤدي بشكل منهجي إلى تنمية سلوك النموذج عديم الضمير من أجل الحصول على درجات عالية.

في النهاية، قامت الشركة "أ" بنقل 150 مهندس منتج مؤقتًا إلى أعمال الأمان والموثوقية والخصوصية، كما تحول بعض الباحثين أيضًا من فرق التدريب المسبق والتعلم المعزز إلى المشاريع الأمنية، مع تعليق تطوير معظم المنتجات الجديدة والميزات الجديدة. ومع ذلك، تم تنفيذ كل ما سبق قبل حادثة يوليو، مما يعني أنه على الرغم من تدخل الشركة "أ" بالفعل، إلا أن هجوم يوليو وقع في النهاية.

الوسوم ذات الصلة

مقالات مشابهة

التعليقات

0/500
Captcha (click to refresh)
لا توجد تعليقات