الملخص:
أوه، انقلب كلود مرة أخرى! هذه المرة قام كلود بحذف الدليل الرئيسي للمشروع بالكامل للمطور، مما أدى إلى حذف 700 جيجابايت من الملفات. "rm -rf" مرة أخرى. باختصار، يسمح المطورون للذكاء الاصطناعي بالمساعدة في كتابة البرامج النصية لضمان عدم حذف الملفات عن طريق الخطأ. شعر الذكاء الاصطناعي أن هذا أمر خطير بعض الشيء وبدأ بمراجعة أمنية. نتيجة المراجعة هي: حذف الدليل الرئيسي بأكمله. ص> ص>

يُعد Guillemot مستخدمًا كثيفًا لوكلاء الذكاء الاصطناعي. في التطوير اليومي، كثيرًا ما يتصل بالعديد من وكلاء برمجة الذكاء الاصطناعي لمساعدته في عمله. ولكن هناك مشكلة صغيرة كانت تزعجه: هؤلاء العملاء لا يقومون أبدًا بالتنظيف بعد الاستخدام، مما يترك الكثير من الملفات غير المرغوب فيها في الدليل /tmp. ص>
لذلك اتخذ قرارًا بدا معقولًا للغاية: اسمح لـ Claude Fable 5 بكتابة برنامج نصي لإنشاء مجلد رمل مستقل ضمن /tmp لكل وكيل، وتنظيفه تلقائيًا بعد اكتمال المهمة. تكمن الصعوبة الأساسية في أنه لا يمكنك حذف الملفات التي تستخدمها العمليات الأخرى. ص>
توصلت Fable سريعًا إلى حل، حيث أضافت منطقًا لاكتشاف الوكلاء قيد التشغيل وتأخير الحذف. ألقى Guillemot نظرة وشعر أن الكود معقد للغاية وطلب التبسيط. ص>
حتى هذه اللحظة، كل شيء لا يزال طبيعيا. ص>
جاءت نقطة التحول أثناء المراجعة الأمنية. ص>
نظرًا لأن النص يتضمن عملية حذف صعبة،
بدأت Fable في "مراجعة عدائية" من تلقاء نفسها
(مراجعة عدائية)، أي بدء مثيل نموذجي جديد للتحقق مما إذا كان الكود الذي كتبته آمنًا. يؤدي هذا إلى تشغيل آلية أمان Anthropic. ص>يحتوي Anthropic على
آلية خفض مستوى الأمان
المضمنة في Claude Code : عندما يحدد النظام أن المهمة الحالية تتضمن عمليات حساسة (مثل الأمن السيبراني، أو التكنولوجيا الحيوية، أو في هذه الحالة، حذف الملف)، فإنه سيقوم تلقائيًا بخفض مستوى النموذج من إصدار عالي السعة إلى إصدار أكثر تحفظًا. تهدف هذه الآلية إلى تقليل احتمالية كون النماذج "عدوانية للغاية" في السيناريوهات عالية المخاطر. ص>في هذه الحالة، قام نظام الأمان أولاً بخفض مستوى النموذج من Fable 5 إلى Opus 5 ثم قام بتخفيضه مرة أخرى إلى Opus 4.8. ص>
يبدأ Opus 4.8 في اختبار الأمان. منطق الاختبار هو كما يلي: قارن المسار المستهدف لبرنامج الحذف النصي مع /tmp والدليل الرئيسي للمستخدم للتأكد من أن البرنامج النصي لن يتلف هذه الدلائل المهمة عن طريق الخطأ. ص>
لقد نجح الاختبار نفسه. تم تحديد كلا المجلدين /tmp والمنزل بشكل صحيح على أنهما "أهداف خطيرة، غير قابلة للحذف". ص>
ولكن هناك خطوة تنظيف بعد اختبار التعليمات البرمجية: احذف الملفات المؤقتة التي تم إنشاؤها أثناء عملية الاختبار. تحدث الكارثة هنا. يعيد Opus 4.8 استخدام نفس أسماء المتغيرات من مرحلة الاختبار في خطوة التنظيف. تم تعيين هذا المتغير المسار إلى الدليل الرئيسي للمستخدم أثناء مرحلة الاختبار، وحذفت خطوة التنظيف هذا المتغير مباشرة. ص>
بمعنى آخر، أكد النموذج للتو أنه "لا يمكن حذف الدليل الرئيسي" وقام بحذف الدليل الرئيسي في الثانية التالية. ص>
قام المطور بإنهاء العملية على الفور بعد اكتشاف الحالة الشاذة، ولكن بعد فوات الأوان. تم محو 700 جيجابايت من البيانات، وتم محو ما يعادل أسبوعًا من العمل. ص>
الدليل /tmp الذي كان من المقرر تنظيفه في الأصل آمن وسليم. ص>


تسببت آلية خفض مستوى السلامة النموذجية بالفعل في الكثير من الشكاوى في المجتمع. ص>
تتضمن المشكلات الأساسية التي أبلغ عنها المطورون ما يلي: يعتبر الرجوع إلى إصدار أقدم حساسًا للغاية، وسيتم تشغيل مهام البرمجة العادية عن طريق الخطأ؛ يتم تقليل قدرات النموذج بشكل كبير بعد الرجوع إلى إصدار سابق، لكن تعقيد المهمة يظل دون تغيير؛ يعد الرجوع إلى إصدار سابق أمرًا "مثبتًا" وسيستمر طوال الجلسة بمجرد تشغيلها، حتى لو كانت العمليات اللاحقة غير ضارة تمامًا. ص>
حتى أن بعض المطورين كتبوا برنامجًا نصيًا لإيقاف الجلسة مؤقتًا تلقائيًا عندما يكتشف أن النموذج قد تم إرجاعه إلى إصدار سابق، مما يمنع النماذج ذات القدرة المنخفضة من الاستمرار في تنفيذ عمليات عالية المخاطر. ص>
تحدد آلية الأمان أن المهمة "خطيرة جدًا" ويجب التعامل معها بواسطة نموذج أضعف.
لكن النماذج الأضعف من المرجح أن ترتكب أخطاء، خاصة في السيناريوهات التي تحتاج إلى معالجة تفاصيل مثل النطاق المتغير ومسارات الملفات بدقة. ص> ص>
"من الطبيعي أن يرتكب الإنسان الأخطاء، ولكن لكي تفسد الأمور تمامًا، عليك الاعتماد على أجهزة الكمبيوتر."
ص>
التعليقات