الملخص:
تم إصدار Fable 5.1 وMythos 5.1! لقد احتل المرتبة الأولى في جميع الاختبارات المعيارية العامة الثمانية، وانخفض السعر بنسبة تصل إلى 45%. ومن الواضح أنها تخلت عن Fable 5 وجارتها GPT-5.6 Sol، خاصة في مجالات البحث العلمي والبرمجة. من منظور أكثر بديهية، عند تشغيل Fable 5.1 الآن بمستويات استدلال متوسطة ومنخفضة، فإن الأداء يعادل بشكل أساسي الإصدار القديم من Mythos 5 بمستوى استدلال مرتفع للغاية أو حتى أعلى مستوى. في هذه الموجة قتلت "الحكاية" "ميثوس". ص> ص>


من حيث السعر، خفض Fable 5.1 سعر قراءة ذاكرة التخزين المؤقت إلى 0.25 دولارًا أمريكيًا لكل مليون رمز، وهو تخفيض بنسبة 75%. ص>
تتوافق أسعار المدخلات والمخرجات مع Fable 5، حيث تبلغ 10 دولارات و50 دولارًا لكل مليون رمز على التوالي. ص>
يبدو أنه تم تخفيض سعر واحد فقط، ولكن التأثير الفعلي كبير نسبيًا، لأنه في مهمة الوكيل، تمثل قراءة ذاكرة التخزين المؤقت غالبية التكلفة. ص>
تشير البيانات المقدمة من Anthropic إلى أن تكلفة أعباء العمل النموذجية أقل بنحو 25% من تكلفة Fable 5. وإذا كانت مهمة ذكية للغاية، فيمكنها توفير ما يصل إلى 45%. ص>

يحتوي فيديو الإصدار الرسمي على ما يقوله:
بغض النظر عن المهمة التي طلبت من كلود التعامل معها من قبل، يمكن لـ Fable 5.1 القيام بالمزيد والقيام بالأجزاء الأصعب بشكل أفضل. ص>

يقوم بذلك لأنه جيد في التعامل مع المهام متعددة الخطوات. ص>
في هذا النوع من المهام، إذا حدث خطأ بسيط في الخطوة الثانية، فسوف ينهار الأمر برمته بحلول الخطوة الأربعين، لكن Fable 5.1 يمكن أن يوفر مخرجات مستقرة طوال العملية بأكملها. ص>
إذا واجهت مشكلة لا يمكن حلها، فسوف يخبرك بالحلول التي جربتها وأين واجهت مشكلة. ص>
ذكر الباحث Flix Rieseberg أيضًا على وجه التحديد أنه فيما يتعلق بالكتابة، فإن Fable 5.1 يقلل من استخدام الخطوط الغامقة، ويستخدم عددًا أقل من العناوين أو القوائم أو علامات الاقتباس، ويتبع إشارات النمط بشكل أفضل. ص>
ما أريد قوله هو، هل يمكنك فتح المصدر لنصائح أسلوبك بالمناسبة؟ ص>

لا يزال Fable 5.1 صحيحًا، وهو مفتوح لجميع المستخدمين، وMythos 5.1 متاح فقط لمؤسسات الأمن السيبراني وعلوم الحياة التي تم فحصها من خلال برنامج الوصول الموثوق. ص>
بحث علمي عملي: تصميم البروتين، إنشاء خرائط الزهرة، تسريع GPU
ص>بالإضافة إلى النتائج الجارية، أظهرت Anthropic أيضًا النتائج العملية لـ Fable 5.1 وMythos 5.1 في مجال البحث العلمي. ص>
فيما يتعلق بتصميم البروتين، استخدمت Anthropic Mythos 5.1 لاستخدام تصميم البروتين مفتوح المصدر وأدوات الطي لتصميم بروتينات ربط عالية الألفة، وأرسلت الخطة إلى مؤسستين خارجيتين للتحقق التجريبي. ص>
عبر ثلاثة أهداف، كان الارتباط الملزم لتصميم Mythos 5.1 أعلى بعشر مرات من أفضل حل في مسابقة تصميم البروتين Adaptyv Bio. وفي جميع الأهداف الـ 12، كان معدل الإصابة قريبًا من 50 بالمائة، مقارنة بمعدل الإصابة النموذجي الذي يتراوح بين 10 إلى 15 بالمائة في المجال الحالي لتصميم البروتين. ص>
تعد بروتينات الارتباط عالية الألفة الخطوة الأولى في العديد من عمليات تطوير الأدوية الشائعة وتحدد بشكل مباشر ما إذا كان الدواء يمكن أن يعمل بجرعات أقل. ص>

في علم الفلك، قامت Fable 5.1 بتدريب شبكة عصبية تعتمد على الصور الرادارية التي التقطتها مركبة ماجلان الفضائية التابعة لناسا منذ أكثر من 30 عامًا لإنشاء خريطة طبوغرافية جديدة عالية الدقة لثلث سطح كوكب الزهرة. ص>
الخرائط الطبوغرافية المتوفرة سابقًا غطت فقط خمس كوكب الزهرة، بدقة تتراوح بين 10 و20 كيلومترًا. يزيد Fable 5.1 الدقة إلى 2 إلى 3 كيلومترات، كما أن دقة الارتفاع أعلى بنسبة 25% من ذي قبل. تم إصدار هذه الخريطة كمصدر مفتوح بموجب ترخيص CC وسيتم استخدامها كمرجع لمهمتي NASA VERITAS وESA EnVision القادمتين للمساعدة في تحديد السمات الجيولوجية الرئيسية لعمليات الرصد المستقبلية. ص>

فيما يتعلق بالبيولوجيا الحاسوبية، يعمل Mythos 5.1 على تحسين سرعة تشغيل 7 نماذج تعلم عميق مفتوحة المصدر بما يصل إلى 2.5 مرة عن طريق كتابة نواة GPU مخصصة وتخزين النتائج الوسيطة مؤقتًا، ويكون الإخراج متسقًا تمامًا. ص>

في الأبحاث الفعلية، قد يحتاج علماء الأحياء إلى تشغيل هذه النماذج آلاف المرات، واختبار جميع الطفرات المحتملة بالقرب من كل جين بشري. يمكن للنماذج المحسنة تقليل تكاليف وحدة معالجة الرسومات بنسبة 30% إلى 60%. ص>

يستغرق هذا النوع من التحسين عادةً عدة أسابيع من قبل فريق هندسة الأداء، ولا تستطيع العديد من المختبرات الأكاديمية تحمل تكاليفه. ومع ذلك، قام Mythos 5.1 بذلك في غضون أيام قليلة واعتمد فقط على التعليمات البرمجية مفتوحة المصدر. ص>
تخطط شركة Anthropic لفتح مصدر هذه التحسينات في المستقبل القريب. ص>
آلية منع التقطير متاحة
ص>مع إصدار Fable 5.1، هناك بعض اللوائح الخاصة وتغييرات واجهة برمجة التطبيقات. ص>
دعونا نتحدث بإيجاز عن السلامة أولاً. ص>
المعدل الإيجابي الخاطئ لأمن الشبكة في Fable 5.1 أقل بنسبة 60% من Fable 5. يُسمح الآن باستخدامه لاكتشاف ثغرات البرامج، لكن تطوير برمجيات إكسبلويت لا يزال محظورًا. سيتم إعادة توجيه المهام ثنائية الغرض مثل اختبار الاختراق، وتوليد الثغرات، وفحص الثغرات الأمنية الثنائية، وما إلى ذلك إلى نموذج سلسلة Opus. ص>
تم تقليل المعدلات الإيجابية الكاذبة في الأسئلة الأساسية المتعلقة بالبيولوجيا والطبية بنسبة 85%، لكن الاستفسارات المتعلقة بالبحث والتطوير في علوم الحياة لا تزال يتم توجيهها إلى معالجة نموذج Opus، ويحتاج المتخصصون إلى الوصول من خلال برنامج التحقق من صحة علوم الحياة (LSVP) الخاص بـ Mythos 5.1. ص>
ثم دعونا نتحدث عن آلية منع التقطير المضافة حديثًا. ص>
بدءًا من اليوم، لا يمكن لحسابات API المسجلة حديثًا تحرير سياق Claude يدويًا في جولات متعددة من المحادثات مع الاحتفاظ بسجلات سلسلة الأفكار. ص>
هناك أسلوب شائع تم تسجيله علنًا من قبل: التلاعب يدويًا بالسياق السابق لكلود في جولات متعددة من المحادثات، مع الاحتفاظ بسجل سلسلة الأفكار عمدًا. يسمح هذا للنموذج بإعادة عرض المنطق الذي تم إنتاجه بموجب مجموعة أخرى من التعليمات ضمن مجموعة تعليمات جديدة، ربما عدائية. ص>
هذا الطريق مسدود الآن. ص>

تتمثل الطريقة في إضافة توقيع إلى كل كتلة من سلسلة التفكير. ص>
عندما يرسل المستخدم رد المساعد مرة أخرى إلى واجهة برمجة التطبيقات في طلبات لاحقة، سيستخدم النظام هذا التوقيع للقيام بأمرين: التحقق مما إذا كان النموذج الحالي لديه الحق في قراءة هذه الكتلة، والتحقق مما إذا كانت المحادثة بأكملها قبل هذه الكتلة (بما في ذلك كلمات موجه النظام، وقائمة الأدوات، وجميع الرسائل التاريخية) هي نفسها تمامًا كما كانت عندما تم إنشاؤها في الأصل. ص>
سوف يفشل التحقق من التوقيع عند لمس أي شيء في المحادثة. ص>
يعتمد ما يجب فعله بعد الفشل على المعلمة prefix_mismatch_behavior التي حددها المطور: القيمة الافتراضية هي "خطأ"، والتي تُرجع مباشرة رمز الحالة 400 ويتم رفض الطلب؛ إذا تم ضبطه على "drop_block"، فسيقوم النظام بإسقاط الكتلة وجميع سلاسل التفكير بعدها بصمت، وسيتم تنفيذ الطلب نفسه كالمعتاد. ص>
لا يتم احتساب الجزء المهمل (الأشخاص غريبو الأطوار نوعًا ما) وسيتم إدراجه في مصفوفة input_transformations في الاستجابة. ص>

ما هي العمليات التي ستؤدي إلى فشل عملية التحقق؟ ص>
تقدم الوثائق قائمة مفصلة: تحرير أو إعادة ترتيب أو حذف أي رسائل سابقة للمستخدم/المساعد/النظام، وتغيير كلمة المطالبة ذات المستوى الأعلى للنظام، وإجراء أي إضافات أو عمليات حذف أو إعادة تسمية إلى قائمة الأدوات، وإزالة كتلة سلسلة التفكير من سجل المحادثة مع الاحتفاظ بالكتل اللاحقة، والإشارة إلى عنوان URL لصورة أو مستند يعرض محتوى مختلفًا بين الطلبات. ص>
سيؤدي أي مما سبق إلى جعل جميع كتل سلسلة التفكير اللاحقة غير صالحة. ص>

على العكس من ذلك، تكون بعض العمليات آمنة:
إن إلحاق رسائل جديدة في نهاية المحادثة، وإزالة كتلة سلسلة التفكير من بداية السجل، وتغيير معلمات الطلب مثل max_tokens، وزيادة أو تقليل علامات Cache_control، والضغط من جانب الخادم أو تحرير السياق لن يؤدي إلى فشل التحقق. ص>
يوجد أيضًا تصميم للتحقق من السلسلة. ستسجل كل كتلة من سلسلة التفكير المعلومات الموجودة في الكتلة السابقة لها، لتشكل سلسلة متقاطعة. يمكن إزالة الكتل من رأس السلسلة، ولكن إذا تمت إزالة واحدة من الوسط، فإن كل كتلة تليها تصبح غير صالحة، وسيتم إبطال السلسلة بأكملها من نقطة الكسر. ص>
من أجل منع المطورين من التعثر، توفر Anthropic أيضًا سلسلة من البدائل التي يمكنها تحقيق نفس التأثير دون لمس السجل. ص>
هل تحتاج إلى تغيير التعليمات في منتصف الطريق؟ استخدم رسائل النظام في منتصف المحادثة بدلاً من تغيير كلمة المطالبة ذات المستوى الأعلى مباشرةً. ص>
هل تحتاج إلى إضافة تذكير مؤقت لكل جولة؟ استخدم رسالة النظام ذات المستوى الدائري مع المعلمة Clear_at لاستبدال الطريقة القديمة المتمثلة في "الإدراج أولاً ثم الحذف". ص>
هل تحتاج إلى إضافة أدوات أو إزالتها في منتصف الطريق؟ استخدم الكتلتين tool_addition وtool_removal بدلاً من تحرير قائمة الأدوات مباشرة. ص>
هل تحتاج إلى قص السياق؟ استبدل الاقتطاع التقريبي من جانب العميل بالضغط من جانب الخادم وتحرير السياق. ص>
إذا كنت تستخدم منتجات رسمية مثل Claude Code، أو claude.ai، أو Claude Managed Agents، أو Claude Agent SDK، فلن تحتاج إلى تغيير أي شيء. لقد تأكدوا تلقائيًا من عدم العبث ببادئة المحادثة. ص>
ولكن إذا كنت مطورًا يتصل مباشرةً بواجهة برمجة التطبيقات للرسائل، فإن اقتراح Anthropic هو استخدام مصفوفة الرسائل بشكل صارم كملحق فقط، ثم تشغيل اختبار جلسة كامل متعدد الجولات مع تعيين prefix_mismatch_behavior على وضع "drop_block" لمعرفة ما إذا كان هناك أي إدخالات prefix_binding_mismatch في السجل. ص>
تذكر الوثيقة النهائية أيضًا على وجه التحديد السيناريو الذي يسهل فيه الوقوع في المشاكل. ص>
إذا كنت تحتفظ بأداة أو إطار عمل واستخدم المستخدمون مفاتيح واجهة برمجة التطبيقات الخاصة بهم لاستدعائها، فسيقوم المستخدمون المسجلون حديثًا بإجراء عملية التحقق هذه مبكرًا. نظرًا لأنه من المرجح أن يتم تسجيل المفتاح الخاص بالمطور قبل 31 أغسطس، فإنه لم يتم تنفيذه بعد. ص>
في هذه الحالة، يوصى بتعيين prefix_mismatch_behavior بشكل استباقي واختباره مسبقًا. لا تنتظر حتى يتعطل المستخدمون قبل أن تكتشف ذلك. ص>
شيء آخر
ص>مع مثل هذه الضجة الكبيرة القادمة من الشركة "أ"، فمن المؤكد أن شركة OpenAI المجاورة لن تكون قادرة على الجلوس ساكنة. ص>
لكن طرازهم الجديد Astra ليس جاهزًا بعد، لذا يتعين عليهم تقديم معاينة رمزية أولاً. ص>

بمناسبة إصدار Fable 5.1 وOpenAI Astra، نادرًا ما خرج إيليا للتحدث علنًا، داعيًا إلى تعزيز أمان الشبكة. ص>

التعليقات