في 17 فبراير، نشرت صحيفة وول ستريت جورنال مقالا:يشرح كيف يستخدم DeepSeek تكاليف تطوير أقل وشرائح أقل قوة لمنافسة النماذج الكبيرة الأخرى الأكثر تقدمًا في العالمبل وأكثر فائدة في بعض الجوانب. هذا هو "التجاوز على منحنى". فيما يلي "التقنيات السوداء" الثلاثة الرئيسية لـ DeepSeek:
1. تعزيز التعلم
وفقًا لورقة بحثية نشرتها DeepSeek، فإن النموذج الكبير قادر على "كسب المزيد بتكلفة أقل" لأن أحدث طراز R1 يعتمد بشكل أكبر على تقنية تسمى التعلم المعزز. في هذه العملية،يحصل النموذج على ردود فعل من سلوكه باستخدام نظام المكافأة الذي ينشئه ويعدله باستمرار.
يعتمد النموذج على كميات كبيرة من النصوص الموجودة، والتي تم تقسيمها إلى كلمات فريدة وأجزاء من الكلمات وعلامات الترقيم ثم يتم إعادة تجميعها بطرق مختلفة. يحتوي نموذج اللغة الكبير هذا على أكثر من 671 مليار إعدادات قابلة للتعديل، تسمى "المعلمات"، والتي تحدد كيفية استجابة النموذج للتعليمات.
عدد معلمات النموذج هو مقياس لحجمه.على عكس نماذج الذكاء الاصطناعي التقليدية، لا تنشط سوى مجموعة صغيرة من الإعدادات القابلة للتعديل أثناء أي عملية فردية لجهاز R1.يؤدي الانخفاض في المعلمات النشطة إلى تقليل الطاقة والحوسبة المطلوبة للمعالجة بشكل كبير، مما يسمح للنموذج بالعمل على شرائح أرخص وأقل تقدمًا.
2. مزيج الخبراء
يعمل نموذج R1 الخاص بـ DeepSeek من خلال الانقسام إلى شبكات متعددة ذات خبرات مختلفة، وهو أسلوب يسمى "خلط الخبراء".تتطلب بعض التعليمات خبرات مختلفة، ومن أجل الاستجابة للتعليمات، سيقوم النموذج بمعالجة الشبكات التي يعتبرها الأكثر صلة فقط.
في المقابل، تعتمد نماذج الذكاء الاصطناعي التقليدية على مجموعات ضخمة من البيانات المصنفة مسبقًا في عملية تسمى التعلم الخاضع للإشراف. تتم عملية وضع العلامات المسبقة يدويًا، وهو أمر مكلف ويستغرق وقتًا طويلاً.متخصصونلقد أدت التكنولوجيا الهجينة المنزلية إلى خفض تكلفة التدريب على الذكاء الاصطناعي بشكل كبير.
3. مفتوح المصدر
تعد نماذج DeepSeek أيضًا فريدة من نوعها لأنها مفتوحة المصدر، مما يعني أن المطورين خارج الشركة يمكنهم أيضًا إعادة توظيفها.
وتصدر نموذج R1 الخاص بالشركة القائمة على منصة ChatbotArena، التي يديرها باحثون في جامعة كاليفورنيا، بيركلي، والتي تسجل نماذج الذكاء الاصطناعي.
يتفوق R1 على معظم النماذج الأخرى في مهام مثل الرياضيات والبرمجة.
تأتي بيانات ChatbotArena من الزوار الذين يستخدمون موقعها على الويب لطرح الأسئلة والحصول على إجابات من نموذجين مجهولين للذكاء الاصطناعي، ثم تقييم الإجابة الأفضل. وقد جمع الموقع أكثر من 2.5 مليون صوت على حوالي 200 عارضة.
يقدم DeepSeek للمطورين أسعارًا أقل من العديد من النماذج الأخرى في فئة الذكاء الخاصة به، وفقًا للبيانات التي جمعتها شركة Artificial Analysis لقياس الذكاء الاصطناعي. .
يقوم مطورو نماذج الذكاء الاصطناعي بفرض رسوم على المستخدمين، مثل الشركات التي ترغب في دمج التكنولوجيا في منتجاتها، استنادا إلى كمية البيانات - أو "الرموز" في لغة الصناعة - التي يتم نقلها ذهابا وإيابا بين الطرفين.
وقالت صحيفة وول ستريت جورنال إن النموذج الصيني لشركة DeepSeek قادر على المنافسة مع نماذج من كبار مطوري الذكاء الاصطناعي في الولايات المتحدة من حيث الأداء والسعر.