وفي يناير 2025، تم إطلاق DeepSeek-R1. في هذا الوقت، في الذكرى السنوية الأولى لإصدار نموذج R1، تم الكشف عن نموذج DeepSeek الجديد "MODEL1". في 21 يناير بتوقيت بكين، قام مستودع GitHub الرسمي الخاص بـ DeepSeek بتحديث سلسلة من أكواد FlashMLA. بمساعدة الذكاء الاصطناعي، تم تحليل العدد الإجمالي لملفات التعليمات البرمجية: 114 (بما في ذلك ملفات .py و.md و.txt و.sh و.cpp و.cu و.h)، وتم اكتشاف معرف بنية النموذج "MODEL1" الذي لم يتم الكشف عنه سابقًا، والذي تم ذكره 31 مرة إجمالاً.

G_HZfZdXYAAwB2j.jpg

FlashMLA هي أداة برمجية أصلية من DeepSeek تم تحسينها بشكل عميق لوحدات معالجة الرسومات الخاصة بهندسة NVIDIA Hopper وهي مصممة خصيصًا لتسريع "توليد الاستدلال" للنماذج الكبيرة. يعتمد تنفيذ هذه الخوارزمية على MLA (آلية الانتباه متعددة الطبقات)، والتي تعد إحدى التقنيات الرئيسية لنماذج DeepSeek (مثل V2 وV3) لتحقيق تكلفة منخفضة وأداء عالٍ. يتم استخدامه لتقليل استخدام الذاكرة على مستوى بنية النموذج وزيادة استخدام أجهزة GPU.

MODEL1 هو أحد معماريتي النموذج الرئيسيتين المدعومتين في DeepSeek FlashMLA، والآخر هو DeepSeek-V3.2. ومن المتوقع أنمن المرجح أن يكون MODEL1 نموذجًا فعالاً للاستدلال. بالمقارنة مع الإصدار 3.2، فهو يتميز باستخدام أقل للذاكرة وهو مناسب للأجهزة الطرفية أو السيناريوهات الحساسة للتكلفة. ويمكن أيضًا أن يكون خبيرًا في التسلسل الطويل، مُحسّن لتسلسلات +16K، ومناسب لمهام السياق الطويلة مثل فهم المستندات وتحليل التعليمات البرمجية. وقد يكون أيضًا متخصصًا في التسلسل الطويل، ومُحسَّنًا لتسلسلات تزيد عن 16 كيلو بايت،مناسب لمهام السياق الطويلة مثل فهم المستندات وتحليل التعليمات البرمجية.

بالإضافة إلى ذلك، يمتد تنفيذ الأجهزة لـ MODEL1 إلى بنيات GPU متعددة. يوجد إصداران على NVIDIA H100/H200 (بنية SM90): يتم استخدام model1_persistent_h64.cu لتكوين 64 رأسًا، ويتم استخدام model1_persistent_h128.cu لتكوين 128 رأسًا. يوجد تطبيق Head64 kernel مخصص على أحدث B200 (بنية SM100)، وتنفيذ Head128 لـ SM100 يدعم فقط MODEL1 ولا يدعم V3.2.يتوقع بعض الأشخاص أن DeepSeek قام بتحسين بنية MODEL1 خصيصًا للتكيف مع الجيل الجديد من وحدات معالجة الرسومات من NVIDIA..

النماذج الرئيسية التي أصدرتها DeepSeek تمثل خطين تقنيين: سلسلة V "المساعد الشامل" التي تسعى إلى تحقيق الأداء الشامل النهائي وسلسلة R "حل المشكلات" التي تركز على التفكير المعقد.

يعد الإصدار 3، الذي تم إطلاقه في ديسمبر 2024، علامة فارقة مهمة لـ DeepSeek. وقد أنشأت بنية وزارة التربية والتعليم الفعالة أساسًا قويًا للأداء الشامل. منذ ذلك الحين، قامت DeepSeek بتكرار الإصدار V3 بسرعة، وأصدرت الإصدار V3.1 لتعزيز قدرات الاستدلال والوكلاء، وأطلقت الإصدار الرسمي الأخير V3.2 في ديسمبر 2025. وفي الوقت نفسه، تم أيضًا إطلاق إصدار خاص V3.2-Speciale يركز على حل الرياضيات الصعبة والمشكلات الأكاديمية.
يستخدم R1، الذي تم إصداره في يناير 2025، التعلم المعزز لأداء مهام الاستدلال المعقدة بشكل متميز مثل حل المشكلات الرياضية وبرمجة التعليمات البرمجية، وكان رائدًا في وضع "التفكير العميق".

وسائل الإعلام التكنولوجية نشرت المعلومات الخبر في بداية الشهر بأن,ستطلق DeepSeek جيلًا جديدًا من نموذج الذكاء الاصطناعي الرائد - DeepSeek V4 خلال السنة القمرية الجديدة في منتصف فبراير من هذا العام، والذي سيتمتع بقدرات تشفير أقوى.

في السابق، أصدر فريق بحث DeepSeek ورقتين تقنيتين، يقدمان على التوالي طريقة تدريب جديدة تسمى "الاتصال المتبقي الأمثل (mHC)" و"وحدة ذاكرة الذكاء الاصطناعي (Engram)" المستوحاة من علم الأحياء. وقد دفعت هذه الخطوة المستخدمين إلى التكهن بأن النموذج الجديد الذي يتم تطويره بواسطة DeepSeek قد يدمج نتائج الأبحاث الأخيرة هذه.