تم فتح أول أوزان نموذجية متعددة الوسائط لـ DeepSeek-V4 و"فتحت عينيها" للحاق بـ Opus-4.8

📅 2026-09-01

الملخص:

بعد التعزيز المستمر لقدرات التفكير والتعليمات البرمجية والوكلاء، أضاف DeepSeek أخيرًا مدخلات مرئية إلى V4. في صباح يوم 31 أغسطس، كان DeepSeek في حالة معانقة لقد فتح Face أوزان نموذج DeepSeek-V4-Flash-Vision-Exp، ويمكن للمطورين تنزيل أوزان النموذج مباشرة ونشرها بأنفسهم. بالإضافة إلى ملفات النماذج، يتضمن المستودع الرسمي أيضًا تطبيقات الاستدلال المرجعي للمكونات مثل برنامج التشفير المرئي وAligner، ويغطي DFlash انتبه، وزارة البيئة، الاتصالات الفائقة و DSpark وأجزاء أخرى.


قبل 10 أيام فقط، أعلنت DeepSeek رسميًا عن نموذج V4-Flash-Vision-Exp، بمقياس يبلغ حوالي 305 مليار معلمة. من السهل معرفة من "Exp" بالاسم أن هذا هو أول نموذج تجريبي متعدد الوسائط في سلسلة V4. إنه مبني على بنية V4-Flash. ومن خلال إضافة وحدة مرئية والتدريب المستمر، يكتسب النموذج القدرة على معالجة الصور.

فيما يتعلق بمهام النص العادي، قال المسؤول إن V4-Flash-Vision-Exp وV4-Flash في مستوى مماثل بشكل عام. يتمثل الاختلاف الرئيسي في أن النموذج الجديد يمكنه التعرف على محتوى الصور، وقراءة النص في لقطات الشاشة، وتحليل المخططات، ويمكنه أيضًا استخدام الصور كجزء من سير عمل الوكيل، بدلاً من الاعتماد فقط على الأوصاف النصية.

تتضمن الحالات التي أوضحتها DeepSeek إنشاء عروض PPT وفقًا للمتطلبات، وقراءة صفحات الويب وتعديلها، وإنشاء صفحات أمامية ذات تأثيرات ديناميكية.


إن القاسم المشترك بين هذه المهام ليس التعرف على الصور بالمعنى التقليدي، ولكن يحتاج النموذج إلى فهم المحتوى المرئي أولاً، ثم الجمع بين التعليمات البرمجية والاستدلال واستدعاءات الأدوات لإكمال العمليات اللاحقة. انطلاقًا من الاختبار المعياري الذي نشرته DeepSeek، بعد إضافة القدرات المرئية، أصبح V4 قريبًا بالفعل من النموذج الأنثروبي الكبير متعدد الوسائط Claude Opus 4.8 الذي اختاره للمقارنة في بعض مهام الوكيل متعدد الوسائط.

على وجه التحديد، في اختبار ApexBench، كانت درجة Pass@1 لـ V4-Flash-Vision-Exp 36.5، وهي أقل من 39.4 لـ Opus-4.8. تبلغ نسبة الرسم البياني 64.3 و65.0 على التوالي، والفجوة صغيرة. في الاختبار الأخير للعملاء، حقق DeepSeek 27.3، وهو أعلى من 25.7 لـ Opus-4.8. درجة Pass@5 لـ ZeroBench هي 35.0، وهي أعلى أيضًا من درجة Opus-4.8 البالغة 34.0.


من بين بيانات الاختبار الأربعة متعددة الوسائط، تجاوزت اثنتين منها Opus-4.8

من الجدير بالذكر أن الوحدة المرئية المضافة حديثًا لا تضحي بشكل كبير بقدرات وكيل النص الأصلي لـ V4-Flash.

على سبيل المثال، في Terminal Bench 2.1، سجل إصدار Vision 83.9، بينما سجل V4-Flash-0731 سابقًا 82.7؛ ارتفع تقييم DeepSWE من 54.4 إلى 59.3، متجاوزًا درجة Opus-4.8 المدرجة رسميًا البالغة 58.0. ومع ذلك، فإن NL2Repo يبلغ 57.7 فقط، وهو أقل بكثير من 69.7 لـ Opus-4.8، كما انخفض CyberGym من 76.7 السابقة إلى 75.3. لذلك، يلخص DeepSeek إمكانيات النص العادي الخاصة به على أنها "على قدم المساواة" مع V4-Flash.

ومن ناحية أخرى، فإن القدرة البصرية نفسها لها حدود. إنه ليس نظامًا مرئيًا يمكنه قراءة التفاصيل عالية الوضوح بشكل لا نهائي.

وفقًا لوثائق DeepSeek API، يدعم النموذج صور JPEG وPNG وGIF وWebP، ويمكنه استقبال صور فردية أو متعددة. ومع ذلك، سيتم تغيير حجم الصورة وفقًا للحجم قبل إدخال النموذج. سيتم في النهاية ضغط الصور الأكبر حجمًا إلى إجمالي حجم بكسل يعادل حوالي 800 × 800، وستشغل كل صورة ما يصل إلى 384 رمزًا.

السبب في اختيار هذا الأسلوب هو التحكم في التكلفة الحسابية الناتجة عن الإدخال المرئي. ومع ذلك، قد يكون تغيير حجم الصورة أيضًا قيدًا على المهام التي تعتمد بشكل خاص على نص صغير أو مواد محلية أو دقة أصلية.

ولكن مهما كان الأمر، فقد عوض DeepSeek أخيرًا عن عيون V4.

الوسوم ذات الصلة

مقالات مشابهة

التعليقات

0/500
Captcha (click to refresh)
لا توجد تعليقات