الملخص:
أصدر فريق Qwen التابع لشركة Alibaba مؤخرًا جيلًا جديدًا من النموذج الأصلي كامل الوسائط Qwen3.8-Omni-Flash، والذي يجمع أيضًا بين فهم الصوت والفيديو وإمكانيات وكيل الذكاء الاصطناعي. ص> يدعم النموذج أربعة نماذج إدخال: النص والصورة والصوت والفيديو، ويوفر نافذة سياقية تضم مليون رمز. بالمقارنة مع الجيل السابق Qwen3.5-Omni-Plus، يزعم مسؤولو Qwen أن متوسط درجاتها في 29 اختبارًا قياسيًا قد زادت بأكثر من 25%، مع تقليل تكاليف معالجة الصوت والصوت والفيديو بشكل كبير. ص> ص>

أحد أكبر التغييرات في Qwen3.8-Omni-Flash هو أنه لا يجمع ببساطة بين التعرف على الكلام والتعرف على الصور والإمكانيات الأخرى، ولكنه بدلاً من ذلك يعالج أنواعًا مختلفة من المعلومات من مستوى النموذج. وتأمل علي بابا في استخدام هذا لتمكين النموذج ليس فقط من "فهم" أو "فهم" محتوى الصوت والفيديو، ولكن أيضًا لتخطيط المهام وأدوات الاتصال وإكمال العمل الفعلي بعد فهم هذه المعلومات. ص>
فيما يتعلق بالإمكانيات الصوتية، فإن أداء Qwen3.8-Omni-Flash متميز بشكل خاص. وفقًا للبيانات الصادرة عن Qwen، فقد تجاوز هذا الطراز Gemini 3.8 Flash في بعض اختبارات قياس الأداء الصوتي. على سبيل المثال، في اختبار استدعاء الأداة متعدد الوسائط WildClawBench-MM، سجل Qwen3.8-Omni-Flash 71.0 نقطة، بينما سجل Gemini 3.8 Flash 58.9 نقطة؛ وفي اختبار DailyOmni، سجل كوين 85.1 نقطة، وسجل الجوزاء 84.0 نقطة؛ في SpotSoundBench، سجل الاثنان 67.2 نقطة و 39.7 نقطة على التوالي؛ وفي اختبار MMAU سجلوا 81.8 نقطة و 76.9 نقطة. ص>
يعد التعرف على الكلام في المؤتمرات متعددة المتحدثين أيضًا محور تركيز هذه الترقية. تُظهر بيانات اختبار AliMeeting الصادرة عن Qwen أن معدل خطأ مكبر الصوت DER لـ Qwen3.8-Omni-Flash هو 3.35، ومعدل خطأ الكلمة cpWER مع إسناد مكبر الصوت هو 17.18، في حين أن الجيل السابق Qwen3.5-Omni-Plus هو 88.11 و89.61 على التوالي. وهذا يعني أن النموذج الجديد يتغير بشكل كبير في هذا الاختبار. ص>
ومع ذلك، فإن Qwen3.8-Omni-Flash لا يتقدم على Gemini 3.8 Flash في جميع المشاريع. على سبيل المثال، في اختبار AgenticVBench، سجل Gemini 3.8 Flash 45.0 نقطة وسجل Qwen 36.8 نقطة؛ في OmniGAIA، سجلوا 78.6 و 74.0 نقطة على التوالي. وفي بعض اختبارات فهم الفيديو، حافظ الجوزاء أيضًا على تفوقه. ولذلك، فإن تركيز Qwen على "الاقتراب من الجوزاء" ينعكس بشكل أكبر في إمكانات الصوت والصوت والفيديو الإجمالية، ولا يعني الريادة الشاملة في جميع المشاريع متعددة الوسائط. ص>
هناك تغيير مهم آخر في Qwen3.8-Omni-Flash وهو السعر. يقول Qwen إن التكلفة المقدرة لكل ساعة لإدخال الصوت قد انخفضت بأكثر من 98% وانخفضت تكلفة الساعة لإدخال الصوت والفيديو بأكثر من 93% مقارنة بالطراز السابق. وفقًا لطريقة الحساب الرسمية، يتم حساب ما يسمى بالتكلفة "بالساعة" عن طريق ضرب سعر معالجة دقيقتين من المادة في 30، حيث يعتمد الفيديو شرط الإدخال 720 بكسل وإطارًا واحدًا في الثانية. ص>
السعر الإقليمي الدولي الحالي الذي أعلنته Alibaba Cloud هو 0.15 دولار أمريكي لكل مليون رمز مُدخل، ورمز الإدخال الذي يصل إلى ذاكرة التخزين المؤقت هو 0.016 دولار أمريكي، ورمز الإخراج لكل مليون هو 0.47 دولار أمريكي. ستختلف الأسعار في البر الرئيسي للصين وبعض المناطق الأخرى. نظرًا لأنه يمكن استخدام الصوت والفيديو مباشرة كمدخلات نموذجية، فإن هيكل التسعير هذا مناسب بشكل خاص لسيناريوهات مثل تسجيل الاجتماعات، وتحليل الصوت الطويل، ومراجعة الفيديو، وإنشاء الترجمة، ومعالجة كميات كبيرة من محتوى الوسائط. ص>
تعمل نافذة سياق المليون رمز مميز على تضخيم هذه الميزة بشكل أكبر. الحد الأقصى لطول الإدخال لـ Qwen3.8-Omni-Flash يقترب من 992,000 رمز، والحد الأقصى لطول الإدخال في وضع التفكير هو حوالي 984,000 رمز، ويصل الحد الأقصى لطول الإخراج إلى 131,000 رمز. وهذا يعني أنه يمكن للمطورين تسليم محتوى صوتي أو فيديو واسع النطاق مباشرةً إلى النموذج للمعالجة، دون الحاجة إلى تقطيع الإطارات واستخراجها بشكل متكرر كما كان الحال في الماضي، ثم استخدام نماذج متعددة لإكمال التعرف على الكلام والفهم البصري واستدلال النص على التوالي. ص>
توضح المعلومات الرسمية لـ Alibaba Cloud أن Qwen3.8-Omni-Flash يمكنه التعامل مع إدخال الصوت بـ 113 لغة ولهجة ويدعم تحليل الصوت المكاني. من خلال المعلمات ذات الصلة، يمكن للنموذج التعامل مع الصوت المجسم ثنائي القناة والصوت المكاني رباعي القنوات. وفي الوقت نفسه، يدعم النموذج استدعاء الوظائف والبحث في الشبكة والتخزين المؤقت للسياق وإمكانيات أخرى، ويمكن استخدامه مباشرة في سير عمل الوكيل الأكثر تعقيدًا. ص>
من منظور اتجاه التطبيق، يركز فريق Qwen على "التسليم الذكي" هذه المرة. على سبيل المثال، يمكن للنموذج تحليل مقاطع الفيديو الطويلة وتحديد المحتوى الرئيسي وأدوات الاتصال الإضافية لإكمال المهام مثل تحرير الفيديو وتنظيم المحتوى وملخص الاجتماع وإنشاء الترجمة. كما أعلنت Qwen عن Qwen-MM-Plugins لتطوير الوكيل متعدد الوسائط، وتخطط لإطلاق Qwen-Live-Harness لمساعدة المطورين على بناء تطبيقات الوكيل الذكية بناءً على إدخال الصوت والفيديو. ص>
بالمقارنة مع الجيل السابق Qwen3.5-Omni، لا يقتصر تركيز هذه الترقية على تحسين دقة التعرف بالمعنى التقليدي فحسب، بل محاولة تغيير طريقة استخدام الذكاء الاصطناعي للصوت والفيديو. في الماضي، كانت التطبيقات متعددة الوسائط تتطلب عادةً استخراج إطارات الفيديو ونسخ الصوت، ثم تسليم النتائج المختلفة إلى نموذج اللغة للمعالجة؛ يحاول Qwen3.8-Omni-Flash توحيد هذه الروابط في نموذج وسائط كامل أصلي قدر الإمكان، ويستخدم مليون سياق رمزي لمعالجة المحتوى الأصلي الأطول بشكل مباشر. ص>
توفر Qwen3.8-Omni-Flash حاليًا الخدمات من خلال Alibaba Cloud Bailian، وتدعم مناطق مثل بكين وسنغافورة وهونج كونج والصين وطوكيو واليابان وفرانكفورت بألمانيا وفيرجينيا بالولايات المتحدة. النموذج نفسه لا يفتح الأوزان مباشرة مثل بعض موديلات Qwen السابقة. يفتح Alibaba بشكل أساسي المكونات الإضافية الداعمة متعددة الوسائط وأدوات التطوير ذات الصلة هذه المرة. ص>
بشكل عام، لا يقتصر جوهر تحديث Qwen3.8-Omni-Flash على تحسين نتائج تشغيل النموذج فحسب، بل أيضًا تقليل تكاليف معالجة الفيديو الجهير، وتوسيع نطاق السياق، والجمع بين فهم الصوت والفيديو واستدعاء الأداة. وعلى وجه الخصوص، تم تخفيض تكلفة إدخال الصوت بنسبة تزيد عن 98%. إذا وصلت تكلفة الاستخدام الفعلية إلى مستوى الحساب الرسمي، فسيؤدي ذلك إلى تسهيل التحليل التلقائي واسع النطاق لتسجيلات الاجتماعات طويلة المدى والبودكاست والبث المباشر ومواد الفيديو، وزيادة حدة المنافسة بين Qwen والنماذج متعددة الوسائط مثل Google Gemini. ص> ص>
التعليقات