أطلقت Microsoft نموذج النسخ وتوليف الكلام في الوقت الفعلي MAI-Transcribe-2-Streaming، لتحتل المرتبة الأولى في قائمة التعرف على البث

📅 2026-10-02

الملخص:

أطلقت مايكروسوفت ثلاثة نماذج جديدة للتفاعل الصوتي في الوقت الحقيقي، وهي نموذج تحويل الكلام إلى نص MAI-Transcribe-2-Streaming، ونماذج تحويل النص إلى كلام MAI-Voice-2.1 وMAI-Voice-2.1-Flash. وتأمل مايكروسوفت أن يقوم المطورون بدمجهم لإنشاء مساعدين صوتيين ووكلاء محادثة يمكنهم المعالجة أثناء الاستماع والاستجابة على الفور بالكلام الطبيعي.

يختلف MAI-Transcribe-2-Streaming عن MAI-Transcribe-2 السابق الذي يمكنه معالجة ملفات التسجيل فقط. يمكنه استقبال تدفقات صوتية مستمرة للإدخال والبدء في إنشاء نص مرحلي قبل أن ينتهي المتحدث من التحدث. وستستمر تنقيحه مع ظهور المزيد من السياق، ويقدم في النهاية نتائج مستقرة. وقالت مايكروسوفت إن النموذج يدعم 60 لغة ويمكنه التعرف على اللغات بشكل مستمر وتلقائي؛ من المفترض أن تظهر الدفعة الأولى من التعرف بعد ما يزيد قليلاً عن 100 مللي ثانية من تلقي الصوت، وهي مناسبة لسيناريوهات مثل وكلاء الصوت وخدمة العملاء وترجمات المؤتمرات والفصول الدراسية والإدخال الصوتي. يُظهر الاختبار الداخلي الذي أجرته مايكروسوفت للإملاء والترجمة أن النص يظهر بسرعة تبلغ ضعف سرعة أقرب منافس، وهي مقارنة تعتمد على مراجعات الشركة الخاصة.

يصنف معيار النسخ المتدفق للتحليل الاصطناعي النموذج في المرتبة الأولى من حيث دقة النص النهائية والمرحلة. وكانت نتائج الاختبار المنشورة أن معدل الخطأ النهائي للكلمات المكتوبة كان حوالي 2.5%، وتم تقديم النص النهائي بعد حوالي 0.13 ثانية من اكتشاف نهاية الخطاب. قارنت القائمة 38 نموذجًا في ذلك الوقت، واختبرت حوالي 8 ساعات من الصوت، وغطت ثلاثة أنواع من المجموعة: AA-AgentTalk، وVoxPpuli، وEarnings22، وهو ما يمثل 50%، و25%، و25% من الوزن الشامل على التوالي. كلما انخفض معدل الخطأ في الكلمات، كلما كان ذلك أفضل. توضح هذه النتيجة أداء النموذج في هذه المجموعة من المعايير ولا تعني أنه يمكن تحقيق نفس الدقة في جميع اللغات والبيئات الصاخبة وتطبيقات العالم الحقيقي.

MAI-Transcribe-2-Streaming معروض للبيع حاليًا مقابل 0.54 دولارًا أمريكيًا لكل ساعة صوتية، ويستمر العرض حتى نهاية عام 2026؛ بالمقارنة، تم الإعلان سابقًا عن MAI-Transcribe-2 غير المتدفق بسعر 0.10 دولار في الساعة. يعد الإصدار في الوقت الفعلي أكثر ملاءمة للتفاعل المستمر، في حين أن الإصدار المجمع مخصص لتسجيل النسخ الصوتي. لا يمكن ببساطة اعتبار أسعار الاثنين بمثابة مقارنة مباشرة تحت نفس طريقة الاستخدام.

يدعم نموذج تركيب الكلام الجديد MAI-Voice-2.1 23 لغة و26 متغيرًا إقليميًا، مما يسمح لنفس الصوت المركب بالتبديل بين اللغات المختلفة مع الاحتفاظ بهوية المتحدث واعتماد اللهجة المحلية للغة المقابلة. ويبلغ سعره 22 دولارًا أمريكيًا لكل مليون حرف. MAI-Voice-2.1-Flash للطلبات ذات الكمون المنخفض والواسعة النطاق تدعم نفس اللغة. تقول Microsoft إنها تستطيع إنشاء 45 ثانية من الصوت مع تأخير شامل يبلغ حوالي 150 مللي ثانية. تمت زيادة سرعة الاستدلال للنموذج بنسبة 55% والسعر أقل بحوالي 60% من النماذج المماثلة. ويبلغ سعره 15 دولارًا لكل مليون حرف. المجموعة الأخيرة من مزايا السرعة والسعر هي من بين المقارنات التي نشرتها Microsoft.

يدعم كلا الطرازين الصوتيين استنساخ الصوت عبر اللغات في الوقت الفعلي، ولكن فقط باستخدام الأصوات المرجعية المعتمدة والمعتمدة. تسرد وثائق Microsoft هذه الميزة على أنها وصول مقيد، مع توصية صوتية مرجعية تتراوح من 5 إلى 60 ثانية، والحماية من إساءة الاستخدام. يعد MAI-Voice-2.1 مناسبًا للمحتوى الأطول والروايات والكتب الصوتية، بينما يعد Flash أكثر ملاءمة لسيناريوهات الوقت الفعلي مثل وكلاء الصوت والمساعدين وخدمة العملاء.

يمكن استخدام النماذج الثلاثة جميعها من خلال Microsoft Foundry وMAI Playground وVercel؛ تم أيضًا توصيل الطرازين الصوتيين بـ OpenRouter ويمكن الاتصال بهما من خلال Azure Voice Live. ومن المتوقع أن يتم إطلاق دعم LiveKit لاحقًا. تقوم وثائق Microsoft Azure حاليًا بتسمية هذه النماذج على أنها معاينة عامة، مع الإشارة إلى عدم وجود اتفاقية مستوى الخدمة ولا يوصى باستخدامها بشكل مباشر في أعباء عمل الإنتاج.

معرفة المزيد:

https://microsoft.ai/news/our-first-streaming-transcription-model/

الوسوم ذات الصلة

مقالات مشابهة

التعليقات

0/500
Captcha (click to refresh)
لا توجد تعليقات