الملخص:
أصدرت Google مؤخرًا Gemini 3.5 Transcribe، وهو أحدث نموذج لتحويل الكلام إلى نص في سلسلة Gemini، ووصفته بأنه نموذج التعرف على الكلام الأكثر دقة في السلسلة. هذا النموذج مفتوح للمطورين والمؤسسات والمستخدمين العاديين، ويركز على تحسين قدرات الترجمة الصوتية في البيئات الصاخبة والمصطلحات المهنية المعقدة والتعبيرات المنطوقة الطبيعية.

وفقًا للتقارير، يمكن لـ Gemini 3.5 Transcribe التعامل بشكل أفضل مع ضوضاء الخلفية والمفردات المعقدة في المجالات المهنية. وقالت جوجل إن النموذج الجديد جلب تحسينات في الأداء لتطبيق Gemini على منصة macOS ووظيفة Rambler في لوحة مفاتيح Gboard على منصة Android. يمكن للمطورين استخدام هذا النموذج لإنشاء تطبيقات مثل الوكلاء الصوتيين وأدوات الترجمة في الوقت الفعلي وعمليات تحليل ما بعد المكالمة.
قالت Google إن Gemini 3.5 Transcribe مصمم لالتقاط أنماط التحدث الطبيعية للمستخدمين لفهم الهدف الدلالي بشكل أكثر دقة، وتحديد المفردات المخصصة، ومساعدة المستخدمين على إكمال المهام من خلال الصوت.
على المستوى الوظيفي، يضيف النموذج الجديد عددًا من إمكانيات التحسين، بما في ذلك التصحيح الذاتي التلقائي، وحذف كلمات الحشو المنطوقة مثل "um" و"ah"، والتنسيق التلقائي للنص الناتج. وفي الوقت نفسه، يمكنه أيضًا تفويض مهام أكثر تعقيدًا مثل تحليل الملفات وإنشاء الصور إلى نماذج Gemini الأخرى لتشكيل تجربة تعاون متعددة النماذج أكثر اكتمالاً.
من حيث الدقة، أشارت جوجل إلى أن متوسط معدل خطأ الكلمات في Gemini 3.5 Transcribe هو 4.0% في سيناريوهات التعرف على الكلام المتدفق، ويمكن تقليله إلى 2.6% في السيناريوهات غير المتدفقة. يتمتع النموذج بأداء نسخ أفضل في البيئات الصاخبة ويمكنه تحديد المعلومات الأساسية المكونة من أحرف وأرقام بشكل أكثر دقة مثل أرقام الطلبات والرموز البريدية.

فيما يتعلق بدعم اللغة، يغطي Gemini 3.5 Transcribe حاليًا 85 لغة ويدعم اللهجات الإقليمية واللهجات المختلفة. بالنسبة للصوت المسجل مسبقًا، يمكنه إجراء التعرف على إسناد الكلام بختم زمني لما يصل إلى ثلاثة مكبرات صوت؛ بالإضافة إلى ذلك، يمكن للنموذج أن يتكيف مع المفردات المحددة من قبل المستخدم لتحديد المصطلحات المهنية والتهجئة الخاصة وأسماء الصناعة.
يتوفر Gemini 3.5 Transcribe حاليًا للمعاينة العامة من خلال Gemini API في Google AI Studio وGoogle Antigravity. يمكن للمستخدمين العاديين تجربة الوظائف ذات الصلة على منصات Android وmacOS. وتخطط جوجل أيضًا لتقديمه إلى متصفح كروم، حيث يمكن للمستخدمين إدخال النص مباشرة من خلال الصوت في مربع الإدخال في أي صفحة ويب.
في الآونة الأخيرة، واصلت Google تسريع تقدم خط إنتاج Gemini. أطلقت الشركة سابقًا برنامج Gemini 3.7 Flash للانضمام إلى المنافسة السعرية الشرسة المتزايدة لنماذج الذكاء الاصطناعي؛ تم أيضًا فتح Gemini في Chrome لنظام Android لجميع المستخدمين في الولايات المتحدة، كما دخل Gemini Assistant أيضًا إلى الجيل الجديد من سيارات الأجرة ذاتية القيادة من Waymo. ص> ص>
التعليقات