تطلق Google وظيفة التفاعل البشري الرقمي Gemini 3.8 Live Live Avatar، مما يوفر وجه فيديو في الوقت الفعلي مدعومًا بالذكاء الاصطناعي

📅 2026-09-25

الملخص:

أعلنت Google أنها أطلقت رسميًا وظيفة "Live Avatar" (الإنسان الرقمي في الوقت الفعلي) في النظام الأساسي للمؤسسات Gemini Enterprise. تم دمج هذه التقنية بشكل عميق مع أحدث بنية نموذجية كبيرة الحجم Gemini 3.8 Live من Google. استنادًا إلى التأخير الأصلي القريب من الصفر والمحادثة الصوتية عالية السلاسة، فإنه يقدم لأول مرة إمكانات إنشاء فيديو في الوقت الفعلي تقريبًا، مما يتيح للذكاء الاصطناعي التحادثي الحصول على صورة مرئية ديناميكية يمكنها "الاستماع والمشاهدة والتحدث في نفس الوقت."

وفقًا للمقدمة الرسمية، تم تصميم Gemini 3.8 Live Live Avatar لإنشاء مساعد خدمة افتراضية أكثر سهولة وغامرة لعملاء المؤسسات. من خلال مزامنة دفق الصوت بدقة مع نموذج توليد الفيديو الأساسي، يمكن للنظام تحقيق مزامنة الشفاه عالية الدقة، وتغييرات تعبيرات الوجه الطبيعية، وتحويل الحوار السلس بين اللغات. حاليًا، يدعم النظام البشري الرقمي ما يصل إلى 97 لغة، ولن يكون هناك تشويه للفيديو أو انحراف للوجه عند التبديل بين اللغات في منتصف المحادثة.

بالإضافة إلى الإنجازات البصرية، تم تجهيز النظام الأساسي أيضًا بقدرات قوية للاتصال بالأدوات غير المتزامنة. مع الحفاظ على محادثة طبيعية ومتماسكة مع المستخدمين، يمكن للبشر الرقميين الاتصال بصمت بواجهات برمجة التطبيقات الخارجية المختلفة وواجهات بيانات المؤسسة في الخلفية للتعامل مع الأعمال المعقدة متعددة الخطوات مثل تسجيل الوصول إلى الفندق وملء مستندات مطالبة التأمين، ويقولون وداعًا تمامًا لظاهرة "التعطل" أو ظاهرة الانتظار الصامت الطويل التي حدثت عندما قام الذكاء الاصطناعي بمعالجة مهام الخلفية في الماضي. وفي الوقت نفسه، بالإضافة إلى وظيفة مشاركة الكاميرا والشاشة للجهاز الطرفي، يمكن للإنسان الرقمي أيضًا توفير فهم بصري في الوقت الفعلي وتوجيه تفاعلي للأشياء المادية أو واجهات البرامج التي يعرضها المستخدم.

فيما يتعلق بالأمان والامتثال، ومن أجل منع مخاطر التزييف العميق للذكاء الاصطناعي وسرقة الهوية، قامت Google بإعداد خطوط دفاع متعددة لـ Live Avatar. افتراضيًا، يفتح النظام فقط لمستخدمي الشركات مكتبة الصور البشرية الرقمية التي تم إعدادها مسبقًا من خلال المراجعة الرسمية، في حين يتم وضع إذن تخصيص صور العلامة التجارية الحصرية أو وجوه محددة ضمن آلية مراجعة القائمة البيضاء الصارمة. بالإضافة إلى ذلك، تم دمج جميع تدفقات الصوت والفيديو الديناميكية التي تم إنشاؤها بواسطة النظام في الوقت الفعلي مع علامات مائية رقمية غير مرئية وغير قابلة للتلاعب لضمان الشفافية وإمكانية تتبع المحتوى الناتج عن الذكاء الاصطناعي.

في الوقت الحالي، تم فتح وظائف Gemini 3.8 Live وLive Avatar رسميًا لعملاء الاشتراك على مستوى المؤسسة من خلال عقد خدمة مراكز البيانات الأمريكية والأوروبية، ويتم توفير دعم الوصول إلى واجهة برمجة تطبيقات المطورين في الوقت نفسه. وأشار محللو الصناعة إلى أن دمج تكنولوجيا الفيديو التوليدية مباشرة في نموذج الكلام الأساسي لا يزيل الكمون العالي الناتج عن مجموعات عرض الفيديو التقليدية فحسب، بل يشير أيضًا إلى أن خدمة العملاء الافتراضية للذكاء الاصطناعي والمحطات التفاعلية الذكية تدخل عصرًا جديدًا من "الحوار المرئي بين الشخص الحقيقي وفي الوقت الفعلي".

الوسوم ذات الصلة

مقالات مشابهة

التعليقات

0/500
Captcha (click to refresh)
لا توجد تعليقات