يفتح OpenAI نفس نموذج الكلام GPT-Live-1 مثل ChatGPT للمطورين. سعر API هو 0.05 دولار أمريكي للدقيقة.

📅 2026-09-11

الملخص:

أعلنت شركة OpenAI مؤخرًا أن GPT-Live-1، المستخدم حاليًا لوظيفة ChatGPT الصوتية، سيتم فتحه رسميًا للمطورين. يمكن للمطورين الآن دمج هذا النموذج الصوتي في تطبيقاتهم وعملياتهم التجارية من خلال واجهات برمجة التطبيقات لإنشاء مساعدين صوتيين مزدوجين يمكنهم الاستماع إلى المستخدمين في الوقت الفعلي والاستجابة في نفس الوقت. يبلغ سعر الواجهة الأمامية الصوتية لهذا النموذج 0.05 دولارًا أمريكيًا للدقيقة، ويجب أن تتم فاتورة النموذج المستخدم في الخلفية للاستدلال المعقد بشكل منفصل وفقًا لسعر النموذج المقابل.

1789093911_chatgpt_voice.webp

GPT-Live-1 هو جيل جديد من نماذج الكلام في الوقت الفعلي التي أطلقتها OpenAI هذا العام. أكبر ميزة لها هي هندستها ثنائية الاتجاه. عادةً ما يحتاج الذكاء الاصطناعي الصوتي التقليدي إلى إكمال الخطوات الثلاث للتعرف على الكلام واستدلال نموذج اللغة وتركيب الكلام بالتسلسل. فقط بعد أن ينتهي المستخدم من التحدث يمكن للنظام أن يبدأ في المعالجة وإنشاء الإجابات. من ناحية أخرى، يمكن لـ GPT-Live-1 إنشاء مخرجات الكلام أثناء الاستماع إلى المستخدم وهو يتحدث، لذلك يمكنه التعامل مع المقاطعات والإيقاف المؤقت والصدى والمحادثات السريعة ذهابًا وإيابًا بشكل أكثر طبيعية.

وهذا يعني أنه لا يتعين على المستخدمين الانتظار حتى ينتهي الذكاء الاصطناعي من التحدث بشكل كامل قبل الاستمرار في التحدث. إذا غيّر المستخدم رأيه، أو أضاف معلومات، أو قاطعه مباشرة، فيمكن لـ GPT-Live-1 تعديل سلوكه في الوقت المناسب وفقًا للمحادثة الجارية. يمكن للنموذج أيضًا معرفة متى يجب الاستمرار في التحدث، ومتى يتوقف مؤقتًا، ومتى يستمر في الاستماع، ومتى يتم استدعاء الأدوات.

ذكرت OpenAI أن هذه البنية يمكن أن تقلل بشكل كبير من التأخير في التفاعل الصوتي وحل مشكلات الاتصال التي قد تحدث في المحادثات الفعلية في خط أنابيب "التعرف على الكلام + نموذج اللغة الكبير + تركيب الكلام" التقليدي. نظرًا لأن GPT-Live-1 نفسه يتعامل مع كل من إدخال وإخراج الصوت، لم يعد المطورون بحاجة إلى تنسيق التبديل المعقد بين نماذج مستقلة متعددة.

في الاختبار الذي نشرته OpenAI، كان أداء GPT-Live-1 في اختبار Full Dual Bench أعلى بنسبة 30 نقطة مئوية من أداء GPT-Realtime-2.1، خاصة من حيث تأخير أخذ الأدوار والسلوك التفاعلي. عند إقرانه مع GPT-6 Astra بكثافة استدلال متوسطة، حقق GPT-Live-1 أيضًا المركز الأول في اختبار Tau3. يستخدم Tau3 بشكل أساسي لتقييم قدرة وكلاء الصوت على إكمال المهام الشاملة.

من الميزات المهمة الأخرى لـ GPT-Live-1 أنها ليست مسؤولة عن جميع أعمال الاستدلال المعقدة. يفصل OpenAI نموذج الكلام المسؤول عن الاستماع والتحدث والتفاعل في الوقت الفعلي عن نموذج الخلفية المسؤول عن التفكير العميق. عندما يطرح المستخدمون أسئلة تتطلب بحثًا أو تحليلًا معقدًا أو مهام طويلة، يمكن لـ GPT-Live-1 تسليم هذه المهام إلى نموذج الخلفية مع الاستمرار في الحفاظ على التواصل الصوتي الطبيعي مع المستخدم.

وبالتالي، يتمتع المطورون بحرية اختيار نماذج الواجهة الخلفية بناءً على احتياجات العمل المحددة. على سبيل المثال، بالنسبة لعدد كبير من المهام البسيطة مثل الحجوزات وتحديثات الطلبات، يمكن استخدام نماذج أسرع وأقل تكلفة؛ بالنسبة لمشاكل العملاء المعقدة، يمكن التعامل معها من خلال نماذج استدلالية أقوى. تسمح هذه البنية للمطورين بإيجاد توازن بين الاستجابة وقدرات التفكير وتكلفة الاستخدام.

ذكرت OpenAI أن هذا التصميم المنفصل يسمح أيضًا لـ GPT-Live-1 بمواصلة التواصل مع المستخدمين أثناء أداء المهام في الخلفية، بدلاً من السماح للمستخدمين بمواجهة فترة طويلة من الانتظار الصامت. يمكن للنموذج مواصلة محادثة طبيعية أثناء إكمال عمل أكثر تعقيدًا في الخلفية، ثم إعادة النتائج إلى المحادثة الحالية عند اكتمال المهمة.

لقد بدأت التطبيقات العملية في الظهور بالفعل. تشمل الأمثلة المبكرة التي أظهرتها OpenAI الخدمات الصوتية مثل Yelp Host وHatch، ومنصة تعلم اللغة Speak. تم العثور على التحدث في التقييمات المبكرة مقارنةً بأنظمة الكلام السابقة القائمة على الأدوار، حيث يمكن لـ GPT-Live-1 أن يمنح متعلمي اللغة مزيدًا من الوقت للتفكير، مما يقلل من عدد المقاطعات الاستباقية للنظام للمستخدمين بنسبة 80٪ تقريبًا.

بالنسبة للمؤسسات، تعد هذه الإمكانية مناسبة بشكل خاص لخدمة العملاء وخدمة العملاء عبر الهاتف والحجوزات والسيناريوهات الأخرى التي تتطلب تفاعلًا صوتيًا مستمرًا. يدعم GPT-Live-1 أصلاً سيناريوهات الهاتف، لذلك يمكن للمطورين استخدامه لإنشاء وكلاء صوت مزدوجين يمكنهم الرد على المكالمات الهاتفية والتعامل معها، مثل حجوزات المطاعم ودعم العملاء والشركات الأخرى التي تتطلب الاتصال في الوقت الفعلي.

يوفر GPT-Live-1 أيضًا النص المكتوب للتعرف التلقائي التلقائي على الكلام ونص الاستجابة النموذجية، ويعزز فهم المجموعات الأبجدية الرقمية، مع دعم وظائف تحيز الكلمات الرئيسية. على الرغم من أنه ليس نموذجًا قائمًا على الدوران بالمعنى التقليدي، إلا أنه لا يزال يدعم اكتشاف الدوران محليًا. لذلك، إذا كان المطورون بحاجة إلى التحكم بوضوح عندما ينتهي المستخدم من التحدث وعندما يبدأ النظام في الإجابة، فلا يزال بإمكانهم تصميم تطبيقاتهم حول دورات الحوار الواضحة.

تم أيضًا تحسين GPT-Live-1 للمشاهد ذات البيئات الخلفية الصاخبة. يمكن للنموذج التمييز بشكل أفضل بين كلام المستخدم وضوضاء الخلفية والصمت. ولن يقوم بمقاطعة المحادثات بشكل متكرر بسبب الأصوات في البيئة المحيطة، ولن يقوم بتذكير المستخدمين باستمرار عندما يفكرون لفترة وجيزة فقط. تعتبر هذه الإمكانية مهمة بشكل خاص للمكالمات الهاتفية وخدمة العملاء والمساعدين الصوتيين المحمولين في بيئات العالم الحقيقي.

قامت OpenAI أيضًا بتوسيع نطاق اختيار الصوت المتاح لـ GPT-Live-1. بالمقارنة مع العدد المحدود نسبيًا من الأصوات في الوقت الفعلي المتوفرة سابقًا، يوفر الإصدار الجديد أصواتًا أكثر تنوعًا ويغطي نطاقًا أكثر ثراءً من اللهجات واللهجات واللغات. تقول OpenAI إنها ستواصل إضافة الأصوات واللغات المتاحة في الأشهر المقبلة.

فيما يتعلق بنشر النموذج، لا يحتاج المطورون إلى تسليم جميع المهام إلى GPT-Live-1. وتأمل OpenAI في استخدامها كواجهة أمامية مسؤولة عن التفاعل الصوتي في الوقت الفعلي، والاضطلاع بأعمال أكثر تعقيدًا من خلال نماذج الخلفية وأطر عمل الوكيل. يسمح هذا الأسلوب أيضًا للمطورين بدمج نماذج مختلفة وفقًا للاحتياجات الفعلية للمهام المختلفة.

على سبيل المثال، يمكن للمطورين السماح لـ GPT-Live-1 بأن يكون مسؤولاً عن تلقي الطلبات الصوتية للمستخدم، والحفاظ على المحادثات الطبيعية، والتعامل مع المقاطعات، ثم تسليم الأسئلة التي تتطلب تفكيرًا معقدًا إلى نموذج الخلفية؛ وبعد انتهاء نموذج الخلفية من العمل، يقوم GPT-Live-1 بتحويل النتائج إلى إجابات صوتية طبيعية. تنطبق هذه الآلية أيضًا على التطبيقات التي تحتاج إلى استدعاء أدوات خارجية.

أوضح OpenAI أيضًا كيفية دمج GPT-Live-1 مع أدوات مثل Codex. يمكن للمطورين السماح لنموذج الكلام بتلقي المهام التي يقترحها المستخدم، ثم نقل السياق ذي الصلة إلى أدوات الخلفية مثل Codex للمعالجة، ثم إعادة نتائج المعالجة إلى GPT-Live-1، الذي سيستمر في التواصل مع المستخدم عبر الصوت.

من حيث السعر، أصبح GPT-Live-1 متاحًا رسميًا الآن من خلال OpenAI API، وتبلغ رسوم الواجهة الأمامية الصوتية 0.05 دولارًا أمريكيًا للدقيقة. من المهم ملاحظة أن هذه ليست سوى تكلفة طبقة الصوت في الوقت الفعلي. إذا قام المطور بتزويد GPT-Live-1 بنموذج استنتاج الخلفية، فيجب حساب تكلفة استدعاء نموذج الخلفية بشكل منفصل بناءً على تسعير النموذج المقابل.

وهذا يعني أنه بالنسبة لتطبيقات الأعمال التي تتطلب عددًا كبيرًا من المكالمات الصوتية، فإن التكلفة الفعلية لا تبلغ 0.05 دولارًا أمريكيًا للدقيقة فحسب، ولكنها تتكون من وقت الاتصال الصوتي واستهلاك الاستدلال لنموذج الخلفية. ومع ذلك، يمكن للمطورين التحكم في التكلفة الإجمالية وفقًا لتعقيد المهمة عن طريق اختيار نماذج خلفية مختلفة.

يعني افتتاح GPT-Live-1 أيضًا أن OpenAI تعمل على توسيع نطاق التكنولوجيا الأساسية خلف وضع ChatGPT الصوتي من المنتجات الاستهلاكية إلى النظام البيئي للمطورين. في السابق، كانت GPT-Live-1 موجودة بشكل أساسي كإمكانية التفاعل الصوتي لـ ChatGPT. الآن يمكن للمطورين استخدام تقنيات مماثلة مباشرة لإنشاء تطبيقاتهم الصوتية ووكلاءهم.

من منظور تقني، تأمل OpenAI أن GPT-Live-1 لن يحل مشكلة "تمكين الذكاء الاصطناعي من التحدث" فحسب، بل سيمكن الذكاء الاصطناعي من المشاركة حقًا في محادثات طبيعية مستمرة وفي الوقت الفعلي وغير قابلة للمقاطعة. ومن خلال تقسيم الاستماع والتحدث والتفاعل في الوقت الفعلي والتفكير العميق، تحاول OpenAI تحقيق زمن استجابة أقل للصوت، وتجربة محادثة أكثر طبيعية وقدرات أقوى لمعالجة المهام الخلفية في نفس الوقت.

مع تحول وكلاء الصوت تدريجيًا من الأسئلة والإجابة الصوتية البسيطة إلى المهام المعقدة مثل خدمة العملاء عبر الهاتف، والحجوزات، وتعليم اللغة، ومعالجة الأعمال، والقدرة على الاتصال بالأدوات بشكل مستقل لإكمال المهام، تتزايد أيضًا أهمية نماذج الكلام في الوقت الفعلي. تعني واجهة برمجة التطبيقات المفتوحة لـ GPT-Live-1 أنه يمكن للمطورين الآن تضمين الجيل الحالي من تقنية الصوت في الوقت الفعلي التي تستخدمها ChatGPT مباشرةً في منتجاتهم الخاصة، كما يسمح سعر الطبقة الصوتية البالغ 0.05 دولارًا أمريكيًا للدقيقة أيضًا لهذه الإمكانية بالدخول رسميًا إلى مرحلة التطبيق التجاري.

الوسوم ذات الصلة

مقالات مشابهة

التعليقات

0/500
Captcha (click to refresh)
لا توجد تعليقات