يستمر نموذج توليد الفيديو Sora الذي أطلقته OpenAI مؤخرًا في تفجير المفاهيم ذات الصلة ويعتبر إنجازًا كبيرًا في خدمات إنشاء الفيديو. ومع ذلك، صب العلماء المنافسون الماء البارد على هذه الفكرة. يُفضل السوق Sora لاستقرار الفيديو ووضوحه، لكن بعض الناس لديهم آمال أكبر عليه، معتقدين أنه قد يكون لديه الفرصة للوصول إلى ذروة محاكاة عالم الذكاء الاصطناعي، وهو أيضًا الشعار الذي أطلقته OpenAI.
تأمل OpenAI أيضًا في مقال موقعها الرسمي على الإنترنت أن يكون Sora ليس مجرد مولد فيديو، ولكنه محاكي للعالم الحقيقي. ومن خلال التعلم ومحاكاة توزيع البيانات، يتم إنشاء عينات افتراضية مشابهة للعالم الحقيقي، وبالتالي توفير معلومات تنبؤية للعالم الحقيقي.
ومع ذلك، تم دحض هذا الاحتمال علنًا من قبل كبير علماء الذكاء الاصطناعي في ميتا، يان ليكون. قال قطب الذكاء الاصطناعي هذا المعروف بصراحته بصراحة: فقط قم بإنشاء مقاطع فيديو، ولا تتفاخر بما لديك.
محاكي محكوم عليه بالفشل
نشر LeCun علنًا على X أن محاكاة العالم عن طريق إنشاء وحدات البكسل هي مضيعة للموارد ومصيرها الفشل. كما جذب المنشور اهتمامًا كبيرًا، حيث ناقش العديد من مستخدمي الإنترنت موضوع السيف في منطقة التعليقات.
ببساطة، يعتقد LeCun أن نموذج Sora يحاول استنتاج الكثير من التفاصيل غير ذات الصلة، مثل محاولة تحديد مسار كرة القدم من خلال محاولة تحليل موادها.
وأشار إلى أن النماذج التوليدية مناسبة للمحتوى النصي لأن النص منفصل وهو عبارة عن بيانات مكونة من عدد محدود من الرموز، وفي هذه الحالة يصبح من السهل جدًا التعامل مع عدم اليقين في التنبؤات. ولكن إذا انتقلت إلى عالم التنبؤات بالبكسل، يصبح عدم اليقين صعبًا للغاية، ويصبح النجاح مستحيلًا.
تحدث مستخدمو الإنترنت أدناه أيضًا واحدًا تلو الآخر. قال بعض الناس أنه على الرغم من أن سورا مثير للإعجاب، إلا أنه قد تكون هناك مشاكل منطقية في كل مشهد تقريبًا. على سبيل المثال، في الفيديو الاختباري للفنان، انقسمت ثلاثة ذئاب إلى خمسة ذئاب لسبب غير مفهوم. وهذا يجعل محاكاة الواقع غير موثوقة إلى حد ما.
يقول بعض الناس أيضًا أن سورا ولد استجابة للأحلام، ويمكن أن يكون لدى الناس أحلام واضحة أو أحلام أقل وضوحًا. هذا البيان الذي يبدو رصينًا هو رهان على أن Sora لديه بعض الإمكانية لتحقيق "محاكي العالم" الخاص بـ OpenAI.
وفي الوقت نفسه، أصدرت Meta، حيث يقع LeCun، فيديو مشتركًا لهندسة التنبؤ المدمجة V-JEPA الأسبوع الماضي. يقال أنه يعلم فهم النماذج الكبيرة ونمذجة العالم المادي من خلال مشاهدة مقاطع الفيديو. إنها محاولة أخرى لمحاكاة العالم إلى جانب سورا.
بالإضافة إلى ذلك، يمكن لـ V-JEPA التخلص بمرونة من المعلومات غير المتوقعة وتحسين التدريب وكفاءة تشغيل العينات بمقدار 1.5 إلى 6 مرات. ومع ذلك، من الواضح أن V-JEPA لم يسبب ضجة كبيرة في السوق وهو أقل أهمية بكثير من Sora.