إن مصادر بيانات التدريب الرياضي المتطورة وحدود استخدام البيانات في OpenAI موضع تساؤل عميق

📅 2026-09-10

الملخص:

مع إعلان OpenAI رفيع المستوى أن نظام الذكاء الاصطناعي الداخلي الخاص بها قد نجح في التغلب على إحدى "مشكلات جائزة الألفية" التي ابتليت بها مجتمع الرياضيات لما يقرب من قرن من الزمان - وجود وسلاسة معادلات نافيير-ستوكس (معادلات نافيير-ستوكس)، انفجر جدل كبير حول مصدر بيانات التدريب الأساسية للنماذج المتطورة، وملكية حقوق الملكية الفكرية للبحث العلمي، والأخلاقيات الأكاديمية بسرعة في المجتمع الأكاديمي العالمي وصناعة التكنولوجيا.

مع غزو الذكاء الاصطناعي تدريجيًا لطليعة البحث العلمي الأساسي، أين يمكن لنماذج الاستدلال الرياضي عالية الترتيب الخاصة بالعمالقة مثل OpenAI أن تستمد العناصر الغذائية الأساسية، وما إذا كان الباحثون العلميون قد أصبحوا عن غير قصد "أسمدة بيانات" للنماذج الخاصة لعمالقة التكنولوجيا عندما يستخدمون أدوات الذكاء الاصطناعي التجارية على أساس يومي.

نشأ الجدل بسبب دليل رياضي مكون من 165 صفحة وشهادة رمز Lean الرسمية الصادرة عن OpenAI. وفقًا لكشف OpenAI، فقد نشرت نموذجًا داخليًا غير معلن عنه أقوى من GPT-6 Astra الذي تم إصداره حديثًا، وحشدت حوالي 10000 وكيل ذكاء اصطناعي مستقل قادر على التواصل التعاوني، واستهلكت مئات المليارات من رموز الإخراج وموارد الحوسبة الفائقة بقيمة 22.5 مليون دولار أمريكي تقريبًا في 88 ساعة، وأخيرًا استنتجت دليلًا رياضيًا على أن معادلة السوائل غير القابلة للضغط تنتج تفردًا في وقت محدود. أوضحت OpenAI أيضًا أنها لن تحصل على مكافأة قدرها مليون دولار أنشأها معهد كلاي للرياضيات. ومع ذلك، قبل إصدار نتائج OpenAI مباشرة، كشف تريستان باكماستر، الأستاذ في معهد كورانت للعلوم الرياضية بجامعة نيويورك، وليفنت ألبوج، الباحث في شركة أنثروبيك المنافسة، عن نتائجهما الرائدة حول مشاكل ديناميكيات الموائع ذات الصلة مثل معادلة أويلر القسرية.

أصدر بوكماستر على الفور بيانًا عامًا، أثار فيه شكوكًا قوية حول الاختراق المستقل الذي حققته OpenAI. أشار بكماستر إلى أنه خلال البحث التعاوني الذي استمر لمدة عام، استخدم هو وألبرجر أداة توليد التعليمات البرمجية الخاصة بـ OpenAI Codex ونموذج Anthropic's Claude بعمق لاستنتاج الصيغ وصياغة المسودات الوسيطة. تم إدخال جميع مخطوطات الاشتقاق الأساسية غير المنشورة، ومسارات الإدخال الرياضية المقسمة، وإعدادات شروط الحدود المحددة بالكامل في سجل جلسة الدستور الغذائي. كشف باكماستر أنه بعد أن علم أن OpenAI قد علمت بشائعات بحثية خارجية ذات صلة، سأل OpenAI مباشرةً عما إذا كان نموذج حل المشكلات الداخلي قد تعرض لبيانات التفاعل الخاصة على Codex أو تم تدريبه عليها؛ على الرغم من إصرار الموظفين الفنيين في OpenAI على أن النموذج لم يصل مباشرة إلى بيانات مستخدم محددة في الوقت الفعلي، إلا أنهم تجنبوا الإجابة على السؤال الرئيسي المتمثل في "ما إذا كان قد تم دمجه في مجموعة بيانات التدريب المسبق أو الضبط الدقيق للنموذج". والأمر الأكثر إثارة للجدل هو أن باكماستر اتهم أيضًا سيباستيان بوبيك، الباحث الأساسي في OpenAI، بوضع شروط للتأليف المشترك في الاتصالات الخاصة، لكنه طلب استبعاد ألبرجر، وهو موظف في الأنثروبي، تمامًا من التأليف المشترك.

في مواجهة الشكوك المتزايدة حول الانتحال الأكاديمي واختلاس البيانات، أصدرت شركة OpenAI رسميًا بيانًا تنفي فيه قيامها بالتطفل على مخطوطات الشخصين من خلال أي قنوات غير رسمية قبل الإصدار العام. وشدد بوبيك أيضًا على أن الدليل الرياضي الذي استمده OpenAI يختلف بشكل أساسي عن فريق Buckmaster من حيث الهيكل الفني والاستنتاجات المحددة. ومع ذلك، نادرًا ما أدرجت OpenAI إخلاء مسؤولية مثيرًا للاهتمام في ردها الرسمي: المسؤولون "لا يمكنهم استبعاد احتمال أن تكون البيانات المجهولة الهوية الناتجة عن استخدام المستخدمين لمنتجاتها قد ساعدت بشكل موضوعي في تحسين أداء النموذج". أثار هذا البيان على الفور ضجة في الدائرة الأكاديمية، وفسره العديد من العلماء على أنه اعتراف مقنع من OpenAI بأن سجلات التفاعل الخاصة لكبار العلماء المخزنة في أدوات المطور التجارية من المرجح أن تكون متورطة في خط التكرار المستمر لنموذجها الأساسي.

كشف هذا الاضطراب عن الحقيقة الخفية المتمثلة في "استنزاف البيانات" و"الامتصاص العكسي" التي تواجهها مختبرات الذكاء الاصطناعي المتطورة عند بناء قدرات رياضية عالية المستوى. معظم بيانات ما قبل التدريب التقليدية تأتي من الزحف العام على شبكة الإنترنت، ولكن الغالبية العظمى من مجموعة الرياضيات العامة على الإنترنت موجودة فقط على مستوى مسابقات المدارس الابتدائية والثانوية أو الكتب المدرسية الأساسية للطلاب الجامعيين، ولا يمكنها دعم النموذج لفهم التحليل الهندسي العميق للمعادلات التفاضلية الجزئية أو الطوبولوجيا الجبرية. من أجل تزويد النموذج بالتفكير المنطقي العميق وقدرات الاستنتاج الصارمة لكبار علماء الرياضيات في العالم، يعتمد مختبر الذكاء الاصطناعي، بالإضافة إلى توظيف علماء رياضيات محترفين لكتابة أكواد Lean الرسمية والبيانات الاصطناعية، بشكل كبير على نقاط الضعف البحثية المتطورة، وفرضيات حل المشكلات غير المنشورة، ومدخلات تدفق الكلمات السريعة المتقدمة من قبل كبار العلماء الحقيقيين في أدوات التطوير (مثل منصة Codex). بمجرد أن تحتوي اتفاقية المستخدم على بند يسمح للمنصة باستخدام بيانات التفاعل غير المحددة لتحسين الخوارزمية، سيتم استيعاب العمل العقلي الأصلي للعلماء بهدوء وتضخيمه بواسطة مجموعات قوة الحوسبة الخاصة بالشركات في منطقة رمادية قانونية.

أشار خبراء في فلسفة العلوم وقانون الملكية الفكرية إلى أن نزاع نافييه-ستوكس لم يكن شجاراً بين باحثين أفراد وعمالقة الأعمال، بل كان بمثابة أزمة أخلاقية بنيوية لا بد من مواجهتها عندما يتعرض نموذج الاكتشاف العلمي البشري إلى انقسام أساسي. على مدى مئات السنين الماضية، كان نظام الشرف والحوافز في الأوساط الأكاديمية يعتمد على مراجعة النظراء الصارمة، وأولوية النشر، وأخلاقيات الاقتباس الأدبي الموحد؛ ولكن في مواجهة "البحث العنيف" الصناعي الذي يتضمن عشرات الآلاف من العملاء الأذكياء الذين يتعاونون بشكل متواز ويكلف عشرات الملايين من الدولارات، أصبحت خطوط الدفاع التقليدية للاكتشاف الأكاديمي ضعيفة. وإذا لم يسيطر عمالقة التكنولوجيا التجارية على هيمنة قوة الحوسبة الرائدة فحسب، بل استخدموا أيضاً برمجيات الإنتاجية التي يسيطرون عليها لاستيعاب الأفكار غير المنشورة من قِبَل أحدث الباحثين من جانب واحد وحرمانهم من إسنادها إلى مصدر كبير، فإن أساس ثقة المجتمع الأكاديمي العالمي في أدوات البحث العلمي المفتوحة سوف تهتز تماما. وسيجبر هذا أيضًا الجامعات الكبرى ومؤسسات البحث العلمي المستقلة على البدء في إعادة النظر في المخاطر المحتملة الهائلة الناجمة عن نقل أسرار البحث العلمي الأساسية إلى أدوات الذكاء الاصطناعي السحابية التي لم يتم التحقق منها.

الوسوم ذات الصلة

مقالات مشابهة

التعليقات

0/500
Captcha (click to refresh)
لا توجد تعليقات