المؤلف الأساسي لـ AlphaGo: بعد مرور عشر سنوات، ما زال LLM لم يتعلم جوهر "حركة الإله" في لعبة الشطرنج تلك

📅 2026-10-05

الملخص:

مارس 2016، فندق فور سيزونز سيول. في منتصف المباراة الثانية من المعركة بين الإنسان والآلة، أسقط AlphaGo بقعة شمسية على السطر الخامس. كان التعليق في الموقع في حيرة من أمره، واشتبه بعض الناس في وجود خطأ في البرنامج، لأنه وفقًا للفطرة السليمة للاعبي الشطرنج المحترفين، كانت هذه الخطوة تقريبًا رمية حرة.


الجميع يعرف القصة اللاحقة. لم يفز AlphaGo بتلك المباراة فحسب، بل هزم Lee Sedol أيضًا بنتيجة إجمالية قدرها 4:1. بعد المباراة، قال لي سيدول شيئًا يتم اقتباسه كثيرًا: "اعتقدت في البداية أن AlphaGo مجرد آلة تعتمد على حساب الاحتمالات. ولكن بعد رؤية تلك اليد، غيرت رأيي. يجب أن يكون AlphaGo مبدعًا."

هذه هي الحركة الشهيرة رقم 37.

بعد عشر سنوات، وقف الرجل الذي بنى AlphaGo وقال: إن الذكاء الاصطناعي اليوم لا يتمتع بالإمكانيات التي تعتمد عليها لعبة الشطرنج.


الشخص الذي قال هذا هو Thor Graepel، أحد المؤلفين الأساسيين لـ AlphaGo والذي شارك في أبحاث التعلم الآلي لفترة طويلة. لقد اتخذ مؤخرًا قرارًا مثيرًا للاهتمام - وهو ترك Google DeepMind لبدء عمل تجاري للقيام بشيء يعتقد أنه أكثر أهمية: وهو تزويد الآلات بقدرات تفكير حقيقية.


تأتي هذه النقطة المؤثرة من مقال نشره مؤخرًا في مجلة MIT Technology Review. عنوان المقال واضح جدًا، ويسمى "لا تنخدع - لا يستطيع حاملو شهادة الماجستير في القانون التفكير". بعد قراءة هذا المقال، أعرب يان ليكون، الحائز على جائزة تورينج، عن تقديره، مشددًا على أن "الاستدلال الحقيقي يجب أن يتضمن البحث، وأن LLM ليس لديه هذه القدرة".


لماذا قال ثور جريبيل ذلك؟ دعونا نلقي نظرة على ما هو مكتوب في هذه المقالة.

لم تكن الخطوة 37 بمثابة "ومضة إلهام"

إنه نتاج الاستدلال

يصف العديد من الأشخاص الحركة السابعة والثلاثين بأنها "لحظة أسطورية للحدس الآلي" - ففي ومضة من البرق، شهد الذكاء الاصطناعي حركة بارعة تتجاوز تاريخ الشطرنج البشري الممتد لألف عام. وقال غرايبل إن هذا هو أكبر سوء فهم بشأن AlphaGo.


لفهم ذلك، يجب علينا أولاً تفكيك البنية الداخلية لـ AlphaGo. وهو يتألف من نظامين: أحدهما عبارة عن شبكة سياسية، تتعلم من سجلات الشطرنج البشرية الضخمة للتنبؤ "بكيفية لعب السيد في هذه الحالة". هذا هو الجزء البديهي. والآخر هو آلية البحث، التي لا تهتم بما إذا كانت حركة معينة في الشطرنج "تبدو وكأنها لعبها إنسان"، ولكنها تبني بشكل صريح شجرة لعبة تحتوي على آلاف الفروع لاستنتاج المستقبل الذي يؤدي إليه كل منصب مرشح.

النقطة الأساسية هي: في نظر الشبكة الإستراتيجية، فإن الحركة 37 غير ملحوظة - فاحتمال أن يلعب لاعب شطرنج بشري محترف هذه الحركة هو حوالي 1 من 10000 فقط. إذا استمعت فقط إلى حدسك، فلن يتم اختيار هذه اليد على الإطلاق. كانت آلية البحث هي التي اكتشفت بعد حسابات دقيقة أن هذه الخطوة "غير المعقولة" أدت إلى نهاية أفضل.

يستعار جريبل إطار كانيمان الشهير لتفسير ذلك. ينقسم التفكير البشري إلى وضعين: النظام 1 سريع وبديهي وسهل. النظام 2 بطيء، خطوة بخطوة، ويتم وزنه بعناية. يصادف أن AlphaGo عبارة عن مزيج نادر من هذين الوضعين على الجهاز: توفر الشبكة العصبية الحدس المتمثل في "هذه الخطوة لديها فرصة" و"هذا الموقف يجب الفوز به"، وآلية البحث مسؤولة عن اختبار هذه البديهات في التغييرات الهجومية والدفاعية المستقبلية. لن ينجح الأمر بدون أي نصف: الحدس وحده لن يقوم بالخطوة السابعة والثلاثين أبدًا؛ لن يكون البحث العنيف وحده قادرًا على حجب الإمكانيات الفلكية لـ Go.

هناك مقارنة أخرى غالبًا ما يتم التغاضي عنها. هزم ديب بلو كاسباروف في عام 1997 بالاعتماد على القواعد التي صاغها البشر لتقييم 200 مليون موقع في لعبة الشطرنج في الثانية والنظر إلى الأمام بست إلى ثماني خطوات. تعقيد Go موجود على مستوى آخر تمامًا. تعتمد قيمة القطعة على نمو وتراجع الزخم والميدان بعد عشرات الجولات. وحتى لو تم حساب جزء صغير فقط من جميع التغييرات، فسيتعين على الكمبيوتر العملاق أن يحسبها على مدى مليارات السنين. لذلك، يجب على AlphaGo أن يتعلم "رؤية الموقف بوضوح في لمحة واحدة" وحتى إنشاء حركات لم يفكر فيها البشر من قبل. ولا يمكن تحقيق ذلك عن طريق سحق قوة الحوسبة، وهو أمر بالغ الأهمية.

نموذج اللغة الكبير:

نظام تم تدريبه إلى أقصى الحدود 1

دعونا نلقي نظرة على الذكاء الاصطناعي اليوم.

مبدأ عمل نماذج اللغات الكبيرة هو التنبؤ بالرمز المميز التالي مرارًا وتكرارًا. هذا هو في الأساس النظام 1 قيد التنفيذ: سريع، ومترابط، وقادر على إكمال الأنماط بشكل مذهل في كل مجال كتب عنه البشر تقريبًا، ولكن بدون جزء "التفكير قبل الإجابة".

بعد وقت قصير من ولادة ChatGPT، أدركت الصناعة أن طلاقة اللغة وحدها لا يمكن أن تدعم الفائدة الحقيقية. الجميع على دراية بخطة العلاج: دع النموذج لا يتسرع في الإجابة، قم أولاً بإنشاء خطوات وسيطة، ثم قم بتفكيك المشكلة، ثم جلب النتائج الوسيطة - أي سلسلة التفكير.

إن التحسن في سلسلة التفكير أمر حقيقي، خاصة في الرياضيات والبرمجة. لكن غرايبل أشار إلى حقيقة يمكن أن تحجبها الإثارة بسهولة: خطوات التفكير الوسيطة هذه لا تزال هي نفس عملية "التنبؤ بالرمز المميز التالي"، فهي تتكرر لفترة أطول قليلاً قبل إعطاء الإجابة النهائية. فهو لا يقدم آلية تفكير مستقلة حقًا مثل بحث AlphaGo. الحدس ممتد لكنه لا يتحول إلى حكمة.

كما أدرج ثلاثة عيوب لشرح سبب عدم يرقى ما يفعله برنامج الدردشة الآلي إلى "نوع المنطق الذي يعترف به العلماء".

أولاً، لا يحتوي النموذج على حالة معرفية واضحة ومحدثة باستمرار وقابلة للفحص. ما هي الفرضيات التي تدرسها في الوقت الحالي، وما مدى الثقة التي تضعها في التفسيرات المختلفة، وما هي الأدلة التي تزنها، وما هي الأسئلة التي تظل دون إجابة. وينبغي مراجعة هذه الأمور بشكل منهجي مع ورود معلومات جديدة، ولكن لا يوجد مثل هذا "دفتر الأستاذ المفتوح" داخل النموذج.

ثانيًا، لا يحقق النموذج الفصل بين "ما يجب معرفته" و"كيفية استخدام المعرفة". المعرفة والتفكير متشابكان بإحكام في أوزان الشبكة العصبية، ولا يوجد نظام معتقد مستقل ومُعبر عنه بوضوح.

ثالثًا، وهو الأكثر دقة: تبدو سلاسل الأفكار وكأنها مداولات مدروسة، لكن الأبحاث أظهرت أن النماذج غالبًا ما تصنعها بعد وقوعها. الجواب يحصل بالسير في طريق ما، ولكن ما ورد إليك هو طريق آخر. "القصة التي تبدو معقولة" و"الاستدلال الذي حدث بالفعل" هما شيئان مختلفان.

سواء كان الاستدلال صحيحًا أم خاطئًا

هل الأمر بهذه الأهمية؟

إذا كنت تقوم فقط بالدردشة والدردشة، فقد لا يهم ما إذا كان السبب صحيحًا أم خطأ. ولكن في المجالات عالية المخاطر التي نهتم بها حقًا - الطب والهندسة والبحث العلمي - فإن ما يصل إليه النظام لا يقل أهمية عن كيفية وصوله إليه. عندما يحدث خطأ ما، مثل خطأ في التشخيص أو العلاج، نحتاج إلى أن نكون قادرين على تحديد مكان الخطأ: هل هناك مشكلة في عملية الاستدلال، أو قبول أدلة غير صالحة، أو وضع افتراض خاطئ؟ إن النظام الذي لا يمكنه اختلاق القصص إلا بعد وقوعها لا يمكن الوثوق به أو مساءلته في مثل هذه السيناريوهات.

وهذا هو بالضبط سبب مغادرة جرايبل لشركة DeepMind. وهو يعتقد أننا بحاجة إلى مسار جديد للاستدلال الآلي، ويأتي الإلهام من برنامج AlphaGo قبل عشر سنوات.

يحتفظ AlphaGo بسجل يضم كافة معرفته بالوضع الحالي في أي وقت، وهو شجرة اللعبة. تحتوي الشجرة على جميع التغييرات التي أخذتها في الاعتبار، وجميع العقود المستقبلية المحتملة، ويتم تمييز كل حركة وكل موقف بحكم الشبكة العصبية. مع تقدم الاستقطاع، يقوم بتحديث الشجرة بشكل مستمر، ويحدد أخيرًا الحركة بناءً على المعلومات الموجودة في الشجرة.

يعتقد جريبل أن الأمر نفسه ينطبق على أنظمة الاستدلال العام: الحفاظ على حالة معرفية تعبر بوضوح عما تم تأكيده، وما هو محل شك، وما تم استبعاده، وما هي الأسئلة التي تظل مفتوحة. و"الاستدلال" عبارة عن سلسلة من "الأفعال" التي تغير هذه الحالة المعرفية - استخلاص النتائج، وتفكيك المشكلات، والأهم من ذلك: تحديد الأسئلة التي يجب طرحها بعد ذلك، وما هي الحسابات التي يجب القيام بها، وما هي التجارب التي يجب إجراؤها.

لا شك أن التفكير في العالم المفتوح أصعب كثيرًا من لعب الشطرنج. الحالة الموجودة على لوحة Go مرئية تمامًا والقواعد ثابتة؛ في العالم الحقيقي، الوضع الحالي معروف جزئيًا فقط، والإجراءات المتاحة عديدة ومعقدة، وعواقب الإجراءات مليئة بالعشوائية أو حتى غير معروفة تمامًا.

لكن الخبر السار هو أن التقدم الذي أحرزته LLM والنماذج العصبية الأخرى على مر السنين قد وفر أجزاء من هذا: يمكن لـ LLM اقتراح مسار لحل المشكلة بناءً على المعلومات المعروفة والموارد المتاحة؛ ويمكنه التفاعل مع الأدوات من خلال واجهات برمجة التطبيقات والرموز؛ يمكن أن يساعد في تقييم ما إذا كان الاستنتاج مدعومًا بالأدلة الموجودة. والأهم من ذلك، يجب أن يكون هناك "حكم" مستقل في النظام يقوم بتقييم كل خطوة استدلالية على أساس "مدى عدم اليقين الذي يتم حله من خلال هذه الخطوة" - ولا يقوم بتحديث المعتقدات إلا عندما تكون مدعومة بالأدلة. بمجرد إنشاء القواعد، يمكن للنظام تجميع المعرفة المعتمدة، والتعلم من تجارب الاستدلال السابقة، وتحسين استراتيجيات الاستدلال الخاصة به.

أعطى جرايبل لهذه الصورة تعبيرًا حيًا: الطريقة العلمية في تناول المنشطات. هناك هدف واحد فقط، وهو إنتاج المعرفة التي يمكن أن تصمد أمام التدقيق.

النظام الأكبر 1,

لن ينمو النظام 2 تلقائيًا

في نهاية المقال، أوضح موقفه: لا يمكن تحقيق ذكاء الآلة الجدير بالثقة من خلال جعل النظام 1 أكبر. المقياس يشحذ الحدس، ولكن ليس الحكمة.

السبب وراء أهمية الحركة 37 هو أن الآلة دافعت عن مركز ما، ووزنت العقود الآجلة المحتملة، ثم اختارت حركة كان حتى "شعورها الغريزي" سيرفضها على الأرجح.

يحتاج المجتمع البشري إلى المزيد من "أيدي الله" في مجالات اكتشاف الأدوية، والمواد الجديدة، والمناخ، والتشخيص الطبي. لم تكن رقعة الشطرنج هناك تشبه لعبة Go، ولم يسلمنا أحد القواعد. مثل هذه الرؤى لا يمكن أن تأتي إلا من أنظمة تعقل حقا: استنتاجات مستمدة من سلسلة من الأدلة القابلة للتدقيق، والاستدلالات، ومراجعات المعتقدات، وليس من قصة مقنعة ملفقة بعد وقوع الحقيقة.

قبل عشر سنوات، استخدم AlphaGo يده السابعة والثلاثين ليخبر العالم أن الآلات قادرة على تجاوز الحدس البشري.

بعد مرور عشر سنوات، يذكرنا أحد المبدعين: لا تدع اللغة السلسة تخدعك. هذه القفزة الحقيقية لم تحدث مرة أخرى لـ LLM حتى الآن.

لقد قلت أن LLM لا يمكنها التفكير،

هل يمكن الدفاع عنه؟

بعد نشر مقال الرأي هذا، أثار جدلا كبيرا على X.

السؤال الأكثر حدة جاء من البروفيسور ديفيد دوفينود من جامعة تورنتو (أحد مؤلفي أفضل ورقة بحثية لـ NeurIPS حول ODE العصبي). وذكر: إن اتهامات جرايبل الثلاث ضد LLM - عدم وجود حالة معرفية يمكن التحقق منها، وعدم وجود فصل بين المعرفة والتفكير، وتلفيق التفسيرات بعد الحقيقة - صالحة أيضًا للبشر. "وفقًا لهذا المعيار، هل يمكن اعتباري جيدًا في التفكير؟"


أجاب جرايبل: لا يمكنك التفكير بشكل جيد بمفردك؛ إذا أعطيت ورقة وقلم، سيكون أفضل بكثير؛ وإذا طُلب منك اتباع المنهج العلمي بدقة، فسيتم اعتبارك مفكرًا ممتازًا. الحيلة لا تكمن أبدًا في اتباع تيار الوعي، بل في هيكلة العملية، وإلا فلن يتمكن أحد من الهروب من التحيزات المعرفية.


أدرك دوفينود على الفور المعنى الضمني لهذه الجملة: "يبدو أننا نستطيع تحقيق تفكير حقيقي وفقًا لتعريفك طالما قمنا بتزويد ماجستير إدارة الأعمال بأدوات مماثلة - أليس هذا ما تنوي القيام به؟"


لقد أثارت "نظرية تعزيز الورقة والقلم" لجريبل أيضًا شكوكًا من مستخدمي الإنترنت الآخرين. وأشار مستخدمو الإنترنت KingBroken إلى أن الورقة والقلم هما في الأساس مكون إضافي للذاكرة العاملة. فهو يسمح لك بالتفكير في المزيد من البيانات في نفس الوقت، لكنه لا يغير وجود القدرة على التفكير "من لا شيء"؛ ولكن لها فائدة إضافية: الكلمات والأرقام المكتوبة هي دليل يمكن التحقق منه على "الحالة المعرفية" للإنسان.


بعد ذلك مباشرة، طرح مستخدم الإنترنت دانييل جرانت سؤالًا أكثر وضوحًا: وفقًا لهذا، فإن طريقة التفكير البشري تعادل "النموذج الحالي + نظام المكونات الإضافية"، فهل تقوم ببناء نموذج يتمتع بقدرات تفكير داخلية أقوى من كليهما؟ أم أنني في عداد المفقودين بعض الفروق الدقيقة؟


لم يرد جرايبل بعد على هذه الأسئلة.

شعر صوت آخر أن هذه المناقشة غير ضرورية. قال مستخدمو الإنترنت visimo-dino بصراحة، "لا أستطيع أن أصدق أنه لا يزال هناك أشخاص يكتبون هذا النوع من المقالات": لقد كان أداء LLM جيدًا بالفعل في أشياء كثيرة جدًا، وعبارة "لا يمكن التفكير" إما سخيفة أو غير ذات صلة، وتم نشر مئات المقالات المماثلة.


لم يتطرق جرايبل إلى هذا الأمر، واكتفى بطرح ثلاثة أسئلة: هل يمكن الاعتماد عليها في المجالات التي لا يمكن التحقق منها؟ هل أنتجت نظرية علمية جديدة قوية؟ هل تجرؤ على السماح لها بإملاء العلاج الطبي الخاص بك؟ كان الطرف الآخر صريحًا، معترفًا بأنه "ليس بعد"، لكنه ألقى اللوم على أساليب التعلم المعزز الحالية بدلاً من بنية LLM نفسها - مما يعني أنه سيتم حل المشكلة في الوقت المناسب. ربما يكون هذا هو الفرق الحقيقي بين المجموعتين: أحد الطرفين يعتقد أن ما ينقصنا هو الوقت، والجانب الآخر يعتقد أن ما ينقصنا هو البنية.


هناك تعليق آخر سأل عما يفكر فيه الكثير من الناس: لماذا لا يدعم DeepMind هذا البحث؟ إن إجابة جرايبل واضحة ومباشرة: فالمختبرات المتطورة تراهن على التوسع، ولا يمكن للاستدلال القابل للتدقيق أن ينشأ من التوسع وحده. يتطلب بنية مختلفة. "في بعض الأحيان يكون تنفيذ الأفكار الجديدة الجذرية أكثر صعوبة داخل المؤسسات الكبيرة." كانت خيبة أمل السائل روبرت سبيري واضحة: من بين جميع المختبرات، كان يتوقع أن تكون شركة DeepMind هي التي تعمل بجد للعثور على إجابات تتجاوز برنامج Transformer.


كما أشار بعض الأشخاص بأصابع الاتهام إلى مكان أكثر أهمية. ولم تترك المعلقة كاثرين مور سوى جملة واحدة: "اللغة نفسها هي الأداة الخاطئة، ولا يمكن الاعتماد عليها في التفكير". أخذ جرايبل هذا الموقف الأكثر تطرفًا على محمل الجد وأثار سؤالًا مفتوحًا: يتطلب الاستدلال نوعًا من تمثيل المعرفة. إذا كانت اللغة الطبيعية غامضة للغاية، فهل يمكن استخدام اللغة الرسمية للتفكير في العالم الحقيقي؟ كيف ستبدو مثل هذه اللغة؟ . ولم يعط إجابة، ولكن قد يكون هذا هو السؤال الذي سيجيب عليه البعض عند بدء أعمالهم التجارية الخاصة.


الوسوم ذات الصلة

مقالات مشابهة

التعليقات

0/500
Captcha (click to refresh)
لا توجد تعليقات