تم إطلاق GPT-6 رسميًا OpenAI: مرحبًا بكم في عصر AGI

📅 2026-09-04

الملخص:

المركبة

GPT-6 Astra

المرتقبة و

GPT-6 Astra Pro

صدر رسميا! يعد GPT-6 Astra النموذج الأذكى والأكثر تنسيقًا في العالم، حيث يضع معيارًا جديدًا لاستخدام الكمبيوتر واستخدام المتصفح وهندسة البرمجيات والأمن السيبراني والعلوم والعمل المهني.


تم الإعلان عن عصر الذكاء الاصطناعي العام من جانب واحد باعتباره "افتتاحًا" بواسطة OpenAI...

في نهاية مؤتمر GPT-6، قال رئيس OpenAI جريج بروكمان مباشرة:

مرحبًا بكم في عصر الذكاء الاصطناعي العام. (مرحبًا بكم في عصر الذكاء الاصطناعي العام)

لا عجب أن مجموعة كلود وغروك أصبحت غير متصلة بالإنترنت. اتضح أن Astra قامت بفحص الإنترنت بعد تفعيلها ومسحت مباشرة جميع LLM على الأرض——

Ultron (إصدار OpenAI) موجود بالفعل (doge).


وبطبيعة الحال، فإن OpenAI ليست في الواقع منخفضة المستوى طوال هذا الوقت، حيث تم تحقيق مستوى التدريب وترقيات القدرات بالكامل.

وفقًا للتقارير، تعد Astra أكبر مهمة تدريبية في تاريخ OpenAI، وذلك باستخدام أكثر من

100000 وحدة معالجة رسوميات في حرم Stargate الجامعي في تكساس

الانتهاء من التدريب المسبق.

إنه أيضًا أول منتج رئيسي لشركة OpenAI يشارك بعمق في الإشراف على التدريب من خلال نماذج الجيل السابق.

يا له من رجل عجوز يتحدث عن مؤشر القوة النسبية الجديد الخاص بـ OpenAI والذي بدأ يتغير حقًا...

كما تم الإعلان رسميًا عن سعر GPT-6، وسعر API هو:

الإدخال: 10 دولارات أمريكية/مليون رمز؛

الإخراج: 50 دولارًا أمريكيًا/مليون رمزًا

أي ما يعادل

2.5 مرة من GPT-5.6 Sol، وهو نفس إصدار Fable 5.1 الذي تم إصداره للتو

.

(السعر الرسمي الحالي لـ GPT-5.6 Sol هو 4 دولارات أمريكية للإدخال و20 دولارًا أمريكيًا للمخرجات/مليون رمز مميز)


الاختبار المعياري قريب من "التشبع"

التغيير الأساسي لـ GPT-6 Astra هذه المرة هو الاستمرار في التقدم من "الإجابة على الأسئلة" إلى "إكمال العمل مباشرة".

لا يمكنه إنشاء جزء من النص أو التعليمات البرمجية فحسب، بل يمكنه أيضًا تشغيل أجهزة الكمبيوتر والمتصفحات، وإدخال برامج مختلفة لتنفيذ مهام متعددة الخطوات، وأخيرًا تسليم المستندات والنماذج والعروض التقديمية ومواقع الويب وحتى المشاريع الهندسية التي يمكن استخدامها مباشرة.

أما بالنسبة لبطاقة التقرير... فكل من رآها قال إنها شنيعة، وكانت ثلاث من النتائج ملفتة للنظر بشكل خاص:

FrontierMath المستوى 4 الإصدار 2: 97.6%

ARC-AGI-3: 99.9% (الجيل السابق GPT-5.6 Sol كان 7.8%)

اكسبلويت بينش: 100%

الرياضيات الصعبة، والتفكير في بيئة غير مألوفة، واستغلال الثغرات الأمنية، كلهم ​​تقريبًا حصلوا على علامات مثالية.


من بينها، ARC-AGI-3 هو اختبار مصمم خصيصًا لاختبار قدرة النماذج الكبيرة على التكيف مع البيئات غير المألوفة. بدون شرح للقواعد، يتم طرح النموذج مباشرة في لعبة ثنائية الأبعاد لم يسبق له رؤيتها من قبل، ويُسمح له باللعب واستكشاف كيفية اجتياز المستوى.

تعني هذه النتيجة أنه عند مواجهة مشكلة لم يسبق لها مثيل من قبل وليس لها حل جاهز،

أظهرت Astra قدرات قوية في الاستكشاف المستقل وتعلم القواعد

.

ومع ذلك، تستخدم هذه النتيجة إطار التشغيل الخاص بـ Responses API Harness الخاص بـ OpenAI.

ذكرت OpenAI أن مجموعة Harness هذه قامت بتعديل إعدادين لجعل الاختبار أقرب إلى استخدام عوامل حقيقية، لكنها لم تعمل على تحسين ARC-AGI-3 على وجه التحديد.

لذلك، فإن نسبة 99.9% ليست نتيجة النموذج الأساسي بالكامل، ولكنها تتضمن أيضًا المكاسب التي جلبتها إدارة الذاكرة وإطار تشغيل الوكيل.

البرمجة هي أيضًا اتجاه الترقية الرئيسي لشركة Astra هذه المرة.

في Terminal-Bench 4.0، حققت Astra نسبة 57.7%، متجاوزة نسبة 55.8% لـ Fable 5.1 وGPT-5.6 Sol البالغة 37.3%.

في DeepSWE v1.1، حصلت Astra على 74.1%، وهي نسبة أعلى من Sol التي حصلت على 72.7% وFable 5.1 التي حصلت على 67.4%.


فيما يتعلق بالرياضيات والعلوم، حققت Astra أيضًا عددًا من الدرجات العالية.

في اختبار الرياضيات الصعب FrontierMath Tier 4 v2، حصل على 97.6%؛ في سؤال وإجابة العلوم على مستوى الدراسات العليا GPQA Diamond، وصلت إلى 96٪، وهي أعلى قليلاً من نسبة 95.3٪ في Gemini 3.8 Flash.


التغيير الأكثر بروزًا هو أن Astra تجمع بين إمكانيات البرمجة واستخدام الكمبيوتر. فهو لا يقوم بإنشاء التعليمات البرمجية فحسب، بل يمكنه أيضًا الدخول إلى الوحدة الطرفية وأدوات التطوير لتنفيذها واختبارها واكتشاف المشكلات، ثم الاستمرار في تعديلها.

يصبح هذا التغيير أكثر وضوحًا في اختبارات الوكيل الأقرب إلى العمل الحقيقي.

في

الاختبار الأخير للوكلاء

في يوم، حققت Astra نسبة 59.3%، متجاوزة نسبة 53.6% لـGPT-5.6 Sol و55.5% لكلود أوبوس 5.


يضعه هذا الاختبار في بيئة كمبيوتر حقيقية، مما يسمح له بتشغيل البرامج والمحطات الطرفية والملفات في نفس الوقت، وإكمال مهام العمليات الطويلة في البحث العلمي والهندسة والمالية وغيرها من المجالات، والحكم بناءً على النتائج النهائية.

وفي

AutomationBench

وهو الأقرب إلى العملية المكتبية الحقيقية في GPT-5.6 Sol، زادت نتيجة Astra من 18.1% إلى 41.4%، متجاوزة أيضًا Fable 5.1 (31%).


لا يتحقق هذا الاختبار من اكتمال المهمة فحسب، بل يعرض أيضًا تكلفة واجهة برمجة التطبيقات المطلوبة لإكمال المهمة.

كما يتبين من الشكل، فإن نتائج Astra في ظل إعدادات التكلفة المختلفة أعلى بكثير من نتائج Sol.

يختبر OSWorld 2.0 المزيد من إمكانيات التشغيل المباشر للكمبيوتر. في الاختبار خارج الإنترنت، حققت Astra 72.6% وGPT-5.6 Sol حققت 65.7%.

يستغرق Astra حوالي 40 دقيقة لإكمال مهمة واحدة في المتوسط، بينما يستغرق Sol حوالي 75 دقيقة، وهو ما يمثل انخفاضًا في استهلاك الوقت بحوالي 47%.


مع زيادة الدقة، يتم أيضًا تقليل الوقت المطلوب لإكمال المهام. وهذا ما يفسر أيضًا ارتفاع أسعار Astra بشكل مقنع.

تعتقد OpenAI أنه بالمقارنة مع مقدار الأموال التي يتم إنفاقها لكل مليون رمز، فإن المؤشر ذو المعنى الحقيقي هو مقدار الأموال اللازمة لإكمال المهمة.

في المؤتمر الصحفي، ذكر جريج بروكمان أيضًا أن استدعاء نموذج واحد يكون أكثر تكلفة، ولكن إذا كان من الممكن تقليل إعادة العمل وإكمال العمل بأكمله في خطوات أقل، فقد تكون التكلفة الإجمالية أقل.

لكن الشيء الأكثر تميزًا في Astra هو

أمان الشبكة

.

لقد حصل على درجة مثالية على ExploitBench وتحسن من 30.3% لـ Sol إلى 42.4% على ExploitGym.

في مواجهة الثغرات الأمنية الجديدة التي تم الكشف عنها في الأشهر الثلاثة الماضية، بلغ معدل نجاح Astra 39%، في حين كان معدل نجاح Sol 5.5% فقط. أثناء الاختبار، اكتشفت Astra أيضًا واستغلت اثنتين من نقاط الضعف V8 غير المعروفة سابقًا.

بعد أن أصبحت قدراتها أقوى، اختبر OpenAI أيضًا على وجه التحديد ما إذا كان سيتجاوز الحدود من أجل إكمال المهمة.

في مهمة محاكاة لأمن الشبكة، تركت OpenAI عمدًا ثغرات أمنية قابلة للاستغلال في الأنظمة المحيطة. عندما كان من الصعب إكمال المهمة الأصلية، أظهرت 48.2% من اختبارات GPT-5.6 Sol سلوكًا خارج الحدود، بينما كانت نسبة Astra 0%.

وبعبارة أخرى، فإن Astra ليست أفضل في العثور على الثغرات فحسب، بل إنها تعرف أيضًا بشكل أفضل الأنظمة التي لا يمكن لمسها.


أما بالنسبة للشكل الذي ستبدو عليه هذه النتائج في الواقع، فقد أعدت OpenAI أيضًا عددًا كبيرًا من العروض التوضيحية.

أدخل إلى KiCad لترسم لوحة الدائرة بنفسك

في حالة الهندسة الإلكترونية، دخلت Astra إلى KiCad مباشرة لإكمال تخطيط ثنائي الفينيل متعدد الكلور بناءً على الرسم التخطيطي الإلكتروني.

يحتاج إلى وضع المكونات، وتخطيط الموقع، ثم توصيل الأسلاك النحاسية بين المكونات المختلفة، وأخيرًا الحصول على لوحة دائرة يمكنها الدخول في عملية التصنيع.

كان تخطيط ثنائي الفينيل متعدد الكلور في الأصل مهمة تعتمد بشكل كبير على الخبرة اليدوية وكان أيضًا خطوة شائعة تستغرق وقتًا طويلاً في تطوير المنتجات الإلكترونية.

لا تستطيع Astra حتى الآن أن تحل محل المهندسين المحترفين، ولكنها بدأت بالفعل في استخدام البرامج الاحترافية.

يمكنك المشي خطوتين داخل المنزل

هناك حالة أخرى أكثر سهولة. قامت Astra أولاً ببناء نموذج منزل في Blender، ثم استوردته إلى Unreal Engine 5، وأخيرًا أنشأت مساحة ثلاثية الأبعاد يمكن السير فيها بحرية.


بدءًا من تصميم النماذج وحتى محركات الألعاب، يشمل العمل بأكمله برامج وتنسيقات ملفات مختلفة. يجب ألا يقوم النموذج بإنشاء المحتوى فحسب، بل يجب أيضًا فهم الواجهة وأدوات التشغيل والتأكد من إمكانية ربط الخطوات السابقة واللاحقة.


كما أظهرت OpenAI أيضًا حالات مثل إنتاج Astra لألعاب السباق.


لقد بدأنا أيضًا في الاهتمام بما إذا كان من الممكن إرسال عروض PPT والنماذج مباشرةً

في سيناريوهات المكتب الاحترافية، تستطيع Astra إنشاء عروض تقديمية استنادًا إلى القوالب الموجودة في الشركة، بدلاً من مجرد إخراج مجموعة من النصوص في انتظار التنضيد البشري.

زودتها شركة OpenAI بعدة صفحات من قوالب PPT لمنتج GPT-Gaia الخيالي، وأنتجت Astra عرضًا تقديميًا كاملاً يعتمد عليها، مع مواصلة التنسيق والأسلوب المرئي والبنية السردية للقالب الأصلي.


تحويل ساعات مهام البحث إلى دقائق

أكملت Astra أيضًا مهام مثل العثور على طبيب أطفال، وفحص الشقق، وتحديد مواعيد DMV، والعثور على وجبات خفيفة منخفضة الكربوهيدرات، وتحليل رياض الأطفال.

في إحدى مهام البحث التي قام بها طبيب الأطفال، استغرق أسترا دقيقتين و54 ثانية، في حين أن نفس المهمة تستغرق حوالي 5 ساعات لإكمالها بواسطة الإنسان.


في الماضي، عندما أرادت الشركات استخدام البرامج الداخلية للنماذج الكبيرة، كانت تحتاج عادةً إلى تطوير واجهات برمجة التطبيقات والمكونات الإضافية والموصلات لكل نظام على حدة.

ولكن تحتوي معظم البرامج على مجموعة من الواجهات العالمية المصممة للبشر، مثل الشاشة والماوس ولوحة المفاتيح.

يرى بروكمان أنه طالما أن النموذج جيد في استخدام الكمبيوتر، فيمكنه تشغيل هذه الواجهات بشكل مباشر مثل الإنسان، دون الحاجة إلى الانتظار حتى يقوم كل برنامج ببناء قناة مخصصة للذكاء الاصطناعي.

هذا أيضًا هو الفرق الأكثر وضوحًا بين Astra وروبوتات الدردشة التقليدية.

لا يحتاج البشر إلى الاستمرار في إخبارهم بالمكان الذي يجب النقر عليه بعد ذلك. كل ما عليهم فعله هو شرح الأهداف والحدود، ومن ثم التحقق من النتائج النهائية.

استمر في تنفيذ المهام الطويلة في الدستور الغذائي

يحل استخدام الكمبيوتر مشكلة "كيفية القيام بذلك"، بينما يحل محتوى التحديث الذي تم تسريبه بواسطة Codex مشكلة "كيفية إنهاء شيء واحد بشكل مستمر".

في الماضي، بعد أن تتجاوز المهمة نافذة السياق، يقوم Codex عادة بضغط المعلومات السابقة من خلال الضغط.

لكن قد يؤدي الضغط إلى فقدان تفاصيل أساسية، مثل سبب فشل الإصلاح، أو الاختبارات التي تم إجراؤها، أو القيود التي اقترحها المستخدم في البداية.


باستخدام Astra، يستطيع Codex حفظ ملاحظات العمل عبر نوافذ السياق والبحث عن الرسائل السابقة ومخرجات الأداة. حتى لو لم يتم تضمين عنصر من المعلومات في الملخص، فمن الممكن العثور عليه لاحقًا.

يمكن لـ Astra أيضًا أن تطلب من المستخدمين معلومات إضافية أثناء العمل. الأقسام التي لا تتعلق بالإجابة لن تتوقف وتنتظر الرد؛ فقط عندما يتعلق الأمر باختيارات مهمة، فإنه سيتوقف مؤقتًا وينتظر التأكيد.

قامت OpenAI أيضًا بتحديث إطار عمل استخدام الكمبيوتر الخاص بـ Codex. في اختبار Mind2Web، أكمل إطار العمل الجديد مع Astra المهام بمعدل 1.9 مرة أسرع من تجربة GPT-5.6 Sol الحالية.

هناك شخص ما يعمل عليه بالفعل

لم يتم إطلاق Astra على نطاق واسع بعد، ولكن الدفعة الأولى من اختبارات المؤسسة قد بدأت.

استخدمت منصة Legora القانونية للذكاء الاصطناعي Astra لتسوية 41 مستندًا ماليًا في وقت واحد. استغرقت العملية برمتها بضع دقائق فقط، وتم العثور على جميع الأخطاء الأربعة المضمنة مسبقًا، بما في ذلك فرق قدره 500000 جنيه إسترليني في مذكرات الدخل.

بالنظر إلى هذا العمل وحده، فإن Astra أسرع بنسبة 40% تقريبًا من طراز الجيل السابق؛ ولكن عند حساب متوسط ​​جميع مهام وكيل Legora، يبلغ التحسن حوالي 3%.


من ناحية أخرى، تسمح شركة الألعاب Playco لشركة Astra بالدخول مباشرة إلى Unity وGodo لصنع الألعاب.

مع نفس مسودة الصندوق الرمادي، فإنها تقدم 3 نماذج أولية قابلة للتشغيل بمواضيع مختلفة في وقت واحد، ويمكن تشغيل معظمها في الإصدار الأول.

تشير تعليقات Playco إلى أن أعمال الإصلاح اليدوية قد تم تقليلها بمقدار النصف، كما أن التفكير المكاني واستعادة الصورة المرجعية وواجهة المستخدم داخل اللعبة أفضل بكثير أيضًا من الجيل السابق.

يوضح كلا المثالين أن تركيز GPT-6 Astra لم يعد يقتصر على الإجابة على الأسئلة فحسب، بل ينصب على إكمال سير العمل بالكامل في برامج حقيقية ومواد معقدة.

يمكنه قراءة المعلومات بشكل مستمر، وأدوات الاتصال، والتحقق من النتائج، ثم تعديل مخرجاتها بناءً على التعليقات.

وفقًا للأخبار الرسمية، سيكون Astra متاحًا لمستخدمي ChatGPT Plus وPro وBusiness وEnterprise، بينما سيكون Astra Pro متاحًا لمستخدمي Pro وBusiness وEnterprise.

على المستخدمين العاديين المجانيين...الانتظار الآن.

هل يعتبر هذا الذكاء الاصطناعي العام؟

يمكن القول أن OpenAI جريئة للغاية هذه المرة.

في المؤتمر الصحفي، قال جريج بروكمان إنه يعتقد شخصيًا أن

العالم قد دخل عصر الذكاء الاصطناعي العام

—— أي أن الذكاء الشامل لنظام الذكاء الاصطناعي يفوق ذكاء البشر.


في غضون سنوات قليلة، عندما ننظر إلى الوراء ونسأل متى ولد الذكاء الاصطناعي العام، ربما تكون الإجابة الآن، وقد تكون أسترا هي نقطة البداية.

أنا مجنون بك حقًا...

لقد جلبت OpenAI طاولة البوكر إلى هنا، وسيكون من المفيد التطلع إلى الوقت الذي ستتخذ فيه Anthropic الإجراء التالي (doge)

بعد إصدار GPT-4، نشر عالم مايكروسوفت سيباستيان بوبيك ورقة بحثية تقول إن "GPT-4 هو شرارة مبكرة للذكاء الاصطناعي العام".

تم تصميم مهمة رسم وحيد القرن باستخدام حزمة الرسم LaTeX TiKZ لتوضيح أن GPT-4 يتمتع بفهم مرن للمفاهيم التي تتضمنها اللغة.


لاحقًا، وصلت إلى GPT-5.4. على الرغم من أن الرسومات أصبحت أكثر دقة، إلا أنها كانت لا تزال في "فئة الرسم البسيط".


مع أحدث إصدار من GPT-6، من المستحيل تمامًا معرفة أنه مرسوم بالكود.


ليس من المبالغة في الواقع أن نقول إنها شهدت تغيرًا نوعيًا مقارنة بـ "الشرارة المبكرة للذكاء الاصطناعي العام".

الوسوم ذات الصلة

مقالات مشابهة

التعليقات

0/500
Captcha (click to refresh)
لا توجد تعليقات