تستمر معالجات الرسوميات Blackwell GB300 وGB200 من NVIDIA في إظهار الأداء الرائد في مختلف أعباء عمل الذكاء الاصطناعي من خلال التحسين الفني المستمر. مع استمرار انتشار الجيل الجديد من منصات الذكاء الاصطناعي حول العالم، ربما توقع العالم الخارجي أن NVIDIA ستحول تركيزها إلى بنية Rubin. ومع ذلك، فقد تبين أن سلسلة Blackwell، التي تم وضعها موضع التنفيذ في عدد لا يحصى من مراكز البيانات، مثل بنية Hopper لهذا العام، لا تزال تطلق إمكانات مذهلة من خلال ترقيات البرامج المستمرة. من بينها، يستمر GB300 في تحقيق أعلى مستويات الأداء الجديدة في مهام حوسبة الذكاء الاصطناعي.

وفقًا للبيانات الرسمية الصادرة عن NVIDIA، أدى التحسين المستمر لمنصة Blackwell إلى تحسين الأداء العام ونسبة كفاءة الطاقة بشكل كبير. في 3 أشهر فقط، قامت NVIDIA بزيادة الإنتاجية لكل ميجاوات بما يصل إلى 4x على نفس تكوين GB200 NVL72 الذي يشغل أحمال عمل DeepSeek R1 0528 - 1K/1K. خلال هذا الوقت، أضافت الشركة 38 تحسينًا رئيسيًا إلى منصة Blackwell من خلال تشغيل أكثر من 250000 تكوين محاكاة واستهلاك إجمالي 1.4 مليون ساعة اختبار لوحدة معالجة الرسومات. ومن الجدير بالذكر أنه يمكن تطبيق أكثر من 90% من نتائج التحسين على نماذج الذكاء الاصطناعي الأخرى، مما يوضح تمامًا التزام NVIDIA بالحفاظ على الاستثمار العميق في منصات الذكاء الاصطناعي الحالية حيث أصبحت المنصات الجديدة أكثر شعبية تدريجيًا.

من ناحية أخرى، لا تزال منصة GB300 "Blackwell Ultra" من NVIDIA تهيمن على مجال تدريب الذكاء الاصطناعي. عند استخدام 256 وحدة معالجة رسومات لتشغيل طراز DeepSeek-V3 671B، سجل نواة Megatron Core رقمًا قياسيًا مذهلاً قدره 1,648 Terops لكل وحدة معالجة رسومات، محققًا قفزة في الأداء بمقدار 3x مقارنة بـ GB200 606 Terops. يمكن أن يؤدي استخدام GB300 NVL72 للتدريب المسبق على DeepSeek-V3 671B إلى تحقيق كفاءة تشغيل قياسية عالمية تبلغ 1648 Terops لكل وحدة معالجة رسومات، مما يسمح لنفس مهمة التدريب بتحقيق أداء معين بجزء صغير فقط من مقياس الأجهزة. وفي الوقت نفسه، زاد أيضًا أداء نفس نظام GB300 NVL72 بما يصل إلى 1.5 مرة في الأشهر الستة الماضية بعد التحسين المستمر.
بالإضافة إلى ذلك، أطلقت NVIDIA أيضًا تعاونًا متعمقًا مع PyTorch ومجتمع JAX مفتوح المصدر لتعزيز التنفيذ الكامل لنتائج التحسين المختلفة في مصفوفة منتجات الذكاء الاصطناعي الخاصة بها. عند تشغيل طراز DeepSeek-V3 671B باستخدام حزمة التدريب الأصلية من PyTorch TorchTitan، حقق حامل Blackwell Ultra تحسنًا في الأداء يصل إلى 6x دون أي تحسين أولي. لقد حقق إطار عمل JAX نموًا أكبر. ارتفعت سرعتها إلى 1025 Terops لكل وحدة معالجة رسومات، ويمكن أن يصل إنتاجية وحدة معالجة الرسومات الواحدة إلى 4082 رمزًا في الثانية. وبالمقارنة مع خط الأساس في يناير من هذا العام، فقد حققت قفزة في الأداء بمقدار 10 مرات.





ليس هذا فحسب، فقد حققت NVIDIA أيضًا أداءً عالميًا من 256 إلى 1024 وحدة معالجة رسوميات في جميع الأطر السائدة للتدريب المسبق. عند الوصول إلى مقياس 1024 وحدة معالجة رسوميات، يمكن لـ Megatron Core الحفاظ على كفاءة توسع تصل إلى 98.5%، بينما تحافظ كفاءة التوسعة في TorchTitan وإطار عمل JAX أيضًا على مستوى 97%. المكون الأساسي الذي يدعم أداء التوسعة الممتاز هذا هو شريحة الشبكة NVIDIA 800Gb/s المدمجة داخل كل حامل NVL72. بدءًا من التدريب النموذجي وحتى نشر الاستدلال، تضع NVIDIA باستمرار معايير جديدة في مجال الذكاء الاصطناعي. مع وجود منصة Rubin بالفعل في السوق وتحقيق مكاسب أكبر في الأداء، يواجه المنافسون الآخرون بلا شك ضغوطًا كبيرة للحاق بالركب.