NVIDIA Mellanox 920-9B210-00FN-0D0 المرجعية التقنية: 400 جيجابايت / ثانية NDR تحسين اتصال متبادل منخفض التأخير
August 27, 2026
الدليل المرجعي التقني لـ NVIDIA Mellanox 920-9B210-00FN-0D0: تحسينات الربط البيني بزمن انتقال منخفض بسرعة 400 جيجابت/ثانية NDR لمجموعات RDMA/HPC/AI
1. خلفية المشروع وتحليل المتطلبات
مع توسع مجموعات تدريب الذكاء الاصطناعي من آلاف إلى عشرات الآلاف من وحدات معالجة الرسومات (GPUs)، واقتراب محاكاة الحوسبة عالية الأداء (HPC) من أداء Exascale، تواجه وصلات الشبكة طلبات غير مسبوقة على عرض النطاق الترددي وزمن الاستجابة والحتمية. لم يعد الانتقال من 200 جيجابت/ثانية HDR إلى 400 جيجابت/ثانية NDR اختياريًا - بل هو ضرورة استراتيجية للمؤسسات التي تنشر نماذج بمعاملات تريليونية وحوسبة متوازية واسعة النطاق. عبر بيئات النشر الرائدة المتعددة، يمكن تلخيص المتطلبات الأساسية على النحو التالي:
- زمن استجابة حتمي فائق الانخفاض: يجب أن تحافظ اتصالات MPI والاتصالات الجماعية الشاملة على زمن استجابة من منفذ إلى منفذ أقل من 100 نانو ثانية لتقليل تأثير حمل الاتصالات على تقارب التدريب.
- نسيج خالٍ من الفقد على نطاق واسع: صفر إسقاط للحزم عبر آلاف نقاط النهاية، مما يضمن عدم تدهور أداء RDMA تحت الازدحام.
- تفريغ الحوسبة داخل الشبكة: تفريغ العمليات الجماعية (all-reduce، all-to-all، broadcast) إلى نسيج المحولات لتحرير موارد وحدة المعالجة المركزية/وحدة معالجة الرسومات المضيفة.
- قابلية التوسع عالية الراديو (radix): دعم طوبولوجيا fat-tree و dragonfly+ مع عرض نطاق ترددي كامل للانقسام عند 8000+ عقدة.
- حماية الاستثمار: توافق سلس مع كابلات HDR الحالية، والبصريات، وأدوات الإدارة للترقيات المرحلية.
لمعالجة هذه المتطلبات، يعتمد هذا الحل على NVIDIA Mellanox 920-9B210-00FN-0D0 كوحدة بناء أساسية - محول InfiniBand بسرعة 400 جيجابت/ثانية NDR مصمم خصيصًا لنشر فئة Exascale.
2. تصميم بنية الشبكة الشاملة
يوظف الحل المقترح بنية طوبولوجيا من طبقتين (leaf-spine)، مما يوفر نسيجًا قابلاً للتوسع وغير مانع مع زمن استجابة حتمي وكابلات مبسطة. في طبقة الأوراق (leaf)، يتم تجهيز كل رف حوسبة بوحدة واحدة أو اثنتين من وحدات 920-9B210-00FN-0D0 InfiniBand switch OPN، مما يوفر 64 منفذًا لاتصال 400 جيجابت/ثانية NDR بخوادم GPU عبر كابلات OSFP المباشرة النحاسية (DAC) أو الكابلات البصرية النشطة (AOC). في طبقة العمود الفقري (spine)، تقوم طبقة ثانية من محولات 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR بربط جميع محولات الأوراق، مما ينشئ نسيج fat-tree بعرض نطاق ترددي كامل للانقسام.
بالنسبة للمجموعات التي تتجاوز 5000 عقدة، يمكن تنفيذ بنية Clos مطوية من ثلاث طبقات، حيث يعمل 920-9B210-00FN-0D0 كمحول أوراق وعمود فقري للحفاظ على أداء متسق عبر جميع المستويات. يدعم المحول ما يصل إلى 64 محولًا في نسيج واحد تحت مدير شبكة فرعية واحد، مما يتيح التحكم الموحد في الطوبولوجيا واسعة النطاق.
يلخص الجدول التالي معلمات التوسع الرئيسية لنسيج NDR ذي الطبقتين المبني حول 920-9B210-00FN-0D0:
| المكون | المواصفات | القيمة |
|---|---|---|
| محولات الأوراق | 920-9B210-00FN-0D0 | 1-2 لكل رف |
| محولات العمود الفقري | 920-9B210-00FN-0D0 | N/2 (N = عدد محولات الأوراق) |
| الحد الأقصى لنقاط النهاية | خوادم GPU | ما يصل إلى 4096 (راديو 64 منفذًا) |
| عرض النطاق الترددي للانقسام | غير مانع بالكامل | 51.2 تيرابايت/ثانية لكل طبقة عمود فقري |
3. دور وميزات رئيسية لـ NVIDIA Mellanox 920-9B210-00FN-0D0
ضمن هذه البنية، يعمل NVIDIA Mellanox 920-9B210-00FN-0D0 كعنصر تبديل أساسي، مما يوفر العديد من القدرات الحيوية التي تعالج مباشرة المتطلبات المحددة في القسم 1:
- 64 منفذًا بسرعة 400 جيجابت/ثانية NDR: يدعم كل منفذ OSFP سرعة 400 جيجابت/ثانية ثنائية الاتجاه مع تصحيح الأخطاء الأمامي (FEC) لاتصال موثوق به بمدى ممتد. توفر سعة التبديل الإجمالية البالغة 51.2 تيرابايت/ثانية هامشًا كبيرًا حتى لأكثر أعباء العمل كثافة في الاتصالات.
- زمن انتقال فائق الانخفاض للقطع (cut-through): زمن انتقال من منفذ إلى منفذ أقل من 100 نانو ثانية، كما هو موثق في ورقة بيانات 920-9B210-00FN-0D0، يضمن الحد الأدنى من الحمل لعمليات MPI و RDMA.
- SHARPv3 مدمج: يقوم بتفريغ العمليات الجماعية من وحدات المعالجة المركزية المضيفة، مما يقلل من زمن انتقال all-reduce بنسبة تصل إلى 40% و all-to-all بنسبة تصل إلى 35% في المهام واسعة النطاق.
- التوجيه التكيفي والتحكم في الازدحام: يعيد توجيه حركة المرور ديناميكيًا لتجنب النقاط الساخنة، مما يحافظ على أداء يمكن التنبؤ به تحت أنماط حركة المرور العدائية. توفر القياسات المتقدمة رؤية لكل تدفق ولكل منفذ للإدارة الاستباقية.
- قابلية إدارة شاملة: تكامل كامل مع مدير النسيج الموحد (UFM) من NVIDIA للتزويد بدون لمس، ومراقبة الصحة، والفشل التلقائي.
يقدم مواصفات 920-9B210-00FN-0D0 مزودات طاقة مزدوجة مكررة، ووحدات مروحة قابلة للتبديل السريع، ودعم لتكوينات مديري الشبكات الفرعية المكررة، مما يضمن توفر بنسبة 99.999% لأعباء العمل الحيوية.
4. توصيات النشر وقابلية التوسع
بالنسبة للمؤسسات التي تخطط لاعتماد حل 920-9B210-00FN-0D0 InfiniBand switch OPN، يوصى بإرشادات النشر التالية:
- استراتيجية الكابلات: استخدم كابلات DAC من OSFP إلى OSFP لتوصيلات داخل الرف (حتى 3 أمتار) وكابلات AOC أو أجهزة الإرسال والاستقبال البصرية للروابط بين الرفوف وبين الأوراق والأعمدة الفقرية (حتى 100 متر). تحقق من أن جميع الكابلات متوافقة مع 920-9B210-00FN-0D0 وفقًا لمصفوفة توافق NVIDIA لتجنب مشاكل سلامة الإشارة.
- التكرار: انشر مزودات طاقة مزدوجة متصلة بوحدات توزيع طاقة (PDUs) منفصلة. استخدم محولين عموديين فقريين على الأقل لكل ورقة للقضاء على نقاط الفشل الفردية. بالنسبة لأعباء العمل الحيوية، ضع في اعتبارك تكرار N+1 في طبقة العمود الفقري.
- إدارة البرامج الثابتة: تأكد من أن جميع المحولات تعمل بإصدارات برامج ثابتة متطابقة من NVIDIA. استخدم ميزة التحديث التلقائي للبرامج الثابتة في UFM للتحديثات المتدرجة دون انقطاع. تحقق من توافق البرامج الثابتة مع محولات المضيف والكابلات قبل النشر.
- مسار قابلية التوسع: بالنسبة للمجموعات التي تتجاوز 4096 عقدة، انتقل إلى بنية Clos مطوية من ثلاث طبقات أو استفد من dragonfly+ مع التوجيه التكيفي. يدعم 920-9B210-00FN-0D0 ما يصل إلى 64 محولًا في نسيج واحد، مع ربط شبكات متعددة عبر البوابات لنشر أكبر.
- التحقق من الأداء: قبل النشر الإنتاجي، قم بإجراء اختبارات إجهاد شاملة باستخدام معايير أداء OpenFabrics Enterprise Distribution (OFED) للتحقق من أداء النسيج مقابل مواصفات ورقة بيانات 920-9B210-00FN-0D0.
عند حساب التكلفة الإجمالية للملكية، ضع في اعتبارك العدد المنخفض من طبقات المحولات والكابلات المبسطة مقارنة بالبدائل ذات الراديو الأقل. بينما يكون سعر 920-9B210-00FN-0D0 أعلى لكل وحدة من محولات HDR، فإن تكلفة المنفذ وتكلفة الشبكات لكل GPU أقل بكثير في عمليات النشر واسعة النطاق، مما يجعله خيارًا فعالاً من حيث التكلفة لمشاريع Exascale.
5. العمليات والمراقبة واستكشاف الأخطاء وإصلاحها
تتطلب الإدارة الفعالة لنسيج NDR إطار عمل شامل للمراقبة واستكشاف الأخطاء وإصلاحها. يوفر UFM من NVIDIA لوحة تحكم واحدة للنسيج بأكمله المستند إلى NVIDIA Mellanox 920-9B210-00FN-0D0، ويقدم:
- تصور الطوبولوجيا: اكتشاف تلقائي وتمثيل رسومي لجميع المحولات والروابط ونقاط النهاية مع تحديثات الحالة في الوقت الفعلي.
- لوحات معلومات الأداء: عروض في الوقت الفعلي لاستخدام المنافذ، ومعدلات الأخطاء، ومؤشرات الازدحام، واحتلال المخزن المؤقت عبر النسيج بأكمله.
- تنبيه استباقي: إنذارات قائمة على العتبة لتدهور الروابط، وشذوذات درجة الحرارة، وفشل مزودات الطاقة، وتآكل الكابلات.
- عزل الأخطاء: سير عمل استكشاف الأخطاء وإصلاحها الموجهة التي تحدد الكابلات أو أجهزة الإرسال والاستقبال أو منافذ المحولات المعيبة، مما يقلل من متوسط وقت الإصلاح (MTTR).
- تحليلات تاريخية: تحليل الاتجاهات وتخطيط السعة بناءً على بيانات الأداء التاريخية، مما يتيح قرارات التوسع الاستباقية.
للمساعدة في استكشاف الأخطاء وإصلاحها المتقدم، استفد من أدوات التشخيص المدمجة في المحول، بما في ذلك اختبارات loopback، وتحليل معدل خطأ البت (BER)، ومراقبة تشخيص وحدات البصريات (DOM). تشمل المشكلات الشائعة التي تمت مواجهتها في عمليات نشر NDR المبكرة التوجيه غير الأمثل الناجم عن سرعات الروابط غير المتساوية، أو أنواع الكابلات غير المتطابقة، أو عدم اتساق البرامج الثابتة. يؤدي تمكين التوجيه التكيفي، والتحقق من أن جميع الروابط تعمل بسرعة 400 جيجابت/ثانية مع تمكين FEC، وضمان البرامج الثابتة المتسقة عبر جميع المحولات إلى حل غالبية شذوذات الأداء.
يجب على مهندسي الشبكات أيضًا إنشاء خط أساس لـ مواصفات 920-9B210-00FN-0D0 خلال مرحلة التحقق، بما في ذلك زمن الاستجابة المتوقع، والإنتاجية، ومعدلات الخطأ. يمكن استخدام الانحرافات عن هذا الخط الأساس كمؤشرات مبكرة للمشكلات المحتملة. يدعم 920-9B210-00FN-0D0 InfiniBand switch OPN أيضًا تسجيل الأحداث الشامل عبر syslog و SNMP، مما يتيح التكامل مع مكدسات مراقبة مراكز البيانات الحالية.
6. الملخص وتقييم القيمة
يقدم 920-9B210-00FN-0D0 عرض قيمة مقنع للمؤسسات التي تبني أو توسع مجموعات HPC و AI المستندة إلى NDR. يوفر 64 منفذًا بسرعة 400 جيجابت/ثانية NDR مع زمن استجابة أقل من 100 نانو ثانية، وتفريغ SHARPv3، وقابلية إدارة على مستوى المؤسسات، وتوافقًا كاملاً مع النظام البيئي HDR الحالي - كل ذلك في منصة 1U مدمجة. تشمل نقاط القيمة الرئيسية:
- الأداء: انخفاض يصل إلى 75% في زمن استجابة الاتصالات الشاملة وانخفاض يصل إلى 40% في زمن استجابة all-reduce من خلال تفريغ SHARPv3 وعرض النطاق الترددي لـ NDR.
- كفاءة التكلفة: تكلفة شبكات أقل لكل GPU مقارنة ببدائل HDR في عمليات النشر واسعة النطاق، مدفوعة براديو أعلى وعدد طبقات محولات أقل.
- بساطة التشغيل: تكامل عميق مع UFM للإدارة الموحدة، والتزويد الآلي، والمراقبة الاستباقية، وحل الأخطاء السريع.
- حماية الاستثمار: توافق كامل مع كابلات HDR الحالية، والبصريات، ومكدسات البرامج، مما يتيح الترقيات المرحلية دون تعطيل أعباء العمل الإنتاجية.
- قابلية توسع مقاومة للمستقبل: دعم طوبولوجيا Clos المطوية من ثلاث طبقات و dragonfly+، مما يضمن قدرة النسيج على التوسع إلى 8000+ عقدة مع نمو متطلبات الحوسبة.
بالنسبة للمؤسسات التي تقيّم 920-9B210-00FN-0D0 للبيع من خلال شركاء NVIDIA، نوصي بمراجعة ورقة بيانات 920-9B210-00FN-0D0 التفصيلية والتواصل مع مهندس حلول معتمد للتحقق من صحة التصميم لمتطلبات عبء العمل والمقياس الخاصة بك. NVIDIA Mellanox 920-9B210-00FN-0D0 جاهز للإنتاج اليوم، ويقدم أساسًا للربط البيني عالي الأداء وقابل للتوسع للجيل القادم من ابتكارات الذكاء الاصطناعي و HPC.

