ميلانوكس (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch في الممارسة العملية
July 15, 2026
Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 محول InfiniBand عمليًا | تحسين الاتصال البيني منخفض زمن الوصول لمجموعات RDMA/HPC/AI
الخلفية والتحديات: عندما يواجه النطاق العنقودي اختناقات الترابط
وجد قسم أبحاث الذكاء الاصطناعي التابع لشركة إنترنت رائدة نفسه عند مفترق طرق مألوف. كان أسطولهم المتنامي من خوادم GPU - الذي يمتد على رفوف متعددة ويستخدم بشكل متزايد للتدريب على نماذج اللغة الكبيرة - يعاني من أوقات إكمال المهام غير المتوقعة. إن النسيج الحالي القائم على شبكة إيثرنت، على الرغم من أنه مناسب لأحمال العمل ذات الأغراض العامة، إلا أنه لا يمكنه التعامل مع أنماط حركة المرور المتزامنة والمتقطعة للتدريب الموزع. ستتوقف عمليات التخفيض الشامل بشكل منتظم بسبب انخفاض الحزم والازدحام، مما يؤدي إلى تأجيل دورات التدريب من أيام إلى أسابيع. احتاج فريق البنية التحتية إلى تحول أساسي في كيفية تعامل شبكتهم الخلفية مع حركة مرور RDMA، وكانوا بحاجة إلى ذلك دون إصلاح بنية مركز البيانات بالكامل.
تصميم الحل: نشر محول InfiniBand 920-9B210-00FN-0D0 OPN
وبعد تقييم خيارات الاتصال البيني المتعددة، اختار الفريق الخيارميلانوكس (نفيديا ميلانوكس) 920-9B210-00FN-0D0كحجر الزاوية في نسيجهم الخلفي الجديد. يتمحور النشر حول طوبولوجيا العمود الفقري للورقة ذات المستويين، حيث يتصل كل مفتاح ورقي بما يصل إلى 40 عقدة GPU عبر روابط بسرعة 400 جيجابت/ثانية. ال920-9B210-00FN-0D0 MQM9790-NS2F 400 جيجابايت/ثانية NDRتم اختيار البديل خصيصًا لبنيته غير المحظورة وقدرات الحوسبة المدمجة داخل الشبكة SHARPv3. وقد أتاح ذلك للفريق تفريغ عمليات الاتصال الجماعية مباشرة على نسيج المحول، مما أدى إلى تقليل حمل وحدة المعالجة المركزية وتحرير دورات وحدة معالجة الرسومات لإجراء عمليات حسابية فعلية.
فيما يتعلق بالنشر الفعلي، تم تركيب المفاتيح مع تدفق الهواء من الأمام إلى الخلف لتتناسب مع التكوين الحالي للممر الساخن/الممر البارد. وقد استفاد الفريق من920-9B210-00FN-0D0 ورقة البياناتللتحقق من متطلبات الطاقة والتبريد، وضمان التكامل السلس في وحدات توزيع الطاقة الحالية. تم الحفاظ على اتساق الكابلات باستخدام أجهزة الإرسال والاستقبال QSFP-DD، مع920-9B210-00FN-0D0 متوافقتم التحقق من صحة البصريات عبر ميزانية الوصلة بأكملها، بما في ذلك الوصلات من العمود الفقري إلى الورقة التي تمتد حتى 100 متر.
نهج النشر: التكامل خطوة بخطوة
- المرحلة الأولى - التحقق من صحة المختبر:تم استخدام اختبار صغير الحجم يحتوي على 8 عقد GPU ومفتاحين لقياس زمن الاستجابة والإنتاجية. النفيديا ميلانوكس 920-9B210-00FN-0D0أظهر زمن انتقال أقل من 600ns، وهو تحسن بنسبة 60% مقارنة بجيل HDR السابق.
- المرحلة الثانية - الطرح المرحلي:قام الفريق بترحيل حجرة تدريب واحدة في كل مرة، باستخدام Unified Fabric Manager من NVIDIA لمراقبة صحة الارتباط ومقاييس الازدحام في الوقت الفعلي. أدى هذا إلى تقليل التعطيل لأعباء عمل الإنتاج المستمرة.
- المرحلة الثالثة – التكامل واسع النطاق:تم نشر جميع المحولات الـ 18 عبر ثلاثة رفوف، لتشكل عمودًا فقريًا غير معوق تمامًا مع وصلات صاعدة بسرعة 400 جيجابت/ثانية. تم تمكين التوجيه التكيفي لموازنة حركة المرور ديناميكيًا وتجنب الاشتراك الزائد أثناء ذروة عمليات تقديم الوظائف.
طوال فترة النشر، أشار الفريق الهندسي إلى الشاملمواصفات 920-9B210-00FN-0D0لضبط إعدادات المخزن المؤقت ومعلمات التحكم في الازدحام. يوفر القياس عن بعد المتقدم للمحول رؤية دقيقة لأعداد الأخطاء لكل منفذ واستخدام الارتباط، مما يتيح الصيانة الاستباقية وتخطيط السعة.
نتائج قابلة للقياس وفوائد تشغيلية
وفي غضون أسبوعين من النشر واسع النطاق، كانت التحسينات ملموسة. تم تقليل أوقات الانتهاء لمهمة التدريب القياسية لوحدة معالجة الرسومات 1,024 من 12.3 ثانية إلى 7.8 ثانية، وهو ما يمثل انخفاضًا بنسبة 37% في أعباء الاتصالات. تحسنت أوقات إكمال المهمة لنموذج نموذجي على طراز GPT بنسبة 30% تقريبًا، مما سمح لفريق البحث بالتكرار بشكل أسرع وإجراء المزيد من التجارب أسبوعيًا. قام محرك SHARPv3 المدمج بتفريغ ما متوسطه 18% من العمليات الجماعية، مما يترجم مباشرة إلى استخدام أعلى لوحدة معالجة الرسومات واستهلاك أقل للطاقة لكل عملية تدريب.
من الناحية التشغيلية، أبلغ فريق تكنولوجيا المعلومات عن عدد أقل من حالات فشل الوظائف المتعلقة بالشبكة وقضاء وقت أقل بكثير في تشخيص المشكلات على مستوى الارتباط. ال920-9B210-00FN-0D0 حل تبديل InfiniBand OPNوقد ثبت استقراره بشكل ملحوظ، مع عدم حدوث أي انقطاع غير مخطط له خلال فترة المراقبة التي استمرت ثلاثة أشهر. أدت واجهة الإدارة الموحدة إلى تقليل منحنى التعلم لفريق عمليات الشبكة، الذي يمكنه الآن إدارة النسيج بالكامل من خلال لوح زجاجي واحد.
اعتبارات التكلفة والمشتريات
بينما الأولي920-9B210-00FN-0D0 السعربعد وضع المفتاح في الطرف المتميز من السوق، روى تحليل التكلفة الإجمالية للملكية قصة مختلفة. من خلال تقليل أوقات إكمال المهام وتحسين استخدام وحدة معالجة الرسومات، حققت المؤسسة انخفاضًا بنسبة 22% في تكاليف المثيلات السحابية مقابل سعة حوسبة مكافئة. علاوة على ذلك،920-9B210-00FN-0D0 للبيعمن خلال شركاء قنوات متعددين سمحوا بتقديم عطاءات تنافسية، كما أدى التزام الدعم طويل الأمد من NVIDIA Mellanox إلى توفير الثقة في الاستثمار.
الملخص والتوقعات: مخطط للبنية التحتية للجيل القادم من الذكاء الاصطناعي
نشرميلانوكس (نفيديا ميلانوكس) 920-9B210-00FN-0D0يعد هذا المرفق البحثي واسع النطاق للذكاء الاصطناعي بمثابة بنية مرجعية مقنعة للمؤسسات التي تواجه تحديات مماثلة في مجال الربط البيني. إن الجمع بين سرعات NDR البالغة 400 جيجابت/ثانية وزمن الوصول دون الميكروثانية وإمكانيات الحوسبة داخل الشبكة يعالج نقاط الضعف الأساسية لمجموعات HPC وAI القائمة على RDMA. سيقدر مهندسو الشبكات مرونة920-9B210-00FN-0D0 مفتاح إنفينيباند OPNفي طبولوجيا مختلفة، في حين يمكن لمديري تكنولوجيا المعلومات الاعتماد على أدوات الإدارة القوية والشاملة920-9B210-00FN-0D0 ورقة البياناتلتخطيط القدرات.
وبالنظر إلى المستقبل، تخطط المنظمة بالفعل لتوسيع النسيج لدعم مجموعات GPU الأكبر، بما في ذلك دمج وحدات DPU BlueField-3 لتفريغ تخزين إضافي وعزل أمني. ال920-9B210-00FN-0D0 متوافقيضمن النظام البيئي أن الترقيات المستقبلية - سواء كانت لبطاقات NIC الأحدث أو التقنيات البصرية - سيتم دعمها بسلاسة. بالنسبة لأي مؤسسة تنشر أحمال عمل واسعة النطاق للذكاء الاصطناعي أو الحوسبة عالية الأداء، لا يمثل هذا التبديل مجرد ترقية تدريجية ولكنه عامل تمكين أساسي للأداء على نطاق واسع.

