NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch في العمل: تحسين الاتصال المشترك منخفض التأخير لمجموعات RDMA / HPC / AI
August 21, 2026
NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch قيد التنفيذ: تحسين الاتصال البيني منخفض زمن الاستجابة لمجموعات RDMA/HPC/AI
في عالم التدريب على نماذج الذكاء الاصطناعي واسعة النطاق والحوسبة عالية الأداء (HPC)، غالبًا ما يصبح زمن استجابة الشبكة هو عنق الزجاجة الحرج الذي يحد من قابلية التوسع للمجموعة وكفاءتها. أكمل أحد مراكز الحوسبة الفائقة على المستوى الوطني مؤخرًا ترقية كبيرة للبنية التحتية، والانتقال من نسيج EDR InfiniBand بسرعة 100 جيجابت/ثانية إلى حل HDR بسرعة 200 جيجابت/ثانية تم تصميمه حولنفيديا ميلانوكس MQM8790-HS2Fتبديل إنفينيباند. تتناول دراسة الحالة هذه التحديات التي واجهوها، واستراتيجية النشر، ومكاسب الأداء القابلة للقياس التي تم تحقيقها من خلال هذا الجيل القادم من الاتصال البيني.
الخلفية والتحديات: عندما يصبح زمن الوصول هو سقف الأداء
يقوم مركز الحوسبة الفائقة بتشغيل مجموعة غير متجانسة تضم أكثر من 2000 عقدة GPU، مما يدعم مزيجًا متنوعًا من أعباء العمل يتضمن محاكاة الطقس والأبحاث الجينومية والتدريب على نماذج اللغة الكبيرة. مع شبكة EDR السابقة بسرعة 100 جيجابت/ثانية، لاحظ فريق العمليات أن عمليات الاتصال الجماعي - مثل كل التخفيض والجمع - كانت تستهلك حصة متزايدة من إجمالي وقت تشغيل المهمة مع زيادة عدد العقد. في بعض وظائف التدريب الموزعة، تمثل النفقات العامة المتعلقة بالشبكة ما يقرب من 40% من وقت التنفيذ الشامل، مما يحد بشدة من استخدام وحدة معالجة الرسومات وتوسيع دورات تقارب النماذج.
وشملت التحديات الإضافية ما يلي:
- بؤر الازدحام:غالبًا ما تكون أنماط حركة المرور في التدريب على الذكاء الاصطناعي متقطعة وغير متوقعة، مما يؤدي إلى حجب الخط الرئيسي وارتفاع زمن الوصول الذي يعطل جدولة الوظائف.
- عدم كفاية التسريع داخل الشبكة:كان النسيج القديم يفتقر إلى الدعم لإمكانيات التفريغ الجماعي المتقدمة، مما أجبر جميع عمليات التخفيض على اجتياز وحدة المعالجة المركزية المضيفة والتسلسل الهرمي للذاكرة.
- تعقيد الإدارة:يتطلب استكشاف مشكلات الأداء وإصلاحها إجراء تحليل يدوي لأدوات مراقبة متعددة، مما يجعل من الصعب تحديد الأسباب الجذرية في عمليات النشر واسعة النطاق.
وبعد تقييم خيارات الربط المتعددة، اختار المركزMQM8790-HS2Fكأساس لنسيجها الجديد. وفقا لورقة بيانات MQM8790-HS2F، يوفر هذا المحول 40 منفذًا من إنتاجية HDR غير قابلة للحظر بسرعة 200 جيجابت/ثانية، وزمن انتقال أقل من 130 نانو ثانية، ودعم التفريغ الجماعي لـ SHARP v3.0 - وهي القدرات التي تعالج نقاط الضعف الأساسية بشكل مباشر.
الحل والنشر: بناء نسيج منخفض الكمون للذكاء الاصطناعي/الحوسبة عالية الأداء
اعتمد النشر طوبولوجيا الشجرة الدهنية ذات المستويين، مع 24MQM8790-HS2F 200 جيجابت / ثانية HDR 40 منفذ QSFP56يتم نشر المفاتيح كعقد ورقية و 8 وحدات كمفاتيح للعمود الفقري. وقد وفر هذا التكوين اشتراكًا زائدًا بنسبة 2:1 عبر المجموعة بأكملها، وهو ما يكفي لعبء العمل الحالي مع السماح بمساحة رأسية للتوسع في المستقبل.
| طبقة النشر | عدد المفاتيح | المنافذ المستخدمة | الاتصال |
|---|---|---|---|
| ورقة (لكل رف) | 24 | 32 منفذًا لكل منهما | خوادم ToR + الوصلات الصاعدة للعمود الفقري |
| العمود الفقري | 8 | 36 منفذًا لكل منهما | شبكة كاملة لجميع مفاتيح الأوراق |
يتصل كل مفتاح طرفي بعقد الحساب عبر محولات القناة المضيفة NVIDIA ConnectX-6 HDR. المتوافق مع MQM8790-HS2Fسمح النظام البيئي للبصريات والكابلات للفريق بإعادة استخدام كابلات QSFP56 الحالية، مما أدى إلى تسريع النشر وتقليل تكاليف الشراء. تم الانتهاء من التثبيت الفعلي بالكامل في غضون أسبوعين، مع الاستفادة من مستوى التحكم في Unified Fabric Manager (UFM) من NVIDIA لاكتشاف الهيكل وتوفيره تلقائيًا.
أثبت دعم المحول للتوجيه التكيفي والتحكم في الازدحام أنه أمر بالغ الأهمية للتعامل مع خاصية حركة المرور المتقطعة لأحمال عمل الذكاء الاصطناعي. من خلال إعادة توزيع التدفقات ديناميكيًا عبر المسارات المتاحة،MQM8790-HS2F التبديل إنفينيباندقلل من تكوين النقاط الساخنة وحافظ على الأداء المتسق حتى أثناء فترات جدولة المهام القصوى.
النتائج والمكاسب: تحسينات قابلة للقياس في إنتاجية العمل واستخدام وحدة معالجة الرسومات
بعد ثلاثة أشهر من عملية الإنتاج، أعلن مركز الحوسبة الفائقة عن مكاسب كبيرة في الأداء عبر أبعاد متعددة:
- تقليل الكمون:انخفض متوسط زمن وصول MPI بينج بونج من 680 نانو ثانية على نسيج EDR السابق إلى أقل من 130 نانو ثانية معنفيديا ميلانوكس MQM8790-HS2Fمما يمثل تحسنًا بمقدار 5 أضعاف في كفاءة تبادل الرسائل.
- تسريع العمل الجماعي:انخفض زمن الوصول المخفض بالكامل للمهام ذات 1024 عقدة بنسبة 62%، وذلك بفضل إلغاء التحميل SHARP v3.0 الذي ينفذ عمليات التخفيض مباشرة داخل نسيج المحول.
- استخدام GPU:أدى التأثير المشترك لزمن الوصول المنخفض وعرض النطاق الترددي العالي إلى دفع متوسط استخدام وحدة معالجة الرسومات من 72% إلى 91%، مما يؤدي إلى انخفاض بنسبة 26% في وقت الحل لعمليات التدريب على نماذج اللغة الكبيرة.
- كفاءة الجدولة الوظيفية:سمح انخفاض تباين زمن الاستجابة لمجدول SLURM بحزم المزيد من المهام على نفس مجموعة العقد دون تداخل في الأداء، مما أدى إلى زيادة إجمالي إنتاجية المجموعة بنسبة 18% تقريبًا.
عندما قام الفريق لاحقًا بقياس مستوىسعر MQM8790-HS2Fومقابل المحولات البديلة من البائعين الآخرين، وجدوا أن التكلفة الإجمالية لكل جيجابت/ثانية تم تسليمها كانت تنافسية للغاية - خاصة عند الأخذ في الاعتبار انخفاض تكاليف الإدارة وقدرة المحول على دعم كل من سرعات الارتباط HDR وHDR100، مما يحمي الاستثمارات في البيئات ذات السرعات المختلطة.
من منظور تشغيلي، قدمت منصة UFM المتكاملة لوحة زجاجية واحدة لمراقبة سلامة النسيج وأنماط حركة المرور والأخطاء على مستوى الارتباط. وقد مكنت هذه الرؤية الفريق من تحديد الكابلات المتدهورة بشكل استباقي واستبدالها أثناء الصيانة المجدولة، وتجنب التوقف غير المخطط له.
الملخص والتوقعات: مخطط للأقمشة ذات الكمون المنخفض من الجيل التالي
توضح دراسة الحالة هذه أنحل التبديل MQM8790-HS2F InfiniBandهو أكثر من مجرد ترقية بسيطة للسرعة، فهو مكون تحويلي للمؤسسات التي تسعى إلى إطلاق العنان لإمكانات الأداء الكاملة للبنية التحتية للذكاء الاصطناعي والحوسبة عالية الأداء. ومن خلال الجمع بين كثافة المنافذ العالية وزمن الوصول المنخفض للغاية وقدرات الحوسبة داخل الشبكة، يعالج المحول بشكل مباشر اختناقات الاتصال التي كانت لها قابلية توسعة محدودة تاريخيًا.
وبالنظر إلى المستقبل، يخطط مركز الحوسبة الفائقة لتوسيع نسيجه إلى 2400 عقدة في السنة المالية المقبلة، مع الاستفادة من نفس الشيءMQM8790-HS2Fالهندسة المعمارية مع مفاتيح العمود الفقري إضافية. يستكشف الفريق أيضًا دعم المحول لخوارزميات التخفيض المحسنة لـ SHARP v3.0، والتي تعد بزيادة تسريع أعباء العمل الناشئة مثل الشبكات العصبية الرسومية والتعلم المعزز.
بالنسبة لمديري تكنولوجيا المعلومات ومهندسي الشبكات والمهندسين الذين يقومون بتقييم خيارات الاتصال البيني لمجموعاتهم الخاصة، فإننفيديا ميلانوكس MQM8790-HS2Fيقدم مسارًا مثبتًا ومعتمدًا ميدانيًا لتحقيق زمن استجابة أقل من الميكروثانية، وزيادة استخدام وحدة معالجة الرسومات، وإدارة النسيج المبسطة. مفصلمواصفات MQM8790-HS2Fوالتصميمات المرجعية متاحة على بوابة التوثيق الفني لـ NVIDIA، والمحول متاح الآن على نطاق واسع — ابحث عنMQM8790-HS2F للبيعللعثور على شريك إقليمي.

