NVIDIA Mellanox 920-9B210-00FN-0D0 في الممارسة العملية: بناء NDR Low-Latency Fabric لمجموعات الذكاء الاصطناعي بمليارات المعايير

August 26, 2026

آخر أخبار الشركة NVIDIA Mellanox 920-9B210-00FN-0D0 في الممارسة العملية: بناء NDR Low-Latency Fabric لمجموعات الذكاء الاصطناعي بمليارات المعايير

NVIDIA Mellanox 920-9B210-00FN-0D0 في الممارسة العملية: بناء NDR Low-Latency Fabric لمجموعات الذكاء الاصطناعي بمليارات المعايير

الخلفية والتحدي: عندما يلتقي HDR بنماذج تريليون المعلمات

قامت مؤسسة أبحاث رائدة في مجال الذكاء الاصطناعي مؤخراً بتوسيع نطاق مجموعة تدريب نماذج اللغة الكبيرة من 1,024 إلى 4,096 NVIDIA H100 GPU، بهدف ضغط جدول زمني التدريب إلى 1.نموذج 8 تريليونات من المعايير المتناقصة لـ MoE (مزيج الخبراء) من أشهر إلى أقل من أسبوعينومع ذلك، خلال التحقق الأولي، لاحظ الفريق ازدحامًا شديدًا في مرحلة الاتصال بين الجميع على نسيج HDR 200Gb / s الحالي.مما تسبب في انخفاض استخدام GPU من 85% المتوقع إلى 52% فقط.

كشف تحليل الشبكة أن العمليات الجماعية للجميع، والتي هي جوهرية للهندسة المعمارية للوزارة،كانت تشبع وصلات HDR وتشغل آليات التحكم في الازدحام التي تضخمت المزيد من فترات الكمونكانت المنظمة بحاجة إلى نسيج يمكنه توفيرتأخير أقل من ميكرو ثانية عبر الآلاف من النقاط النهائية مع توفير مساحة عرض النطاق الترددي لاستيعاب انفجارات الحركة دون انهيار الأداءهذا هو تحديا تحدياNVIDIA Mellanox 920-9B210-00FN-0D0صممت لمعالجة.

الحل والتنفيذ: نسيج NDR 400Gb / s للذكاء الاصطناعي

المنظمة استخدمت920-9B210-00FN-0D0 InfiniBand switch OPN(رقم الطلب) كأسس لنسيج جديد من طبقتين من الأوراق العمود الفقري. في طبقة الأوراق ، تلقى كل رف اثنين من920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRالمفاتيح، التي توفر 128 منفذًا من اتصال 400 جيجابايت / ثانية إلى 64 خادم H100 مزدوج الموانئ لكل رف عبر كابلات OSFP إلى OSFP النشطة.16 مفاتيح إضافية 920-9B210-00FN-0D0 مترابطة جميع مفاتيح الأوراق، وخلق شجرة الدهون غير الممنوعة مع عرض النطاق الترددي الكامل من 51.2 Tb / s لكل طبقة العمود الفقري.

ما جعل هذا الحل مقنعًا بشكل خاص هو تكنولوجيا SHARPv3 المتكاملة في المفتاح (بروتوكول تجميع وتقليل هرمية قابلة للتوسع).الاتصالات بين الجميع تم تحميلها مباشرة على نسيج التبديل، مع المفاتيح التي تقوم بتقليل البيانات في الشبكة وإعادة توزيعها. هذا يلغي الحاجة إلى مرورات متعددة من جانب المضيف ،تقليل كبير من تكاليف الاتصالات التي كانت تعاني من نشر HDR السابق.

وفقًاورقة بيانات 920-9B210-00FN-0D0، يقدم المفتاح فترة تأخير أقل من 100ns ، والتي تم التحقق منها خلال مرحلة إثبات المفهوم. كما أكد فريق الهندسة أن920-9B210-00FN-0D0 متوافقةوقد شملت النظام البيئي جميع أجهزة OSFP البصرية والكابلات التي كانت مؤهلة بالفعل ، مما يلغي تأخيرات المشتريات.مواصفات 920-9B210-00FN-0D0- بما في ذلك إمدادات الطاقة المزدوجة الإضافية والمروحة القابلة للتبادل الساخن - أعطت الفريق الثقة في تحقيق هدف التوافر 99.999٪ لمجموعة الإنتاج.

النتائج والمكاسب القابلة للقياس: من الحاجز إلى المُساعد

بعد نشر نسيج NDR الكامل وإعادة بدء عمل التدريب في وزارة الخارجية ، قامت المنظمة بقياس التحسينات التحولية عبر أبعاد متعددة:

  • استرداد استخدام GPU:ارتفع متوسط استغلال GPU من 52٪ إلى 89٪ ، حيث وصل الذروة إلى 94٪ خلال المراحل المكثفة في الحوسبة نتيجة مباشرة للقضاء على التوقف الناجم عن الشبكة.
  • انخفاض في فترة التأخيرانخفض الوقت المطلوب لتبادل كامل من كل شيء إلى كل شيء عبر 4,096 GPU من 180ms إلى أقل من 45ms ، وهو تحسن بنسبة 75٪ يترجم مباشرة إلى تكرارات تدريب أسرع.
  • وقت الانتهاء من المهمة:تم تقليل الجدول الزمني المتوقع للتدريب لنموذج 1.8T MoE من 14 يومًا إلى 9 أيام فقط - مع تسارع بنسبة 36٪ مما خفض بشكل كبير كل من وقت التسويق وتكاليف الحوسبة السحابية.
  • كفاءة التشغيل:مع 64 منفذًا لكل مفتاح ، تم تقليل عدد مفاتيح العمود الفقري المطلوبة بنسبة 37٪ مقارنة بتصميم HDR ذي 40 منفذًا ، مما يسهل الكابلات ويقلل من استهلاك الطاقة لكل رف بنسبة 28٪.

من منظور التكلفة الإجمالية للملكية، لاحظ فريق التمويل في المنظمة أنه في حين أن920-9B210-00FN-0D0 السعركانت تكلفة الشبكة لكل وحدة HDR أعلى من بديل HDR ، انخفضت تكلفة الشبكة لكل وحدة معالجة معالجة معالجة في الواقع بسبب ارتفاع الجذور وانخفاض عدد طبقات التبديل.جنبا إلى جنب مع مكاسب الأداء الدرامية، جعل تحديث NDR ربح تجاري واضح.920-9B210-00FN-0D0 حل InfiniBand switch OPNكما تم دمجها بسلاسة مع نشر NVIDIA UFM الحالي ، مما يوفر الرؤية المركزية والتنبيه الآلي الذي خفض التكاليف التشغيلية بنسبة 40٪.

ملخص وتوقعات: مؤسسة NDR للجيل القادم من الذكاء الاصطناعي

الـNVIDIA Mellanox 920-9B210-00FN-0D0أثبتت أنها الحل التحولي الذي احتاجته هذه المنظمة البحثية في مجال الذكاء الاصطناعي لتحقيق الإمكانات الكاملة لمجموعة H100 ذات 4,096-GPU.و SHARPv3 الحوسبة في الشبكة، تمكنهم التبديل من التوسع من 1024 إلى 4،096 GPU دون المساس بالأداء أو قابلية الإدارة - وهو إنجاز كان مستحيلا مع بنية تحتية HDR السابقة.

بالنظر إلى المستقبل، تخطط المنظمة للتوسع إلى 8،192 GPU في غضون 18 شهرا المقبلة،920-9B210-00FN-0D0 للبيعمن خلال شركاء قناة NVIDIA لبناء نسيج مغلق مطوي من ثلاثة مستويات أكبر. للمنظمات التي تقيم استثماراتها في شبكات الذكاء الاصطناعي والحوسبة العالية920-9B210-00FN-0D0 يوفر، وهو حل جاهز للإنتاج يوفّر على وعد تحسين ربط RDMA المتداخل بفترة تأخير منخفضة على نطاق إكسا.