NVIDIA Mellanox 920-9B210-00FN-0D0 في الممارسة العملية: بناء نسيج NDR منخفض التأخير لنماذج MoE بمليارات المعايير

August 27, 2026

آخر أخبار الشركة NVIDIA Mellanox 920-9B210-00FN-0D0 في الممارسة العملية: بناء نسيج NDR منخفض التأخير لنماذج MoE بمليارات المعايير

NVIDIA Mellanox 920-9B210-00FN-0D0 في الممارسة العملية: بناء شبكة NDR منخفضة الكمون لنماذج MoE ذات تريليون معلمة

الخلفية والتحدي: عندما يصبح الاتصال الشامل عنق الزجاجة في التدريب

قامت منظمة رائدة في مجال أبحاث الذكاء الاصطناعي مؤخرًا بتوسيع مجموعة تدريب نماذج اللغة الكبيرة الخاصة بها من 1,024 إلى 4,096 وحدة معالجة رسومات NVIDIA H100، بهدف طموح يتمثل في تقليل وقت تدريب نموذج MoE (مزيج الخبراء) المتناثر ذي 1.8 تريليون معلمة من أشهر إلى أقل من أسبوعين. ومع ذلك، خلال التحقق الأولي، اكتشف الفريق أن شبكتهم الحالية HDR بسرعة 200 جيجابت/ثانية كانت تعاني من ازدحام شديد خلال مرحلة الاتصال الشامل - وهو نمط مميز لهياكل MoE - مما تسبب في انخفاض استخدام وحدة معالجة الرسومات من 85% المتوقعة إلى 52% فقط، وهو أقل بكثير من الحد الأدنى المطلوب للوفاء بموعد التدريب النهائي.

كشف تحليل الشبكة أن الاتصال الجماعي الشامل شكل أكثر من 40% من بصمة الاتصال لنموذج MoE، ومع زيادة عدد الخبراء، أصبح نمط حركة المرور مجزأً ومتزايدًا بشكل متقطع. الشبكة الحالية HDR، بعد تشغيل آليات التحكم في الازدحام، شهدت زيادات دراماتيكية في زمن الاستجابة المتأخر، مما ترك جزءًا كبيرًا من وحدات معالجة الرسومات خاملة وتنتظر. احتاجت المنظمة بشكل عاجل إلى شبكة قادرة على توفير زمن استجابة حتمي أقل من ميكرو ثانية، ونقل خالٍ من الفقد، وقابلية توسع ضخمة غير مانعة - وNVIDIA Mellanox 920-9B210-00FN-0D0 تم بناؤه خصيصًا لهذا التحدي بالضبط.

الحل والنشر: بنية ورقة-عمود محسّنة لـ MoE بنظام NDR

قامت المنظمة بنشر شبكة ورقة-عمود من مستويين مبنية حول920-9B210-00FN-0D0 InfiniBand switch OPN. في كل رف حوسبة، تم نشر اثنين من مفاتيح920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR في طبقة الورقة، مما يوفر اتصالاً بسرعة 400 جيجابت/ثانية لـ 64 خادم H100 مزدوج المنفذ عبر كابلات OSFP إلى OSFP النشطة البصرية. في طبقة العمود، قامت 16 مفتاحًا إضافيًا من طراز 920-9B210-00FN-0D0 بربط جميع مفاتيح الأوراق، مما أدى إلى إنشاء شبكة شجرة سمينة غير مانعة بالكامل بعرض نطاق ترددي إجمالي للانقسام يبلغ 51.2 تيرابايت/ثانية.

القطعة المركزية لهذا الحل هي تقنية SHARPv3 (بروتوكول التجميع والاختزال الهرمي القابل للتوسع) المدمجة في المفتاح. بالنسبة لحمل عمل MoE، تم تفريغ الاتصال الشامل مباشرة على شبكة المفاتيح، مع قيام المفاتيح بإجراء تقليل البيانات وإعادة توزيعها داخل الشبكة. هذا ألغى الحاجة إلى تمريرات متعددة على جانب المضيف، مما قلل بشكل كبير من عبء الاتصال الذي ابتلى نشر HDR السابق. يبرز920-9B210-00FN-0D0 datasheet زمن استجابة قطع أقل من 100 نانو ثانية، والذي تم التحقق منه خلال مرحلة إثبات المفهوم وأثبت أنه حاسم لمتطلبات زمن الاستجابة الصارمة لحمل عمل MoE.

أثبتت920-9B210-00FN-0D0—بما في ذلك وحدات إمداد الطاقة المزدوجة الاحتياطية والمراوح القابلة للتبديل السريع—منحت الفريق الثقة في تحقيق هدف التوفر بنسبة 99.999%. أكد فريق الهندسة أيضًا أن النظام البيئي المتوافق مع920-9B210-00FN-0D0 تضمن جميع بصريات وكابلات OSFP التي كانوا قد قاموا بتأهيلها بالفعل، مما ألغى تأخيرات الشراء وبسط الجدول الزمني للنشر.

النتائج والمكاسب القابلة للقياس: من عنق الزجاجة إلى المُمكّن

بعد اكتمال نشر شبكة NDR وإعادة تشغيل مهمة تدريب MoE، قامت المنظمة بقياس تحسينات تحويلية عبر أبعاد متعددة:

  • استعادة استخدام وحدة معالجة الرسومات: ارتفع متوسط استخدام وحدة معالجة الرسومات من 52% إلى 89%، مع وصول الاستخدام الأقصى إلى 94% خلال المراحل المكثفة للحوسبة—وهي نتيجة مباشرة لإزالة حالات التوقف الناجمة عن الشبكة.
  • تقليل زمن استجابة الاتصال الشامل: انخفض الوقت المطلوب لتبادل شامل كامل عبر 4,096 وحدة معالجة رسومات من 180 مللي ثانية إلى أقل من 45 مللي ثانية، وهو تحسن بنسبة 75% ترجم مباشرة إلى تكرارات تدريب أسرع.
  • وقت إكمال المهمة: تم تقليل الجدول الزمني المتوقع للتدريب لنموذج MoE ذي 1.8 تريليون معلمة من 14 يومًا إلى 9 أيام فقط—تسريع بنسبة 36% قلل بشكل كبير من كل من وقت الوصول إلى السوق وتكاليف حوسبة السحابة.
  • الكفاءة التشغيلية: مع 64 منفذًا لكل مفتاح، تم تقليل عدد مفاتيح العمود المطلوبة بنسبة 37% مقارنة بتصميم HDR ذي 40 منفذًا، مما بسّط الكابلات وقلل استهلاك الطاقة لكل رف بنسبة 28%.

من منظور التكلفة الإجمالية للملكية، لاحظ فريق المالية في المنظمة أنه بينما كان920-9B210-00FN-0D0 price لكل وحدة أعلى من بدائل HDR، انخفضت تكلفة الشبكات لكل وحدة معالجة رسومات فعليًا بسبب الكثافة الأعلى وعدد طبقات المفاتيح الأقل. هذه الميزة الاقتصادية، جنبًا إلى جنب مع مكاسب الأداء الدراماتيكية، جعلت ترقية NDR فوزًا تجاريًا واضحًا. حل920-9B210-00FN-0D0 InfiniBand switch OPN solution اندمج أيضًا بسلاسة مع نشر NVIDIA UFM الحالي لديهم، مما يوفر رؤية مركزية وتنبيهًا آليًا قلل من العبء التشغيلي بنسبة 40%.

الملخص والتوقعات: أساس NDR لأعباء عمل MoE من الجيل التالي

أثبتتNVIDIA Mellanox 920-9B210-00FN-0D0 أنها الحل التحويلي الذي احتاجته منظمة أبحاث الذكاء الاصطناعي هذه لإطلاق العنان للإمكانات الكاملة لمجموعة H100 الخاصة بها المكونة من 4,096 وحدة معالجة رسومات. من خلال توفير عرض نطاق ترددي NDR بسرعة 400 جيجابت/ثانية، وكثافة 64 منفذًا، وحوسبة SHARPv3 داخل الشبكة، مكنتهم من التوسع من 1,024 إلى 4,096 وحدة معالجة رسومات دون المساس بالأداء أو قابلية الإدارة—وهو إنجاز كان سيكون مستحيلاً مع بنية HDR السابقة لديهم.

بالنظر إلى المستقبل، تخطط المنظمة للتوسع إلى 8,192 وحدة معالجة رسومات في غضون الـ 18 شهرًا القادمة، مستفيدة من920-9B210-00FN-0D0 for sale من خلال شركاء قناة NVIDIA لبناء شبكة مطوية Clos ثلاثية المستويات أكبر. بالنسبة للمنظمات التي تقيّم استثماراتها في شبكات الذكاء الاصطناعي والحوسبة عالية الأداء من الجيل التالي، تقدم 920-9B210-00FN-0D0 حلاً مثبتًا وجاهزًا للإنتاج يحقق وعد تحسين اتصال RDMA منخفض الكمون على نطاق إكساسكيل.