NVIDIA Mellanox MCX556A-ECAT Server Adapter في العمل: فتح أداء RDMA / RoCE منخفض التأخير وتسريع الذكاء الاصطناعي
September 4, 2026
NVIDIA Mellanox MCX556A-ECAT Server Adapter في العمل: فتح أداء RDMA / RoCE منخفض التأخير وتسريع عبء العمل الذكي والتخزين الموزع
الطراز:MCX556A-ECAT♫ العلامة التجارية: NVIDIA Mellanox ♫ ♫ الفئة: محولات إيثيرنت عالية الأداء ♫ ♫ القدرات الرئيسية: RDMA / RoCE نقل بطء منخفض و تحسين إمكانية إرسال الخادم ♫
الخلفية والتحديات: اختناقات الشبكة في تدريب الذكاء الاصطناعي واسع النطاق
لفريق البنية التحتية للبيانات في شركة رائدة لتكنولوجيا القيادة الذاتيةكان النمو السريع لحملات عمل تدريب نموذج الذكاء الاصطناعي قد تجاوز قدرات البنية التحتية الحالية للشبكةتتكون مجموعة الحوسبة الخاصة بهم من أكثر من 200 خادم GPU، كل منها مجهز بمحولات 25GbE، متصلة بنظام تخزين موزع يضم بيتابايت من بيانات المستشعرات والمحاكاة.أثناء عمليات التدريب على نطاق واسع، لاحظ الفريق باستمرار قضيتين حاسمتين: نادراً ما يتجاوز استخدام GPU 70٪ بسبب اختناقات تحميل البيانات ،عمليات حفظ نقاط التفتيش الضرورية لاستعادة النموذجاستغرق أكثر من 40 ثانية، مما يبطئ بشكل كبير دورات التدريب المتكررة.
تم تتبع السبب الجذري إلى طبقة الوصول إلى الشبكة: المكيفات الموجودة تفتقر إلى قدرات RDMA القوية على التحميل ، مما يجبر إدخال / إخراج التخزين على عبور كومة TCP / IP واستهلاك دورات وحدة المعالجة المركزية المفرطة.أدى ذلك إلى تأخيرات الذيل العالية ، واستخدام غير فعال لموارد GPU ، وتقليص قابلية التوسع للتوسع المستقبلي للمجموعة.كان الفريق بحاجة ماسة إلى محول عالي الأداء يمكنه توفير تأخير RDMA أقل من 5μs وسرعة تسجيل كاملة لفتح إمكانات نسيج التخزين NVMe-oFهذا هو بالضبط حيثNVIDIA Mellanox MCX556A-ECATدخلت عملية التقييم.
الحل والتنفيذ: بناء نسيج محسّن لـ RDMA حول MCX556A-ECAT
بعد مراجعة شاملةورقة بيانات MCX556A-ECATوالتحقق من صحةمواصفات MCX556A-ECATعلى أساس معايير الأداء الداخلية، صمم فريق الهندسة المعمارية استراتيجية تنفيذ متدرجة.بطاقة الشبكة PCIe MCX556A-ECAT ConnectXتم اختياره لقدرته على 50GbE مزدوجة الموانئ و ConnectX-5 ASIC الناضجة ، والتي توفر التوازن المثالي بين الأداء وكفاءة الطاقة ونضج النظام البيئي.
اتبعت استراتيجية النشر ثلاث مراحل رئيسية:
- المرحلة 1 التنفيذ التجريبي (16 عقدة معالجة معالجة معالجة معالجة معالجة معالجة معالجة معالجة معالجة معالجة معالجة معالجة معالجة معالجة معالجة معالجة معالجة معالجة معالجة:تم تثبيت محولين MCX556A-ECAT لكل عقدة حساب ، مزدوجة الموطن لفصل مفاتيح الورق المفعلة RoCEv2.قام الفريق بتكوين المحولات مع SR-IOV لتخصيص وظائف افتراضية مخصصة للتخزين I / O واتصالات التدريبلضمان عزلة الجودة.
- المرحلة الثانية: دمج أنسجة التخزين:تم تكوين أهداف تخزين NVMe-oF للإعلان عن النقاط النهائية القابلة لـ RDMA. تم تمكين PFC و ECN في جميع أنحاء النسيج لضمان النقل بدون خسائر لحركة RoCEv2.
- المرحلة الثالثة توسيع الإنتاج (كل 200 عقدة GPU):وبناء على نتائج التجربة الإيجابية، تم توسيع نطاق التنفيذ إلى المجموعة بأكملها.متوافق مع MCX556A-ECATنظام بيئي يضمن التكامل السلس مع منصات الخوادم الحالية ومصفوفات التخزين وبنية التحتية للتبديل.
على مدى النشر،بطاقة مكيج 556A-ECAT Ethernetأظهرت بساطة استثنائية للشحن والتشغيل.استفاد الفريق من كومة برامج تشغيل MLNX_OFED مع مكتبة الاتصالات الجماعية NVIDIA (NCCL) لتحسين أداء RDMA لنماذج الاتصالات من GPU إلى GPU و GPU إلى التخزين.
النتائج القابلة للقياس: مكاسب كبيرة في الأداء وتحرير الموارد
بعد نشر الإنتاج على نطاق واسع، وثّق الفريق تحسينات كبيرة في العديد من المقاييس الحرجة.يجمع الجدول أدناه مقارنة الأداء قبل وبعد إدخالNVIDIA Mellanox MCX556A-ECAT:
| متري | قبل (25GbE / TCP) | بعد (MCX556A-ECAT / RoCE) | تحسين |
|---|---|---|---|
| تأخير القراءة في التخزين (P99) | ~ 18 μs | ~ 4.2 μs | انخفاض بنسبة 76% |
| نقطة التفتيش توفير الوقت (نموذج 200GB) | 41 ثانية | 11 ثانية | 73% أسرع |
| الاستخدام الفعال لـ GPU | ~ 70% | 94% | 24 نقطة مئوية |
| استخدام وحدة المعالجة المركزية (مسار إدخال / إخراج التخزين) | ~38% | 12٪ | 26% من سعة وحدة المعالجة المركزية |
وبالإضافة إلى التحسينات الكمية، أبلغ الفريق عن انخفاض كبير في أوقات تكرار التدريب من 4.2 يوم في المتوسط لكل نموذج إلى 2.8 يوم فقط.مما يمثل تسارعًا بنسبة 33٪ في الوقت الإجمالي للأسواق لنماذج القيادة الذاتية الجديدةبالإضافة إلى ذلك، عند تقييمسعر MCX556A-ECATمقابل التكلفة الإجمالية للملكية ، أصبحت عائد الاستثمار مقنعاً خلال الشهرين الأولين من استخدام الإنتاج. سمحت سعة وحدة المعالجة المركزية المجانية للفريق بتأجيل الترقية المخطط لها للخادم ،في حين أن وقت التدريب المختصر ترجمت مباشرة إلى ميزة تنافسية.MCX556A-ECAT للبيعالخيارات من خلال شركاء قناة NVIDIA قدمت نماذج المشتريات المرنة التي تتماشى مع دورات الإنفاق الرأسمالي للشركة.
ملخص وتوقعات: أساس للبنية التحتية للمستقبل
اعتماد العالم الحقيقيNVIDIA Mellanox MCX556A-ECATفي هذه البيئة القيادة المستقلة تظهر أن ربط الخادم معتمد على RDMA / RoCE لم يعد ترفًا بل ضرورة لحملات العمل الحديثة للذكاء الاصطناعي.حل البطاقات المتكاملة MCX556A-ECAT Ethernetأثبتت قدرتها على القضاء على اختناقات التخزين، وتعظيم استغلال GPU، وتسريع دورات تدريب النموذج بشكل كبير، وكل ذلك ضمن شبكة موحدة قابلة للإدارة.
في المستقبل، يخطط الفريق لاستكشاف حالات استخدام إضافية تمكنهابطاقة الشبكة PCIe MCX556A-ECAT ConnectX، بما في ذلك بث بيانات أجهزة الاستشعار في الوقت الحقيقي ومزامنة متعددة المجموعات للتعلم الموحد.ورقة بيانات MCX556A-ECATوتتطورمواصفات MCX556A-ECATومع أن المزيد من الشركات تواجه ضغوطًا مماثلة للتوسع في مجالات الذكاء الاصطناعي والحوسبة العالية، فإنMCX556A-ECATيقدم نموذجًا ثبتًا للتوازن بين الأداء والموثوقية والبساطة التشغيلية في البيئات الحرجة للمهمة.

