NVIDIA Mellanox MCX556A-ECAT خادم محول ورقة بيضاء فنية

July 23, 2026

NVIDIA Mellanox MCX556A-ECAT خادم محول ورقة بيضاء فنية

NVIDIA Mellanox MCX556A-ECAT Server Adapter كتاب أبيض تقني

1خلفية المشروع وتحليل المتطلبات

تشهد مراكز البيانات الحديثة تحولًا أساسيًا مدفوعًا بالذكاء الاصطناعي والحوسبة عالية الأداء (HPC) والتحليلات في الوقت الحقيقي.هذه الأحمال العاملة تتطلب أداء شبكة غير مسبوق ليس فقط عرض النطاق الترددي الخام، ولكن تأخيرًا منخفضًا محددًا ، وحركة البيانات الفعالة لمعالجة المعالجة المركزية ، والقدرة على التوسع السلسة. أصبحت محولات Ethernet التقليدية ، التي تعتمد على كومة TCP / IP القائمة على البرمجيات ، خنقًا كبيرًا ،تستهلك 20 ٪ إلى 30 ٪ من نواة وحدة المعالجة المركزية وتقدم تباينات متأخرة لا يمكن التنبؤ بها تدهور أداء التطبيقبالنسبة للمنظمات العاملة على نطاق واسع، فإن هذه عدم الكفاءة تترجم مباشرة إلى ارتفاع تكاليف البنية التحتية وأبطأ وقت التعرف.

تقدم هذه الورقة البيضاء حلًا تقنيًا شاملًا يركز علىNVIDIA Mellanox MCX556A-ECATمصممة للمؤسسات التي تسعى لتحقيق أقصى قدر من العائد على استثماراتها في 100GbE،بطاقة مكيج 556A-ECAT Ethernetتوفر RDMA المتسارعة بالأجهزة عبر Ethernet المتقاربة (RoCE) ، مما يتيح نقلًا دون خسائر ونقص في التأخير الذي يحول إدخال الشبكة إلى أصل استراتيجي.تم تصميم الحل خصيصا لتحقيق ثلاثة أهداف أساسية: (1) تحقيق تأخير التطبيقات من نهاية إلى نهاية أقل من 10μs ، (2) خفض تكاليف معالجة شبكة وحدة المعالجة المركزية إلى أقل من 5٪ ، و (3) توفير أساس قابل للتوسع ومؤكد للمستقبل لـ 100GbE وما بعده.

2تصميم بنية الشبكة والنظام بشكل عام

تتبنى الهندسة المعمارية الموصى بها توبولوجيا العمود الفقري الأوراق عالية الأداء مع 100GbE كطبقة الوصول إلى الخادم و 400GbE uplinks إلى العمود الفقري. في جوهر هذا التصميم هوبطاقة الشبكة PCIe MCX556A-ECAT ConnectX، يتم نشرها في كل عقدة الحوسبة والتخزين عبر النسيج. بنيت الهندسة المعمارية حول خمسة مبادئ رئيسية:

  • نسيج إيثرنت بدون خسارة:الاستفادة من RoCE v2 مع PFC (تحكم تدفق الأولوية) و ECN (إخطار الازدحام الصريح) عبر جميع المفاتيح للقضاء على انخفاض الحزم وضمان تأخير محدد لحركة RDMA.
  • تحميل الأجهزة في كل مكان:تحميل معالجة طبقة النقل بما في ذلك تحميل مجموعات التحقق ، والجزء (LSO / LRO) ، ووضع علامات VLAN ، و RDMA إلى المحول ، مما يحرر دورات وحدة المعالجة المركزية من أجل منطق التطبيق.
  • التكرار النشط النشطاستخدام كل من منافذ QSFP28 في وضع تجميع الروابط (LACP) لنطاق النطاق الترددي المجمع 200Gb / s وتغيير الفشل التلقائي مع استرداد ثانوي.
  • تقسيم حركة المرورفئات حركة المرور المخصصة للتخزين (NVMe-oF) ، والحساب (MPI / RDMA) ، وحركة المرور الإدارية ، مما يضمن جودة خدمة قابلة للتنبؤ عبر جميع أحمال العمل.
  • طائرة التحكم القابلة للتوسع:إدارة مركزية عبر محولات NVIDIA Spectrum مع قياسات عن بعد متضمنة وأتمتة من خلال واجهات برمجة التطبيقات REST وكتب اللعب Ansible.

الحل هو تمامامتوافق مع MCX556A-ECATمع منصات الخادم الرائدة (Dell PowerEdge ، HPE ProLiant ، Supermicro ، Lenovo) ويتكامل بسلاسة مع أنظمة التشغيل الرئيسية (Linux ، Windows Server ، VMware ESXi).المعمار يدعم NVMe-oF عبر RoCE، مما يتيح التخزين الممزق المشترك مع فترات تأخير تقترب من محركات NVMe المحلية.

3الدور والميزات الرئيسية لـ NVIDIA Mellanox MCX556A-ECAT

كمكون أساسي لهذا الحل،NVIDIA Mellanox MCX556A-ECATيخدم ثلاثة أدوار حاسمة داخل العمارة:

الوظيفة تفاصيل التنفيذ الفائدة التجارية
محرك RDMA/RoCE RoCE v2 القائم على الأجهزة مع دعم ECN / PFC ، تأخير أقل من 0.8μs مشاركة تقريباً صفر في وحدة المعالجة المركزية لحركة البيانات؛ أداء محدد
منفذين 100GbE منفذين مستقلين من QSFP28 ، مع معدل عرض إجمالي 200Gb / s ربط النشط النشط للعرض النطاق الترددي؛ الاستعداد النشط للتكرار
التطبيق الافتراضي وتفريغ التغطية SR-IOV مع ما يصل إلى 128 VF لكل منفذ؛ VXLAN/NVGRE تحميل الأجهزة مستأجرات متعددة ذات كثافة عالية مع أداء معدل الخط والعزل

المواصفات التقنية الرئيسيةورقة بيانات MCX556A-ECATتتضمن واجهة PCIe 3.0/4.0 x16 المضيف، وقدرات شمولية للخروج من الحمولة (مجموع التحقق، LSO / LRO، VLAN stripping / insertion، RSS) ، والقياس عن بعد المتقدم لكل منفذ.كفاءة طاقة المحول (عادة أقل من 15 واط) ودعم النظام التشغيلي الواسع يجعله كتلة بناء متعددة الاستخدامات للبيئات المتباينة.مواصفات MCX556A-ECATكما يسلط الضوء على دعم 25GbE و 40GbE التوافق، مما يوفر المرونة في النشر للبيئات المختلطة السرعة.

4توصيات النشر والتوسع

بالنسبة للتنفيذات الخضراء ، نوصي بتوصيف طوبولوجيا صفحة العمود الفقري من مستويين مع وصول 100GbE و 400GbE Uplinks العمود الفقري. يستضيف كل خادم واحدبطاقة مكيج 556A-ECAT Ethernetمع كل من منافذ QSFP28 متصلة إلى مفاتيح ورقة منفصلة للتكرار. يتطلب نسيج RoCE تكوينًا متسقًا لجودة الخدمة عبر جميع المفاتيح ، على وجه التحديد ،PFC على الأولوية 3 (للحركة RDMA) والأولوية 4 (للتخزين)، مع علامة ECN على نفس فئات حركة المرور. نوصي بتخصيص شبكات VLAN مخصصة لـ RoCE وإدارة وحركة التخزين لتبسيط المراقبة وإصلاح الأخطاء.

لبيئات الحقل البني مع البنية التحتية الحالية 40GbE،حل البطاقات المتكاملة MCX556A-ECAT Ethernetيقدم مسار هجرة لطيف. نظرًا لأن المحول متوافق مع 40GbE QSFP + البصريات ، يمكن إعادة استخدام الكابلات الموجودة أثناء الترقية التدريجية إلى 100GbE.كما يدعم المحول التبديل القياسي لـ Ethernet دون تمكين RoCE الإلزامي، مما يسمح للفرق بنشر الأجهزة أولاً وتفعيل قدرات RDMA في مراحل مع نضج النسيج وحملات العمل تبرر الانتقال.

يقدم توسيع الحل إلى ما وراء 50 عقدة اعتبارات إضافية.نوصي بتنفيذ استراتيجية خاصة لإدارة الازدحام RoCE باستخدام مفاتيح NVIDIA Spectrum مع قياس المدى المدمج وتعديل عتبة ECN الديناميكيةبالنسبة للمجموعات التي تتجاوز 200 عقدة، فكر في نشر وحدة تحكم مركزية لإدارة النسيج (على سبيل المثال، NVIDIA Cumulus NetQ) للحفاظ على الرؤية من النهاية إلى النهاية وتوافق التكوين الآلي.الـMCX556A-ECAT للبيعمن خلال شركاء قناة NVIDIA العالمية يتضمن ضمانًا شاملًا ودعم تحديث البرمجيات الثابتة ، مما يضمن موثوقية طويلة الأجل على نطاق واسع.

5العمليات، المراقبة، حل المشاكل وتحسين

يتطلب التشغيل الفعال لنسيج RoCE استراتيجية مراقبة وإصلاح مشاكل متعددة الطبقات:

  • "القياس عن بعد على مستوى المحول"الـمواصفات MCX556A-ECATتشمل العدادات لكل منفذ لإطارات PFC ، والحزم المميزة بـ ECN ، والإطارات المنسوبة ، وأخطاء الرابط.5 ملم,إيثتول، أو أدوات برمجيات NVIDIA لتصدير هذه المقاييس إلى لوحات Prometheus / Grafana.
  • مراقبة مستوى التبديل:مراقبة احتلال العازل، عدد الإطار توقف، عمق الطابور، ومعدلات علامة ECN على العمود الفقري والورق المفتاحات.الزيادات المفاجئة في إطارات التوقف تشير إلى الازدحام الدقيق الذي قد يتطلب ضبط عتبة ECN.
  • مقاييس مستوى التطبيق:بالنسبة لتطبيقات RDMA ، تتبع فترات تأخر إكمال WR (طلب العمل) ، وأحداث التفريغ CQ (صفوف الإكمال) ، وعدد أخطاء QP (صفوف الزوج) باستخدام مكتبات NVIDIA libibverbs و rdma-core.

السيناريوهات الشائعة لحل المشاكل والإجراءات الموصى بها:

  • تدهور أداء RoCE:تأكد من تم تمكين PFC على جميع منافذ المفتاح وأن علامة DSCP تتطابق مع تكوين المفتاح.ورقة بيانات MCX556A-ECATللتحقق من صحة إعدادات تخصيص العازل مقابل القيم الموصى بها لملف تحميل العمل الخاص بك.
  • الخطأ في التشغيل أو الخطأ في CRC:تحقق من جودة كابل QSFP28 وتأكد من تحديث برمجيات جهاز التكيف إلى أحدث إصدار. تحقق من أن الكابلات تلبي مواصفات IEEE 802.3bj لـ 100GBASE-SR4 أو LR4.
  • وحدة المعالجة المركزية لا تزال عالية على الرغم من التحميل:تأكيد أن RDMA يتم استخدامه بالفعل (لا يعود إلى TCP) عن طريق فحص عدادات السائقين وسجلات التطبيقات وحالات الاتصال.
  • تعطل PFC أو توقف العاصفة:تحقق من وجود أولويات غير مرتبة بشكل صحيح، وتأكد من تمكين PFC فقط على فئات حركة RoCE (وليس على حركة الإدارة أو التخزين).

من أجل التحسين، نوصي بالمعايير التالية المعتمدة على التحقق من صحة المختبر:

  • انقطاع التجميع (الاعتدال):تعيين إلى 4 ¢ 8 ميكرو ثانية لحملات العمل المختلطة (التداول + التخزين) لتحقيق التوازن بين فترة الكمون وكفاءة وحدة المعالجة المركزية.
  • وحدة RDMA:زيادة إلى 4096 بايت لحملات عمل التخزين لتقليل تكاليف البروتوكول وتحسين الناتج.
  • الرسائل الرسومية (توسيع نطاق جانب الاستقبال):تكوين عبر العديد من نواة وحدة المعالجة المركزية للحركة غير RDMA لتوزيع المعالجة وتجنب تشبع النواة الواحدة.
  • عتبات ECN:حدد الحد الأدنى للحد عند 50% من العازل والحد الأقصى عند 80% للحركة ذات الأولوية 3، مع تعديل على أساس أنماط الازدحام الملاحظة.

6ملخص وتقييم القيمة

الـNVIDIA Mellanox MCX556A-ECATيقدم هذا الحل قيمة تحويلية لمراكز البيانات الحديثة. من خلال استبدال TCP/IP القائم على البرمجيات بـ RDMA/RoCE المتسارعة بالأجهزة،يمكن للمنظمات تحقيق تخفيضات في فترة تأخير على مستوى التطبيق بنسبة 5 × 10، تخفيض تكاليف شبكة وحدة المعالجة المركزية بنسبة تزيد عن 80٪ وزيادة كثافة حاويات الخادم بنسبة 30٪ إلى 50٪.بطاقة مكيج 556A-ECAT Ethernetيوفر مسارًا فعالًا من حيث التكلفة لاعتماد 100GbE مع حماية الاستثمار من خلال التوافق مع 40GbE والقدرات المستقبلية على التخلص من الحمولة لأحمال العمل الناشئة.

عند تقييم التكلفة الإجمالية للملكيةسعر MCX556A-ECATيتم تعويضها من خلال وفورات تشغيلية كبيرة: عدد خادمات أقل (بسبب ارتفاع الاستخدام) ، وتكاليف تبريد أقل (بفضل استهلاك الطاقة < 15W) ،وإزالة أنسجة InfiniBand منفصلة أو أنسجة RDMA خاصة. الحل هو تمامامتوافق مع MCX556A-ECATمع الأنظمة البيئية الرئيسية مفتوحة المصدر والشركات ، بما في ذلك Kubernetes و Apache Spark و TensorFlow و VMware vSphere ، مما يضمن قابلية التطبيق الواسعة عبر الشركات و HPC و التطبيقات السحابية الأصلية.

للحصول على نصوص نشر مفصلة، قوالب تكوين، وتقارير مقارنة الأداء، يرجى الرجوع إلى الرسميورقة بيانات MCX556A-ECATوبوابة توثيق الشبكات الشاملة لشركة NVIDIA. هذه الورقة البيضاء بمثابة أساسوالفوائد قابلة للقياس.بطاقة الشبكة PCIe MCX556A-ECAT ConnectXليس مجرد محول، بل هو محفز استراتيجي لمراكز البيانات المستقبلية المعدة لـ RDMA ومُحسّنة للسرعة.