إنفينيباند مقابل رو سي إي مقابل إيثرنت عادي: اختيار البنية التحتية في عام 2026

تظهر ثلاثة خيارات نقل في كل طلب عروض أسعار لمجموعة حوسبة الذكاء الاصطناعي متعددة العقد: InfiniBand وRoCE وTCP/IP Ethernet. ليست هذه الخيارات ثلاث نقاط على خط واحد، بل هي ثلاث فلسفات هندسية مختلفة: بنية الحوسبة عالية الأداء المصممة بدون فقدان للبيانات، وشبكة Ethernet المُحسّنة بدون فقدان للبيانات، وبروتوكول الشبكة المستخدم في باقي الحوسبة. ولكل منها تكلفة مختلفة، وبصمة تشغيلية مختلفة، وإجابات صحيحة مختلفة تمامًا بحسب نوع البنية التي يتم بناؤها.

تشرح هذه المقالة ماهية كل منها، وأين تذهب زمن الاستجابة والأموال فعليًا في عام 2026، وأين يقع الخط الفاصل بين "نحن بحاجة إلى RDMA" و"نحن بحاجة إلى RDMA وInfiniBand تحديدًا". نختتم بمصفوفة قرار مسطحة.

الجمهور المستهدف: الأشخاص الذين يُحددون حجم مجموعة ذكاء اصطناعي تتراوح بين 2 و32 عقدة، ويحاولون تحديد ما إذا كان بند محول InfiniBand في الميزانية مُبررًا أم مُبالغًا فيه. يُرجى الرجوع إلى N01 للاطلاع على أساسيات 25/100 جيجابت إيثرنت، و N06 للاطلاع على ميزانية زمن الاستجابة الأساسية، و N07 للاطلاع على إعدادات التوجيه، و N08 للاطلاع على التشغيل العملي لتقنية RDMA.

ثلاثة أنواع من الأقمشة، ما هو كل منها في الواقع

إنفيني باند الأصلي هي بنية حاسوبية مصممة خصيصًا للحوسبة عالية الأداء. طبقة الربط مصممة لتكون خالية من الفقدان - التحكم في التدفق القائم على الرصيد يعني أن المرسل لا يرسل أبدًا إلا إذا كان لدى المستقبل مساحة تخزين مؤقتة، لذلك لا يتم إسقاط الحزم بسبب الازدحام كما هو الحال في الإيثرنت. التوجيه مركزي: كل بنية حاسوبية لديها مدير شبكة فرعية ( opensm عملية (أو وحدة إدارة مُدمجة على مُبدِّل مُدار) تُخصِّص مُعرِّفات الأجهزة، وتحسب المسارات، وتُعيد التكوين عند تغيير بنية الشبكة. واجهة التطبيق هي واجهة برمجة التطبيقات للأفعال. ibv_post_send، أزواج قوائم الانتظار، قوائم انتظار الإكمال، مناطق الذاكرة - نفس واجهة برمجة التطبيقات التي استعارها باقي عالم RDMA.

في عام 2026، سيتم نشر الجيل NDR (بسرعة 400 جيجابت/ثانية لكل منفذ، وConnectX-7، ومفاتيح Quantum-2). أما الجيل XDR (بسرعة 800 جيجابت/ثانية، وConnectX-8، وQuantum-X800) فسيتم شحنه هذا العام إلى مراكز البيانات الضخمة ومختبرات الذكاء الاصطناعي؛ وقد نشرت IBTA مواصفات XDR في عام 2023، وأصبح إنتاج السيليكون متوفرًا بكميات كبيرة. يبلغ زمن استجابة التبديل أقل من 100 نانوثانية على شريحة NDR ذات التوصيل المباشر - وهو الأدنى المتاح تجاريًا، وقد ظل الأدنى بفارق أربعة أضعاف تقريبًا على مدى عقدين من الزمن.

RoCEv2 (RDMA عبر إيثرنت متقارب، الإصدار 2) هو نفس واجهة برمجة تطبيقات أفعال RDMA التي تعمل على UDP/IP عبر الإيثرنت. شريحة بطاقة الشبكة، في ConnectX-7 أو ConnectX-8، هي نفس الشريحة تمامًا كإصدار InfiniBand — علامة البرامج الثابتة (LINK_TYPE_P1 = 1 بالنسبة لبرنامج البكالوريا الدولية، 2 بالنسبة لشبكة الإيثرنت، يقوم بروتوكول RoCE بتغيير الوضع بين الأوضاع. لكن ما ليس مجانيًا هو أن الإيثرنت يعاني من فقدان البيانات افتراضيًا، بينما يفترض بروتوكول RDMA نقل البيانات بدون فقدان. لذا، يتطلب نشر RoCE أن تتصرف البنية التحتية مثل InfiniBand على مستوى طبقة الربط، ما يعني استخدام التحكم في تدفق الأولوية (PFC) لكبح الطوارئ قصير المدى، وECN لإشارة الازدحام طويلة المدى، وحلقة تحكم مثل DCQCN لربطهما معًا. هذا هو العمل المطلوب لتكوين RoCE - والمخاطر التشغيلية - التي تميزه عن الإيثرنت العادي. عند تنفيذه بشكل صحيح، يقترب زمن استجابة RoCEv2 من زمن استجابة InfiniBand: من 1.5 إلى 2.5 ميكروثانية لزمن استجابة RDMA على نفس المحول، مقابل حوالي 1 ميكروثانية لـ InfiniBand.

شبكة إيثرنت TCP/IP العادية هي الشبكة الرئيسية في العالم. واجهة برمجة تطبيقات المقابس، ومكدس الشبكة الخاص بنواة النظام، بدون RDMA، ولا ضمان لنقل البيانات بدون فقدان. يتراوح الأداء بين 10 و30 ميكروثانية لكل اتجاه لكل N06 ، ومعدل نقل البيانات مناسب لسرعة خط بطاقة الشبكة لنقل البيانات بكميات كبيرة، ووحدة المعالجة المركزية موجودة على مسار البيانات. هذه هي البنية المناسبة لحركة بيانات الإدارة، وتنزيل النماذج، والقياس عن بُعد، وسرعة جيجابت بين الروبوت وخادم الاستدلال. لكنها ليست البنية المناسبة لعمليات AllReduce المتزامنة للتدرج عبر 16 وحدة معالجة رسومية.

مقارنة العناوين الرئيسية

الممتلكات إنفينيباند NDR RoCEv2 (100 جيجابت إيثرنت) بروتوكول TCP عادي بسرعة 100 جيجابت إيثرنت
سرعة كل منفذ (السرعة السائدة 2026) 400 Gb / s 100-400 جيجابت/ثانية 100 Gb / s
زمن استجابة RDMA على نفس المحول، 64 بايت ~1 ميكروثانية 1.5-2.5 ميكرومتر غير متوفر (بدون RDMA)
زمن استجابة قفزة التبديل <100 نانوثانية 400–600 نانوثانية 400 نانوثانية – 3 ميكروثانية
زمن استجابة المقابس (مكدس النواة) ن / أ ن / أ 20-60 ميكرومتر
طبقة ربط بدون فقدان نعم، هذا مقصود. تم ضبطه (PFC + ECN) لا
التوجيه SM، حتمي ECMP + تكيفي ECMP / معيار L2/L3
سيليكون NIC ConnectX-7/8 ConnectX-7/8 (نفس الشريحة) اي
التكلفة النسبية لكل منفذ ~$$$ ~$$ ~$
التعقيد التشغيلي متوسط ​​(SM، لكن به عدد قليل من المقابض) ضبط عالي (PFC/ECN/DCQCN) منخفض
تركيز البائعين حصريًا لـ NVIDIA نفيديا، برودكوم، أيه إم دي/بينساندو، سيسكو، أريستا أي شخص

اقرأ جدول التكلفة كنسبة مئوية، وليس كقيمة مطلقة. يبلغ الفرق الحقيقي في سعر المحولات حوالي ضعفين إلى ثلاثة أضعاف لكل منفذ بين محول InfiniBand NDR ومحول إيثرنت مكافئ من فئة الذكاء الاصطناعي (Spectrum-X، Tomahawk 5/6). بطاقة الشبكة نفسها هي نفسها تقريبًا في كلا الوضعين؛ والفرق يكمن في الترخيص وعقد الدعم.

أين يذهب زمن الاستجابة

يستغرق N06 رحلة ذهاب وإياب واحدة عبر RDMA بفارق ميكروثانية واحدة. النسخة المختصرة ذات الصلة بهذه المقارنة:

هوب إنفينيباند NDR RoCEv2 100 جيجابت إيثرنت بروتوكول TCP عادي بسرعة 100 جيجابت إيثرنت
NIC TX (أفعال) 0.3-0.5 ميكرومتر 0.3-0.5 ميكرومتر ن / أ
تبديل القفزة (فردي) <0.1 ميكروثانية 0.4-0.6 ميكرومتر 0.4-3 ميكرومتر
سلك (10 أمتار) شنومكس نس شنومكس نس شنومكس نس
NIC RX 0.3-0.5 ميكرومتر 0.3-0.5 ميكرومتر ن / أ
بروتوكول TCP/IP أحادي الاتجاه في نواة النظام ن / أ ن / أ 10-30 ميكرومتر
التطبيق (نسخ الذاكرة، التسلسل) 0.1-1 ميكرومتر 0.1-1 ميكرومتر 1-10 ميكرومتر
مفتاح أحادي الاتجاه بالكامل ~1 ميكروثانية ~1.2–2 ميكروثانية ~15–40 ميكروثانية

يتفوق نظام InfiniBand في زمن استجابة ASIC للمحولات - وهذه هي الفجوة التي لم تُسد بعد. تصل محولات إيثرنت الحديثة للذكاء الاصطناعي (Spectrum-X SN5600 / Tomahawk 5) إلى زمن استجابة يتراوح بين 400 و600 نانوثانية لكل قفزة، وهو زمن تنافسي لدرجة أن الفرق المطلق عبر بنية Leaf-Spine ثنائية القفزة يبلغ حوالي 1 ميكروثانية. هذا الأمر مهم لعمليات التجميع المتوازية الدقيقة باستخدام الموترات، ولكنه غير مهم لعمليات قراءة البيانات من وحدات التخزين أو الاستدلال المجمع.

يُثير عمود TCP العادي مخاوف من لا يعرفون سوى زمن الاستجابة من المقابس. تبلغ تكلفة النواة 10-30 ميكروثانية لكل حزمة؛ وفي حالة الرسائل الصغيرة ذات الرحلات المتعددة، تتراكم هذه التكلفة بسرعة. يُعدّ NCCL عبر TCP فعالاً، ولكنه الخيار الأخير.

عرض النطاق الترددي وواقع بطاقة الشبكة

في عام 2026، ستغطي نفس مجموعة البطاقات كلاً من InfiniBand وRoCE:

NIC المعالم لكل منفذ بكيي
ConnectX-6 DX IB HDR / RoCE 100 GbE 200 / 100 جيجابت/ثانية Gen4
برنامج ConnectX-7 IB NDR / RoCE 400 GbE 400 Gb / s Gen5
كونيكت إكس-8 سوبرنيك IB XDR / RoCE 800 GbE 800 Gb / s Gen6
بلوفيلد-3 دي بي يو IB NDR / RoCE 400 جيجابت + إلغاء التحميل 400 Gb / s Gen5
برودكوم ثور 2 / ثور 3 إيثرنت RoCE فقط سرعة تصل إلى 800 جيجابت/ثانية الجيل الرابع/الخامس
AMD Pensando Pollara 400 RoCE / Ultra Ethernet 400 Gb / s Gen5

العنوان الرئيسي: بطاقة ConnectX-7 التي تشتريها لـ IB هي نفسها التي تشتريها لـ RoCE. يتراوح سعرها في أوائل عام 2026 بين 1,500 و2,200 يورو لبطاقة NDR أحادية المنفذ؛ أما النسخة المعدلة فتُهيئ البرامج الثابتة مسبقًا. لهذا السبب، فإن "التحويل من IB إلى RoCE" لا يعني إعادة شراء بطاقة الشبكة في معظم المجموعات، بل هو تغيير في البرامج الثابتة، واستبدال جهاز الإرسال والاستقبال، وتغيير في بنية التبديل.

من جانب AMD، تُعدّ بطاقة Pensando Pollara 400 (المتوفرة حاليًا مع منصتي MI300X/MI325) أول بطاقة شبكة RDMA موثوقة من غير NVIDIA تُستخدم في تطبيقات الذكاء الاصطناعي الإنتاجية. أعلنت Broadcom عن بطاقة شبكة 800G AI في عام 2025 (جيل Thor Ultra / Thor 3). ولأول مرة منذ عقد، لم يعد سوق بطاقات شبكة RDMA حكرًا على مُصنِّع واحد.

نقاط التحويل: حيث توجد الأموال فعلياً

سعر بطاقة الشبكة متقارب في جميع الأوضاع، أما سعر المحول فليس كذلك.

فئة التبديل السعة قائمة تقريبية، لكل ميناء، 2026
NVIDIA Quantum-2 QM9700 (64× 400G NDR IB) 51.2 Tb / s $$$$ (ما يعادل 3 أضعاف سرعة الإيثرنت تقريبًا)
NVIDIA Quantum-X800 (XDR IB) 115.2 Tb / s $ $ $ $ $
NVIDIA Spectrum-X SN5600 (64× 800G Eth) 51.2 Tb / s $ $ $
Broadcom Tomahawk 5 reference (51.2 Tb/s) 51.2 Tb / s $$
برودكوم توماهوك 6 (102.4 تيرابايت/ثانية) 102.4 Tb / s $$$ (أحدث، مميز)
ورقة بيانات عامة بسرعة 100 جيجابت إيثرنت (فئة مركز البيانات) 6.4–12.8 تيرابايت/ثانية $

ظلّت الزيادة في سعر منفذ InfiniBand، والتي تتراوح بين ضعفين إلى ثلاثة أضعاف، ثابتةً لسنوات. إنها تكلفة حقيقية: يتراوح سعر محوّل Quantum-2 NDR ذي 64 منفذًا بين 120 ألفًا و180 ألف يورو، اعتمادًا على البصريات والدعم؛ بينما يتراوح سعر محوّل Spectrum-X SN5600 ذي 64 منفذًا، والذي يحمل عددًا مماثلًا من المنافذ، بين 60 ألفًا و90 ألف يورو؛ أما محوّل Tomahawk 5 العادي من شركة تصنيع تايوانية، فيمكن أن يكون سعره نصف ذلك. وإذا أضفنا البصريات - حيث تتراوح أسعار أجهزة الإرسال والاستقبال OSFP NDR بين 600 و1,200 يورو للوحدة عند الشراء بكميات كبيرة - فإنّ الفارق في السعر الإجمالي لكل منفذ يزداد اتساعًا.

حيث لا يتسع نطاق التوصيل بالقدر المتوقع: كابلات الألياف الضوئية النشطة (AOC) وكابلات النحاس ذات التوصيل المباشر (DAC) للتوصيلات داخل الرفوف. يبلغ سعر كابل DAC بطول 3 أمتار حوالي 100-200 يورو في كلا النظامين. تظهر التكلفة الباهظة للألياف الضوئية فقط عند تجاوز طول 5 أمتار تقريبًا، وعند الحاجة إلى أجهزة إرسال واستقبال أحادية/منخفضة المدى (SR/LR) على كلا الطرفين.

زاوية Spectrum-X: عرض NVIDIA لتقنية "إيثرنت الذكاء الاصطناعي"

يتمثل رد NVIDIA الاستراتيجي على التحول إلى الإيثرنت في Spectrum-X، وهي حزمة من رقائق التبديل Spectrum-4 (والآن Spectrum-5)، وبطاقات الشبكة BlueField/ConnectX، ونظام تحكم شامل في الازدحام يُطلق عليه اسم "التوجيه التكيفي + موازنة الأحمال القائمة على القياس عن بُعد". ويزعم التسويق أن Spectrum-X يوفر أداءً مماثلاً لأداء AllReduce في InfiniBand على الإيثرنت، وقد تم التحقق من ذلك على أحمال عمل تدريب الذكاء الاصطناعي الحقيقية.

الواقع المقاس، من معايير NVIDIA الخاصة ومن جهات خارجية:

  • يُقلّص Spectrum-X ما يقارب 80-90% من فجوة الأداء بين AllReduce وInfiniBand NDR في أحمال عمل NCCL. أما الفجوة المتبقية فتتمثل في الرسائل الصغيرة وسلوكيات الحالات القصوى.
  • يكمن سرّ نجاح Spectrum-X في التوجيه التكيفي لكل حزمة (الذي يوزع الحزم عبر مسارات متعددة ويعيد ترتيبها عند المُستقبِل). تعتمد تقنية ECMP القياسية على تجزئة التدفقات الكاملة، مما يُنتج نقاط ضعف في بيئات العمل ذات التدفقات المنخفضة في تطبيقات الذكاء الاصطناعي. أما Spectrum-X، فيُخالف هذا الافتراض.
  • لا يعمل إلا كمجموعة. عند دمج بطاقة شبكة غير تابعة لشركة NVIDIA مع محول Spectrum، ينقطع مسار بيانات القياس عن بُعد للتوجيه التكيفي. هذه هي مقايضة التقييد - أنت تخرج من نظام InfiniBand البيئي لتعود إليه عبر الإيثرنت.

بصراحة، يُعدّ Spectrum-X حلاً هندسياً حقيقياً لمشكلة حقيقية. كما أنه يُبقي NVIDIA على اطلاع دائم بكل طبقة من طبقات مجموعة الذكاء الاصطناعي، وهو ما دفع مُزوّدي خدمات الحوسبة السحابية العملاقة إلى اختيار الإيثرنت لتجنبه. ويعتمد صواب هذا القرار على ما إذا كانت فجوة الأداء المتبقية بنسبة 10-20% تستحق التضحية بحرية التكامل الإضافية.

الحل البديل من NVIDIA هو Ultra Ethernet - مواصفات UEC 1.0 التي نُشرت عام 2025، بدعم من AMD وBroadcom وCisco وHPE وIntel وMeta وMicrosoft. تتميز هذه المواصفات بتعدد مسارات نقل البيانات، وموازنة الأحمال على مستوى الحزم، والتحكم في ازدحام الشبكة، وواجهة برمجة تطبيقات مفتوحة (API). تُعدّ بطاقتا Pensando Pollara وBroadcom Thor 3 أولى بطاقات الشبكة التي تدعم UEC. وبحلول منتصف عام 2026، أصبح هذا المسار الموثوق لتقنية Ethernet في تطبيقات الذكاء الاصطناعي، والذي لا يتطلب استخدام حزمة NVIDIA بشكل كامل.

سياق الحوسبة السحابية الضخمة (وما يعنيه ذلك بالنسبة لنا جميعًا)

أبرز ما جاء في العامين الماضيين: تخلّت شركات الحوسبة السحابية العملاقة إلى حد كبير عن تقنية إنفينيباند. درّبت شركة ميتا نموذج لاما 3 باستخدام عائد رأس المال المستثمر (RoCE). تعتمد بنية الذكاء الاصطناعي في AWS على الإيثرنت بشكل كامل. لطالما كانت وحدات معالجة الموتر (TPU) من جوجل مصممة خصيصًا، لكن أساطيل وحدات معالجة الرسومات (GPU) الخاصة بها تعمل على الإيثرنت. تستخدم مايكروسوفت أزور مزيجًا من التقنيات وتستثمر بكثافة في الإيثرنت في عمليات الإنشاء الجديدة. وفقًا لبيانات أرباح برودكوم، اختارت حوالي 70% من عمليات نشر البنية التحتية الجديدة للذكاء الاصطناعي في أوائل عام 2026 الإيثرنت بدلًا من إنفينيباند، وهو ما يمثل تحولًا عن حصة إنفينيباند التي بلغت حوالي 80% في عام 2023.

كان استنتاج ميتا المنشور واضحًا لا لبس فيه: توفر تقنيتا RoCEv2 وInfiniBand المُحسّنتان بشكل صحيح أداءً تدريبيًا متكافئًا على أحمال العمل الخاصة بهما. لا يتعلق التحول بالأداء الخام، بل يتعلق بمن يملك شريحة السيليكون، ومن يوظف مهندسي موثوقية الموقع، وكيفية الحصول على المكونات، وما إذا كان النموذج التشغيلي يتكامل مع بقية مركز البيانات.

ثلاثة أمور مهمة بالنسبة لنا نحن الباقين، الذين لا نشغل أجهزة تدريب تحتوي على 10,000 وحدة معالجة رسومية:

  1. لقد حُسمت مسألة "هل يمكن لشبكة الإيثرنت القيام بالذكاء الاصطناعي؟". نعم، هذا ممكن. يُعدّ RoCEv2 المزود بشرائح تبديل الذكاء الاصطناعي الحديثة ونظام التحكم الأمثل في الازدحام جاهزًا للاستخدام في الإنتاج. وقد أثبتت شركات الحوسبة السحابية العملاقة ذلك. لم تعد بحاجة إلى تبرير اختيارك في طلب عرض الأسعار.
  2. لقد تغيرت الخبرة التشغيلية مع تطور السيليكون. قبل خمس سنوات، كان هناك ثلاثة أشخاص في بلدكم قادرين على تشغيل شبكة InfiniBand، وشخص واحد فقط قادر على ضبط PFC/DCQCN على RoCE. أما اليوم، فقد انتشرت مهارات RoCE على نطاق أوسع بكثير، بينما تتركز مهارات InfiniBand في مختبرات الحوسبة عالية الأداء وشركاء NVIDIA. لذا، خططوا لتوفير الكوادر بناءً على ذلك.
  3. انقلبت قصة احتكار الموردين. لطالما كانت تقنية InfiniBand حكرًا على مُصنِّع واحد (NVIDIA، المعروفة سابقًا باسم Mellanox). وكان الإيثرنت هو البديل المفتوح - إلى أن طرحت Spectrum-X حلول NVIDIA الشاملة على الإيثرنت أيضًا. أما الحل الأمثل المحايد تمامًا في عام 2026 فهو تقنية RoCE من فئة UEC مع معالجات Broadcom أو AMD.

متى يكون إنفينيباند هو الخيار الأمثل

يُعدّ نظام InfiniBand هو الحل الأمثل عندما تكون معظم هذه الحالات صحيحة:

  • مجموعة تدريب مخصصة، تضم أكثر من 16 عقدة، تشغيل خوارزمية التدرج المتزامن AllReduce بمعدلات ثابتة. وتتضاعف ميزة زمن الاستجابة في الطرف الجماعي الصغير عبر آلاف التكرارات.
  • أنت تشتري أنظمة NVIDIA HGX أو DGX على أي حال. صُممت هذه اللوحات الأساسية لتتوافق مع تقنية NDR/XDR. إن دمج تقنية الإيثرنت على عقدة DGX أمر غير عملي من الناحية التشغيلية.
  • لديك خبرة ضمن فريق العمل الذي يعرف مدير الشبكة الفرعية، يمكنه القراءة ibtracert مخرجات، وهو مرتاح لإدارة UFM من NVIDIA.
  • تدعم الميزانية زيادة في سعر المحول لكل منفذ بمقدار 2-3 أضعاف دون الإخلال بالاقتصاديات الجماعية.
  • إن التجمع هو الغرض الأساسي من المبنى. نشر HPC/AI خالص بدون مستأجرين تخزين مشتركين وبدون حركة مرور التطبيقات - يعمل InfiniBand على تبسيط النموذج التشغيلي لأنه لا توجد حجة QoS.

إذا انطبقت ثلاثة من هذه الشروط الخمسة على حالتك، فإنّ InfiniBand يستحق ثمنه. أما إذا انطبق شرط واحد فقط، فأنت تدفع ثمن نسيج مُصمّم خصيصاً لمشكلة شخص آخر.

عندما يكون RoCEv2 هو الاستدعاء العملي

يُعدّ معدل العائد على رأس المال المستثمر (RoCE) هو الإجابة الصحيحة لأكبر شريحة من قاعدة عملاء شركة كينتينو:

  • من 4 إلى 16 عقدة، أحمال عمل مختلطة، التدريب والاستدلال والتخزين على نفس النسيج.
  • مراعاة الميزانية ولكن يتطلب RDMA. تقوم المجموعة بتدريب متعدد العقد أو استدلال موزع بما يكفي بحيث يكون عبء مكدس النواة لبروتوكول TCP العادي غير مقبول، ولكن علاوة تبديل InfiniBand غير مقبولة.
  • شبكة مشتركة مع حركة مرور غير مدعومة بالذكاء الاصطناعي. تعتمد عمليات التشغيل والتخزين ووصول المطورين جميعها على نفس شبكة الإيثرنت. ويتعايش بروتوكول RoCE مع ذلك؛ بينما يحتاج بروتوكول InfiniBand إلى طبقة مادية خاصة به.
  • أنت تريد خيارات متعددة للبائعين. يمكن دمج محولات Broadcom مع بطاقات الشبكة NVIDIA مع عقد AMD MI300. يسمح نظام Ethernet بذلك، بينما لا يسمح به نظام InfiniBand.
  • يتمتع الفريق بالفعل بخبرة تشغيلية واسعة في مجال الإيثرنت. ضبط PFC/ECN عملٌ شاق، ولكنه عملٌ على بنية أساسية يعرفها الجميع. وحدة SM في ذهنك هي مستوى التحكم L2/L3 الذي استخدمته لسنوات.

الفخ الذي يجب التنبيه إليه: سوء تكوين RoCEv2 أسوأ من TCP العادي. قد تؤدي عواصف توقف PFC عبر بنية غير مجزأة إلى تعطيل مستوى الإدارة. ينتج عن ضبط عتبات ECN بشكل خاطئ بنية تبدو سليمة في اختبار الأداء، لكنها تنهار تحت ضغط AllReduce الفعلي. وفقًا لـ N08 ، هذا هو تحذير "تكوين PFC يدويًا على جهاز عام مشروع معقد". اشترِ من مورد لديه قوالب RoCE معتمدة (مثل NVIDIA Spectrum-X، Arista، Cisco Nexus 9000 مع ملف تعريف خدمة بنية الذكاء الاصطناعي)، أو استعن بشخص لديه خبرة سابقة في هذا المجال.

عندما يكون بروتوكول TCP/IP العادي كافيًا.

إن استخدام الإيثرنت العادي - بدون RDMA، ولا PFC، ولا ضبط DCQCN، فقط المقابس ومكدس النواة - هو الحل الصحيح في كثير من الأحيان أكثر مما يعترف به الناس:

  • خادم أحادي العقدة مزود بمعالج رسومات رباعي أو ثماني وحدات معالجة رسومات. تبقى حركة البيانات بين وحدات معالجة الرسومات عبر PCIe أو NVLink داخل الهيكل. يقتصر دور الشبكة على إرسال بيانات التدريب، وأوزان النموذج، وبيانات القياس عن بُعد. يكفي استخدام منفذ 25 جيجابت إيثرنت أو وصلة واحدة بسرعة 100 جيجابت إيثرنت.
  • مجموعات الاستدلال ذات التنسيق الخفيف بين العقد. يهيمن حساب وحدة معالجة الرسومات على زمن الاستجابة لكل طلب؛ أما 10 ميكروثانية من الشبكة فهي مجرد ضوضاء.
  • مختبر متعدد الاستخدامات، بيئة تطوير وتدريب الروبوتات. لا يقوم نظام المجموعة بتشغيل تدريب متزامن مستمر. استخدام RDMA مبالغ فيه.
  • إعدادات الذكاء الاصطناعي الطرفي للروبوتات كما هو موضح في I01 — يتحدث الروبوت إلى خادم استدلال واحد، وميزانية زمن الاستجابة في حدود مئات المللي ثانية، والبنية التحتية غير مرئية.

النصيحة الصريحة لمعظم عملاء كينتينو: إذا كنت تشتري جهاز K-AI 256 Turin Dual واحدًا مزودًا بثمانية بطاقات رسومات RTX 5090، فلن تحتاج إلى InfiniBand ولا حتى RoCE. يكفي استخدام وصلتين بسرعة 100 جيجابت إيثرنت إلى محول مركز بيانات قياسي، مع تفعيل الإطارات الضخمة، وضبط إعدادات النواة الافتراضية - هذا هو الحل الأمثل، وهو أرخص بكثير من البدائل.

رأي كينتينو الصادق

نبيع منتجاتنا للعملاء الذين يبنون مجموعات حوسبة تتراوح من عقدة واحدة إلى ثماني عقد، باستخدام وحدات معالجة رسومية (GPU) للمستهلكين ومحطات العمل (5090، 4090، RTX Pro 6000 Blackwell). لا نستهدف سوق الحوسبة فائقة الأداء (HPC) ولا سوق الحوسبة عالية الأداء (HPC). بالنسبة لهذه الفئة:

  • صندوق أحادي العقدة بثمانية وحدات معالجة رسومية: منفذ إيثرنت عادي بسرعة 25/100 جيجابت. تم. لا يوجد اتصال مباشر بالشبكة عن بُعد (RDMA)، ولا رسوم إضافية على الشبكة. يُخصص عرض النطاق الترددي المهم داخل الهيكل على منفذ PCIe Gen5؛ أما الوصلة الخارجية فهي مخصصة لاستقبال البيانات وإدارتها.
  • مجموعة من 2 إلى 4 عقد مع تدريب موزع عرضي: RoCEv2 على 100 جيجابت إيثرنت مع قالب تبديل الذكاء الاصطناعي المدعوم من البائع. استخدم Spectrum-X إذا كنت ترغب في المسار المعتمد من NVIDIA؛ أو Tomahawk 5 / Arista إذا كنت ترغب في المسار متعدد الموردين. خصص أسبوعين لتشغيل PFC/ECN بشكل صحيح. nccl-tests التحقق من الصحة.
  • مجموعة تدريب مستدامة من 4 إلى 8 عقد: RoCEv2 على 200 أو 400 جيجابت إيثرنت، مع فصل مستوى الإدارة بالكامل. هذا هو الموضع الأمثل لمنحنى تكلفة المنفذ الواحد؛ الفرق مقابل IB على هذا النطاق ليس كافيًا لتبرير علاوة التبديل إلا إذا كان عبء العمل حساسًا بشكل غير عادي لزمن الوصول.
  • عند تجاوز 8 عقد، والتدريب المكثف المستمر باستخدام AllReduce: يبدأ InfiniBand في استحقاق النظر فيه. ليس تلقائيًا - قم بقياسه. ولكن عند هذا الحجم، فإن البساطة التشغيلية لـ "النسيج بدون فقدان، وSM يتولى التوجيه، وNCCL يعمل ببساطة" تستحق أموالًا حقيقية.
  • أي شيء بمقياس DGX حقيقي: ليس نحن. اشترِ جهاز HGX، واقبل باقة InfiniBand.

ماذا تفعل بعد ذلك

مصفوفة قرارات تنهي معظم هذه المحادثات:

سؤال اذا نعم إذا كانت الإجابة بلا
هل هذا خادم ذو عقدة واحدة، أم عقدتان تقومان بعمل مستقل؟ بروتوكول TCP عادي، 25/100 جيجابت إيثرنت. توقف هنا. تواصل.
هل تقوم بتشغيل التدريب الموزع المتزامن (DDP / FSDP / Megatron)؟ تواصل. يكفي استخدام بروتوكول TCP/100 جيجابت إيثرنت العادي. توقف.
هل يبلغ إجمالي عدد العقد في المجموعة 4 عقد أو أقل؟ RoCEv2 على 100 جيجابت إيثرنت. تواصل.
هل تتكون المجموعة من 4 إلى 16 عقدة، وتعتمد على أحمال عمل مختلطة، وبنية مشتركة؟ RoCEv2 على 100/200/400 GbE مع Spectrum-X أو Tomahawk 5/6. تواصل.
هل تتكون المجموعة من 16 عقدة أو أكثر، وتخضع لتدريب مخصص للذكاء الاصطناعي، ولديها ميزانية من NVIDIA؟ إنفينيباند NDR / XDR. لا يزال من الممكن الدفاع عن RoCEv2.
هل لديكم فريق عمل متخصص في تقنية إنفينيباند؟ يُعدّ الاستثمار المصرفي أقل تكلفة من الناحية التشغيلية. Lean RoCEv2؛ سوق مهارات الإيثرنت أعمق بكثير.
هل ستنقل نفس البنية التحتية حركة البيانات غير المتعلقة بالذكاء الاصطناعي (التخزين، والإدارة، والتطوير)؟ RoCEv2؛ يتطلب IB بنية مادية منفصلة. يُعدّ برنامج البكالوريا الدولية خيارًا أنظف إذا سمحت الميزانية بذلك.

إذا كنت تقوم بتقييم إصدار معين وكنت غير متأكد، فإن ترتيب العمليات هو:

  1. قم بتحليل حجم العمل. ما هي نسبة وقت التشغيل الإجمالي الذي يقضيه في عمليات الحوسبة الجماعية بين العقد مقابل الحوسبة أحادية العقدة؟ إذا كانت هذه النسبة أقل من 10% من وقت التشغيل، فإن اختيار البنية الأساسية لا يُحدث فرقًا يُذكر.
  2. قم بتقييم حجم المجموعة بصدق. لا تُشكل عقدتان نفس مشكلة 16 عقدة. حدد العدد قبل إنشاء الشبكة.
  3. تحدث إلى اثنين من موردي أجهزة التبديل. احصل على عرض سعر حقيقي لكل منفذ يشمل البصريات. إن زيادة سعر InfiniBand بمقدار 2-3 أضعاف ليست مجرد تكلفة نظرية، ولا تظهر في العروض التسويقية.
  4. خطط لخطة الإدارة بشكل منفصل، إلى N08إن النقاش الدائر حول بنية مستوى البيانات يصرف الانتباه عن حقيقة أنك تحتاج أيضًا إلى شبكة إدارة بسرعة 10 جيجابت إيثرنت لا تعتمد على بنية الذكاء الاصطناعي لكي تعمل.
  5. في حالة RoCE: خصص أسبوعين لتشغيل المجموعة لضبط PFC/ECN/DCQCN. إلى N08هنا يكمن مصير مجموعات RoCE، فإما أن تنجح أو تفشل.

تتناول المقالات اللاحقة أساسيات الشبكة السلكية ( N01 )، وميزانية زمن الاستجابة التي ينبع منها الاختيار ( N06 )، وتعقيد التوجيه والتحكم في الازدحام ( N07 )، والتشغيل العملي لتقنية الوصول المباشر للذاكرة عن بُعد (RDMA) بغض النظر عن نوع الشبكة ( N08 ). ويتناول المسار K مواضيع على مستوى المجموعات الحاسوبية - التدريب الموزع (K02)، ومجموعات الاستدلال (K03) - والتي تفترض أن هذا القرار قد اتُخذ بالفعل.

تُعدّ تقنية InfiniBand ممتازة في أدائها. وقد لحقت بها تقنية RoCEv2 بما يكفي لتفوز بمعظم المشاريع الجديدة من حيث التكلفة والنظام البيئي. أما تقنية Ethernet العادية فهي الخيار الأمثل لأغلب المشترين، وإن لم تكن جذابة. اختر ما يناسب احتياجات عملك الفعلية، وليس ما توصي به الشركة المصنّعة.


هذا جزء من موسوعة كينتينو، وهي سلسلة مرجعية حول الحوسبة الذكية والأنظمة التي تربطها. نرحب بالتصحيحات على البريد الإلكتروني info@kentino.com.