أساسيات الإيثرنت للذكاء الاصطناعي: 25/100/400 جيجابت إيثرنت
تُعدّ شبكة الإيثرنت البنية الأساسية لأي مجموعة حوسبة ذكاء اصطناعي تُبنى خارج نطاق مراكز البيانات الضخمة. صحيح أنها ليست الخيار الأسرع دائمًا نظريًا - سيُبرهن N02 على تفوق InfiniBand في الحالات التي تتفوق فيها فعليًا - إلا أنها الخيار المتاح في كل مكان، وتُشغّل جميع الأدوات المجاورة، وتُكلّف أقل تكلفة لكل جيجابت، ولا تُقيّد المستخدم بأي قيود.
بالنسبة لمجموعات الحوسبة من فئة كينتينو - خوادم الاستدلال أحادية العقدة، وأجهزة التدريب من عقدتين إلى ثماني عقد، ومختبرات الأبحاث الصغيرة - يُعدّ الإيثرنت الخيار الأمثل في أغلب الأحيان. وتتمثل الأسئلة المهمة في: أي فئة سرعة، وأي بطاقة شبكة، نحاسية أم ألياف ضوئية، وما هي التكلفة الفعلية لكل ترقية؟ يجيب هذا المقال على هذه الأسئلة بصدق، مع أرقام أسعار منتصف عام 2026.
إذا كنت تستخدم جهازًا واحدًا مزودًا بأربعة أو ثمانية وحدات معالجة رسومية للاستدلال فقط، فيمكنك الانتقال سريعًا إلى جدول التكاليف في الأسفل والتوقف. أما بقية هذه المقالة فهي مخصصة لمخططات متعددة العقد.
لماذا يفوز الإيثرنت افتراضياً؟
ثلاثة أسباب، مرتبة حسب مدى تأثيرها الفعلي على القرار:
- النظام البيئي. كل خادم ومحول ووحدة تخزين وجهاز تنسيق يدعم تقنية الإيثرنت. تأتي برامج التشغيل مُضمنة في نواة النظام. وتفترض أدوات المراقبة ذلك. اليوم الأول للموظف الجديد ليس مخصصًا لشرح تقنية إنفينيباند.
- التكلفة لكل جيجابت. يُكلّف منفذ محوّل 100 جيجابت إيثرنت ربع سعر منفذ HDR InfiniBand المُماثل تقريبًا. أما مُحوّلات الصوت الرقمي إلى التناظري (DAC) وأجهزة الإرسال والاستقبال فهي سلع أساسية. وتتوفر بطاقات الشبكة من عدة مُصنّعين - مثل NVIDIA وBroadcom وIntel - مما يُحافظ على أسعار مُناسبة. بينما يقتصر إنتاج InfiniBand على مُصنّع واحد.
- لا يوجد تثبيت للنسيج. الإيثرنت هو وسيلة نقل. تتعامل المحولات الحديثة مع بروتوكولات TCP وRoCE وNVMe-oF وحركة بيانات مستوى الإدارة على نفس السلك بجودة خدمة جيدة. يضمن InfiniBand دمج هذه البنية في خطة NVIDIA المستقبلية.
يكمن التحدي في أن تقنية الإيثرنت لتطبيقات الذكاء الاصطناعي تحتاج إلى مزيد من الضبط لتحقيق نفس سرعة نقل البيانات التي توفرها تقنية إنفينيباند مباشرةً. RoCEv2 وPFC وECN وDCQCN - جميعها قابلة للتكوين على الإيثرنت، ومُهيأة مسبقًا على إنفينيباند. يغطي N02 و N08 هذا الجانب.
مستويات السرعة ومتى يكون لكل منها فائدة
أكبر خطأ في عروض أسعار كينتينو هو المبالغة في تحديد مواصفات الاتصال. استخدام محول 400 جيجابت إيثرنت أسفل جهاز استدلال مزود بثمانية وحدات معالجة رسومية هو إهدار للمال. كما أن استخدام وصلة 10 جيجابت إيثرنت بين عقدتي تدريب هو إهدار لوقت وحدة المعالجة الرسومية. الخريطة أدناه هي الأهم.
| الطبقة | مكان جميل | تكلفة الميناء الواحد (منتصف عام 2026) | ملاحظة |
|---|---|---|---|
| 1/10 جيجابت إيثرنت | الإدارة، IPMI/BMC، التمهيد، SSH | 50،200 يورو - XNUMX،XNUMX يورو | افصل دائمًا عن مستوى البيانات |
| 25 GbE | وصلة إدارة، تخزين خفيف، استيعاب مجموعات البيانات أقل من 3 جيجابايت/ثانية تقريبًا | 300،600 يورو - XNUMX،XNUMX يورو | أرخص فئة "حقيقية"؛ معيار 2× SFP28 في معظم الخوادم |
| 100 GbE | خط الأساس داخل المجموعة للتدريب على 2-8 عقد وتخزين RoCE | 1200،2000 يورو - XNUMX،XNUMX يورو | الأداة الأساسية - ما تحتاجه 80% من مواصفات كينتينو متعددة العقد |
| 200 GbE | تدريب الحدود، فئة 70B+، تقليل كثيف | 2500،4000 يورو - XNUMX،XNUMX يورو | الطبقة الوسطى غير مستغلة بشكل كافٍ؛ متوافقة مع QSFP56 / QSFP-DD |
| 400 GbE | التدريب متعدد الرفوف، مجاور للمراكز فائقة التوسع، مسار البيانات الساخن | 5500،9000 يورو - XNUMX،XNUMX يورو | التكلفة الحقيقية - فقط عندما يمكنك إثبات قدرة وحدة معالجة الرسومات على استيعابها |
| 800 GbE | أحدث التقنيات، رفوف B200/MI355، معظمها من مزودي خدمات الحوسبة السحابية الضخمة اليوم | € 11000 + | نطاق ConnectX-8 / Thor Ultra؛ نادر خارج الفئة العليا |
ثلاثة أمور يجب استيعابها:
- لا يُستخدم منفذ 25 جيجابت إيثرنت لبنية الذكاء الاصطناعي. يُستخدم هذا النظام لكل ما يتعلق به - الإدارة، والقياس عن بُعد، والربط بخادم التخزين عندما لا يكون التخزين على نفس بنية RDMA. إن تسمية 25 جيجابت إيثرنت بـ "طبقة الذكاء الاصطناعي" دليل على أن المورّد لا يُدرك حجم العمل المطلوب.
- 100 جيجابت إيثرنت هو الحد الأدنى الصحيح للعقد المتعددة. أسفل هذا المستوى، يتوقف تزامن التدرج في كل تكرار. أما أعلاه، فيُطرح التساؤل حول قدرة وحدات معالجة الرسومات على إنتاج البيانات بسرعة كافية لتشبع الشبكة. بالنسبة لأنظمة 5090 / RTX Pro 6000 Blackwell أحادية العقدة التي تُجري عمليات ضبط دقيقة، فإن سرعة 100 جيجابت إيثرنت عادةً ما تكون كافية.
- لا يُجدي استخدام تقنية 400 جيجابت إيثرنت نفعاً إلا من خلال التدريب العملي على أنظمة متعددة الخوادم. لا تحتاج عقدتان مزودتان بثمانية وحدات معالجة رسومية (GPU) تقومان بعملية ضبط دقيق بقيمة 70 مليار إلى ذلك. بينما تحتاج ست عشرة عقدة تقوم بالتدريب المسبق على نص مُجزأ إلى ذلك.
تتوفر تقنية 800 جيجابت إيثرنت، ويتم شحن الشرائح (ConnectX-8، Thor Ultra)، لكنها حاليًا مخصصة لمراكز البيانات الضخمة وشبكات الفئة B200. ذُكرت هذه التقنية من باب الإحاطة؛ فمن غير المرجح أن تُدرجها في مواصفات نظام كينتينو في عام 2026.
عائلات NIC التي تشحن بالفعل
تهيمن سلسلة ConnectX من NVIDIA على سوق بطاقات الشبكة في عام 2026، بينما تغطي Broadcom وIntel باقي السوق. وتوجد بطاقات من Marvell وAMD/Pensando وعدد قليل من بطاقات Broadcom المعاد تسميتها من قبل مصنعي المعدات الأصلية، لكنها نادراً ما تظهر في قوائم مكونات Kentino.
| NIC | سرعة قصوى | بكيي | ملاحظات / الدور النموذجي |
|---|---|---|---|
| إنتل E810-CQDA2 | 2×100 جيجابت إيثرنت | الجيل 4 x16 | أرخص خدمة إنترنت موثوقة بسرعة 100 جيجابت إيثرنت؛ خدمة ممتازة ice برنامج تشغيل؛ يدعم RoCE الإصدار 2 |
| ميلانوكس كونيكت اكس-6 دي اكس | 2×100 جيجابت إيثرنت | الجيل 4 x16 | أداة أساسية لشبكات 100 جيجابت إيثرنت على مضيفات الجيل الرابع؛ بروتوكول RoCE ناضج |
| برنامج Mellanox ConnectX-7 | 1–2 × 200/400 جيجابت أو NDR IB | الجيل 5 x16 | وضع مزدوج IB/Ethernet؛ أعلى مواصفات Kentino الحالية لأنظمة متعددة العقد عالية الأداء |
| برودكوم ثور 2 | 2 × 200/400 جيجابت إيثرنت | الجيل 5 x16 | فئة المؤسسات، RoCE v2، مستخدمة في وحدات SKU المعاد تسميتها من قبل مصنعي المعدات الأصلية |
| بطاقة الشبكة الفائقة NVIDIA BlueField-3 | 1-2 × 400 جيجابت إيثرنت | الجيل 5 x32 | وحدة معالجة بيانات Arm ذات 16 نواة؛ RoCE، NVMe-oF، تفريغ التشفير؛ باهظة الثمن |
| نفيديا كونيكتكس -8 | 1 × 800 / 2 × 400 جيجابت إيثرنت | الجيل 6 x16 | أحدث إصدار؛ يتوافق مع Spectrum-X 800؛ يتطلب منفذ PCIe من الجيل السادس لتزويده بالطاقة |
| برودكوم ثور ألترا | 1×800 جيجابت إيثرنت | الجيل 6 x16 | متوافق مع معيار UEC-1.0؛ بطاقة شبكة ذكاء اصطناعي مصممة من الصفر؛ هدف قابل للتوسع لأكثر من 100 ألف وحدة معالجة مضاعف (XPU). |
الاختيارات الصادقة لأعمال بمستوى كينتينو:
- إنتل E810-CQDA2 عندما يرغب العميل في الحصول على سرعة 100 جيجابت إيثرنت ضمن ميزانية محددة، ويتقبل أن ضبط RoCE يتطلب جهدًا أكبر من ضبطه على Mellanox. يتراوح السعر في السوق بين 700 و900 يورو تقريبًا.
- ConnectX-6 DX لأي وصلة 100 جيجابت إيثرنت تحتاج إلى تشغيل RoCE بشكل موثوق. إضافة بقيمة 1100-1500 يورو. الحل الأمثل بنسبة 90%.
- برنامج ConnectX-7 عندما تكون المنصة من الجيل الخامس PCIe، فإن استخدام سرعة 200 أو 400 جيجابت إيثرنت يكون مبرراً من خلال التدريب العملي على عدة عقد. تبلغ تكلفة بطاقة OSFP NDR400 أحادية المنفذ حوالي 1650 يورو، وهي قادرة على التبديل بين وضع IB ووضع Ethernet عبر البرامج الثابتة، وهو أمر مفيد في حال رغبتك في ترقية البنية التحتية لاحقاً.
- بلوفيلد-3 وكونكت إكس-8 موجودة؛ إذا كنت تقوم بتحديد مواصفاتها فأنت لست بصدد قراءة هذه المقالة.
PCIe هو الحد الأقصى الصامت. بطاقة شبكة 100 جيجابت إيثرنت في فتحة من الجيل الثالث x8 تعمل بسرعة الربط وتعمل بنصف السرعة. القاعدة:
| سرعة بطاقة الشبكة | الحد الأدنى لـ PCIe | فتحة مريحة |
|---|---|---|
| 25 GbE | الجيل 3 x4 | الجيل الخامس × 4 أو الجيل الرابع × 8 |
| 100 GbE | الجيل الخامس × 8 أو الجيل الرابع × 16 | الجيل 4 x16 |
| 2×100 جيجابت إيثرنت | الجيل 4 x16 | الجيل الخامس × 8 أو الجيل الرابع × 16 |
| 200 GbE | الجيل الخامس × 8 أو الجيل الرابع × 16 | الجيل 5 x16 |
| 400 GbE | الجيل 5 x16 | الجيل السادس x16 فقط |
| 800 GbE | الجيل السادس × 16 أو 2 × الجيل الخامس × 16 | الجيل السادس x16 فقط |
في منصات كينتينو EPYC ذات 8 وحدات معالجة رسومية، تستحوذ وحدات المعالجة الرسومية على معظم فتحات الجيل الرابع/الخامس x16؛ بينما ينتهي الأمر ببطاقة الشبكة في فتحة الجيل الرابع x8 في بعض التكوينات. هذا مناسب لمنفذ 100 جيجابت إيثرنت واحد، ولكنه غير كافٍ لمنفذين. تأكد من ذلك قبل الاقتباس. W02 (مسارات PCIe وبنية الشبكة) هو شرح مفصل لهذه المسألة.
الخيارات المعدنية والبصرية - محول رقمي تناظري، محول صوتي تناظري، بصريات
ثلاث طرق لإنشاء وصلة مادية، تفصل بينها تكلفة باهظة. يهدر المشترون أموالاً طائلة على البصريات في حين كان من الممكن استخدام محول رقمي تناظري (DAC).
| خيار | الوصول (100 جيجابت إيثرنت) | الوصول (400 جيجابت إيثرنت) | تكلفة الربط لكل وصلة (100 جيجابت إيثرنت) | تكلفة الربط لكل وصلة (400 جيجابت إيثرنت) | الطاقة / زمن الاستجابة |
|---|---|---|---|---|---|
| محول رقمي تناظري (نحاس سلبي) | 1-3 أمتار، ≤5 أمتار مع المتغيرات النشطة | عملي ≤ 2 متر، سلبي ≤ 3 متر | 50،150 يورو - XNUMX،XNUMX يورو | 200،400 يورو - XNUMX،XNUMX يورو | ~0 واط، أقل من نانوثانية/متر |
| AOC (بصري نشط) | يتراوح طولها عادةً بين 3 و30 متراً، ويصل إلى 100 متر. | 3-30 مترًا، 100 متر كحد أقصى | 200،500 يورو - XNUMX،XNUMX يورو | 600،1200 يورو - XNUMX،XNUMX يورو | 2-4 واط لكل طرف، ~5 نانوثانية/متر |
| بصريات SR + MMF | 70 مترًا على OM3 / 100 متر على OM4 / 150 مترًا على OM5 | 30-100 متر نموذجي (SR4 / SR8) | 400-800 يورو للزوج + الألياف | 1500-2500 يورو للزوج + الألياف | 3–4.5 واط لكل طرف |
| بصريات LR + SMF | حتى 10 كم | حتى 10 كم | 800-1500 يورو للزوج + الألياف | 2500-4000 يورو أو أكثر للزوج + الألياف | 3.5–5 واط لكل طرف |
القواعد التي تنطبق على جميع الموردين:
- محول رقمي تناظري داخل رف واحد. يُعتبر النحاس السلبي في تقنية 100GBASE-CR4 موثوقًا به حتى مسافة 3 أمتار، بينما تصل مواصفاته إلى 5 أمتار مع الأنواع النشطة. أما عند سرعة 400 جيجابت في الثانية (100 جيجابت في الثانية PAM4 لكل مسار)، فإن الحد العملي هو 2 متر سلبي — توجد محولات رقمية تناظرية بطول 3 أمتار، لكن سلامة الإشارة تصبح هشة مع انحناءات الكابل.
- AOC للجري من 5 إلى 30 مترًاوخاصةً عبر الرفوف المتجاورة. جهاز الإرسال والاستقبال ملتصق بالألياف، لذا فإن وجود طرف تالف يعني التخلص من الكابل بأكمله.
- بصريات SR + MMF بالنسبة للتمديدات داخل الغرف التي تتجاوز 30 مترًا أو في حال وجود كابلات هيكلية مسبقًا، يوفر كابل OM5 مدىً أطول بنسبة 50% تقريبًا مقارنةً بكابل OM4 بسرعة 100 جيجابت إيثرنت، وهو الخيار الأمثل للتركيبات الجديدة حاليًا.
- بصريات LR + SMF لعبور المباني أو الغرف. مبالغة داخل مجموعة واحدة من 4 رفوف.
حساب طول الكابلات لمجموعة من 4 رفوف. صف من أربعة رفوف 42U، عرض كل منها حوالي 600 مم، مع مسافة بين الرفوف تبلغ حوالي 100 مم. مفتاح التبديل الموجود أعلى الرف 1 إلى بطاقة الشبكة الموجودة أسفل الرف 4: حوالي 2.1 متر أفقيًا + حوالي 2 متر رأسيًا = حوالي 4 أمتار مع وجود مساحة إضافية. عند سرعة 100 جيجابت إيثرنت، تكون على حافة نطاق DAC؛ وعند سرعة 400 جيجابت إيثرنت، تتجاوزه. لأي مجموعة أعرض من رفّين تقريبًا عند سرعة 400 جيجابت إيثرنت، يُنصح باستخدام كابلات AOC أو بصريات. هذا هو الخطأ الأكثر شيوعًا في مواصفات عروض أسعار الرفوف المتعددة - افتراض أن نطاق DAC سيصل لأن "الرفوف متجاورة تمامًا".
وصلة إيثرنت بسرعة 100 جيجابت/ثانية من البداية إلى النهاية، مع قفزة داخلية بطول مترين، في منتصف عام 2026: زوج من وحدات ConnectX-6 Dx بتكلفة تقريبية 2400 يورو + منفذي تبديل بتكلفة تقريبية 1500 يورو + كابل QSFP28 DAC بطول مترين بتكلفة تقريبية 90 يورو = حوالي 4000 يورو لكل وصلة . في المقابل، تبلغ تكلفة نفس الوصلة بسرعة 400 جيجابت/ثانية (زوج من وحدات ConnectX-7، منافذ تبديل بسرعة 400 جيجابت/ثانية، كابل QSFP-DD DAC بطول مترين) حوالي 14 ألف يورو - أي أربعة أضعاف عرض النطاق الترددي بتكلفة تقارب 3.5 أضعاف. الجدوى الاقتصادية معقولة، لكن السؤال هو: هل يتطلب حجم العمل ذلك؟
تبديل الوضع الأفقي
ينقسم سوق محولات إيثرنت بتقنية الذكاء الاصطناعي لعام 2026 إلى ثلاث فئات واضحة.
| الفئه | أمثلة | زمن الاستجابة لكل منفذ | ملاحظة |
|---|---|---|---|
| الذكاء الاصطناعي في أعلى الرف (القطع، المخزن المؤقت العميق) | NVIDIA Spectrum-X SN5600 (64×800 جيجابت إيثرنت / 51.2 تيرابت/ثانية)، Arista 7060X4 (32×400 جيجابت إيثرنت، ~700 نانوثانية)، سلسلة Cisco Nexus 9300 | 400–700 نانوثانية | قوالب RoCE بدون فقدان، وPFC/ECN جاهزة للاستخدام، وتم اختبارها باستخدام تقنية AI fabric |
| العمود الفقري المعياري | أريستا 7800R3 (حتى 36 × 400 جيجابت إيثرنت لكل بطاقة خط)، سيسكو نيكسوس 9500 | 1-3 ميكروثانية حسب نوع بطاقة الخط | للمجموعات التي تضم 16 عقدة أو أكثر؛ العمود الفقري الموجه لشبكة كلوز |
| عام / صندوق أبيض | فئة توماهوك مع SONiC، وDell PowerSwitch، وMikrotik للأجهزة منخفضة التكلفة | يختلف، من 600 نانوثانية إلى 3 ميكروثانية | أرخص، يتطلب المزيد من العمل على التكوين، ضبط RoCE هو مهمتك |
ندوان يحملان آراءً صريحة:
- بالنسبة لمجموعات التدريب المكونة من 4 إلى 8 عقد بسرعة 100 أو 400 جيجابت إيثرنت، فإن جهاز Spectrum-X SN5600 أو Arista 7060X4 هو الحل الصحيح. مفتاح واحد، نطاق عطل واحد، بدون أقفال، قوالب RoCE مُقدمة من المورد. يوفر SN5600 سرعة 800 جيجابت إيثرنت (64×800 جيجابت) في وحدة 2U مع إجمالي 51.2 تيرابت/ثانية ومخازن مؤقتة عميقة مُحسّنة بالذكاء الاصطناعي؛ بينما يوفر 7060X4 سرعة 400 جيجابت إيثرنت (32×400 جيجابت) في وحدة 1U مع زمن استجابة سريع يبلغ حوالي 700 نانوثانية، وذلك بتكلفة أقل بشكل ملحوظ عندما لا تحتاج إلى سرعة 800 جيجابت إيثرنت.
- بالنسبة لأكثر من 16 عقدة، خطط لتوجيه L3 Clos مع وجود شوكتين، BGP غير مرقم بين الأوراق والشوكتين، ECMP عبر الشوكتين. N08 يغطي آليات الوصلة الصاعدة؛ N04 يغطي هذا الخيار الطوبولوجي.
إطارات MTU و جامبو
يبلغ الحد الأقصى الافتراضي لوحدة الإرسال (MTU) لشبكة الإيثرنت 1500 بايت. عند سرعة 100 جيجابت في الثانية، يُعادل ذلك حوالي 8.3 مليون حزمة بيانات في الثانية لكل تدفق، مع تكلفة معالجة لكل حزمة. أما استخدام MTU 9000 فيُقلل معدل نقل الحزم بمقدار 6 أضعاف، ويُخفض بالتالي الحمل الزائد على وحدة المعالجة المركزية، وهو أمر ضروري لأي بنية تحتية للذكاء الاصطناعي.
بالنسبة لبروتوكول RoCEv2 تحديدًا، يتم اختيار وحدة النقل القصوى (MTU) من نمط IB من أكبر حجم يتناسب مع وحدة النقل القصوى لشبكة الإيثرنت. توفر شبكة الإيثرنت ذات سعة 9000 بايت لبروتوكول RoCE وحدة نقل قصوى تبلغ 4096 بايت، وهي القيمة التي تتوقعها جميع بروتوكولات NCCL وRDMA. أما إذا تم استخدام سعة 1500 بايت، فستحصل على وحدة نقل قصوى لبروتوكول RoCE تبلغ 2048 بايت، مما يؤدي إلى انخفاض ملحوظ في الأداء في كل عملية تجميع.
ثلاثة أشياء يجب معرفتها:
- يجب أن تتطابق من البداية إلى النهاية. يؤدي وجود جهاز واحد بحجم 1500 ميجابايت كحد أقصى في مسار البيانات إلى تجزئة البيانات بشكل صامت وانخفاض معدل نقل البيانات. لذا، قم بتفعيله على كل بطاقة شبكة، وكل منفذ محول، وكل قفزة توجيه على شبكة VLAN الخاصة بالذكاء الاصطناعي.
- أبقِ البيانات الضخمة محصورة في شبكة VLAN الخاصة بالذكاء الاصطناعي. لن تعمل شبكة شركتك بسلاسة مع وحدة MTU 9000. ستبقى طبقة الإدارة عند 1500.
-
تحقق من ذلك مع
ip linkوtracepathليس بالاعتماد على الإعدادات. إن عدد المجموعات التي قام فيها أحدهم بتعيين 9000 على بطاقات الشبكة ونسي منافذ المحول أمر محرج.
إيثرنت مع فقدان البيانات مقابل إيثرنت بدون فقدان البيانات - لمحة عامة
يُعدّ بروتوكول TCP/IP العادي عبر الإيثرنت غير مستقرّ بسبب فقدان البيانات: إذ تقوم المحوّلات بإسقاط الحزم عند امتلاء قوائم الانتظار، ثمّ يعيد بروتوكول TCP إرسالها، ممّا يؤدّي إلى انخفاض معدل نقل البيانات. وهو مناسب لحركة مرور الويب المتدفقة، لكنّه كارثيّ لتقنية RDMA، حيث يؤدّي فقدان حزمة واحدة في عملية تقليل البيانات الشاملة في RoCE إلى إيقاف عملية النقل بالكامل وإجبار NCCL على تجاوز المهلة الزمنية.
الحل هو تقنية إيثرنت بدون فقدان للبيانات ، والتي يتم تحقيقها من خلال آليتين تعملان معًا:
- PFC (التحكم في التدفق ذي الأولوية، 802.1Qbb) — إيقاف مؤقت حسب الأولوية. عندما تمتلئ ذاكرة التخزين المؤقت للمحول للأولوية 3 (أولوية RDMA وفقًا للاتفاقية)، فإنه يرسل إطار إيقاف مؤقت إلى المنفذ العلوي. فرملة طوارئ قصيرة المدى.
- ECN (إشعار الازدحام الصريح) تقوم المحولات بتحديد الحزم في قوائم الانتظار التي تمتلئ، فيرد جهاز الاستقبال برسالة CNP، فيبطئ المرسل من سرعة نقل البيانات. هذا هو التحكم في الازدحام على المدى الطويل.
يشكلان معًا DCQCN - إشعار الازدحام الكمي لمركز البيانات - وهو حلقة التحكم القياسية RoCEv2 على بنى إيثرنت الحديثة القائمة على الذكاء الاصطناعي. يقوم ECN بالعمل في معظم الأوقات، ولا يتم تفعيل PFC إلا عندما يعجز ECN عن الاستجابة بالسرعة الكافية.
خلاصة هذا المقال: إذا كنت تستخدم RoCE، فيجب أن يدعم المحول لديك PFC وECN على أولوية RDMA، ويجب تهيئة بطاقة الشبكة لديك لتمييزهما واحترامهما. شراء محول من مورد لديه قوالب RoCE موثقة (مثل NVIDIA Spectrum أو Arista أو Cisco Nexus 9000) يوفر أسبوعًا من أعمال التهيئة. يتناول الجزء الثاني المقارنة مع InfiniBand، بينما يتعمق الجزء السابع في جانب التحكم في الازدحام.
عمق المخزن المؤقت - ضحل مقابل عميق
المحور الآخر في محولات الذكاء الاصطناعي هو عمق المخزن المؤقت. تُجري تقنية AllReduce عملية متعددة إلى واحد في كل تكرار - حيث تتقارب كل عقدة في الحلقة أو الشجرة على عقدة واحدة في نفس اللحظة. هذا ما يُعرف بالتحويل الداخلي ، وهو يتفوق بشكل كبير على المحولات ذات المخازن المؤقتة الضحلة.
- مفاتيح ذات مخزن مؤقت ضحل (أجهزة توماهوك القديمة، أجهزة المؤسسات العامة) تحتوي على ذاكرة تخزين مؤقتة إجمالية تتراوح بين 4 و32 ميجابايت. رخيصة الثمن، ذات زمن استجابة منخفض، ومناسبة لحركة البيانات الداخلية على شبكة الشركة. يتم إسقاط الحزم عند أول اتصال بها.
- مفاتيح الذكاء الاصطناعي ذات التخزين المؤقت العميق (مثل Jericho3-AI و Spectrum-X وبعض بطاقات خط 7800R3) تحتوي على ذاكرة تخزين مؤقتة تتراوح سعتها من مئات الميغابايت إلى عدة غيغابايت. تستوعب هذه الذاكرة تدفق البيانات الواردة، وتحتفظ بالحزم بينما يقوم DCQCN بتقليل عدد المرسلين.
بالنسبة لمجموعة من عقدتين، لا يُعدّ عمق المخزن المؤقت ذا أهمية. أما بالنسبة لأكثر من ثماني عقد تُجري عملية تقليل البيانات الكثيفة، فإنّ المخازن المؤقتة العميقة تُشكّل الفرق بين بنية شبكية سليمة وأخرى تعاني من توقفات وتعطلات PFC. وهذا سبب وجيه لشراء محولات من فئة الذكاء الاصطناعي بدلاً من المحولات العامة.
بصراحة، هل ينطبق هذا على تصميمك؟
لا يحتاج خادم Kentino K-AI أحادي العقدة، الذي يقوم بالاستدلال أو الضبط الدقيق أحادي العقدة، إلى أي من ذلك . تتواصل وحدات معالجة الرسومات عبر PCIe وNVLink؛ ويُستخدم رابط الإيثرنت لاستقبال المطالبات، وإرسال الرموز، وقراءة مجموعات البيانات. ويكفي وجود منفذي SFP28 بسرعة 25 جيجابت/ثانية على بطاقة الشبكة المدمجة في الجهاز المضيف.
أنت تقرأ هذا لأنك تخطط لإنشاء عقدتين أو أكثر. المصفوفة:
- عقدة واحدة: منفذ إيثرنت بسرعة 10 أو 25 جيجابت مدمج. لا يوجد ترقية.
- 2-4 عقد، ضبط دقيق: 100 جيجابت إيثرنت عبر ConnectX-6 Dx، محول واحد، مُهيأ بتقنية RoCE. حوالي 4 يورو لكل وصلة.
- 4-8 عقد، 70 مليار عملية تدريب فأكثر: شبكة إيثرنت بسرعة 100 أو 200 جيجابت مع تقنية ConnectX-7 في حال توفر PCIe Gen 5. مفتاح تحويل أحادي Spectrum-X SN5600 أو Arista 7060X4.
- 8-16 عقدة، تدريب كثيف: 200 أو 400 جيجابت إيثرنت، موجهة L3 Clos مع عمودين، مفاتيح ذات مخزن مؤقت عميق.
- 16+ عقدة: يتجاوز هذا التشكيلة المعتادة لشركة كينتينو. استخدم بنية NVIDIA المرجعية (Spectrum-X أو BlueField-3 أو ConnectX-8) واستعن بخبير استشاري.
ماذا تفعل بعد ذلك
قبل توقيع قسم الشبكة في عرض الأسعار، يرجى الرد كتابياً:
- كم عدد العقد التي ستعمل معًا فعليًا؟ ليس "لاحقاً"، ولا "ربما". هذا ما يحدد المستوى.
- ما هو أكبر حجم عمل تدريبي ستنفذه من البداية إلى النهاية؟ التدريب المسبق لنموذج اللغة الموجه بالرمز النصي خفيف على عرض النطاق الترددي؛ أما نشر الصور/الفيديو فهو ثقيل على عرض النطاق الترددي.
- هل يُعدّ العائد على رأس المال المستثمر (RoCE) مطروحاً للنقاش؟ إذا كانت الإجابة بنعم، فاختر بطاقات شبكة من شركة Mellanox وموردًا يوفر قوالب RoCE. أما إذا كانت الإجابة بلا، فإن Intel E810 خيار جيد وأرخص بمقدار 500 يورو لكل جهاز مضيف.
- ما هو مسار الكابل الفعلي من الخادم إلى المحول؟ استخدم شريط قياس، ولا تعتمد على التقدير. حدود محول الإشارة الرقمية إلى التناظرية (DAC) عند سرعات 100 جيجابت/400 جيجابت ضيقة.
- هل فصلت الإدارة عن مستوى البيانات؟ دائماً هناك نوعان من الشبكات - شبكة 1/10 جيجابت إيثرنت رخيصة لـ SSH/IPMI/Prometheus، وشبكة RDMA باهظة الثمن لـ NCCL فقط. N08 يحتوي على التصميم.
- هل يحتوي الجهاز المضيف على مسارات PCIe؟ توفر بطاقة الشبكة بسرعة 400 جيجابت إيثرنت في منفذ الجيل الرابع x16 سرعة تقارب 200 جيجابت إيثرنت عمليًا. تحقق من ذلك قبل تقديم عرض السعر.
المراجع المتقاطعة في المسار N للطبقة التالية من التفاصيل: N02 (InfiniBand مقابل RoCE مقابل Ethernet العادي - متى يفوز البديل لـ Ethernet بالفعل)، N04 و N05 (طوبولوجيات التبديل وعدم التبديل لحالة العقد المتعددة)، N06 (تشريح زمن الوصول - أين تذهب الميكروثواني بالفعل)، و N08 (إعداد RDMA عمليًا وكيفية اتصال المجموعة ببقية العالم).
يُعدّ استخدام الإيثرنت في تطبيقات الذكاء الاصطناعي حلاً مُرضياً. لا تتعلق الأخطاء الشائعة عادةً بالأسلاك، بل باختيار الطبقة غير المناسبة لحجم العمل، أو تركيب بطاقة الشبكة في منفذ PCIe غير ملائم، أو التعامل مع المحوّل كوحدة استهلاكية عادية بينما يحتاج حجم العمل فعلياً إلى مخازن مؤقتة كبيرة وتصحيح معامل القدرة. إذا تمّت معالجة هذه النقاط الثلاث بشكل صحيح، ستكون الشبكة الجزء الأقل تعقيداً في عملية البناء، وهذا هو المطلوب.
هذا جزء من موسوعة كينتينو، وهي سلسلة مرجعية حول الحوسبة الذكية، والروبوتات، والأنظمة التي تربط بينهما. نرحب بالتعليقات والتصويبات على البريد الإلكتروني info@kentino.com.