طوبولوجيات المجموعات المُبدَّلة: Fat-Tree، Leaf-Spine، Dragonfly+، Tesseract

تبدأ جميع مخططات التجميع في عروض الموردين بنفس الطريقة: صف من المربعات بعنوان "عقدة"، وصف من المربعات بعنوان "مفتاح"، وأسهم بينهما. المخططات بسيطة عمدًا لأن الخيار الحقيقي الكامن وراءها هو... التي الطوبولوجيا، مع كم اكتتاب زائد، مع ماذا سرعة كل منفذ - هي أكبر قرار تكلفة منفرد في مجموعة الذكاء الاصطناعي بعد وحدات معالجة الرسومات نفسها.

هذه المقالة هي طبقة الطوبولوجيا بين N02 (أي بروتوكول - إنفينيباند، أو روسي، أو إيثرنت عادي) و N06-N08 (كيف يتصرف السلك فعليًا بعد توصيل الشبكة). ويغطي هذا التقرير العائلات الأربع المهمة في عام 2026: شجرة دهنية / كلوس / شوكة ورقية, اليعسوب / اليعسوب+, المكعب الفائق / المكعب الفائق، و نتوء مستدير عائلة نجت في ركنين محددين من عالم الحوسبة عالية الأداء. وينتهي الأمر بتصريح صريح: تسعة من كل عشرة عملاء لشركة كينتينو تقريبًا لا يحتاجون إلى أي من هذا، والمقال موجود للعميل العاشر.

الجمهور المستهدف: الأشخاص الذين يقومون بتحديد حجم مجموعة تدريب تتراوح من 8 إلى 64 عقدة والشبكة المحيطة بها. ليس هذا دليلًا إرشاديًا لتكوين Cisco/NVIDIA - النموذج الذهني الذي يجعل الدليل سهل القراءة.

ثلاثة أشياء مختلفة يطلق عليها الناس اسم "عرض النطاق الترددي"

قبل أن نرسم المربعات والأسهم، دعونا نتعرف على المصطلحات. هناك ثلاثة مصطلحات تُستخدم بشكل متبادل في أدبيات مبيعات المجموعات، وهي ليست بنفس العدد:

مصطلح ما يقيسه فعلياً حيث تؤذيك
عرض النطاق الترددي الإجمالي مجموع سعات جميع الروابط في الشبكة. الرقم الموجود في ورقة بيانات المورد. غير مجدٍ بمفرده. قد يظل نسيج التجميع بسرعة 1 تيرابايت/ثانية يمثل عنق زجاجة لتدفق واحد.
عرض النطاق الترددي المقطعي معدل التدفق عبر قطع عشوائي في النسيج. معدل نقل البيانات الفعلي لأحمال العمل عندما تكون حركة المرور غير منتظمة - ما تقيسه أثناء عملية allreduce.
عرض النطاق الترددي للتقسيم الثنائي عرض النطاق الترددي عبر المقطع العرضي سجق قطع يقسم العقد إلى نصفين متساويين. الرقم الذي يحدد ما إذا كانت عملية تقليل الأخطاء تؤدي إلى معدل الخط على نطاق واسع.

يحتوي مفتاح 400 جيجابت إيثرنت ذو 32 منفذًا على سرعة نقل بيانات تبلغ 12.8 تيرابت/ثانية مجموع عرض النطاق الترددي. ضع 16 عقدة عليه بسرعة 400 جيجابت إيثرنت لكل منها، وستحصل على 3.2 تيرابت/ثانية من التنصيف عرض النطاق الترددي (8 عقد × 400 جيجابت/ثانية على كل جانب من القطع). في خطوة allreduce حيث ترسل كل وحدة معالجة رسومية من أصل 16 نصف تدرجها عبر عملية التنصيف، فإن 3.2 تيرابت/ثانية هي ما يُقسم عليه وقت الخطوة - وليس 12.8.

الاختصار: يُعد عرض النطاق الترددي للتقسيم الثنائي هو الرقم الوحيد من بين هذه الأرقام الثلاثة الذي يتنبأ بوقت خطوة التدريب على عبء عمل مرتبط بالاختزال الكامل. عندما يقدم كتيب البائع عرض أسعار إجمالي، قم بأخذ أسوأ الحالات في الاعتبار وقم بالتقسيم وفقًا لذلك للعودة إلى عملية التنصيف.

بالنسبة لمجموعة مكونة من 16 عقدة تحتوي كل منها على 8 وحدات معالجة رسومية (128 وحدة معالجة رسومية إجمالاً) على عقد ذات بطاقة شبكة واحدة بسرعة 100 جيجابت إيثرنت:

طبيعة الكابل عرض النطاق الترددي الإجمالي متوسط ​​وزن الجسم في المقطع العرضي تقسيم ثنائي الأبعاد أبيض وأسود
مفتاح تحويل واحد ذو 32 منفذًا بسرعة 100 جيجابت إيثرنت 1.6 Tb / s 800 Gb / s 800 Gb / s
شجرة الدهون، 1:1 (تقسيم كامل) 3.2 Tb / s 1.6 Tb / s 1.6 Tb / s
فات تري، 2:1 اكتتاب زائد 2.4 Tb / s 800 Gb / s 800 Gb / s
اليعسوب+ (4 مجموعات من 4) 2.0 Tb / s ~1.0 تيرابايت/ثانية ~800 جيجابت/ثانية (أسوأ زوج)
مكعب رباعي الأبعاد (بدون مفتاح) 1.6 Tb / s ~800 جيجابت/ثانية 800 Gb / s
حلقة ثلاثية الأبعاد 4×2×2 1.5 Tb / s ~600 جيجابت/ثانية 600 Gb / s

نفس عدد العقد، نفس سرعة نقل البيانات، لكن الأرقام تختلف باختلاف المقصود. هذا هو الإطار الذي يستخدمه باقي المقال.

شجرة دهنية، كلوس، شوكة ورقية - نفس الشيء بثلاث لهجات

أثبت تشارلز كلوز في عام 1953 أن شبكة متعددة المراحل من مفاتيح التبديل المتقاطعة الصغيرة يمكن أن تكون غير مانعة - أي يمكن لأي مدخل الوصول إلى أي مخرج دون تعارض - بتكلفة أقل بكثير من تكلفة مفتاح تبديل متقاطع عملاق واحد. كل شبكة مركز بيانات حديثة هي شكل من أشكال هذه الفكرة. وقد أصبح التسميات معقدة.

  • A شبكة كلوز هو الهيكل الرياضي: مراحل الدخول والوسط والخروج للمفاتيح الأصغر.
  • A شجرة السمين (تشارلز ليسرسون، 1985) هو نوع من أنواع Clos حيث تصبح الجذوع الأقرب إلى الجذر أكثر سمكًا تدريجيًا بحيث يتناسب عرض النطاق الثنائي مع N.
  • A كلوز المطوي يُعيد لفّ مرحلة الخروج إلى مرحلة الدخول. أ شوكة الورقة هي شجرة كلوس مطوية من طبقتين. أما شجرة كلوس المطوية من ثلاث طبقات مع ورقة وعمود فقري وعمود فقري فائق، فهي ما يسميه معظم الناس في الممارسة العملية شجرة سمينة.
العمود الفقري 1 العمود الفقري 2 العمود الفقري 3 العمود الفقري 4 ورقة 1 ورقة 2 ورقة 3 ورقة 4

بنية ثنائية الطبقات: كل عقدة ورقية تتصل بكل عقدة عمودية. أي عقدتين تتواصلان في خطوتين فقط. التقسيم الثنائي الكامل = لا يوجد اكتظاظ في طبقة العمود الفقري.

تتصل كل عقدة طرفية بكل عقدة رئيسية. حركة البيانات بين أي عقدتين لا تتجاوز خطوتين: عقدة طرفية ← عقدة رئيسية ← عقدة طرفية ← عقدة طرفية. مع توفر عرض نطاق كافٍ للعقدة الرئيسية، تصبح الشبكة غير محجوبة: إذ يمكن لكل عقدة التواصل مع أي عقدة أخرى في الوقت نفسه بسرعة الخط.

استخدم نسبة الاكتتاب الزائد يُعدّ المقبض هو الذي يُحدد التكلفة. إذا كان لكل وحدة طرفية 32 وصلة هابطة بسرعة 100 جيجابت إيثرنت (3.2 تيرابت/ثانية داخل الحامل) و8 وصلات صاعدة بسرعة 100 جيجابت إيثرنت (800 جيجابت/ثانية خارج الحامل)، فإنّ الاكتظاظ هو 4:1 — عرض نطاق ترددي داخل الرف يزيد أربع مرات عن عرض النطاق الترددي الخارج منه. تقسيم كامل يعني 1:1: نفس قوة الوصلة الصاعدة ونفس قوة الوصلة الهابطة. 2:1 وهو أمر شائع في مراكز البيانات ذات الأغراض العامة. 1:1 (تقسيم كامل) هو خط الأساس لمجموعة الذكاء الاصطناعي.

الاعداد روابط صاعدة من الأوراق عدد الأشواك التكلفة التقريبية للمحول والبصريات (2026) تقسيم ثنائي الأبعاد أبيض وأسود
مفتاح تحويل واحد ذو 64 منفذ بسرعة 400 جيجابت إيثرنت (رف واحد) ن / أ 1 ~ 50 ألف دولار 12.8 تيرابايت/ثانية (رف واحد)
نظام ذو طبقتين على شكل عمود فقري ورقي، بنسبة اكتتاب زائدة 2:1 8 × 100 جيجابت إيثرنت منفذ واحد ذو 32 منفذًا ~ 120 ألف دولار 800 Gb / s
نظام ذو طبقتين على شكل عمود فقري ورقي، بنسبة اكتتاب زائدة 2:1 16 × 100 جيجابت إيثرنت منفذ واحد ذو 32 منفذًا ~ 180 ألف دولار 1.6 Tb / s
شوكة ورقية من طبقتين، تقسيم كامل (1:1) 32 × 100 جيجابت إيثرنت منفذ واحد ذو 32 منفذًا ~ 280 ألف دولار 3.2 Tb / s
وصلات صاعدة ثنائية الطبقات بسرعة 400 جيجابت إيثرنت، تقسيم كامل للشبكة 8 × 400 جيجابت إيثرنت منفذ واحد ذو 32 منفذًا ~ 220 ألف دولار 3.2 تيرابايت/ثانية، عدد أقل من الكابلات

تتضاعف التكلفة تقريبًا عند الانتقال من نسبة 4:1 إلى 1:1 لأنك تشتري ضعف عدد منافذ العمود الفقري وضعف عدد العدسات. وهذا هو السبب الذي يدفع كل مجموعة حوسبة ذكاء اصطناعي جادة إلى دفع هذه التكلفة الإضافية. يؤدي الاكتظاظ إلى تدمير كل شيء وتقليل الإنتاجية. لا تعمل عملية التخفيض المتزامنة ذات التدفق 8 على نسيج مكتظ بنسبة 4:1 بسرعة ربع السرعة - بل تنهار تحت ضغط عكسي لـ PFC (N07ويمكن أن تفقد 60-80% من الإنتاجية النظرية عمليًا. تقول الحسابات "اقسم على 4". أما الواقع فيقول "اقسم على 5-10".

تُحدد بنية DGX SuperPOD المرجعية من NVIDIA بنيةً ثلاثية الطبقات ذات بنية شجرية سميكة مع تقسيم ثنائي كامل على شبكة Quantum-2 NDR InfiniBand بسرعة 400 جيجابت/ثانية لكل منفذ. وتُبنى مجموعات التدريب RoCE المنشورة من Meta وسلسلة Azure ND من Microsoft على نفس البنية باستخدام شبكة Spectrum-X Ethernet. لقد تقاربت الصناعة على استخدام نموذج الشجرة الدهنية ذات التقسيم الثنائي الكامل لتدريب الذكاء الاصطناعي، والتطور الذي حدث في الفترة من 2024 إلى 2026 هو جعل الشجرة السمينة أوسع (400 جيجابت إيثرنت → 800 جيجابت إيثرنت لكل منفذ) أو محسّنة للسكك الحديدية (القسم التالي)، دون تغيير البنية الأساسية.

شجرة الدهون المُحسّنة للسكك الحديدية - اللهجة الخاصة بالذكاء الاصطناعي

يعامل نموذج الشجرة الدهنية القياسي جميع بطاقات الشبكة بنفس الطريقة. يهتم تدريب الذكاء الاصطناعي بـ التي بطاقة الشبكة الخاصة بوحدة معالجة الرسومات ترسل التي التدرج، لأن أنماط حركة المرور ليست منتظمة. مُحسَّن للسكك الحديدية يقوم هذا المتغير بتعيين كل وحدة معالجة رسومية في عقدة إلى "مسار" محدد - مسار مخصص من نوع Leaf-Spine - ويضمن أن وحدة المعالجة الرسومية رقم i في كل عقدة تتحدث فقط مع وحدة المعالجة الرسومية رقم i في كل عقدة أخرى من خلال المسار رقم i.

عقدة 1 GPU0 GPU1 GPU2 GPU3 السكك الحديدية 0 السكك الحديدية 1 السكك الحديدية 2 السكك الحديدية 3 العمود الفقري 0 العمود الفقري 1 العمود الفقري 2 العمود الفقري 3 8 أشجار دهنية مستقلة، واحد لكل فتحة وحدة معالجة الرسومات (Rail). يستخدم Allreduce على وحدة معالجة الرسومات N خط السكة الحديدية N فقط — صفر ECMP تصادم بين القضبان.

شجرة بيانات مُحسّنة للسكك الحديدية: كل فتحة لوحدة معالجة الرسومات تُخصص لمستوى أساسي مستقل. حلقة Allreduce على وحدة معالجة الرسومات 3 تستخدم السكة الحديدية 3 فقط.

ثمانية هياكل شجرية ثنائية الطبقات مستقلة، واحدة لكل فتحة وحدة معالجة رسومية. تستخدم حلقة Allreduce على وحدة المعالجة الرسومية 3 عبر 16 عقدة فقط المسار 3 لا يتقاطع أبدًا مع المسارات الأخرى. المزايا: انعدام تصادمات ECMP بين المسارات، وتبسيط التوجيه، وتقليل عدد المحولات لكل مستوى. العيب: يتم تقسيم المهمة التي تمتد على فتحات وحدة معالجة الرسومات (توازي الموترات داخل العقدة، وتوازي البيانات عبر العقد) عبر المسارات بواسطة NCCL على أي حال، لذا فإن البنية لا تفيد إلا إذا توافق عبء العمل. بالنسبة لـ NCCL المتوازي للبيانات والمدرك للمسارات، فهو مكسب واضح؛ أما بالنسبة لتوازي الموترات الذي يمتد عبر المسارات، فإن التوفير يتلاشى.

دراغون فلاي ودراغون فلاي بلس — عندما لا تستطيع تحمل تكلفة فات تري

تتزايد تكلفة بنية الشجرة السمينة تقريبًا وفقًا للوغاريتم N - فكل مضاعفة لعدد العقد تتطلب عرض نطاق أكبر للعمود الفقري، ويضاعف المستوى الثالث عدد المحولات لكل نقطة نهاية. بالنسبة لـ 1024 عقدة، يمكن بناء بنية شجرة سمينة ثلاثية المستويات غير مانعة. أما بالنسبة لـ 10,000 عقدة، فإن عدد المحولات وتكلفة البصريات يصبحان باهظين للغاية. وقد صُممت شبكة Dragonfly، التي اقترحها جون كيم وويليام دالي وآخرون في عام 2008، خصيصًا لتجاوز هذا الحد.

الفكرة: تجميع العقد في مجموعاتداخل المجموعة، تكون جميع المفاتيح متصلة بكثافة (غالبًا ما تكون شبكة Clos أصغر). بين المجموعات، ترتبط كل مجموعة برابط مباشر واحد مع كل مجموعة أخرى. والنتيجة هي شبكة ذات قطر 3 (قفزة محلية للمجموعة، قفزة بين المجموعات، قفزة محلية للمجموعة) التي تتوسع لتشمل أعدادًا هائلة من العقد باستخدام عدد أقل بكثير من كابلات النقل لمسافات طويلة مقارنة بـ fat-tree.

المجموعة أ sss sss داخل المجموعة المجموعة باء sss sss داخل المجموعة المجموعة ج sss sss داخل المجموعة المجموعة د sss sss داخل المجموعة الروابط العالمية (كل زوج من المجموعات متصل مباشرة)

دراجون فلاي: شبكة كلوز كثيفة داخل المجموعة، رابط عالمي واحد لكل زوج من المجموعات. قطرها 3. تتوسع لتشمل أكثر من 1000 عقدة مع عدد أقل من كابلات النقل لمسافات طويلة مقارنةً بشبكة فات تري.

التوفير الكبير هو الكابلات البصريةتُعدّ كابلات الألياف الضوئية طويلة المدى بين الخوادم الجزءَ الأكثر تكلفةً في بنية Fat-tree. يستبدلها نظام Dragonfly بوصلة Fat واحدة لكل زوج من المجموعات، وليس وصلة واحدة لكل تركيبة من Leaf-Spine. بالنسبة لمجموعة تضم G مجموعة، كل مجموعة تتكون من S عقدة، يحتاج نظام Fat-tree إلى ما يقارب G × S × log(G × S) كابلًا؛ بينما يحتاج نظام Dragonfly إلى G(G − 1)/2 كابلًا بين المجموعات بالإضافة إلى كابلات البنية التحتية لكل مجموعة. عند G = 32 مجموعة، كل مجموعة تتكون من 32 عقدة (1024 عقدة إجمالًا)، ينخفض ​​عدد كابلات الألياف الضوئية طويلة المدى بمقدار عشرة أضعاف تقريبًا.

دراغون فلاي+ قام (ميلانوكس، 2017) بتحسين هذا المفهوم لشبكة إنفينيباند. يصبح النسيج الداخلي للمجموعة عبارة عن شبكة كلوز ثنائية الأجزاء صغيرة، لذا لا يتطلب توسيع المجموعة إعادة توصيل الأسلاك، وتستخدم الروابط بين المجموعات توجيهًا تكيفيًا لتجنب المجموعات المزدحمة. هذه هي البنية في حدود (مختبر أوك ريدج الوطني، معالج AMD MI250X فائق السرعة) و كابيتان (LLNL, MI300A) - كلاهما موصلان بمفاتيح HPE Slingshot-11 في ترتيب اليعسوب، قطر أقصى ثلاث قفزات، 12.8 تيرابايت/ثانية لكل مفتاح.

المشكلة هي نمط الفشل للوظائف الصغيرة التي تمتد عبر مجموعاتفي شبكة Fat-Tree، ترى عقدتان في طرفي المجموعة نفس عرض النطاق الترددي للتقسيم الثنائي كما ترى عقدتان تفصل بينهما وحدة رف واحدة (مع مراعاة عدد القفزات). أما في شبكة Dragonfly، فتتشارك عقدتان في مجموعتين مختلفتين رابطهما بين المجموعتين مع كل تدفق بيانات آخر بين المجموعات. فإذا وصلت مهمة تدريبك التي تستخدم 16 وحدة معالجة رسومية إلى 8 عقد في المجموعة A و8 في المجموعة B، فإنك تشارك رابطًا واحدًا بين المجموعتين مع جميع العقد الأخرى التي تقع على نفس الزوج. يساعد التوجيه التكيفي، لكنه لا يقضي على التنازع.

الآثار العملية: يعمل برنامج Dragonfly بشكل رائع مع أحجام مشاكل الحوسبة فائقة التوسع (أكثر من 1000 عقدة، ووظائف مصممة لملء المجموعات) وليس جيدًا جدًا بالنسبة للمجموعات المتوسطة ذات الوظائف الصغيرة المتنوعة. هذه البنية غير مناسبة لمجموعة تدريب مكونة من 16 عقدة، فبنية Fat-Tree أرخص وأسرع على هذا النطاق. وهي البنية المناسبة لحاسوب فائق متعدد المهام مكون من 1024 عقدة.

تيسيراكت - المكعب الفائق رباعي الأبعاد

المكعب الفائق هو مكعب رباعي الأبعاد: 16 رأسًا، كل منها متصل بأربعة جيران بالضبط، وقطره 4 (أطول مسار بين أي عقدتين). تعميم ذلك على k أبعاد يُعطينا... مكعب كي: 2k العقد، كل منها يحتوي على k روابط مباشرة، قطرها k. توجيه مسافة هامينغ - XOR عناوين المصدر والوجهة، قلب بت واحد في كل مرة - هو أمر حتمي بشكل بديهي ومتوازن الحمل في ظل حركة المرور العشوائية.

1000 1001 1010 1011 1100 1101 1110 1111 0000 0001 0010 0011 0100 0101 0110 0111

المكعب الفائق رباعي الأبعاد (Tesseract): 16 عقدة، لكل منها 4 جيران. الخطوط المتصلة = حواف المكعب ثلاثي الأبعاد؛ الخطوط المتقطعة = روابط البعد الرابع. القطر 4. كل تسمية عقدة عبارة عن عنوان من 4 بتات؛ يختلف الجيران ببت واحد فقط.

هيمنت بنى المكعب الفائق على الحوسبة المتوازية الضخمة في ثمانينيات القرن الماضي. آلة التوصيل CM-2 (آلات التفكير، 1987) كان يتكون من 65,536 عقدة موصلة على شكل مكعب فائق الأبعاد ذي 12 بُعدًا. Intel iPSC/2 تم تشغيل مكعبات فائقة الأبعاد سباعية الأبعاد. CM-5 (Thinking Machines, 1991) تخلت عن المكعبات الفائقة لصالح الأشجار السمينة لأن نهج المكعب الفائق لم يتوسع بسلاسة بعد حوالي 1024 عقدة - كل بُعد جديد يضاعف عدد العقد ويتطلب إعادة توصيل كل عقدة موجودة.

في عام 2026، لا يزال مصطلح "المكعب الفائق" يظهر في ثلاثة مواضع جديرة بالتمييز:

  1. كاسم لنظام بحثي / DiRAC HPC. يُعدّ نظام DiRAC Tesseract في مركز EPCC (إدنبرة) عبارة عن مجموعة خوادم HPE SGI 8600 تضم 1476 عقدة، وتعمل على منصة Intel Omni-Path. وكلمة "Tesseract" هنا هي مجرد علامة تجارية، أما البنية التحتية فهي أقرب إلى مفهوم "الشجرة السمينة".
  2. كمصطلح بحثي "مستوى التحكم في الشبكات المعرفة بالبرمجيات" (المكعب: مستوى تحكم رباعي الأبعاد، يان وآخرون). لا علاقة له بالطوبولوجيا الفيزيائية.
  3. باعتبارها البنية الأساسية لمجموعات مسرعات الجسيمات المدمجة عديمة المفاتيح. تتمتع مجموعة من 16 عقدة موصولة على شكل مكعب فائق رباعي الأبعاد بخصائص مثيرة للاهتمام: كل عقدة تحتوي على 4 بطاقات شبكة بالضبط، ولا يوجد بها محول مركزي، وتوجيه حتمي، وقطرها 4. نتناول هذا الموضوع بالتفصيل في N05 (الشبكات بدون مفاتيح).

ما يوفره نظام المكعب الفائق في عام 2026: لا رسوم على التبديل، وتوجيه حتمي عبر عملية XOR باستخدام مسافة هامينغ، وقطر صغير (log₂(N)). ما يُصعّب الأمر: قيمة N ثابتة (يجب أن تكون قوة للعدد 2)، وتعقيد الكابلات يزداد مع البُعد، وعدد بطاقات الشبكة لكل عقدة يساوي k، ومجموعات الذكاء الاصطناعي الحديثة (حلقة/شجرة NCCL) لا تستغل بنية المكعب الفائق بشكل أصلي.

الحلقة - الناجي في زاويتين محددتين

يُعمم المكعب ذو البعد n من الرتبة k مفهوم المكعب الفائق: فبدلاً من استخدام عنوان ثنائي برابط واحد لكل بُعد، يُستخدم شبكة k×k×k مع التفاف. في الطارة ثلاثية الأبعاد، تتصل كل عقدة بستة جيران (±x، ±y، ±z). أما في الطارة سداسية الأبعاد، فيتصل كل عقدة باثني عشر جارًا.

IBM Blue Gene/L و/P تم تشغيلها على شكل حلقة ثلاثية الأبعاد، قابلة للتوسع إلى مئات الآلاف من العقد، حيث تحتوي كل عقدة على 6 روابط عالية السرعة فقط. فوجيتسو التوفو (ربط حاسوب K، 2011) عمم هذا إلى شبكة/حلقة سداسية الأبعاد — 158,976 عقدة على Fugaku (نشطة حتى عام 2026)، مرتبة 24×23×24×2×3×2.

محرك سيريبراس بمقياس الرقاقة تستخدم هذه التقنية بنية حلقية ثنائية الأبعاد على الرقاقة: لكل عنصر معالجة أربعة عناصر مجاورة، ملتفة حول بعضها، وتستغرق كل قفزة حوالي 1 نانوثانية. ينجح هذا التصميم لأن الأسلاك الموجودة على الرقاقة شبه مجانية، بينما الكابلات الخارجية ليست كذلك.

لماذا فشلت تقنية Torus في كل مكان آخر؟ السبب هو المسارات غير المتناظرة والسلوك غير المناسب لأحمال عمل الذكاء الاصطناعي غير المتجانسة. تفترض أحمال عمل الذكاء الاصطناعي الحديثة (مثل حلقات/أشجار NCCL، وخوارزميات NVIDIA الهرمية) تجانس عرض النطاق الترددي بين أي عنصرين. وتخالف تقنية Torus هذا الافتراض. في عام 2026، لا يزال التوروس موجودًا في ثلاثة أماكنتعتمد تقنية الربط البيني على الرقاقات من Cerebras، وتقنية Fujitsu Fugaku وخلفائها، وداخل عقد SXM عبر NVSwitch. وباستثناء هذه المجالات المتخصصة، فإن كل مجموعة حوسبة ذكاء اصطناعي جديدة في الفترة 2025-2026 ستكون من Clos.

جدول المقارنة

طبيعة الكابل قطر الدائرة قسم BW (16 عقدة، 100 جيجابت) المفاتيح المطلوبة الكابلات (تقريبًا) نسبة التكلفة مقابل فات تري 1:1 نموذج النمو
مفتاح واحد 1 800 جيجابت/ثانية (محدودة بواسطة المحول) منفذ واحد ذو 32 منفذًا 16 0.3 × غطاء صلب عند قاعدة المفتاح
شجرة الدهون 1:1 (تقسيم كامل) 2 1.6 Tb / s شوكتان + ورقتان 64 1.0 × أضف أوراقًا / أشواكًا
فات تري 2:1 2 800 Gb / s شوكتان + ورقتان 48 0.7 × أضف أوراق الشجر
دراغون فلاي+ 3 800 جيجابت/ثانية (محدودية أزواج المجموعات) 4 (2 لكل مجموعة) 32-40 0.6× عند 16 نيوتن؛ ينقلب فوق 64 نيوتن أضف المجموعات
مكعب رباعي الأبعاد (بدون مفتاح) 4 ~800 جيجابت/ثانية (فعلي) 0 32 0.4 × يتضاعف بإضافة خافت
حلقة ثلاثية الأبعاد (4×2×2، بدون مفتاح) 4 ~600 جيجابت/ثانية 0 48 0.5 × أي حجم مستطيل

وصلة الإرسال العنقودية - كيف تلتقي البنية الشبكية بالعالم الخارجي

تُعدّ البنية التحتية المُبدّلة بمثابة جزيرة معزولة. إذ يجب أن تتصل بشبكة الشركة (سجلات النماذج، وتخزين مجموعات البيانات، وخدمة S3، والقياس عن بُعد)، وبمحطات عمل المطورين (SSH، وJupyter، ونسخ نقاط التحقق)، وبمجموعات أخرى (من التدريب إلى تسليم الاستدلال). هذا الاتصال هو وصلة صاعدة للمجموعة.

نموذجان، لهما نتائج مختلفة تماماً:

نقطة اتصال واحدة. ينهي زوج من محولات العمود الفقري (أو موجه مخصص للوصلة الصاعدة) جميع الاتصالات الخارجية. سهل الحماية بجدار ناري، وسهل تحديد معدل نقل البيانات، وسهل المراقبة. في حالة الفشل: تُعدّ هذه الوصلة نقطة فشل واحدة؛ إذ يؤثر استهلاكها الكامل (مثل نسخ نقطة تفتيش كبيرة، أو سحب جزء من مجموعة بيانات بحجم 10 جيجابايت) على جميع العقد في آنٍ واحد.

وصلة صاعدة موزعة. لكل جهاز طرفي وصلة صاعدة منفصلة إلى شبكة الحرم الجامعي، غالبًا ما تكون أبطأ بسرعة 25 جيجابت إيثرنت فوق بنية 100 جيجابت إيثرنت الأساسية. تبقى عمليات سحب البيانات وحركة البيانات الخارجية محلية داخل الجهاز الطرفي، مما يمنع الازدحام على البنية الداخلية. في حالة الفشل، يُمثل كل جهاز طرفي حاجزًا أمنيًا، مما يجعل جدار الحماية أكثر تعقيدًا، والمراقبة أصعب.

بالنسبة لحالة كينتينو الأساسية (مجموعة تدريب من 4 إلى 16 عقدة)، تُعد نقطة الربط الصاعدة الوحيدة هي الحل الأمثل. تعتمد البنية الداخلية على تقنية RDMA فقط (RoCE أو InfiniBand)، وهي مُحسَّنة لتقليل زمن الاستجابة وضمان عدم فقدان البيانات. أما الربط الصاعد فهو عبارة عن إيثرنت عادي، وبروتوكول TCP، وجودة خدمة عادية. لا ضع مخزن كائنات مجموعة البيانات على نفس البنية التحتية غير المفقودة التي تستخدمها وحدة معالجة الرسومات (GPU) لتقليل البيانات بالكامل - لن يتمكن عميل S3 المخالف من التسبب في ضغط عكسي على حركة مرور التدريب. بنيتان تحتيتان: طبقة البيانات (RDMA غير مفقود) وطبقة الإدارة/الوصلة الصاعدة (TCP مفقود). N08 يغطي هذا القسم الإعداد العملي.

رأي كينتينو الصريح

يشتري معظم عملاء كينتينو من عقدة واحدة إلى أربع عقد. وبهذا الحجم:

  • عقدة واحدة. لا يوجد سؤال حول بنية الشبكة. منفذ PCIe داخل الصندوق (كيه07 ) تم إخراج بطاقة إدارة الشبكة 25 جيجابت إيثرنت واحدة، تم الأمر.
  • عقدتان. كابل مباشر بين بطاقتي شبكة RDMA. لا حاجة إلى محول. لا حاجة لاختيار بنية الشبكة.
  • 3-4 عقد. مفتاح واحد ذو 32 منفذًا بسرعة 100 جيجابت إيثرنت يتولى الاتصال بين كل طرفين مع تقسيم ثنائي كامل بتكلفة إجمالية تتراوح بين 30 ألف و50 ألف دولار. ولا يزال لا يوجد خيار لتحديد بنية الشبكة.

يبدأ الحديث عن الطوبولوجيا عند عقد 8عندما يصبح عدد منافذ المحول الواحد محدودًا، ويصبح ذلك إلزاميًا عند عقد 16أما ما دون ذلك، فالإجابة الصحيحة هي "مفتاح تحويل واحد جيد، وتقسيم كامل لكل منفذ، وانتهى الأمر". وما فوق ذلك، فالإجابة الصحيحة هي "بنية أساسية ثنائية الطبقات، بسرعة 100 أو 200 جيجابت إيثرنت لكل عقدة، وتقسيم كامل (1:1)، ولا تقم أبدًا بتفعيل خيار زيادة سعة الشبكة إلا إذا أجبرك أحدهم على ذلك".

يُعدّ Dragonfly+ الحل الأمثل لأحجام مشاكل الحوسبة السحابية الضخمة. أما Tesseract / hypercube فهو خيار مثير للاهتمام كخيار لا يتطلب تبديلًا للمجموعات المدمجة (N05). يُعد Torus خيارًا مقيدًا بمورد معين لمشغلي الحوسبة عالية الأداء الذين لديهم أحمال عمل مدركة للطوبولوجيا. بالنسبة لبقية المستخدمين ضمن نطاق سعر كينتينو، يُعدّ نموذج الشجرة السميكة هو الخيار الافتراضي. استخدم نموذج التقسيم الثنائي الكامل إن أمكنك تحمّل تكلفته؛ ونموذج 2:1 إن لم يكن ذلك ممكناً؛ ولا تستخدم أبداً نموذج 4:1 لتدريب الذكاء الاصطناعي.

ماذا تفعل بعد ذلك

إذا كنت تقوم بتحديد حجم نسيج مُبدَّل لمجموعة حقيقية:

  1. دوّن عدد العقد، ووحدات معالجة الرسومات لكل عقدة، ومعدل الخط لكل بطاقة شبكة. اضرب. اقسم على 2. هذا هو رقم التنصيف المستهدف.
  2. حدد ما إذا كانت مهامك تمتد على كامل المجموعة أم أنها تقع داخل رف واحد. تتحمل الوظائف المحلية على الرفوف الاكتظاظ. أما الوظائف التي تمتد عبر المجموعة فلا تتحمله.
  3. يجري nccl-tests/all_reduce_perf على تكوين مؤقت لشجرة البيانات قبل الالتزام بتشغيل الكابل. إذا كانت عملية الاختزال الكاملة المكونة من 8 عقد تفقد بالفعل 20٪ من عرض النطاق الترددي النظري، فإن لديك مشكلة مختلفة عن مشكلة الطوبولوجيا.
  4. لا تُحسّن الأداء للسنوات الخمس القادمة. اشترِ المجموعة التي تحتاجها هذا العام مع خطة توسع واضحة. يُعدّ تصميم "الشجرة السمينة ذات الأوراق والأعمدة" أرخص تصميم للتوسع التدريجي.
  5. قم بمطابقة معدل تحميل البيانات مع معدل استيعاب مجموعة البيانات الخاصة بكلا يتعلق الأمر بسرعة الشبكة الداخلية. تحتاج معظم المجموعات إلى سرعة نقل بيانات خارجية تتراوح بين 25 و100 جيجابت إيثرنت، وليس 400 جيجابت.
  6. نوعان من الأقمشة، دائماً. مستوى البيانات ومستوى الإدارة منفصلان، حتى عند 4 عقد.

تتناول المتابعات في هذا المسار الموضوع بشكل أعمق: N05 يغطي هذا القسم التكوينات التي لا تحتوي على مفتاح (خيارات المكعب الرباعي والحلقة عندما لا تريد مفتاحًا على الإطلاق)؛ N06 يحلل مصدر كل جزء من الثانية من زمن الاستجابة بمجرد تشغيل الشبكة؛ N07 يغطي هذا القسم أعمال التوجيه والتحكم في الازدحام التي تحدد ما إذا كانت بنية الشبكة الجميلة الخاصة بك تعمل بالفعل أم لا؛ N08 يتضمن ذلك إعداد RDMA العملي وتصميم وصلة المجموعة الصاعدة.


هذا جزء من ويكي كينتينو، وهي سلسلة مرجعية حول الحوسبة الذكية، والروبوتات، والأنظمة التي تربط بينهما. نرحب بالتعليقات والتصويبات على info@kentino.com.