مقارنة بين نظام أحادي العقدة متعدد وحدات معالجة الرسومات ونظام متعدد العقد: متى يتم التوسع الأفقي
أكثر الأخطاء تكلفةً عند الشراء هو تقسيم ميزانية وحدة معالجة الرسومات (GPU) على عقدتين، بينما كان من الممكن استخدام عقدة واحدة أكبر. أما ثاني أكثر الأخطاء تكلفةً فهو الاعتماد على عقدة واحدة فقط في حين أن عبء العمل يتطلب فعلياً استخدام تقنية Fabric، ثم قضاء ستة أشهر في محاولة التظاهر بأن الجهاز يلبي الاحتياجات.
تتناول هذه المقالة منطق اتخاذ القرار في هذا التقسيم: متى يكون جهاز واحد بثمانية وحدات معالجة رسومية هو الحل الأمثل، ومتى لا يكون كذلك، وكيفية تحديد أي جانب من الخط يقع عليه عبء العمل الخاص بك. وتغطي المقالات المصاحبة الآليات (كيه02 تدريب، كيه03 الاستدلال، كيه07 حدود PCIe، كيه06 معالجة الأعطال)؛ هذا الأمر متروك للمشتري.
الحد الأقصى لعدد وحدات معالجة الرسومات (8 وحدات) حسب الطراز
السؤال الأول هو ما إذا كان النموذج يتسع في عقدة واحدة. مع 8 بطاقات رسومات RTX Pro 6000 Blackwell (سعة كل منها 96 جيجابايت)، تحصل على 768 جيجابايت من ذاكرة الوصول العشوائي للفيديو (VRAM) القابلة للاستخدام؛ ومع 8 بطاقات رسومات RTX 5090 (سعة كل منها 32 جيجابايت)، تحصل على 256 جيجابايت. كلا الخيارين ليسا صغيرين بمعايير عام 2026، ولا يتسع أي منهما لجميع البيانات.
| الموديل | الأوزان (FP8) | الأوزان (INT4) | 8× 5090 (256 جيجابايت)؟ | 8× Pro 6000 (768 جيجابايت)؟ |
|---|---|---|---|---|
| لاما 3.1 / 3.3 70B | ~ شنومك غيغابايت | ~ شنومك غيغابايت | نعم، بكل راحة | نعم، مع مساحة رأسية KV |
| كوين 2.5 72B (بما في ذلك VL) | ~ شنومك غيغابايت | ~ شنومك غيغابايت | نعم | نعم |
| ميكسترال 8x22B (إجمالي 141B) | ~ شنومك غيغابايت | ~ شنومك غيغابايت | INT4 فقط، ضيق | نعم |
| اللاما 3.1 405 ب | ~ شنومك غيغابايت | ~ شنومك غيغابايت | لا | نعم، INT4، هامشي FP8 |
| DeepSeek-V3 (671B MoE, 37B act) | ~ شنومك غيغابايت | ~ شنومك غيغابايت | لا | نعم، INT4، هامشي FP8 |
| كثافة افتراضية تزيد عن 600 مليار | 600+ جيجابايت | 300+ جيجابايت | لا | هامشي أو لا شيء |
يقع الحد الفاصل عند خط 405B / 671B. أسفل هذا الخط، يكفي جهاز واحد من نوع Pro 6000 مزود بثمانية وحدات معالجة رسومية. أما عند هذا الحد وما فوقه، فإما أنك تقوم بتكميم البيانات بشكل مفرط (أوزان INT4 - مناسبة للاستدلال، لكنها غير مناسبة للتدريب) أو أنك تتجاوز حد العقدة.
"التوافق" لا يعني "التشغيل الجيد". فالنموذج الذي يشغل 95% من ذاكرة الوصول العشوائي للفيديو (VRAM) دون أي مساحة كافية لذاكرة التخزين المؤقت للمفتاح والقيمة، أو ذاكرة التخزين المؤقت للبادئة، أو رسوم CUDA البيانية، أو ذاكرة التنشيط، سيرفض الطلبات تحت أي ضغط حقيقي. القاعدة العملية: تخصيص أوزان تتراوح بين 60-70% من ذاكرة الوصول العشوائي للفيديو، وترك 30-40% لبقية المكونات. مع هذا القيد، فإن 405 بايت عند دقة FP8 لست يمكن تركيبها بسهولة على 8× Pro 6000 للاستدلال عند أي مستوى تزامن مفيد - فهي تناسب الأوزان، وليس عبء العمل.
متى لا ينبغي التوسع الأفقي
الحالات التي يكون فيها البقاء على عقدة واحدة هو الخيار الصحيح بشكل قاطع:
- الاستدلال لأي نموذج مناسب. إذا كان النموذج بالإضافة إلى KV مناسبًا للتزامن المستهدف، فإن نقل البيانات عبر الإيثرنت أو IB متعدد العقد يكون أبطأ بشكل ملحوظ من نقل البيانات عبر عقدة واحدة. يوفر PCIe Gen5 داخل جهاز واحد سرعة نقل بيانات تبلغ حوالي 50 جيجابايت/ثانية بين وحدات معالجة الرسومات على نفس المحول؛ بينما يوفر IB بسرعة 200 جيجابت/ثانية بين العقد سرعة نقل بيانات تبلغ حوالي 25 جيجابايت/ثانية. وبالتالي، فإن عبء العمل الذي يعاني من بطء على PCIe يصبح بطيئًا للغاية على IB.
- خدمة إنتاجية لمستأجر واحد. نموذج واحد، عميل واحد، تزامن متوسط. يستطيع جهاز Pro 6000 ذو 8 وحدات معالجة رسومية التعامل بسهولة مع 70 مليار طلب متزامن يتراوح بين 32 و64 طلبًا. لا يُفيد وجود جهاز ثانٍ إلا كجهاز احتياطي ساخن أو لمضاعفة إنتاجية DP - ولا يُعد أي منهما "توسعًا أفقيًا" بالمعنى الدقيق للكلمة.
- مختبرات الأبحاث التي تشغل نماذج 7B–72B. تتركز معظم الأعمال الأكاديمية والتطبيقية في عام 2026 هنا - Llama 3.x 8B، وQwen 7B/14B/32B، وMistral، وGemma، وذيل الضبط الدقيق 70B. لا يحتاج أي منها إلى أكثر من عقدة واحدة.
- ضبط دقيق لتقنية LoRA / QLoRA. تكمن فائدة PEFT في عدم الحاجة إلى موارد تدريب كاملة للنموذج. يتسع نموذج LoRa بحجم 70 بايت على 4-8 وحدات معالجة رسومية في عقدة واحدة؛ بينما يتسع نموذج QLoRA بحجم 405 بايت على 8 وحدات معالجة رسومية من نوع Pro 6000.
- الاستدلال الدفعي وأحمال العمل غير المتصلة بالإنترنت. إذا كانت اتفاقية مستوى الخدمة تنص على "معالجة هذه المجموعة من البيانات بحلول يوم الجمعة"، فإن المعالجة الدفعية في وضع الإنتاجية على جهاز واحد مزود بثمانية وحدات معالجة رسومية تكفي. ولا يفيد استخدام عدة عقد إلا في حال تعذر الانتهاء في الوقت المحدد، وعادةً ما يكون ذلك بسبب كبر حجم النموذج، وليس بسبب بطء إحدى العقد.
ينبغي على ما يقرب من 80% من عملاء Kentino شراء عقدة واحدة أكبر بدلاً من عقدتين أصغر، ومعظم الـ 20% المتبقية يريدون في الواقع نسخ DP خلف موازن تحميل، وليس مجموعة.
متى يجب عليك التوسع أفقياً
إن الحالات التي لا تكفي فيها عقدة واحدة فعلاً هي أضيق مما يفترضه الناس.
تدريب نموذج يزيد حجمه عن 70 مليار وحدة من الصفر. ثماني وحدات معالجة رسومية (GPUs) لا تكفي من حيث وقت التشغيل. يتطلب تدريب مسبق لـ 70 مليار وحدة، وفقًا لميزانيات الرموز المنشورة (1.5-15 تريليون رمز)، مئات الأشهر من استخدام وحدات المعالجة الرسومية على أجهزة من فئة H100، وأكثر من ذلك على وحدات معالجة رسومية PCIe المخصصة للمستهلكين. يتطلب هذا العمل من 32 إلى 128 وحدة معالجة رسومية أو أكثر، بالإضافة إلى بنية SXM. لا تقوم شركة Kentino ببناء هذا المستوى.
ضبط دقيق كامل الرتبة لـ 70B+. ليس LoRA - بل ضبط دقيق كامل مع حالات المُحسِّن، والتدرجات، والتنشيطات المُدمجة. يتطلب الضبط الدقيق الكامل بحجم 70 بايت (أوزان FP16 + FP32 Adam + التدرج + التنشيط) ما بين 1.2 و1.5 تيرابايت من البيانات، وهو ما يتجاوز عقدة واحدة ذات 8 وحدات معالجة رسومية حتى مع FSDP. وهذا يُبرر استخدام مجموعة IB مكونة من 2 إلى 4 عقد.
استضافة 405 مليار بايت بزمن استجابة الإنتاج. تتناسب الأوزان مع INT4 على 8 وحدات معالجة رسومية Pro 6000، ولكن ذاكرة التخزين المؤقت KV بالإضافة إلى الخدمة المتزامنة بزمن استجابة مقبول يتطلبان عقدتين أو أكثر. يُعدّ جهازان من نوع Pro 6000 بثمانية وحدات معالجة رسومية في TP=8 × PP=2 أو TP=4 × PP=4 الحد الأدنى الواقعي لتشغيل Llama 3.1 بسرعة 405 بايت بمعدل استعلامات في الثانية مناسب. كيه03 يشرح هذا.
إنتاج متعدد المستأجرين بمعدل إجمالي يزيد عن 100 ألف عملية إنتاج في الثانية. تُقدّم عقدة واحدة مزودة بثمانية وحدات معالجة رسومية (GPU) خدمةً تتراوح بين 500 و2,000 عملية نقل بيانات (tok/s) بمعدل 70 مليار نقطة في الثانية (FP8). عند تجاوز عشرات الآلاف من عمليات الاستعلام في الثانية (QPS)، يُفضّل استخدام نسخ متعددة، وبعد ذلك يُفضّل استخدام مجموعة خوادم حقيقية مزودة بموجّه وتوجيه مُدرك لذاكرة التخزين المؤقت للبادئات. عادةً ما يكون الحل الأمثل هو استخدام العديد من نسخ DP، وليس مجموعة TP ضخمة واحدة.
باستثناء هؤلاء الأربعة، تضعف الحجة بسرعة. فمعظم طلبات "أحتاج إلى عقد متعددة" تتحول إلى "أريد إنتاجية أعلى" - وهو سؤال يتعلق بالنسخ المتماثلة، وليس بالبنية التحتية.
النقطة المثالية أحادية العقدة
هندسة بنية عقدة واحدة قوية، على الأجهزة التي يتم شحنها فعليًا من Kentino:
| مكون | “الاختيار” | لماذا |
|---|---|---|
| وحدة معالجة الرسوميات: | 8× RTX Pro 6000 Blackwell (96 جيجابايت) | تحتوي ذاكرة الوصول العشوائي للفيديو بسعة 768 جيجابايت على جميع النماذج المفتوحة الواقعية لعام 2026 |
| وحدة معالجة الرسومات (بديلة) | 8× RTX 5090 (32 جيجابايت) | أرخص، بسعة إجمالية 256 جيجابايت، ومناسب حتى فئة 72B |
| وحدة المعالجة المركزية: | EPYC 9554P أو 9654 (مقبس واحد) | 128 مسار PCIe من الجيل الخامس، بدون اختناق xGMI |
| ربط | PCIe Gen5 x16 (نسيج مُبدَّل) | سرعة نقل البيانات بين وحدات معالجة الرسومات تصل إلى حوالي 50 جيجابايت/ثانية، ولا يوجد اتصال NVLink في هذه الطرازات. |
| رامات | 768 جيجابايت - 1 تيرابايت DDR5 | سخية في توفير مغذيات مجموعات البيانات وتسرب KV |
| الشبكات | 2 × 100 جيجابت (اختياري 400 جيجابت) | مساحة كافية للاستدلال والخروج والتخزين |
| التخزين | 4-8 U.2 NVMe + 2 M.2 boot | ذاكرة NVMe محلية لمجموعات البيانات ونقطة التفتيش المؤقتة |
القيد الرئيسي: لا تدعم هذه البطاقات تقنية NVLink. بطاقات RTX 5090 و RTX Pro 6000 Blackwell و L40 و L4 متصلة عبر منفذ PCIe. تتطلب وحدات NVLink-fabric SXM (H100 SXM و B200 SXM و GB200) لوحات أساسية من نوع HGX لا نقوم بتصنيعها. كيه07 يغطي التكلفة؛ N03 يغطي الحالات التي يكون فيها NVLink مهمًا.
يُعدّ مسار PCIe مناسبًا للعمليات التي تعتمد على الاستدلال أولًا، ولأغلب عمليات التدريب التي لا تصل إلى حدود الإمكانيات. تعمل معالجة الدفعات في وضع الإنتاجية على توزيع تكلفة الاستدلال. عند ضبط النماذج ذات الحجم الثابت بدقة، تتراوح تكلفة وقت التشغيل الفعلي مقارنةً بـ SXM بين 1.2 و1.4 ضعف، وهو أمر مقبول عادةً. أما عند التدريب المتوازي باستخدام الموترات لأكثر من 70 مليار نموذج من الصفر، فتتراوح التكلفة بين ضعفين وثلاثة أضعاف، والحل الأمثل هو: "شراء SXM أو عدم استخدام أجهزة Kentino لهذا العمل".
الفجوة بين العقدة الواحدة والعقد المتعددة
إن الشيء الذي يجعل النظام متعدد العقد فئة مختلفة هو الفجوة الكبيرة في الربط البيني بين داخل العقدة وبين العقد، من حيث عرض النطاق الترددي وزمن الوصول.
| مسار | عرض النطاق الترددي | كمون |
|---|---|---|
| من وحدة معالجة الرسومات إلى وحدة معالجة الرسومات، نفس مفتاح PEX (PCIe Gen5 x16) | ~50 جيجابايت/ثانية | جزء من الميكروثانية |
| التبديل بين وحدات معالجة الرسومات (GPU) عبر وحدة معالجة الرسومات الجذرية | سرعة مشاركة تبلغ حوالي 50 جيجابايت/ثانية | أجزاء من الثانية |
| 400 جيجابت في الثانية InfiniBand NDR (العقدة الداخلية) | ~50 جيجابايت/ثانية | 1-2 ميكروثانية |
| تقنية InfiniBand HDR بسرعة 200 جيجابت في الثانية (عقدة مشتركة) | ~25 جيجابايت/ثانية | 1-2 ميكروثانية |
| 100 جيجابت إيثرنت RoCE (بين العقد) | ~12.5 جيجابايت/ثانية | 5-15 ميكروثانية |
| 25 جيجابت إيثرنت TCP (بين العقد) | ~3 جيجابايت/ثانية | 20-50 ميكروثانية |
داخل صندوق، تتواصل وحدتا معالجة رسومية بسرعة 50 جيجابايت/ثانية تقريبًا مع قفزات زمنية أقل من ميكروثانية. أما عند الاتصال بين العقد، فتصل السرعة إلى 25 جيجابايت/ثانية تقريبًا على شبكة IB بسرعة 200 جيجابت/ثانية - أي بزيادة قدرها الضعف على شبكة IB، ومن 4 إلى 5 أضعاف على شبكة 100 جيجابت إيثرنت، و15 ضعفًا على شبكة 25 جيجابت إيثرنت. بالنسبة لمجموعات TP التي تُفعّل كل طبقة من طبقات المحولات، فإن هذا يُؤثر سلبًا بشكل كبير. كيه07 يحتوي على جدول توقيت التخفيض الكامل.
يؤدي زمن الاستجابة إلى مضاعفة ذلك: يتراوح زمن الاستجابة بين العقد من 5 إلى 15 ميكروثانية على RoCE المُحسَّن مقابل نانوثانية داخل نطاق محدد. بالنسبة للتدريب والتعبئة المسبقة، يُصبح هذا الفرق ضئيلاً؛ أما بالنسبة للاستدلال التفاعلي منخفض زمن الاستجابة مع دقة عالية، فلا يُؤثر ذلك.
يكمن الخطر في أن "إضافة جهاز آخر" ليس قرارًا مستمرًا. أي شيء بالكاد يعمل على PCIe داخل عقدة واحدة لن يعمل على Ethernet أو IB بين العقد.
الرياضيات ذات التوسع القوي: أين تكمن نقاط ضعفها
قانون أمدال: تتحدد سرعة المعالجة بنسبة العمليات المتسلسلة من إجمالي عبء العمل، وفي التدريب الموزع، تمثل هذه النسبة تكلفة الاتصال. بالنسبة لخطوة تدريب من فئة 70 مليار على أجهزة PCIe من فئة Kentino، تبدو كفاءة التوسع (إنتاجية كل وحدة معالجة رسومية مقابل خط الأساس لوحدة معالجة رسومية واحدة) كما يلي في جميع الإصدارات التي قمنا بإصدارها:
| الاعداد | كفاءة وحدة معالجة الرسومات لكل وحدة معالجة رسومات | نظام مفيد |
|---|---|---|
| 1 GPU | 1.00× (خط الأساس) | دائما |
| 4 وحدات معالجة رسومية، عقدة واحدة، PCIe Gen5 TP | 0.82 × | المكان الأمثل لورق التواليت |
| 8 وحدات معالجة رسومية، عقدة واحدة، PCIe Gen5 TP (مُبدَّلة) | 0.73 × | حافة مفيدة لـ TP |
| 8 وحدات معالجة رسومية، عقدة واحدة، FSDP / معالجة البيانات بالتوازي | 0.88 × | قوي لـ DP |
| عقدتان × 4 وحدات معالجة رسومية، 200 جيجابت في الثانية IB، TP عبر العقد | 0.65 × | مؤلم، ونادراً ما يكون الأمر يستحق العناء. |
| عقدتان × 8 وحدات معالجة رسومية، 200 جيجابت في الثانية IB، TP داخلي / PP داخلي | 0.74 × | مناسب للنماذج الكبيرة |
| 4 عقد × 8 وحدات معالجة رسومية، 400 جيجابت في الثانية IB NDR، TP/PP/DP مختلط | 0.62 × | عمل جماعي حقيقي |
| عقدتان × 8 وحدة معالجة رسومات، و100 جيجابت RoCE، وبيانات متوازية فقط | 0.84 × | أفضل صفقة متعددة العقد لـ DP |
نقطتان أساسيتان. أولاً، تقسيم مهمة تتطلب 8 وحدات معالجة رسومية إلى عقدتين، كل منهما تحتوي على 4 وحدات معالجة رسومية، أسوأ من تشغيلها على جهاز واحد. — كل نسيج متعدد العقد أبطأ من PCIe الموجود داخل الجهاز الذي كان لديك بالفعل. ثانيًا، يُعدّ التوازي في معالجة البيانات أكثر قابلية للتوسع من التوازي في معالجة الموترات عبر النسيج. إذا كان سؤالك الحقيقي هو "هل يمكنني تلبية المزيد من الطلبات" بدلاً من "هل يمكنني تشغيل نموذج واحد أكبر بشكل أسرع"، فإن النسخ المتماثلة DP تعمل، وهي تعمل عبر 100 جيجابت إيثرنت التجارية.
إذا انخفضت الكفاءة المتوقعة إلى أقل من 60%، فإن توزيع عبء العمل غير مناسب لشبكة متعددة العقد على بنية قياسية. لذا، يُنصح بإعادة تصميم البنية (نقل البيانات داخل العقدة، أو نقل نقاط المعالجة أو نقاط التوزيع عبر العقد)، أو شراء عقدة واحدة أكبر، أو شراء أجهزة من فئة SXM. الحلول التقليدية غير مجدية.
فخ مختبرات الأبحاث والضريبة التشغيلية
نمطٌ نراه كثيراً لدرجة تستدعي التنبيه: مختبرٌ يخطط "للمستقبل" ويطلب عقدتين بأربع وحدات معالجة رسومية بدلاً من عقدة واحدة بثماني وحدات. ما يحصلون عليه فعلياً هو تدريبٌ أسوأ (0.65 ضعف معدل التنبؤ الصحيح بين العقد مقابل 0.73 ضعف داخل العقدة الواحدة)، واستدلالٌ أسوأ لأي نموذجٍ يناسب عقدة واحدة، وضعفٌ في العبء التشغيلي (وحدتا تحكم في لوحة التحكم، وضبط بطاقتي شبكة، وحالتا دبابيس تعريف، ونطاقا أعطال)، وتكلفةٌ مماثلةٌ تقريباً للمكونات بعد ترقية بطاقة الشبكة الثانية ووحدة تزويد الطاقة الثانية والمحول. اشترِ عقدة واحدة بثماني وحدات معالجة رسومية أولاً.
إنّ استخدام عدة عقد، عندما يكون هو الحل الأمثل، ليس مجانيًا. والتكلفة الإضافية هي:
- التخزين المشتركة — لم يعد استخدام NVMe المحلي كافيًا. يجب استخدام NFS أو BeeGFS أو Lustre، بالإضافة إلى شبكة VLAN للتخزين (كيه04 ).
- نقاط التفتيش المجزأة غير المتزامنة — تؤدي عمليات الكتابة المتزامنة غير المجزأة إلى نظام ملفات الشبكة (NFS) إلى توقف المجموعة. يُعدّ استخدام PyTorch DCP أو NeMo إلزاميًا وليس اختياريًا.
- ضبط NIC و NCCL — التحكم في تدفق RoCE، وPFC، وECN، والإطارات الضخمة، واختيار نقل NCCL، وملفات الطوبولوجيا، وخوارزميات الحلقة مقابل الشجرة. كل خيار سيكون خاطئًا عند التشغيل.
- مراقبة — DCGM لكل عقدة، اتحاد بروميثيوس، مخازن تتبع NCCL.
- معالجة الفشل — انقطاع اتصال العقدة، وإعادة ضبط بطاقة الشبكة، وتقلبات منفذ المحول. كيه06 يغطي هذا التقرير الأنماط؛ معدلات الفشل في الأنظمة متعددة العقد تقارب N ضعف معدلات الفشل في الأنظمة أحادية العقدة، وتكون عملية التعافي أكثر تعقيدًا.
من الناحية الهندسية، تبلغ تكلفة إضافة عقدة واحدة إلى نظام متعدد العقد من 4 إلى 5 أضعاف التكلفة الإجمالية. لذا، ضع ذلك في اعتبارك، أو تقبّل أن يقضي النظام الأشهر الستة الأولى بنصف طاقته النظرية.
مسار اتخاذ القرار الملموس
اتبع الخطوات بالترتيب. أول "نعم" تنهي المحادثة.
- هل يتناسب هذا الطراز مع 8 × 96 جيجابايت بدقة FP8 مع هامش 30-40% من ذاكرة الوصول العشوائي للفيديو (VRAM) لـ KV؟ إذا كانت الإجابة بنعم، عقدة واحدة، تم الأمر.
- هل يتناسب مع INT4 بنفس المساحة الرأسية؟ إذا كانت الإجابة نعم، وكنت تقوم بالاستدلال (وليس التدريب)، فإن استخدام عقدة واحدة من نوع INT4 هو الحل. أوزان INT4 غير مناسبة لمسار التدرج في التدريب - تابع.
- هل يرتبط حجم العمل بمعدل نقل البيانات بدلاً من حجم النموذج؟ إذا كانت الإجابة بنعم، فالحل هو نسخ متوازية للبيانات من تكوينات عقدة واحدة، وليس مجموعة. جهازان خلف موازن الأحمال، ولا حاجة إلى بنية أساسية.
- هل عبء العمل عبارة عن تدريب متوازي للموتر لنموذج لا يتناسب مع عقدة واحدة؟ نظام متعدد العقد مع تقنية InfiniBand. كفاءة توسيع نطاق المشروع باستخدام كيه07 جدول 's. إذا كانت النسبة أقل من 60%، فأعد تصميم البنية (TP في الداخل، PP عبر) أو قلل عدد العقد واقبل وقت تشغيل أبطأ.
- هل عبء العمل هو تدريب نموذج يزيد حجمه عن 70 مليار نموذج من الصفر؟ حالة Frontier. نظام متعدد العقد مع NDR IB أو SXM. بإمكان Kentino بناء جانب IB، لكن معظم العملاء الذين يطرحون هذا السؤال لا يحتاجون فعليًا إلى القيام بهذا العمل بأنفسهم.
الخطوتان الأولى والثانية تشكلان الجزء الأكبر من السوق. الخطوة الثالثة تعني أنك تنمو بشكل جيد - والحل هو وجود نسخ متماثلة، وليس مجموعة متجانسة. الخطوتان الرابعة والخامسة حقيقيتان لكنهما نادرتان.
رأي صريح
تُعدّ الحوسبة متعددة العُقد في طليعة التكنولوجيا - حيث تُتيح أكثر من 70 مليار عملية تدريب من الصفر، وأكثر من 405 مليارات عملية استدلال بزمن استجابة مُماثل في بيئة الإنتاج، ومراكز بيانات فائقة التوسع تُقدّم أكثر من 100 ألف استعلام في الثانية، أو أبحاثًا تعتمد على إنتاجية يومية لا يُمكن لجهاز واحد توفيرها. هذه هي أحمال العمل الحقيقية، وليست مُعظم ما يتم بناؤه.
أما بالنسبة لبقية الأمور، فإن عقدة واحدة ذات مواصفات عالية وثماني وحدات معالجة رسومية هي الحل الأمثل. فهي تشغل جميع أحمال عمل الاستدلال مفتوحة الوزن لعام 2026 التي تتناسب مع 768 جيجابايت بدقة FP8/INT4، وLoRA وQLoRA حتى 405 بايت، بالإضافة إلى عمليات الضبط الدقيق الكاملة لفئة 13 بايت دون أي مشاكل، ويمكن توسيعها لتشمل نسختين أو ثلاث نسخ متماثلة من نوع DP لزيادة الإنتاجية دون الحاجة إلى بنية عنقودية. كما أنها أسهل بكثير في التشغيل.
تتلخص آلية حوارنا مع معظم العملاء في: وصف حجم العمل، وحسابات التوافق، وتقييم كفاءة التوسع. إذا كان المشروع عبارة عن مجموعة خوادم، نقوم بإنشاء مجموعة خوادم. إذا كان عقدة واحدة، نقوم بإنشاء عقدة واحدة. إذا كان نسختين متماثلتين خلف جهاز توجيه، نقوم بإنشاء ذلك. نحن لا نبيع أكبر تكوين يمكنك تحمله، بل نبيع التكوين الأمثل الذي سيعمل بكفاءة.
ماذا تفعل بعد ذلك
إذا كنت تزن نفسك قبل التوقيع:
- دوّن النموذج وحجم العمل. عدد المعاملات، والتكميم، وذروة عدد المستخدمين المتزامنين، وزمن الاستجابة المستهدف، ومعدل النقل المستهدف. تنبثق حسابات التوافق وعرض النطاق الترددي من هذه الأرقام؛ وبدونها، ستكون الإجابة مجرد تخمين.
- حساب الأوزان بالإضافة إلى ذاكرة التخزين المؤقت للقيم المفتاحية عند التزامن المستهدف. يتسع لـ 8 وحدات تخزين سعة كل منها 96 جيجابايت مع هامش أمان بنسبة 30% ← عقدة واحدة. وإلا، فقم بتقييم خيار العقد المتعددة.
- كفاءة توسيع نطاق المشروع وفقًا لتكوينك الفعلي. استعمل كيه07 الجدول 's. نسبة أقل من 60% تعني أن البنية خاطئة، وليس عدد العقد.
- افصل مسألة الإنتاجية عن مسألة ملاءمة النموذج. "عدد الطلبات في الثانية الواحدة" هو سؤال مُكرر. جهازان مزودان بـ 8 وحدات معالجة رسومية خلف جهاز توجيه يتفوقان على مجموعة واحدة من 16 وحدة معالجة رسومية في جميع أحمال العمل الحساسة للتأخير التي قمنا بقياسها.
- قيّم القدرة التشغيلية بصدق. بدون مهندس تخزين، ومهندس شبكة، وفريق دعم عند الطلب، تقضي العقدة الثانية ربعها الأول بنسبة 50% من سعتها النظرية بينما تقوم بتصحيح أخطاء NCCL وBeeGFS.
- يتم اختيار عقدة واحدة أكبر حجماً بشكل افتراضي، وليس عقدتين أصغر حجماً. مقارنة بين 4 وحدات معالجة رسومية × 2 و 8 وحدات معالجة رسومية × 1 ترجح كفة صندوق 8 وحدات معالجة رسومية في كل جانب تقريبًا.
المقالات المرافقة: كيه02 (تمرين)، كيه03 (مجموعات الاستدلال)، كيه04 (تخزين)، كيه06 (معالجة الأعطال)، كيه07 (حدود PCIe وجدار التوسع)، N02 (IB مقابل RoCE مقابل Ethernet)، N03 (NVLink ومتى يكون ذلك مهمًا).
هذا جزء من ويكي كينتينو، وهي سلسلة مرجعية حول الحوسبة الذكية، والروبوتات، والأنظمة التي تربط بينهما. نرحب بالتعليقات والتصويبات على info@kentino.com.