تقنية NVLink وتقنية NVSwitch: متى يكون استخدامها مهمًا، ولماذا لا يكون كذلك عادةً بالنسبة لتشكيلة كينتينو
سؤال متكرر في صندوق الوارد: عميل يبحث عن خادم بمعالج رسومات رباعي أو ثماني، يرى إعلانات NVIDIA DGX التسويقية التي تتباهى بعرض نطاق NVLink بالتيرابايت في الثانية، ويسأل عما إذا كان إصدار Kentino يدعم NVLink. الإجابة الصادقة هي لا، لا يدعم أي من إصداراتنا NVLink، وهذا مناسب تمامًا لأحمال العمل التي يستخدمها العميل. توضح هذه المقالة السبب.
تُعدّ تقنية NVLink مثيرة للإعجاب حقًا في أعلى فئات المنتجات، بينما تغيب تمامًا عن باقي الفئات. لا تُوضّح الحملات التسويقية الفرق بوضوح، ما يدفع المشترين إما إلى دفع مبالغ زائدة مقابل تقنية لا يحتاجونها، أو إلى التقليل من قيمة PCIe ظنًا منهم أنها تراجعٌ كبيرٌ في الأداء. كلا الأمرين غير صحيح. فالفرق واضحٌ ومحددٌ بدقة.
ما هو NVLink في الواقع؟
NVLink عبارة عن وصلة ربط بين وحدات معالجة الرسومات (GPU) عالية النطاق الترددي، تعمل بنظام نقطة إلى نقطة، وتتجاوز بنية PCIe الأساسية للمضيف. تقوم وحدتا معالجة رسومات متصلتان عبر NVLink بنقل الموترات مباشرةً عبر الوصلة دون المرور عبر ذاكرة وحدة المعالجة المركزية (CPU) ودون التداخل مع أي مكونات أخرى في بنية PCIe. هذه هي الفكرة الأساسية.
تُعدّ ميزة عرض النطاق الترددي مقارنةً بـ PCIe كبيرة. يوفر منفذ PCIe Gen5 x16 - وهو الحد الأقصى الحالي لفتحة مخصصة للمستهلكين أو محطات العمل - حوالي 64 جيجابايت/ثانية في كل اتجاه، أي 128 جيجابايت/ثانية إجمالاً. بينما يوفر NVLink 5 على لوحتي B200 وGB200 سرعة نقل بيانات إجمالية تبلغ 1.8 تيرابايت/ثانية لكل وحدة معالجة رسومية، أي ما يقارب 14 ضعف سرعة منفذ PCIe Gen5 x16.
هذه المقارنة مضللة بمجرد كتابتها، لأن وحدات معالجة الرسومات المزودة بتقنية NVLink 5 ليست بالضرورة وحدات معالجة رسومات تستخدم PCIe Gen5 x16 كوصلة أساسية. تُستخدم تقنية NVLink في وحدات معالجة الرسومات المخصصة لمراكز البيانات (A100، H100، H200، B200، GB200)؛ بينما تُعد PCIe المسار الوحيد في وحدات معالجة الرسومات المخصصة للمستهلكين ومحطات العمل (4090، 5090، RTX Pro 6000 Blackwell، L40، L4). وبالتالي، فإن مقارنة "NVLink مقابل PCIe" تعني عمليًا "مقارنة سلسلة H100 ببقية السلاسل".
نظرة سريعة على أجيال NVLink
| جيل | وحدة معالجة الرسوميات: | عدد الروابط لكل وحدة معالجة رسومية | إجمالي لكل وحدة معالجة رسومية | السنة |
|---|---|---|---|---|
| NVLink 2 | V100 (فولتا) | 6 | 300 جيجابايت / ثانية | 2017 |
| NVLink 3 | A100 (أمبير) | 12 | 600 جيجابايت / ثانية | 2020 |
| NVLink 4 | H100 / H200 (قادوس) | 18 | 900 جيجابايت / ثانية | 2022 |
| NVLink 5 | B200 / GB200 (Blackwell DC) | 18 | 1.8 TB / s | 2024 |
ازداد عدد الروابط من الجيل الثاني إلى الرابع، ثم تضاعفت سعة النطاق الترددي لكل رابط من الجيل الرابع إلى الخامس (من 50 جيجابايت/ثانية إلى 100 جيجابايت/ثانية). لهذا السبب يبدو NVLink 5 وكأنه نقلة نوعية - وهو كذلك بالفعل.
PCIe في جهاز Kentino:
| Standard | لكل اتجاه × 16 | المجموع × 16 |
|---|---|---|
| فتحة PCIe Gen4 x16 | 32 جيجابايت / ثانية | 64 جيجابايت / ثانية |
| فتحة PCIe Gen5 x16 | 64 جيجابايت / ثانية | 128 جيجابايت / ثانية |
في أسوأ الأحوال (الجيل الرابع)، تبلغ قيمة PCIe حوالي 1/14 من قيمة NVLink 4. وفي أفضل الأحوال (الجيل الخامس)، تبلغ قيمة PCIe حوالي 1/14 من قيمة NVLink 5. وتظل النسبة ثابتة تقريبًا بفضل تصميم NVIDIA.
بصراحة: تشكيلة كينتينو لا تحتوي على تقنية NVLink
| وحدة معالجة الرسوميات: | شكل عامل | NVLink؟ |
|---|---|---|
| RTX 4090 | بكيي | لا |
| RTX 5090 | بكيي | لا |
| RTX Pro 6000 Blackwell (WS/Server/Max-Q) | بكيي | لا |
| L40 / L40S | بكيي | لا |
| L4 | بكيي | لا |
| إنتل آرك برو بي 70 | بكيي | ن / أ |
أزالت NVIDIA تقنية NVLink من بطاقات GeForce المخصصة للمستهلكين بدءًا من Ada Lovelace. كانت بطاقة 3090 آخر بطاقة للمستهلكين مزودة بجسر NVLink فعال؛ بينما تخلت عنها بطاقة 4090، أما بطاقة 5090 فلا تحتوي عليها إطلاقًا. وكان السبب المعلن هو "أن المستخدمين يريدون عرض نطاق ترددي داخل وحدة معالجة رسومية واحدة، وليس بين وحدتين" - وهو ما يتوافق تمامًا مع تدريب العملاء الذين يدفعون أسعار مراكز البيانات مقابل عرض نطاق ترددي بين وحدات معالجة الرسوميات.
تُعدّ بطاقة RTX Pro 6000 Blackwell حالةً مثيرةً للاهتمام، فهي بطاقةٌ بسعة 96 جيجابايت مُخصصة لمحطات العمل والخوادم، وتعتمد على نفس شريحة Blackwell المستخدمة في بطاقة B200، والتي تُعتبر الخيار الأمثل للحصول على ذاكرةٍ قويةٍ لوحدة معالجة الرسومات دون الحاجة إلى استخدام شريحة B200. كما أنها تفتقر إلى تقنية NVLink، سواءً في محطات العمل أو الخوادم أو حتى في تقنية Max-Q. ولا يوجد موصل جسر على لوحة الدوائر المطبوعة. وتشير بيانات NVIDIA إلى أن تقنية NVLink غير مدعومة في جميع وحدات SKU الثلاث.
هذا هو خط التقسيم المقصود. تعني تقنية NVLink الترقية إلى H100 أو H200 أو B200 أو GB200 - وهي عبارة عن هيكل SXM، ولوحة أم HGX، وهيكل مختلف، ونظام تبريد مختلف، ومساحات تخزين غير متوفرة لدى Kentino. إذا كنت بحاجة فعلية إلى تقنية NVLink، فتحدث إلى أحد موردي أنظمة HGX.
ما الذي ستفقده بدون NVLink؟
تظهر العقوبة في نمطين محددين من أنماط عبء العمل:
- التوازي الموتري عبر وحدات معالجة الرسومات. عندما يكون حجم النموذج أكبر من أن تستوعبه وحدة معالجة رسومية واحدة، ويتم تقسيم مصفوفة أوزان كل طبقة على عدة بطاقات، فإن كل طبقة تحويل تتطلب عملية AllReduce عبر الأجزاء. وتستهلك AllReduce نطاقًا تردديًا كبيرًا وتتأثر بزمن الاستجابة. ويُعدّ PCIe هو عنق الزجاجة.
- التدريب الموزع مع مزامنة التدرج الدقيق. تُجري تقنيات التدريب DDP وFSDP وMegatron عمليات تقليل التدرج في كل خطوة. وكلما قلّت العمليات الحسابية لكل خطوة وكبر حجم النموذج، زادت سيطرة عملية الربط البيني على وقت التشغيل الفعلي.
كل شيء آخر - الاستدلال على وحدة معالجة رسومية واحدة، والتوازي في خطوط المعالجة، وتوازي البيانات، والتضمينات، والاستدلال البصري، والتعرف التلقائي على الكلام، وتحويل النص إلى كلام، وتوليد صور الانتشار، وضبط نموذج يناسب وحدة معالجة رسومية واحدة - يعمل بشكل جيد على PCIe. NVLink غير ذي صلة.
قياسات TP لـ LLM من الفئة 70B عند INT4/INT8، من معايير 3090/4090/L40S المنشورة:
| الاعداد | توسيع نطاق TP | ملاحظة |
|---|---|---|
| 2× وحدة معالجة رسومات، NVLink (3090 + جسر) | ~ 0.90–0.95 | شبه خطي |
| 2 وحدات معالجة رسومية، PCIe Gen4 | ~ 0.60–0.70 | تقليل الخسائر بشكل كبير |
| 2 وحدات معالجة رسومية، PCIe Gen5 | ~ 0.65–0.75 | أفضل، لكنه لا يزال يعاني من اختناقات في الزجاجة |
| 4 وحدات معالجة رسومية، PCIe Gen5 | ~ 0.50–0.65 | زيادة تكلفة AllReduce |
| 8 وحدات معالجة رسومية، PCIe Gen5 | ~ 0.40–0.55 | يصبح استخدام ورق التواليت مؤلماً |
اقرأ هذه الأرقام على أنها نطاقات، وليست وعودًا مؤكدة - فالأرقام الدقيقة تعتمد على النموذج، وحجم الدفعة، وطول التسلسل، والتكميم، وبنية NUMA، وموضع الفتحة. الشكل حقيقي: يتوسع التوازي الموتري PCIe بشكل غير خطي، وتزداد التكلفة مع عدد وحدات معالجة الرسومات. لهذا السبب، توصي وثائق vLLM باستخدام التوازي الخطي بدلاً من التوازي الموتري على أنظمة PCIe فقط التي تحتوي على أكثر من وحدتي معالجة رسومات.
البديل العملي: الاحتفاظ بالنموذج على وحدة معالجة رسومات واحدة
الحقيقة التي لا تحظى بالتقدير الكافي في عالم معالجات الرسوميات الحالية: تحتوي بطاقة RTX Pro 6000 Blackwell على 96 جيجابايت من ذاكرة الوصول العشوائي للفيديو (VRAM) على بطاقة واحدة، وهو ما يكفي لتشغيل معالج رسوميات 70B بسرعة INT4 أو INT8 على معالج رسوميات واحد مع مساحة تخزين مؤقتة KV. إذا تجنبت تقسيم النموذج على معالجات رسوميات متعددة، فإن تقنية NVLink تصبح غير ضرورية.
| الموديل | كوانت | VRAM | ون برو 6000؟ |
|---|---|---|---|
| 7 ب / 8 ب | INT4 | ~ شنومك غيغابايت | نعم، نسخ عديدة |
| 13B | INT4 | ~ شنومك غيغابايت | نعم، نسخ عديدة |
| 32B | INT4 | ~ شنومك غيغابايت | نعم، 4 أضعاف التزامن |
| 70B (Llama 3.3, Qwen) | INT4 | ~ شنومك غيغابايت | نعم، بالإضافة إلى ذاكرة التخزين المؤقت للقيم المفتاحية |
| 70B | INT8 | ~ شنومك غيغابايت | نعم، ضيق |
| Qwen2.5-VL 72B | INT4 | ~ شنومك غيغابايت | نعم |
| 405B (لاما 3.1) | INT4 | ~ شنومك غيغابايت | لا — 3 بطاقات |
| ميكسترال 8×22B | INT4 | ~ شنومك غيغابايت | محكم، بطاقة واحدة |
تُعد استضافة البطاقة الواحدة هي البنية المناسبة لكل نموذج تقريبًا يستحق الخدمة في عام 2026. الاستثناءات: النماذج الكبيرة جدًا ذات الكثافة العالية (405 بايت، GPT-OSS 120 بايت) وتخطيطات MoE حيث تتناسب مجموعة الخبراء النشطة مع بطاقة واحدة ولكن مجموعة الوزن الكامل لا تتناسب معها.
بالنسبة للبطاقات المتعددة على PCIe، فإن الخيار الصحيح هو موازية خط الأنابيبلا يعتمد هذا على التوازي الموتري. يقسم التوازي الخطي الطبقات إلى كتل متصلة طويلة (تحتوي وحدة معالجة الرسومات 0 على الطبقات من 0 إلى 39، ووحدة معالجة الرسومات 1 على الطبقات من 40 إلى 79، وهكذا). يقتصر حجم البيانات المنقولة بين وحدات معالجة الرسومات على موتر التنشيط عند كل حد من حدود الكتلة - بضع مئات من الكيلوبايت لكل رمز، وليس غيغابايت لكل طبقة.
| وضع التوازي | حركة البيانات بين وحدات معالجة الرسومات لكل طبقة | هل هو حساس للترابط؟ |
|---|---|---|
| موتر متوازٍ | تفعيل × خافت مخفي، كل طبقة | نعم — يريد NVLink |
| خط الأنابيب الموازي | التفعيل عند حدود الكتل فقط | لا، PCIe جيد |
| موازاة البيانات | التدرجات عند حدود الخطوة (للتدريب فقط) | معتدل |
| خبير موازٍ (وزارة التعليم) | توجيه شامل من الخبراء | نعم — يساعد NVLink |
في خادم ثماني البطاقات من طراز 5090 يخدم جهاز 70B، لا يتم توزيع النموذج على البطاقات الثماني جميعها. بل يتم تشغيل نسختين بتوازي رباعي الاتجاهات، أو أربع نسخ بتوازي ثنائي الاتجاهات، أو -وهو الأكثر شيوعًا- ثماني نسخ مستقلة من نموذج أصغر خلف موازن أحمال. يصبح الخادم ثماني النسخ بمثابة مضاعف إنتاجية ثماني النسخ بدلًا من وحدة معالجة رسومية افتراضية ضخمة واحدة. بالنسبة للاستدلال في بيئة الإنتاج، يُعدّ تصميم النسخ المتماثلة هو الحل الأمثل عادةً بغض النظر عن توفر تقنية NVLink: فهو يوفر تزامنًا أكبر، وتراجعًا تدريجيًا في الأداء عند تعطل إحدى البطاقات.
عندما يكون لتقنية NVLink أهمية حقيقية
أحمال العمل التي يمثل فيها غياب تقنية NVLink مشكلة حقيقية، وليس مشكلة تسويقية:
- تدريب نموذج لا يتسع لوحدة معالجة رسومية واحدة. يتطلب التدريب المسبق أو الضبط الدقيق الكامل لنموذج كثيف بحجم 70 مليار عنصر تقسيم النموذج على وحدات معالجة الرسومات (GPUs) مع استخدام تقنية AllReduce للتدرج في كل خطوة. ويُعدّ NVLink هو الفرق بين جهاز إنتاجي مزود بثمانية وحدات معالجة رسومات وأربع بطاقات تنتظر في الغالب على ناقل البيانات.
- الاستدلال المتوازي للموتر على نماذج كثيفة كبيرة جدًا. إذا كنت بحاجة إلى خدمة 405B عبر وحدات معالجة الرسومات ولا يمكنك قبول زمن الوصول المتوازي لكل رمز مميز، فإن NVLink مهم.
- MoE مع توجيه خبير عبر وحدات معالجة الرسومات. تُعدّ تقنية MoE all-to-all قاسية على PCIe. بينما تستفيد تصميمات DeepSeek-V3 و Mixtral 8×22B والتصميمات المشابهة ذات الكثافة العالية عبر MoE بشكل واضح.
- حلقات RLHF / GRPO عالية التردد. تؤدي عملية مزامنة السياسة/المرجع التي تتكرر آلاف المرات في كل حقبة إلى نفس تكلفة AllReduce.
- التدريب على الانتشار باستخدام وحدات معالجة الرسومات المتعددة على نطاق واسع. بعض نماذج انتشار الفيديو الأكبر حجماً لها أنماط تنشيط تشبه أنماط التوازي الموتري.
إذا كان حجم العمل لديك مدرجًا في هذه القائمة، فلا تشتري خادم Kentino 8× 5090 وتتوقع أداءً مماثلاً لـ DGX H100. اشترِ نظام HGX، أو استأجر H100/B200 على السحابة لمرحلة التدريب، ثم أعد البيانات إلى الخادم المحلي للاستدلال. هذه طريقة عمل منطقية تمامًا ونوصي بها بشدة.
NVSwitch: نسيج على مستوى الهيكل
تقنية NVLink هي اتصال مباشر بين وحدتي معالجة رسومية، حيث تربط بينهما عبر مجموعة من الروابط. عند استخدام أكثر من وحدتي معالجة رسومية في هيكل واحد، يمكنك إما تخصيص رابط NVLink مستقل لكل زوج (لا يمكن توسيع نطاق هذه التقنية لأكثر من أربع وحدات)، أو وضع محول NVLink بينهما. يُعد NVSwitch من NVIDIA هو هذا المحول.
في لوحة HGX H100 ذات 8 وحدات معالجة رسومية، توفر أربع رقاقات NVSwitch لكل وحدة معالجة رسومية نطاقًا تردديًا كاملًا لتقنية NVLink 4 لجميع وحدات المعالجة الرسومية الأخرى - بسرعة 900 جيجابايت/ثانية، من الكل إلى الكل، دون أي تعارض. في رف GB200 NVL72، تتوسع تقنية NVSwitch لتشمل 72 وحدة معالجة رسومية في بنية واحدة غير مانعة، بسرعة 1.8 تيرابايت/ثانية لكل وحدة معالجة رسومية، و130 تيرابايت/ثانية إجمالًا. تُعد تقنية NVSwitch هي ما يجعل "وحدة معالجة رسومية افتراضية كبيرة واحدة" تعمل فعليًا؛ فبدونها، تُصبح تقنية NVLink مجرد كابل ثنائي أسرع.
عملي:
- لا يوجد مفتاح NVSwitch في أي إصدار من Kentino. لا يتم شحن NVSwitch إلا داخل هياكل HGX وDGX المعتمدة من NVIDIA. لا يمكن تركيب أي شريحة بديلة في هياكل Supermicro أو Bone64c.
- لا يوجد مفتاح NVSwitch في أي بطاقة RTX، على الإطلاق. مخصص لمراكز البيانات فقط.
- GB200 NVL72 هو جهاز بحجم الرف، وليس بحجم الخادم. تتعاون 72 وحدة معالجة رسومية عبر كابلات NVLink النحاسية بسرعات اللوحة الخلفية. الكابلات والمحولات واللوحة الخلفية جميعها من إنتاج NVIDIA. يصل سعرها المعلن إلى ملايين الدولارات الأمريكية مع فترات انتظار تمتد لعدة فصول. هذا هو الحد الأقصى لما يمكن أن توفره تقنية NVLink في عام 2026. ليس هذا ما نبحث عنه.
التكلفة والتوافر
تُصنّف الأنظمة المتوافقة مع تقنية NVLink ضمن فئة سعرية خاصة بها. السوق المتوقع في منتصف عام 2026 تقريبًا، الولايات المتحدة/الاتحاد الأوروبي:
| فئة النظام | وحدات معالجة الرسومات | نطاق سعر القائمة | المهلة |
|---|---|---|---|
| 4× RTX 5090 (فئة كينتينو) | 4 | 25 ألف يورو - 40 ألف يورو | أسابيع 2 – 4 |
| 8× RTX 5090 (فئة كينتينو) | 8 | 50 ألف يورو - 80 ألف يورو | أسابيع 3 – 6 |
| 4x RTX Pro 6000 Blackwell | 4 | 60 ألف يورو - 90 ألف يورو | أسابيع 3 – 6 |
| 8x RTX Pro 6000 Blackwell | 8 | 120 ألف يورو - 180 ألف يورو | أسابيع 4 – 8 |
| HGX H100 SXM (8× H100, NVSwitch) | 8 | 250 ألف يورو - 350 ألف يورو | أسابيع 8 – 16 |
| HGX B200 SXM (8× B200, NVSwitch) | 8 | 400 ألف يورو - 550 ألف يورو | أسابيع 12 – 24 |
| GB200 NVL72 (72× B200) | 72 | 3 مليون يورو - 4 مليون يورو+ | أشهر 6 - 12 |
يبلغ فرق السعر بين جهاز Kentino 8× Pro 6000 وجهاز HGX H100 ضعف السعر تقريبًا لنفس عدد وحدات معالجة الرسومات. أما فرق الأداء في التطبيقات التي لا تعتمد على NVLink فهو أقل بكثير من الضعف. بالنسبة للتطبيقات التي تعتمد على NVLink (مثل تدريب النماذج الكبيرة، ومعالجة الموترات المتوازية على 405B)، يُعد جهاز H100 الخيار الأمثل، وسعره مُبرر. القاعدة العامة: إذا كان حجم العمل لديك مناسبًا لوحدة معالجة رسومات واحدة بسعة 96 جيجابايت، فإن جهاز Pro 6000 يوفر أكثر من 50% من الميزانية. أما إذا كان حجم العمل أكبر، فمن الأفضل شراء جهاز يدعم NVLink.
ملخص
| سؤال | إجابة كينتينو على تشكيلة الفريق |
|---|---|
| هل لديك أي بطاقة حالية تدعم تقنية NVLink؟ | لا |
| هل يوجد أي إصدار حالي يستخدم NVSwitch؟ | لا |
| هل يمكن استخدام موتر موازٍ لـ 70B؟ | نعم، هناك عقوبة توسع تتراوح بين 0.6 و0.7 ضعف مقارنةً بـ PCIe |
| هل يمكن تشغيل خط أنابيب موازٍ لخط أنابيب بقيمة 70 مليار دولار؟ | نعم، شبه خطي |
| هل يمكن وضع بطاقة 70B على بطاقة واحدة؟ | نعم — RTX Pro 6000 Blackwell، سعة 96 جيجابايت |
| هل تقوم بتدريب شخص من الفئة 70B من الصفر؟ | ليس بكفاءة - انتقل إلى السحابة أو HGX |
| هل يُقدّم 405B كثيفًا؟ | المعالجة المتوازية الوحيدة عبر أكثر من 3 وحدات معالجة مركزية من طراز Pro 6000 |
| وزارة التعليم على نطاق واسع؟ | وزارة التعليم الأصغر نعم؛ فئة ديب سيك لا |
| هل يمكنك بناء جهاز مكافئ لجهاز DGX؟ | لا |
ماذا تفعل بعد ذلك
إذا كنت تقوم بتحديد حجم النظام ولست متأكدًا مما إذا كنت بحاجة إلى NVLink، فقم بحل المشكلة بهذا الترتيب:
- اكتب أكبر نموذج تحتاج إلى خدمته، مع مراعاة التكميم. إذا كان بالإمكان تشغيله على وحدة معالجة رسومية واحدة، فإن تقنية NVLink تصبح غير ذات صلة. توقف.
- إذا لم يكن ذلك مناسبًا، فاسأل عما إذا كان التوازي في خط الأنابيب مقبولًا. يُضيف خط الأنابيب زمن استجابة لكل رمز مميز، لكن معدل النقل جيد. وهذا مقبول بالنسبة للاستدلال الدفعي ومعظم أحمال عمل الدردشة.
- إذا لم يكن التوازي في خط الأنابيب مقبولاً (إذا كنت بحاجة إلى أقل زمن استجابة ممكن لتدفق واحد في نموذج كبير جدًا)، فأنت بحاجة إلى معالجة متوازية للموترات. عند استخدام PCIe، ستدفع رسومًا إضافية تتراوح بين 30 و50%. إذا كانت هذه الرسوم تُؤثر سلبًا على ميزانيتك، فإن NVLink يستحق ترقية النظام.
- إذا كنت تتدرب، فالإجابة دائمًا تقريبًا هي NVLink. يُعدّ تدريب النماذج الكثيفة التي تتجاوز 13 مليار عنصر على PCIe استخدامًا غير مُجدٍ لساعات معالجة الرسومات. يُنصح باستئجار NVLink في السحابة أو شراء HGX.
- للاستدلال، فإن بطاقة Pro 6000 Blackwell أحادية البطاقة أو بطاقة 5090 متعددة النسخ 4×/8× هي عادةً الإجابة الصحيحة. هذا ما يشتريه معظم عملائنا، وهو فعال.
تقنية NVLink ليست سيئة، بل هي ممتازة في وظيفتها. لقد وضعت NVIDIA معيارًا واضحًا للتجزئة، وتحت هذا المعيار، يكون الحل الأمثل هو "استضافة نماذج أصغر، وتكرارها أفقيًا، واستخدام المعالجة المتوازية عند الحاجة إلى التقسيم". هذا هو الغرض من تصميم سلسلة معالجات Kentino.
متابعة: تقنية InfiniBand وتقنية RoCE للربط البيني على نطاق المجموعات (N02)، طوبولوجيات المجموعات المتغيرة (N04و PCIe كوصلة بينية للمجموعات الصغيرة (كيه07 ).
هذا جزء من ويكي كينتينو، وهي سلسلة مرجعية حول الحوسبة الذكية، والروبوتات، والأنظمة التي تربط بينهما. نرحب بالتعليقات والتصويبات على info@kentino.com.