مسارات PCIe وطوبولوجيا خادم الذكاء الاصطناعي متعدد وحدات معالجة الرسومات

هناك خرافة شائعة في مجال الذكاء الاصطناعي للمستهلكين مفادها أن "منفذ PCIe x8 مقابل x16 لا يُحدث فرقًا في الاستدلال". وهذا صحيح في الغالب، لكن من يرددونه نادرًا ما يعرفون السبب. كما أنهم غالبًا ما يعجزون عن الإجابة بمجرد سؤالهم عن سبب عدم قدرة لوحة أم سطح المكتب على استضافة وحدة معالجة رسومية رابعة بكامل عرض النطاق الترددي، أو لماذا لا يتصرف خادم EPYC ذو 8 وحدات معالجة رسومية كما لو كان جهازي سطح مكتب بأربع وحدات معالجة رسومية متصلين ببعضهما.

هذه المقالة هي النسخة المطولة. تتناول ماهية مسارات PCIe، وكيفية تخصيصها على وحدات المعالجة المركزية التي تستخدمها شركة Kentino، ووظيفة التفرع والمحولات، ومكان استخدام NVLink (وأين لا يُستخدم)، ومتى تكون بنية الشبكة مهمة. وتختتم برسومات توضيحية عملية لمنصات EPYC التي نوفرها، والتي تدعم 4 و8 وحدات معالجة رسومية.

ما هو مسار PCIe باختصار؟

مسار PCIe عبارة عن زوج من الوصلات التسلسلية التفاضلية - واحدة لكل اتجاه - بين وحدة المعالجة المركزية (أو المحول النهائي) والجهاز. يتم دمج عدة مسارات لتشكيل وصلة أوسع: x1، x4، x8، x16. يتناسب عرض النطاق الترددي طرديًا مع عدد المسارات، ويتضاعف تقريبًا مع كل جيل.

جيل الخام لكل حارة ملف خام x16 x16 قابل للاستخدام (~)
Gen3 شنومكس غ / s 16 جيجابايت / ثانية ~15.75 جيجابايت/ثانية
Gen4 شنومكس غ / s 32 جيجابايت / ثانية ~31.5 جيجابايت/ثانية
Gen5 شنومكس غ / s 64 جيجابايت / ثانية ~63 جيجابايت/ثانية
Gen6 شنومكس غ / s 128 جيجابايت / ثانية ~121 جيجابايت/ثانية

ملاحظتان. يتم تحديد عرض النطاق الترددي لكل اتجاه. — يوفر رابط Gen5 x16 سرعة نقل بيانات تبلغ 64 جيجابايت/ثانية في كل اتجاه في وقت واحد، ولهذا السبب تذكر الشرائح التسويقية إما "64 جيجابايت/ثانية" أو "128 جيجابايت/ثانية". لا يتم شحن الجيل السادس في أي وحدة معالجة رسومات يمكنك شراؤها اليوم. تمّ وضع المواصفات النهائية، لكنّ رقائق السيليكون لم تُستخدم في بطاقات محطات العمل حتى مايو 2026؛ إذ إنّ أولى نقاط نهاية الجيل السادس مخصصة لمراكز البيانات فقط، ولا تستخدمها شركة كينتينو في تصنيعها. بالنسبة لتشكيلتنا الحالية - RTX 5090، وRTX 4090، وRTX Pro 6000 Blackwell (بنوعيها)، وL40، وL4 - فإنّ الجيل الخامس x16 هو الحد الأقصى.

ميزانيات المسارات لكل مقبس وحدة المعالجة المركزية

هنا يصبح الحد الفاصل بين سطح المكتب/محطة العمل/الخادم واضحًا. عدد المسارات على وحدات المعالجة المركزية في إصدارات Kentino الحالية، بعد طرح ما هو محجوز لمجموعة الشرائح/DMI:

فئة وحدة المعالجة المركزية جيل إجمالي مسارات PCIe قابل للاستخدام مع وحدات معالجة الرسومات / بطاقات الشبكة / NVMe
معالج Intel Core (LGA1700/1851) مزيج الجيل الخامس/الرابع 20 حوالي 20 (ضيق جداً)
معالج Intel Xeon W7 / W9 (Sapphire R.) Gen5 112 ~ 112
AMD Ryzen 9000 (AM5) Gen5 28 ~ 24
معالج AMD Threadripper 7000 Gen5 92 ~ 88
معالج AMD Threadripper Pro 7000 WX Gen5 128 ~ 128
AMD EPYC Genoa (9004) Gen5 128 ~128 (مقبس واحد)
AMD EPYC Turin (9005) Gen5 128 ~128 (مقبس واحد)
معالج AMD EPYC ثنائي المقبس Gen5 160 تمت المشاركة عبر xGMI

تترتب على ذلك ثلاث نتائج مباشرة.

لا يمكن لوحدة المعالجة المركزية في أجهزة سطح المكتب المخصصة للمستهلكين استضافة أربع وحدات معالجة رسومية (GPU) ذات نطاق ترددي كامل. مع وجود 20-28 مسارًا إجماليًا، إذا خصصت مسار x16 واحدًا للفتحة الرئيسية، ومسار x4 واحدًا لـ NVMe، فستكون قد استنفدت النطاق الترددي. تعمل تصميمات "سطح المكتب بأربع وحدات معالجة رسومية" التي تقسم مسار x16 إلى 4×x4 بشكل جيد للاستدلال لأن معظم عمليات الاستدلال لا تستغل كامل نطاق x4 Gen5 (حوالي 16 جيجابايت/ثانية). لكنها لا تعمل بشكل جيد للتدريب عبر البطاقات بسبب حركة مرور مزامنة التدرج.

تستضيف محطة العمل Xeon W أو Threadripper Pro أربعة وحدات معالجة رسومات بسرعة x16 بشكل مريح - 64 مسارًا لوحدات معالجة الرسومات، والكثير المتبقي لـ NVMe وبطاقة شبكة 25/100 جيجابت إيثرنت.

يمنحك معالج EPYC Genoa أو Turin أحادي المقبس 128 مسارًا، وهي الطريقة الوحيدة المنطقية لبناء خادم بثمانية وحدات معالجة رسومية (GPU) مع تشغيل جميع البطاقات الثمانية بسرعة x16. يضيف معالج EPYC ثنائي المقبس عددًا اسميًا من المسارات، لكن الزيادة أقل مما تبدو عليه، لأن حركة البيانات بين المقابس تمر عبر xGMI، وهي محدودة ومشتركة.

التفرع: تقطيع قطعة x16 إلى قطع أصغر

يبلغ حجم فتحة PCIe فعليًا x16، ولكن يمكن توجيه الجهاز المضيف لعرضها كهربائيًا على شكل روابط أصغر. القطع القياسية هي:

  • x16 → 2 × x8
  • x16 → 4 × x4
  • x8 → 2 × x4

توجد خاصية تقسيم المسارات في وحدة المعالجة المركزية (CPU) ويتم عرضها عبر نظام BIOS للوحة الأم. يعتمد استخدام هذه الخاصية على توافر ثلاثة شروط: دعم وحدة المعالجة المركزية لها، وتوافرها في نظام BIOS، وتوصيل لوحة التوصيل الخلفية بشكل صحيح لتقسيم المسارات. عادةً ما يكون الشرطان الأولان مناسبين للوحات الخوادم (مثل Supermicro وASRock Rack وGigabyte). أما الشرط الثالث فهو ما يسبب المشاكل، حيث تختلف طريقة تقسيم المسارات بين الشركات المصنعة.

تقنية التفرع هي الحيلة التي تسمح بتركيب عدد أكبر من وحدات معالجة الرسومات في هيكل واحد مقارنةً بعدد منافذ x16 المتاحة في وحدة المعالجة المركزية. نادرًا ما يحتوي خادم EPYC ذو 8 وحدات معالجة رسومات على 8 منافذ x16 أصلية؛ بل هو مزيج من المنافذ الأصلية والمتفرعة الموجهة عبر وصلات رأسية، حيث تحصل كل وحدة معالجة رسومات على منفذ x16 أو x8 حسب التصميم.

ما تخسره: عرض النطاق الترددي لكل بطاقة. يبلغ عرض النطاق الترددي لوصلة الجيل الخامس x8 المتفرعة 32 جيجابايت/ثانية، أي نصف عرض النطاق الترددي لوصلة x16. هذا غير ملحوظ في عملية الاستدلال، ولكنه يظهر في مزامنة التدرج وتمرير التنشيط عند التدريب باستخدام وحدات معالجة رسومية متعددة.

محولات PCIe ومُعيدات التوقيت

إذا لم يكن التوزيع الثنائي كافيًا - لنفترض أنك تريد ثماني وحدات معالجة رسومية (GPUs) جميعها بسرعة x16 - فإن الحل هو مُبدِّل PCIe. تُعد سلسلة Broadcom PEX مثالًا نموذجيًا. يقوم مُبدِّل PEX من فئة 89000 بأخذ منفذ x16 واحد من وحدة المعالجة المركزية (CPU) وتوزيعه على منافذ x16 متعددة. تستغل المنافذ اللاحقة سعة وصلة الإرسال؛ فإذا ضغطت جميع وحدات المعالجة الرسومية الثمانية على المضيف في وقت واحد، فإنها تتشارك في منفذ x16 الخاص بالإرسال.

هذه هي البنية المستخدمة في لوحات NVIDIA HGX الأساسية (وأنظمة SXM التي لا تُصنّعها شركة Kentino). وتكمن كفاءتها في أن معظم حركة البيانات في أحمال العمل متعددة وحدات معالجة الرسومات (GPU) المُحسّنة تكون بين وحدات معالجة الرسومات (عبر NVLink أو PCIe من نظير إلى نظير)، وليس بين وحدات معالجة الرسومات والمعالج المضيف. ولا ينقل رابط الإرسال إلا الأوزان عند التحميل، وعمليات التحقق من البيانات عند الحاجة، وعمليات الإدخال/الإخراج للتخزين. ولا يُؤدي الاستدلال إلى تشبعه، وكذلك التدريب في الغالب، طالما بقيت العمليات الجماعية بين وحدات معالجة الرسومات.

تختلف أجهزة إعادة التوقيت: فهي مُكرِّرات إشارة تسمح لوصلة الجيل الخامس بالعمل عبر كابل أطول من المسموح به في المواصفات. لا تُغيِّر هذه الأجهزة بنية الشبكة، بل تجعل البنية المختارة قابلة للتحقيق عمليًا. تستخدم جميع هياكل EPYC الثمانية التي تُشحنها شركة Kentino أجهزة إعادة التوقيت لأن طول الكابل الممتد من اللوحة الأم إلى فتحات وحدات معالجة الرسومات يتجاوز المدى الأصلي للجيل الخامس.

تقنية NVLink - ما هي وأين لا توجد

NVLink هي تقنية ربط خاصة بشركة NVIDIA بين وحدات معالجة الرسومات، وهي منفصلة عن PCIe. تستخدم هذه التقنية مجموعة مخصصة من المسارات عالية السرعة على حافة وحدة معالجة الرسومات (أو من خلال موصل SXM أو جسر NVLink) لتوفير وصول مباشر إلى الذاكرة بين وحدات معالجة الرسومات بنطاق ترددي أعلى بكثير من PCIe.

ربط عرض النطاق الترددي الإجمالي البطاقات التي تدعمها (في عام 2026)
فتحة PCIe Gen5 x16 64 جيجابايت / ثانية جميع وحدات معالجة الرسومات PCIe الحالية
جسر NVLink 4 600 جيجابايت / ثانية إصدارات PCIe A100 و H100 (معظمها متوقف عن الإنتاج)
NVLink 5 (SXM) 1800 جيجابايت / ثانية H100 SXM، H200، GB200، B200 — جميعها تدعم تقنية SXM فقط
NVLink (Pro 6000 SXM) لا يوجد بطاقة RTX Pro 6000 Blackwell تعمل بتقنية PCIe، ولا تدعم تقنية NVLink.

الحقيقة الأساسية لأي سفينة كينتينو قيد الإنشاء: لا تحتوي أي من بطاقاتنا على تقنية NVLink. تخلّت بطاقة RTX 4090 عن منفذ PCIe الموجود في بطاقة 3090، وكذلك بطاقة 5090. أما بطاقة RTX Pro 6000 Blackwell (بنسختيها Workstation و Max-Q) فهي تعمل عبر منفذ PCIe فقط، وكذلك بطاقتا L40 و L4.

هذا ليس سهوًا. تحتفظ NVIDIA بتقنية NVLink لوحدات معالجة الرسومات SXM المخصصة لمراكز البيانات، ولعدد قليل من بطاقات PCIe المزودة بجسر NVLink، والتي يجري التخلص منها تدريجيًا مع انتقال الفئة العليا بالكامل إلى SXM. إذا كنت ترغب في استخدام NVLink، فعليك شراء HGX مع وحدات H100/H200/B200 بسعر يزيد عشرة أضعاف، وKentino لا تُصنّع هذه البطاقات.

بدون تقنية NVLink، تنتقل عمليات التجميع بين وحدات معالجة الرسومات (التقليل الكلي، التجميع الكلي، التقليل والتشتيت) عبر منفذ PCIe من نظير إلى نظير. ويُحدَّد عرض النطاق الترددي الفعال بين أي بطاقتين بواسطة أبطأ وصلة PCIe وأي محول أو منفذ رئيسي بينهما. في نظام EPYC ثماني وحدات معالجة رسومات، يكون الاتصال من نظير إلى نظير بين وحدات معالجة الرسومات على نفس المحول سريعًا؛ أما الاتصال من نظير إلى نظير عبر المجمعات الرئيسية فيمر عبر وحدة المعالجة المركزية، وهو أبطأ.

في عملية الاستدلال، لا يُشكل هذا الأمر أهمية تُذكر، إذ أن الاستدلال مُقيد بذاكرة وحدة معالجة الرسومات المحلية، ونادرًا ما تنتقل عمليات التنشيط المُجمعة بين وحدات معالجة الرسومات. أما في التدريب باستخدام التوازي الموتري، فهذا هو السبب الرئيسي لعدم تكافؤ بنية EPYC 5090 8× مع عقدة HGX H100 8×، حتى وإن بدت عمليات الفاصلة العائمة الأولية متقاربة.

عندما يصل عرض نطاق PCIe إلى أقصى حد له

عبء العمل هل يُشبع PCIe؟ ملاحظة
الاستدلال باستخدام وحدة معالجة الرسومات الواحدة (LLM، الدفعة 1) لا يُخزَّن النموذج في ذاكرة الوصول العشوائي للفيديو (VRAM)؛ و PCIe مخصص فقط للرموز.
الاستدلال باستخدام وحدة معالجة رسومية واحدة (LLM، دفعة كبيرة) لا يزداد معدل نقل البيانات مع زيادة حجم الدفعة؛ وتبقى تقنية PCIe في وضع الخمول.
استدلال الرؤية باستخدام وحدة معالجة الرسومات الواحدة أحيانا في حالة التغذية من ذاكرة وحدة المعالجة المركزية، يكون الفرق ملحوظًا بمقدار 8 أضعاف.
الاستدلال متعدد وحدات معالجة الرسومات (التوازي الموتري) أحيانا عمليات التنشيط عبر وحدات معالجة الرسومات في كل طبقة
الاستدلال متعدد وحدات معالجة الرسومات (التوازي عبر خط الأنابيب) نادرا التفعيل فقط عند حدود المسرح
تحميل النموذج من NVMe / الشبكة نعم محرك الأقراص الصلبة Llama-405B Q8 بسعة 140 جيجابايت يحتاج إلى كل جيجابايت/ثانية لديك
التدريب، وحدة معالجة رسومات واحدة لا نفس الاستدلال
التدريب، متعدد وحدات معالجة الرسومات، زيرو 1/2 نعم يُضعف التدرج اللوني الشامل الرابط
التدريب، متعدد وحدات معالجة الرسومات، ZeRO-3 / FSDP نعم، صعب المعلمة all-تجميع كل خطوة للأمام
التدريب، متعدد وحدات معالجة الرسومات، التوازي الموتري نعم، صعب بدون NVLink، هذه هي أسوأ حالة

النمط ثابت: الاستدلال لا يشبع PCIe؛ التدريب هو الذي يفعل ذلك. إذا كان الجهاز سيُستخدم في عمليات الاستدلال - وهو ما ينطبق على معظم المستخدمين - فإن استخدام 8 وحدات معالجة رسومية من الجيل الخامس لكل بطاقة يُعدّ خيارًا مناسبًا، ويمكنك إضافة المزيد من وحدات المعالجة الرسومية بميزانية أقل. أما إذا كنت تستخدمه للتدريب، فستحتاج إلى استخدام 16 وحدة معالجة رسومية لكل بطاقة وتجميع وحدات المعالجة الرسومية بحيث لا تسلك العمليات الجماعية المسار الأبطأ.

مخطط طوبولوجيا لجهاز مكون من 4 وحدات معالجة رسومية (EPYC Genoa، مقبس واحد)

هذا هو التكوين القياسي لمعالج Kentino رباعي وحدات معالجة الرسومات على معالج AMD EPYC. وهو يعمل أيضًا على معالج Threadripper Pro 7000 WX مع تخصيص مسارات متطابق.

معالج AMD EPYC من جنوة / تورينو — 128 مسار PCIe من الجيل الخامس
وحدة معالجة الرسومات 0
x16
وحدة معالجة الرسومات 1
x16
وحدة معالجة الرسومات 2
x16
وحدة معالجة الرسومات 3
x16
المسارات المتبقية (حوالي 32 مسارًا): 4 مسارات NVMe، و8 مسارات NIC، وBMC، والإدارة

معالج EPYC رباعي وحدات معالجة الرسومات: تحصل كل وحدة معالجة رسومات على رابط x16 Gen5 مخصص مباشرةً إلى وحدة المعالجة المركزية. لا يوجد تبديل، ولا اكتظاظ.

تحصل كل وحدة معالجة رسومية (GPU) على وصلة كاملة من الجيل الخامس x16 مباشرة إلى وحدة المعالجة المركزية (CPU). لا يوجد تفرع، ولا مفتاح تحويل، ولا مُعيد توقيت لوحدات المعالجة الرسومية نفسها (قد تحتوي الوصلات الرأسية على مُعيدات توقيت حسب تصميم الهيكل). يتم نقل البيانات من نقطة إلى نقطة بين أي وحدتي معالجة رسومية عبر البنية الداخلية لمعالج EPYC، وهي متناظرة - جميع البطاقات الأربع متساوية البعد من حيث البنية.

هذا هو أفضل تصميم متعدد وحدات معالجة الرسومات متوفر. وهو ما نوفره مع 4 وحدات RTX 5090، و4 وحدات RTX 4090، و4 وحدات RTX Pro 6000 Blackwell، و4 وحدات L40.

مخطط طوبولوجيا لجهاز مكون من 8 وحدات معالجة رسومية (EPYC Genoa / Turin، مقبس واحد)

لا تكفي 128 مسارًا لمنح ثماني وحدات معالجة رسومية (GPUs) سرعة x16 كاملة لكل منها، فهذا سيستنزف الميزانية بالكامل دون أي مخصصات لتقنية NVMe أو الشبكات. أما التخطيطات القياسية فهي:

الخيار أ: جميع وحدات معالجة الرسومات الثمانية بسرعة x16، مع بنية تبديل

AMD EPYC جنوة / تورينو - 128 ممرًا Gen5
مفتاح PEX A (x16 في اتجاه التيار)
G0
x16
G1
x16
G2
x16
G3
x16
مفتاح PEX B (x16 في اتجاه التيار)
G4
x16
G5
x16
G6
x16
G7
x16
مسارات وحدة المعالجة المركزية المتبقية (حوالي 96 مسارًا): مصفوفة NVMe، وبطاقات الشبكة، ووحدة التحكم في إدارة اللوحة الأم، والإدارة

الخيار أ: مفتاحان PCIe، كل منهما مزود بمعالج x16 واحد في اتجاه المنبع إلى وحدة المعالجة المركزية وأربعة وحدات معالجة رسومية x16 في اتجاه المصب. الاتصال المباشر بين المفاتيح سريع؛ أما الاتصال المباشر بين المفاتيح فيمر عبر وحدة المعالجة المركزية.

يتصل كل محول في اتجاه المنبع بوحدة المعالجة المركزية عبر منفذ x16 Gen5، ويوزع أربعة منافذ x16 في اتجاه المصب. تتشارك وحدات معالجة الرسومات من 0 إلى 3 وصلة نقل بيانات بسرعة 64 جيجابايت/ثانية مع وحدة المعالجة المركزية، بينما تتشارك وحدات معالجة الرسومات من 4 إلى 7 وصلة أخرى. الاتصال المباشر بين وحدتي معالجة الرسومات 0 و1 سريع (عبر نفس المحول)، بينما الاتصال المباشر بين وحدتي معالجة الرسومات 0 و4 يمر عبر مجمع وحدة المعالجة المركزية، مما يجعله أبطأ. تتبع أنظمة Kentino ذات 8 وحدات معالجة رسومات، والمبنية على هياكل Supermicro وBone64c، هذا النموذج.

الخيار ب: جميع وحدات معالجة الرسومات الثمانية تعمل بسرعة x8، متصلة مباشرة بوحدة المعالجة المركزية

معالج AMD EPYC في جنوة/تورينو - 128 مسارًا من الجيل الخامس، متفرع
G0
x8
G1
x8
G2
x8
G3
x8
G4
x8
G5
x8
G6
x8
G7
x8
8 × 8 = 64 مسارًا لوحدات معالجة الرسومات. ~64 مسارًا متاحًا لـ NVMe / بطاقات الشبكة / BMC

الخيار ب: 8 وحدات معالجة رسومية بسرعة x8 متصلة مباشرة بوحدة المعالجة المركزية عبر التفرع. لا يوجد تبديل، ولا اكتظاظ، وسرعة نقل بيانات 32 جيجابايت/ثانية لكل بطاقة. مخصص لعمليات الاستدلال فقط.

لا يوجد تبديل، ولا اكتظاظ، وزمن استجابة أقل بين وحدة المعالجة المركزية ووحدة معالجة الرسومات. تحصل كل بطاقة على 32 جيجابايت/ثانية بدلاً من 64. هذا الفرق غير ملحوظ في الاستدلال. أما في التدريب في ظل اتصالات جماعية مكثفة، فهو أسوأ بشكل ملحوظ من الخيار أ - حيث أن طول الرابط لكل بطاقة أقصر، ولا يوجد اتصال سريع من نقطة إلى نقطة داخل المبدل.

يُعد خيار Kentino الافتراضي لبنية 8-GPU هو الخيار أ (النسيج المبدل) للأنظمة القادرة على التدريب والخيار ب (المباشر المتشعب) للبنى التي تعتمد على الاستدلال فقط حيث يكون من الأفضل إنفاق ميزانية المسار على NVMe وبطاقات الشبكة المزدوجة 100 جيجابت إيثرنت.

سلامة الإشارة في الجيل الخامس

يتميز الجيل الخامس بسرعة فائقة تجعل الطبقة الفيزيائية ذات أهمية بالغة، على عكس الجيلين الثالث والرابع. يمتد مسار الجيل الخامس لمسافة 7 بوصات تقريبًا على لوحة الدوائر المطبوعة FR4 القياسية قبل أن يغلق طرفه. ويمتد كابل الجيل الخامس لمسافة 20 سم تقريبًا بدون مُعيد توقيت. هذا الطول كافٍ لفتحة مجاورة لوحدة المعالجة المركزية، ولكنه غير كافٍ لكابل رافع في هيكل 4U على بُعد 40 سم.

ماذا يعني هذا:

  • تُعدّ الدرجات مهمة. لا تدعم كابلات الجيل الرابع إشارات الجيل الخامس. أنت بحاجة إلى كابلات مصممة للجيل الخامس، وعادةً ما تكون مزودة بمؤقت إعادة ضبط. يوجد فرق ملحوظ في التكلفة، يتراوح بين 80 و150 يورو لكل كابل.
  • طول الكابل محدود بشكل صارم. يحتاج طول يزيد عن 30 سم إلى مُعيد توقيت، بينما يحتاج طول يزيد عن 70 سم إلى اثنين. لهذا السبب، لا توجد منتجات "صندوق وحدة معالجة الرسومات الخارجية" في الجيل الخامس.
  • سيؤدي وجود رابط غير مستقر إلى انخفاض مستوى التدريب إلى الجيل الرابع أو الثالث دون أن يلاحظ أحد. يبدأ تشغيل النظام، وتظهر وحدة معالجة الرسومات (GPU) في nvidia-smi، عمليات الاستدلال. عرض النطاق الترددي هو ربع ما دفعته مقابله. nvidia-smi --query-gpu=pcie.link.gen.current,pcie.link.width.current أول شيء يجب التحقق منه عند بناء مبنى جديد.
  • نظام الإدخال والإخراج الأساسي (BIOS) مهم. بعض لوحات Supermicro و ASRock Rack مضبوطة افتراضيًا على سرعة اتصال "تلقائية" وتختار السرعة بشكل متحفظ. قم بفرض استخدام الجيل الخامس صراحةً وتأكد من ذلك بعد إعادة التشغيل.

لقد رأينا عمليات بناء حيث تم تدريب وحدة معالجة رسومية واحدة من أصل ثماني وحدات على سرعة Gen3 x8 لأسابيع دون أي مراقبة. تم تشغيل المهمة، ولكنها كانت أبطأ بأربع مرات مما ينبغي.

متى تكون الطوبولوجيا مهمة ومتى لا تكون كذلك

لا يهم في الغالب إذا: أنت تقوم بتشغيل الاستدلال باستخدام وحدة معالجة الرسومات أحادية بأي حجم نموذج؛ أو الاستدلال باستخدام وحدات معالجة الرسومات المتعددة مع التوازي النسخي (تقوم كل وحدة معالجة رسومات بتشغيل نسختها الخاصة)؛ أو الاستدلال الدفعي الذي يهيمن عليه عرض نطاق ذاكرة الوصول العشوائي للفيديو؛ أو تحميل النماذج مرة واحدة وتقديمها لساعات.

الأمر مهم للغاية إذا: أنت تقوم بتدريب نموذج متعدد وحدات معالجة الرسومات مع تقسيم النموذج عبر البطاقات (متوازي الموترات أو خط الأنابيب)؛ أو تقوم بتنفيذ FSDP أو ZeRO-3 حيث يتم تجزئة المعلمات وإعادة تجميعها في كل خطوة؛ أو تشغيل RLHF أو أحمال عمل أخرى مع مزامنة التدرج المتكررة؛ أو تبديل النماذج أثناء التشغيل؛ أو تغذية وحدات معالجة الرسومات من طبقة تخزين بعيدة حيث يكون PCIe هو القناة.

بالنسبة لمعظم المشترين - خوادم الاستدلال لخدمة نماذج التعلم العميق/التعلم العميق الافتراضي، وأنظمة الروبوتات الخلفية، واستضافة خوادم الذكاء الاصطناعي - تُعدّ بنية الشبكة مسألة فحص للوصلات، وليست مسألة معمارية. أما بالنسبة للقلة الذين يقومون بتدريب مكثف باستخدام وحدات معالجة رسومية متعددة، فإن بنية الشبكة (المبدلة مقابل المتشعبة، وNVLink مقابل غير المبدلة) هي القرار المعماري، وهذا هو السبب في أن بنية EPYC 5090 8× هي الأداة المناسبة لبعض مهام التدريب وغير المناسبة لمهام أخرى.

ماذا تفعل بعد ذلك

إذا كنت بصدد تحديد مواصفات جهاز كمبيوتر متعدد وحدات معالجة الرسومات، فإليك بعض الأسئلة التي يجب الإجابة عليها قبل اختيار وحدة المعالجة المركزية:

  1. كم عدد وحدات معالجة الرسومات، وما هو عرض المسار؟ 4 × x16 تناسب محطة العمل؛ 8 × x16 تحتاج إلى EPYC + مفاتيح التبديل؛ 8 × x8 تحتاج إلى EPYC + تقسيم.
  2. الاستدلال أم التدريب؟ للاستدلال فقط: يكفي استخدام 8 وحدات معالجة رسومية لكل وحدة، مما يوفر تكلفة التبديل. أما التدريب باستخدام التوازي الموتري: فيكفي استخدام 16 وحدة معالجة رسومية وتبديل، لا داعي لذلك.
  3. ما الذي يحتاج إلى مسارات أيضاً؟ بطاقة شبكة بسرعة 100 جيجابت إيثرنت تتطلب x16. أربعة محركات أقراص U.2 NVMe تتطلب x16. خطط قبل اتخاذ القرار.
  4. ما هي قصتك مع وصلات الجيل الخامس؟ خصص ميزانية قدرها 100 يورو لكل رافع، وتأكد من أنه مصنف من الجيل الخامس مع أجهزة إعادة التوقيت حسب الحاجة. انظر W03 للحصول على تفاصيل الصاعد.
  5. هل أنت متأكد من أنك لست بحاجة إلى NVLink؟ إذا كان عبء التدريب لديك مرتبطًا بوصلة الربط البيني، فلن تُجدي أي بنية PCIe نفعًا. حينها ينتقل الحديث إلى أجهزة من فئة HGX، والتي لا تُصنّعها شركة Kentino. من الأفضل معرفة ذلك مُسبقًا بدلًا من الانتظار حتى تركيب النظام.

بعد بناء النظام واختبار أدائه مرة واحدة، ستنسى أمر بنية PCIe لمدة ثلاث سنوات. لكن عليك الانتباه إليها في الأوقات التالية: اليوم الأول (تحقق من سرعة اتصال كل وحدة معالجة رسومية)، بعد أي تحديث لنظام BIOS (إعادة ضبط إعدادات تدريب الاتصال)، بعد أي إعادة توصيل فعلية (اهتزاز الكابلات، انخفاض سرعة الاتصال)، وقبل أي عملية تدريب مكلفة.


هذا جزء من ويكي كينتينو، وهي سلسلة مرجعية حول الحوسبة الذكية، والروبوتات، والأنظمة التي تربط بينهما. نرحب بالتعليقات والتصويبات على info@kentino.com.