اختيار وحدة معالجة الرسومات لأحمال عمل الذكاء الاصطناعي: 5090، 4090، RTX Pro 6000، L40، L4 مقارنة مباشرة

لا يوجد معالج رسومات مثالي لجميع تطبيقات الذكاء الاصطناعي في عام 2026. يوجد معالج رسومات مثالي لحجم عمل محدد، واستهلاك طاقة محدد، وميزانية محددة - واختيار البطاقة الخاطئة في الهيكل المناسب يُعد خطأً مكلفًا أكثر من اختيار البطاقة المناسبة في الهيكل غير المناسب. تستعرض هذه المقالة مجموعة معالجات Kentino بشكل مباشر، مع أرقام أداء حقيقية، ومفاضلات موضوعية، ومنهجية اتخاذ قرار استخدمناها بالفعل في مكالماتنا مع العملاء. لا نتجاهل وجود معالجي H100 وA100؛ فهما موجودان، لكننا لا نبيعهما، وسنوضح بالتفصيل متى يكون هذا الفارق مهمًا.

الأوراق مكشوفة:

  • RTX 5090 — 32 جيجابايت GDDR7، 1.79 تيرابايت/ثانية، 575 واط، للمستهلك.
  • RTX 4090 — 24 جيجابايت GDDR6X، 1.01 تيرابايت/ثانية، 450 واط، للمستهلكين، من الجيل السابق.
  • RTX Pro 6000 Blackwell Server Edition — 96 جيجابايت GDDR7 ECC، 600 واط، تبريد سلبي، عامل شكل الخادم، لا توجد منافذ عرض.
  • RTX Pro 6000 Blackwell Max-Q — 96 جيجابايت GDDR7 ECC، 300 واط، مروحة ثنائية الفتحة، نفس السيليكون المستخدم في محطة العمل.
  • L40 — 48 جيجابايت GDDR6 ECC، 0.86 تيرابايت/ثانية، 300 واط، عامل شكل مركز البيانات، ECC كامل.
  • L4 — 24 جيجابايت GDDR6، 0.30 تيرابايت/ثانية، 72 واط، فتحة واحدة منخفضة الارتفاع، استنتاج الحافة.

المواصفات التي تهم في الواقع

تتميز جداول مواصفات وحدات معالجة الرسومات (GPU) بالتعقيد، ومعظم الأرقام لا تؤثر على قرار الشراء. إلا أن ثلاثة منها تؤثر.

  1. سعة ذاكرة الوصول العشوائي للفيديو (VRAM). هذا أمر ثنائي. إما أن نموذجك مناسب، أو غير مناسب. ولا يُعدّ تفريغ وحدة المعالجة المركزية بديلاً عملياً (مُغطّى في W01).
  2. عرض نطاق ذاكرة الوصول العشوائي للفيديو (VRAM). تعتمد عملية توليد الرموز على المحول على عرض النطاق الترددي. أما عدد عمليات الفاصلة العائمة في الثانية (TFLOPS) المذكورة في ورقة المواصفات، فهي غير ذات صلة إلى حد كبير بعملية الاستدلال.
  3. قوة مستدامة وشكل مميز. بطاقة بقدرة 600 واط في هيكل لا يستطيع تبريدها تُعتبر بطاقة بقدرة 300 واط مزودة بجهاز إنذار حراري. بطاقة بقدرة 72 واط في خادم 1U تختلف عن بطاقة بقدرة 575 واط في محطة عمل 4U.
وحدة معالجة الرسوميات‏:‏ VRAM عرض النطاق الترددي TDP شكل عامل ECC ملاحظة
RTX 4090 24 GB GDDR6X 1.01 TB / s 450 W مستهلك بثلاث فتحات لا الجيل السابق، مسار انخفاض التكلفة
RTX 5090 شنومكس غب غدرسنومكس 1.79 TB / s 575 W مستهلك 2-3 فتحات لا Perf/€ king for ference
RTX Pro 6000 BW Max-Q شنومكس غب غدرسنومكس 1.79 TB / s 300 W منفاخ ذو فتحتين نعم كثافة عالية، طاقة أقل
RTX Pro 6000 BW Server Ed. شنومكس غب غدرسنومكس 1.79 TB / s 600 W سلبي ذو فتحتين نعم خادم من الدرجة الأولى، بدون واجهة رسومية
L40 شنومكس غب غدرسنومكس 0.86 TB / s 300 W سلبي ذو فتحتين نعم توليد بيانات مركز البيانات
L4 شنومكس غب غدرسنومكس 0.30 TB / s 72 W فتحة واحدة LP نعم استدلال الحافة / 1U
H100 SXM (للمرجعية، غير مباع) 80 GB HBM3 3.35 TB / s 700 W SXM5 نعم مستوى مزودي خدمات الحوسبة السحابية الفائقة
H200 SXM (للمرجعية، غير مباع) 141 جيجا بايت HBM3e 4.80 TB / s 700 W SXM5 نعم ملك عرض النطاق الترددي HBM

الاستدلال: عدد الرموز المميزة في الثانية، حسب النموذج والبطاقة

يُحسب توليد رموز الاستدلال، في تدفق واحد، تقريبًا بقسمة عرض النطاق الترددي على حجم النموذج مضروبًا في عامل كفاءة المكدس 0.6-0.8. يوضح الجدول أدناه ما قمنا بقياسه على نماذج الاختبار باستخدام vLLM 0.6+ وملف llama.cpp المُحدّث حتى الربع الثاني من عام 2026. INT4 ما لم يُذكر خلاف ذلك. معدل نقل البيانات في التدفق الواحد أولًا؛ والمعدل الإجمالي المُجمّع بين قوسين حيثما أمكن قياسه.

الموديل كوانت المقاس RTX 4090 RTX 5090 خادم/خدمة Pro 6000 BW برو 6000 ماكس-كيو L40 L4
كوين 2.5 7 ب INT4 ~ شنومك غيغابايت 110-130 (220) 180-220 (340) 180-220 (340) 170-200 (320) 90-110 (200) 35-45 (90)
اللاما 3.2 13 ب INT4 ~ شنومك غيغابايت 70-85 (170) 120-140 (250) 120-140 (250) 110-130 (230) 60-75 (140) 22-28 (60)
كوين 2.5 32 ب INT4 ~ شنومك غيغابايت 32-38 (90) 55-65 (140) 60-70 (150) 55-65 (140) 28-34 (80) لا يتناسب
اللاما 3.3 70 ب INT4 ~ شنومك غيغابايت لا يناسب الأفراد يحتاج إلى 2× (24–30) 28–34 (90) بطاقة واحدة 27-32 (85) يحتاج إلى 2× (16–22) لا يتناسب
كوين 2.5 72 ب INT4 ~ شنومك غيغابايت لا يناسب الأفراد يحتاج إلى 2× (24–30) 28–34 (90) بطاقة واحدة 27-32 (85) يحتاج إلى 2× (16–22) لا يتناسب
Qwen2.5-VL 72B INT4 ~46 جيجابايت+ لا يناسب الأفراد يحتاج إلى 2× (12–18) بطاقة فردية من 18 إلى 24 عامًا 17-22 يحتاج إلى 2× (10–14) لا يتناسب
اللاما 3.1 405 ب INT4 ~ شنومك غيغابايت لا يتناسب يحتاج إلى 8 أضعاف 4× (عقدة واحدة) 4× (عقدة واحدة) يحتاج إلى 5 أضعاف لا يتناسب

بعض الملاحظات الهامة. هذه أرقام نموذجية على هيكل مُبرّد بشكل صحيح مع وجود الجهاز بكامل طاقته. يعتمد زمن الاستجابة الكلي (TTFT) في حالة التخزين المؤقت البارد بشكل أساسي على تخصيص ذاكرة التخزين المؤقت للقيم والقيم (KV-cache) وحسابات التعبئة المسبقة، وليس على عرض النطاق الترددي، ويتراوح بين 200 و900 مللي ثانية عبر هذه المجموعة من البطاقات. ينخفض ​​معدل نقل البيانات المجمعة بشكل غير خطي بعد 8-16 تدفقًا متزامنًا بسبب التنافس على الموارد الحسابية. إذا كان تطبيقك تفاعليًا (مثل الدردشة أو التوجيه خطوة بخطوة)، فإن التدفق الفردي أهم من التدفق المجمع. أما إذا كان تطبيقك يعتمد على معالجة كميات كبيرة من البيانات (مثل معالجة المستندات أو التصنيف التلقائي)، فإن التدفق المجمع أهم.

تُعدّ وحدة 5090 الرباعية العمود الفقري لمجموعتنا لسبب وجيه: فهي تُكلّف ما بين 8,500 و14,000 يورو للبطاقات فقط، وتضمّ أربع وحدات معالجة رسومية في هيكل 4U مع تهوية مناسبة، وتُقدّم أداءً إجماليًا يُقارب 12,000 توك/ثانية على Llama 3.3 70B INT4 باستخدام vLLM مع التوازي الموتري. في المقابل، تُقدّم وحدة Pro 6000 Blackwell أحادية بسعر 8,500 يورو أداءً يُقارب 30 توك/ثانية للتدفق الفردي و90 توك/ثانية للدفعات على نفس الطراز. بالنسبة لخادم خدمة متعدد المستخدمين، تُعدّ وحدات 5090 هي الخيار الأمثل. أما بالنسبة لأحمال العمل ذات السياق الكبير لمستخدم واحد مع طرازات بسعة 64 جيجابايت أو أكثر، فإنّ وحدة Pro 6000 هي الخيار الأمثل. لا توجد إجابة واحدة تناسب الجميع.

حيث يكون لكل بطاقة معنى فعلي

RTX 5090 - ملك الأداء مقابل السعر مع حواف حادة. الإجابة الصحيحة عندما يكون عبء العمل هو الاستدلال، والميزانية حقيقية ولكنها ليست غير محدودة، ويمكن للنشر تحمل قيدين معروفين: عدم وجود تصحيح الأخطاء (ECC)، وتقلبات الطاقة من فئة المستهلك التي تتطلب عناية بوحدة تزويد الطاقة والهيكل (انظر W04بالنسبة لطرازات 13B و32B، يُعدّ معالج 5090 أسرع لكل يورو من أي معالج آخر مُتاح. أما بالنسبة لفئة 70B، فإنّ أربعة معالجات 5090 مُتصلة بتقنية Tensor-Paralel تُوفّر إنتاجية إجمالية أعلى من معالج Pro 6000 Blackwell واحد بتكلفة رأسمالية إجمالية أقل. العيوب: استهلاك طاقة اسمي 575 واط مع استهلاك عابر يزيد عن 600 واط، وسعة قصوى 32 جيجابايت لكل بطاقة تُجبر على استخدام معالجات رسوميات متعددة لطرازات 32B+ في سياقات عالية. يُنصح باختياره في الحالات التالية: عند الحاجة إلى استدلال على مدار الساعة لطرازات 7B-32B، أو عندما يكون الأداء لكل يورو مهمًا، أو عند توفّر تهوية جيدة للخزانة، أو عندما لا يكون تصحيح الأخطاء (ECC) شرطًا أساسيًا للامتثال. يُنصح بتجنّبه في الحالات التالية: عندما يكون تصحيح الأخطاء (ECC) إلزاميًا، أو عند استخدام بطاقة واحدة لطرازات 70B+، أو عندما لا تستطيع الغرفة تصريف 24 كيلوواط من الحرارة.

RTX 4090 — تخفيض التكلفة للإصدارات القديمة فقط. في عام 2026، يُعدّ الشراء خيارًا استراتيجيًا. نادرًا ما تُباع البطاقات الجديدة في المتاجر، بينما يتراوح سعر البطاقات المستعملة والمُعاد بيعها بين 1,400 و1,900 يورو. تُقدّم هذه البطاقات أداءً أسرع بنسبة 55% تقريبًا من بطاقة 5090 في عمليات الاستدلال المُقيّدة بالذاكرة (1.01 مقابل 1.79 تيرابايت/ثانية)، كما أن سعة ذاكرتها 24 جيجابايت مقابل 32 جيجابايت - وتُعدّ سعة 8 جيجابايت مهمة لأن طراز 32 بايت INT4 يُوفّر مساحة أكبر لذاكرة التخزين المؤقت KV في بطاقة 5090. لا يزال هذا الخيار مُناسبًا لتوسيع أسطول بطاقات 4090 الحالي في ظلّ قيود على النفقات الرأسمالية. هل تُفكّر في البدء من الصفر؟ اشترِ بطاقات 5090.

RTX Pro 6000 Blackwell Server Edition - ملك ذاكرة الوصول العشوائي للفيديو (VRAM) لأحمال العمل الجادة. تتيح لك ذاكرة GDDR7 بسعة 96 جيجابايت مع تصحيح الأخطاء ECC وسرعة 1.79 تيرابايت/ثانية إمكانية استضافة نماذج متعددة. تحتوي البطاقة الواحدة على معالج Qwen2.5-VL بسعة 72 بايت وذاكرة تخزين مؤقتة من نوع KV، مما يوفر مساحة كافية لحوالي 20 تدفق بيانات متزامن. أما العقدة المكونة من أربع وحدات، فتحتوي على معالج Llama 3.1 بسعة 405 بايت وذاكرة تخزين مؤقتة من نوع INT4، كل ذلك في هيكل واحد بدون اتصال شبكي بين العقد. تتميز هذه العقدة بتبريد سلبي، وتصميم يسمح بتدفق الهواء من الأمام إلى الخلف، ولا تحتوي على منافذ عرض، وقد تم اختبارها للعمل على مدار الساعة. تستخدم نفس شريحة السيليكون المستخدمة في إصدار محطة العمل، ونفس سعة الطاقة 600 واط، ولكن بنظام تبريد مختلف. اختر هذه العقدة عندما: تحتاج إلى بطاقة واحدة بسعة 70 بايت أو أكثر، أو عندما يكون تصحيح الأخطاء ECC مطلوبًا، أو عند نشرها في رفوف مع توفير تهوية مناسبة، أو عند دمج التدريب، أو عندما يكون استخدام عدد أقل من البطاقات ذات السعة الأكبر أفضل من استخدام عدد أكبر من البطاقات ذات السعة الأصغر من حيث مساحة الرف والطاقة.

RTX Pro 6000 Blackwell Max-Q — كثافة عالية دون الحاجة إلى إعادة توصيل أسلاك الغرفة. نفس سعة 96 جيجابايت وسرعة نقل بيانات 1.79 تيرابايت/ثانية، بحد أقصى 300 واط. تستهلك أربع بطاقات Max-Q طاقة 1.2 كيلوواط من وحدات معالجة الرسومات، بينما تستهلك أربع بطاقات Server Edition طاقة 2.4 كيلوواط. صحيح أن انخفاض الأداء بسبب الحد الأقصى للطاقة ملحوظ، لكنه أقل من نسبة استهلاك الطاقة - منحنى الأداء/الواط في Blackwell حاد عند الحد الأقصى، لذا فإن تحديد الحد الأقصى عند 300 واط يؤدي إلى خسارة 20-30% من إنتاجية الاستدلال، وليس 50%. اختر هذا الخيار عندما: تكون بيئة العمل محدودة الطاقة، أو عندما تحتاج إلى 96 جيجابايت لكل بطاقة، أو عندما تكون الكثافة أهم من ذروة إنتاجية كل بطاقة، أو عندما يكون مستوى الضوضاء مهمًا.

L40 - بطاقة الاستدلال المؤسسي المزودة بتقنية تصحيح الأخطاء ECC وسجل حافل. جيل Ada. أبطأ من Blackwell من حيث عرض النطاق الترددي (0.86 مقابل 1.79 تيرابايت/ثانية) والسعة (48 مقابل 96 جيجابايت)، وسعرها مناسب لمراكز البيانات. السبب الرئيسي لشرائها هو سهولة التوريد: تصحيح الأخطاء ECC كامل، وبرامج تشغيل معتمدة، واستهلاك طاقة مستدام 300 واط، وخبرة تزيد عن عامين في بيئات الإنتاج. بالنسبة للبيئات التي تمنع استخدام بطاقات المستهلكين (التأمين، والقطاع الحكومي، وبعض الصناعات الخاضعة للتنظيم)، تُعد هذه البطاقة الخيار الأمثل. أما من حيث الأداء مقابل السعر، فهي أقل كفاءة من 5090. اخترها عندما: تمنع سياسة التوريد استخدام أجهزة المستهلكين، ويتناسب حجم العمل مع سعة 48 جيجابايت، وتكون موثوقية التشغيل على مدار الساعة أهم من الأداء مقابل السعر.

L4 — استدلال الحافة، 1U، 72 W. البطاقة الوحيدة في هذه القائمة التي تتناسب مع خادم 1U بجانب اللوحة الأم بسلاسة، والوحيدة التي تعمل باستهلاك طاقة مماثل لاستهلاك حاسوب محمول. استهلاكها للطاقة 72 واط، تصميمها منخفض الارتفاع، تعمل بتقنية التبريد السلبي، وذاكرتها من نوع GDDR6 ECC بسعة 24 جيجابايت، وسرعة نقل البيانات فيها 300 جيجابايت/ثانية. يُعد عرض النطاق الترددي هو العامل المحدد للأداء - حيث تصل سرعة نقل البيانات أحادية التدفق 7 بايت إلى 35-45 كيلوبت/ثانية، وهي سرعة مقبولة وليست سريعة. تتمثل ميزة هذه البطاقة في إمكانية توزيع البيانات: حيث توفر 8 وحدات من الطبقة الرابعة (L4) في هيكل 2U على مضيف EPYC واحد 8 تدفقات استدلال متزامنة 7 بايت بتكلفة إجمالية معقولة (حوالي 20 ألف يورو للبطاقات)، وتستهلك أقل من 700 واط، وتناسب أي دائرة مكتبية. اخترها عندما: يكون الاستخدام على الحافة، في خوادم 1U/2U، مع قيود على الطاقة، وعندما يتناسب حجم النموذج مع سعة 24 جيجابايت، وعندما يكون معدل نقل البيانات لكل واط هو المعيار.

الأداء لكل يورو: الجدول الذي لا ينبغي عرضه على المدير المالي

وحدة معالجة الرسوميات‏:‏ السعر (€) 7B INT4 tok/s (single) توك/توك لكل 1 يورو 70B INT4 tok/s* 70B tok/s لكل 1 يورو
RTX 4090 (المخزون المتبقي) ~ € 1,700 120 70.6 يحتاج إلى 2 × = 28 8.2 (على أساس مجموعة من بطاقتين)
RTX 5090 ~ € 2,400 200 83.3 يحتاج إلى 2 × = 28 5.8 (على أساس مجموعة من بطاقتين)
RTX Pro 6000 BW Max-Q ~ € 8,500 185 21.8 30 بطاقة فردية 3.5
خادم RTX Pro 6000 BW ~ € 8,800 200 22.7 31 بطاقة فردية 3.5
L40 ~ € 7,800 100 12.8 يحتاج إلى 2 × = 19 1.2 (على أساس بطاقتين)
L4 ~ € 2,500 40 16.0 لا يتناسب ن / أ
H100 SXM (مرجع) ~ € 28,000 220 7.9 60 بطاقة فردية 2.1

*بالنسبة لـ 70B INT4: أرقام لكل بطاقة عندما يتناسب النموذج مع بطاقة واحدة؛ معدل نقل البيانات الإجمالي أحادي التدفق عندما تكون هناك حاجة إلى توازي الموترات متعددة البطاقات، مقسومًا على إجمالي تكلفة البطاقة.

تُعدّ بطاقة 5090 الأفضل من حيث الأداء مقابل التكلفة في جميع أحجام النماذج التي تتناسب معها. أما بطاقات Pro 6000، فتتفوق في جانب آخر: إذ يُلغي تشغيل نماذج من فئة 70 مليار على بطاقة واحدة زمن الاستجابة وتكاليف التعقيد الإضافية للتوازي الموتري. تُعتبر بطاقة L40 الأسوأ من حيث الأداء مقابل التكلفة في هذا الجدول بفارق كبير، حيث تُكلّف ما يقارب ثلاثة أضعاف تكلفة بطاقة 5090 مقابل 50% فقط من أداء الاستدلال. وتكمن قيمتها في التوافق مع متطلبات الشراء وسجلها الحافل في الإنتاج باستخدام لغة Ada، وليس في جدواها الاقتصادية البحتة. أما بطاقة L4، فهي الأفضل من حيث الأداء مقابل التكلفة تحديدًا في فئة النماذج الصغيرة ذات استهلاك الطاقة المنخفض، حيث لا تُنافسها أي بطاقة أخرى.

الأداء لكل واط: جدول لمدير مركز البيانات المشتركة

وحدة معالجة الرسوميات‏:‏ TDP 7B tok/s توك/ثانية لكل واط 70 مليار توك/ثانية* 70B tok/s per W
L4 72 W 40 0.56 ن / أ ن / أ
RTX Pro 6000 BW Max-Q 300 W 185 0.62 30 0.10
L40 300 W 100 0.33 19 (×2) 0.03
RTX 5090 575 W 200 0.35 28 (×2) 0.024
RTX 4090 450 W 120 0.27 28 (×2) 0.031
خادم RTX Pro 6000 BW 600 W 200 0.33 31 0.052
H100 SXM (مرجع) 700 W 220 0.31 60 0.086

تتفوق بطاقة Max-Q في الأداء لكل واط ضمن هذه المجموعة، وبفارق كبير. يُحافظ تحديد استهلاك بطاقة Blackwell بسعة 96 جيجابايت عند 300 واط على كفاءة البطاقة، مما يُتيح لك الحصول على معظم إنتاجية إصدار Server Edition بنصف استهلاك الطاقة. في مراكز البيانات المشتركة حيث يتم قياس استهلاك الطاقة ودفع 0.18-0.30 يورو لكل كيلوواط ساعة بشكل مستمر، تُوفر بطاقة Max-Q مبالغ كبيرة على مدى سنوات عديدة مقارنةً بإصدار Server Edition. لدينا عملاء انتقلوا من إصدار Server Edition إلى Max-Q تحديدًا لتجنب ترقية نظام التبريد في مبانيهم.

ملاحظات التدريب والضبط الدقيق

لا يُعدّ التدريب الميزة الأساسية لشركة كينتينو، إذ يشتري معظم العملاء الاستدلال. لكنّ الضبط الدقيق يظهر في كل مكان، ويخضع اختيار التدريب لقيود مختلفة. لا يُعدّ التدريب الكامل للمعلمات لنماذج 70 مليار نموذج فأكثر خيارًا عمليًا على هذه المجموعة؛ إذ يتطلب ذلك 8 وحدات H100/H200 SXM أو خدمة سحابية مستأجرة، وسنوضح ذلك. يعمل الضبط الدقيق لتقنية LoRa لنماذج 7-32 مليار نموذج بكفاءة على 4 وحدات 5090 أو 4 وحدات Pro 6000 BW Max-Q. يُفضّل استخدام وحدتي Pro 6000 BW (أي إصدار) لتقنية QLoRA لنماذج 70 مليار نموذج على 4 وحدات 5090 مع FSDP، لأنّ استخدام بطاقة واحدة لكل نسخة من النموذج أبسط بكثير. قاعدة القرار: إذا كانت عمليات التدريب تستغرق أكثر من 24 ساعة دون مراقبة، فإنّ تصحيح الأخطاء ECC مهم - اختر Pro 6000 أو L40. أما إذا كانت أقل من 24 ساعة مع وجود مُراقب بشري، فإنّ 5090 خيار جيد وأسرع من حيث التكلفة.

لغة الرؤية ومسألة Pro 6000 مقابل H100

تُغيّر وحدات VLM الحسابات نظرًا لكبر حجم منطقة التنشيط وزيادة استهلاك موارد المعالجة المسبقة (ترميز الصور). بالنسبة لنموذج Qwen2.5-VL 72B INT4 (بسعة 46 جيجابايت تقريبًا)، تُقدّم بطاقة Pro 6000 BW أداءً يتراوح بين 18 و24 رمزًا/ثانية على بطاقة واحدة مع زمن تعبئة مسبقة يبلغ 1.4 ثانية تقريبًا؛ بينما تُقدّم بطاقتا 5090 في وضع المعالجة المتوازية أداءً يتراوح بين 12 و18 رمزًا/ثانية مع زمن معالجة إضافي يتراوح بين 20 و40 مللي ثانية لكل رمز. بالنسبة للاستدلال المحلي في مجال الروبوتات، تُعدّ بطاقة Pro 6000 BW الخيار الأمثل لأن نموذج Qwen2.5-VL 72B هو النموذج الذي يرغب المستخدمون في تشغيله فعليًا، كما أن استخدام بطاقة واحدة يُلغي زمن المعالجة الإضافي. أما بالنسبة لخطوط أنابيب التصنيف التلقائي وتحويل الصور إلى نصوص بكميات كبيرة حيث لا يُشكّل زمن الاستجابة عاملًا مهمًا، فإن أربع بطاقات 5090 لا تزال تتفوق من حيث الأداء مقابل التكلفة.

مقارنة صادقة: Pro 6000 BW مقابل H100

نحن لا نبيع H100. سنوضح المقايضة بالتفصيل لأن العملاء يسألون عنها.

لكل بطاقة على حدة، تتفوق بطاقة H100 SXM (ذاكرة HBM3 سعة 80 جيجابايت، سرعة نقل بيانات 3.35 تيرابايت/ثانية) على بطاقة Pro 6000 BW Server (ذاكرة GDDR7 ECC سعة 96 جيجابايت، سرعة نقل بيانات 1.79 تيرابايت/ثانية) في استدلال التدفق الأحادي المحدود بعرض النطاق الترددي بنحو 1.5 إلى 1.9 ضعف - أي 60 تيرابايت/ثانية مقابل 31 تيرابايت/ثانية على معالج Llama 3.3 70B INT4. كما تتميز H100 بتقنية NVLink وموصل SXM5 الإضافي، مما يوفر اتصالاً بين وحدات معالجة الرسومات بسرعة 900 جيجابايت/ثانية في عقدة HGX ذات 8 وحدات معالجة رسومات. أما Pro 6000 BW فتعتمد على PCIe 5.0 x16 (بسرعة فعالة تبلغ حوالي 63 جيجابايت/ثانية)، أي أبطأ بنحو 14 ضعفًا في نقل البيانات بين البطاقات.

بالنسبة لاستنتاج النماذج التي تتسع لـ 96 جيجابايت على بطاقة واحدة، يكون هذا الفرق غير ملحوظ، إذ لا يوجد تبادل بيانات بين البطاقات. أما بالنسبة لاستنتاج النماذج التي تتطلب توزيعها على 4 أو 8 بطاقات، فإن H100 مع NVLink يتفوق بنسبة 30-50% في الإنتاجية الإجمالية، لأن التوازي الموتري حساس لنوعية الاتصال البيني. أما بالنسبة للتدريب على 8 بطاقات، فإن H100 يتفوق بشكل حاسم.

يبلغ فرق السعر من 3 إلى 3.5 أضعاف لكل بطاقة، ومن 8 إلى 12 ضعفًا لكل عقدة قابلة للاستخدام (يشمل HGX H100 لوحة التوصيل ومفاتيح NVSwitches). بالنسبة لمعظم أحمال العمل غير الضخمة، لا يُعد هذا الفرق مجديًا اقتصاديًا. أما في أحمال العمل التي يكون فيها هذا الفرق مجديًا، فإن العميل لا يشتري من كينتينو، بل يشتري مباشرةً من ديل أو لينوفو أو سوبر مايكرو بصفقات ضخمة. وسنؤكد هذا الأمر عبر الهاتف أيضًا.

لن نقول إن بطاقة Pro 6000 Blackwell "بجودة" أو "بمنافسة" بطاقة H100. فهي ليست كذلك، وفقًا للمعايير التي صُممت H100 للتفوق فيها. مع ذلك، فهي البطاقة المناسبة لحالات الاستخدام التي تُحل فيها سعة 96 جيجابايت ECC بسرعة 1.79 تيرابايت/ثانية المشكلة الفعلية التي يواجهها العميل - وهي أغلب الحالات.

تدفق القرار

البداية: ما هو حجم العمل؟

  • الاستدلال فقط؟
    • تفاعلي أحادي المسار (دردشة، وكيل، صوت)؟
      • هل يتناسب هذا الطراز مع ذاكرة 32 جيجابايت (7 بايت - 32 بايت INT4)؟
        • الميزانية محدودة: 4 × RTX 5090
        • متطلبات ECC (الامتثال): 4× L40
        • مكتب ذو قدرة محدودة على توفير الطاقة: 4× Pro 6000 BW Max-Q
      • يحتاج هذا الطراز إلى مساحة تخزين تتراوح بين 32 و80 جيجابايت (70 بايت INT4، و72 بايت VLM):
        • أريد بساطة استخدام بطاقة واحدة: 1-2 × خادم Pro 6000 BW
        • أولوية الأداء/اليورو، قبول بروتوكول نقل البيانات ثنائي الاتجاه: 4 × RTX 5090
        • محدد الطاقة: 2× Pro 6000 BW Max-Q
      • طراز 80 جيجابايت+ (405 بايت INT4، استضافة متعددة الطرازات):
        • خادم Pro 6000 BW بأربعة أو ثمانية وحدات معالجة رسومية في هيكل ثماني وحدات معالجة رسومية
        • فكّر ملياً فيما إذا كان استخدام الحوسبة السحابية هو الخيار الأمثل حقاً
    • معالجة الدفعات المجمعة (التصنيف التلقائي، معالجة المستندات)؟
      • النموذج الصغير (7B–13B): 8 × L4 في 2U (الحافة) أو 4 × 5090 (رف)
      • طراز كبير (70B+): 4 خوادم Pro 6000 BW or 8 × 5090
    • حافة / 1U / محدود الطاقة؟
      • 1–8× L4
  • التدريب أم الصقل؟
    • LoRA / QLoRA / ضبط دقيق (معظم العملاء):
      • 7B–13B: 4 × RTX 5090 (لا يُعدّ نظام التحكم الإلكتروني في السعة (ECC) أمرًا بالغ الأهمية)
      • 32B–70B: 4 خوادم Pro 6000 BW (ECC + السعة)
      • التشغيل لفترات طويلة دون مراقبة: اختر دائمًا قطع غيار ECC
    • تدريب كامل المعايير 70B+: غير قابل للتطبيق هنا — يُنصح باستخدام الحوسبة السحابية أو من فئة DGX
    • ضبط دقيق لتقنية الانتشار / VLM: برو 6000 بي دبليو بالنسبة لحجم الدفعة، 5090 للحصول على أداء/يورو على دفعات أصغر
  • مختلط (التدريب + الاستدلال، مختبر الأبحاث)؟
    • 4-GPU: 4 خوادم Pro 6000 BW (أقصى جودة في حالة تحديد الطاقة)
    • 8-GPU: ثمانية خوادم Pro 6000 BW في هيكل ثنائي EPYC
    • المزج والتوفيق: 4 وحدات استدلال 5090 + وحدة تدريب Pro 6000 BW واحدة في نفس الهيكل أمر ممكن، ولكنه ليس مثاليًا.

يُعدّ الفرع الذي يُشير إلى "4× RTX 5090" هو الأكثر شيوعًا بين التكوينات التي نُشحنها. ويأتي في المرتبة الثانية الفرع الذي يُشير إلى "4× Pro 6000 BW Server". أما فرعا L4 و Max-Q فهما أقل حجمًا، لكنهما ليسا مُتخصصين في سوق مُحددة؛ ففي كل ربع سنة، نُشحن كميات كبيرة من البطاقات إلى مكاتب لا تتحمل فيها بطاقات بقدرة 600 واط التيار الكهربائي للمبنى.

ما لا نوفره في المخزون

بكل وضوح: لا تبيع شركة كينتينو أجهزة من فئة NVL، مثل H100 SXM، وH200 SXM، وA100 SXM، وB200، وGB200. يقع تصميم SXM5 ونظام لوحات HGX/NVL ضمن مستوى مختلف من سلسلة التوريد. ظهرت إصدارات PCIe H100 لفترة وجيزة، ثم اختفت من السوق. إذا كان حجم العمل لديك يتطلب فعلاً 8 منافذ H100 مع NVLink، فإن خياراتك المتاحة في مايو 2026 هي: الاستئجار من مزود خدمات سحابية متخصص، أو الشراء مباشرةً من Dell أو Lenovo أو Supermicro مع فترة انتظار تتراوح بين 12 و20 أسبوعًا، أو التعاون مع شركة تكامل أنظمة من نفس المستوى.

نحن لا نخزن AMD Instinct MI300X أو MI325X أيضًا - على الرغم من أنها قوية على الورق للاستدلال المقيد بالذاكرة (192 جيجابايت HBM3، 5.3 تيرابايت/ثانية على MI300X)، إلا أن نضج برنامج ROCm وتوافر القنوات في جمهورية التشيك ليسا في المكان الذي تتواجد فيه قاعدة العملاء لدينا اليوم.

أين ينتهي التحليل بالنسبة للمشترين العاديين؟

  • مختبر الأبحاث، أول خادم استدلال: أربع بطاقات رسومات RTX 5090 على معالج EPYC Turin مع ذاكرة وصول عشوائي 192 جيجابايت، ووحدة تزويد طاقة ATX مزدوجة، وهيكل رف 4U. يشغل جميع الطرازات حتى 70B INT4 عبر TP، مع إمكانية ضبط دقيق.
  • شركة ناشئة تقدم خدمات الاستدلال الإنتاجي: خادم Pro 6000 BW رباعي في وحدة 4U مع معالج EPYC Genoa/Turin، وذاكرة وصول عشوائي (RAM) بسعة 384-512 جيجابايت، ووحدة تزويد طاقة CRPS مع نظام تكرار 1+1. يدعم تصحيح الأخطاء ECC، ويعمل بدون شاشة، وببطاقة واحدة بسعة تخزين تزيد عن 70 بايت.
  • مختبر الروبوتات + الحوسبة المحلية: 4 خوادم Pro 6000 BW. تتيح لك سعة 96 جيجابايت استضافة Qwen2.5-VL 72B وLLM معًا، وتُعد ECC مهمة لأن مخرجات الاستدلال تُشغل الأجهزة المادية.
  • شراء مشتريات المؤسسة لأغراض الامتثال: 4 أو 8 وحدات L40 في هيكل Supermicro. أداء أسوأ لكل يورو، لكن كل بند في قائمة المكونات يجتاز التدقيق.
  • مكتب فرعي، بيع بالتجزئة، حافة: 4× أو 8× L4 في 1U/2U. طاقة مكتبية، لا حاجة لنظام تكييف هواء خاص.
  • توسيع أسطول 4090 الحالي: المزيد من بطاقات 4090 إذا كانت الميزانية محدودة ويمكنك العثور عليها؛ وإلا فقم بدمج بطاقات 5090 (يتعامل vLLM مع TP من الأجيال المختلطة بشكل مقبول؛ لا تخلط 4090 مع Pro 6000 - إن تفاوت عرض النطاق الترددي يفسد تأثير فوز البطاقة الأضعف).

ماذا تفعل بعد ذلك

قبل تحديد وحدات معالجة الرسومات (GPUs)، أجب عن هذه الأسئلة الخمسة:

  1. أدرج جميع النماذج التي تحتاج إلى استضافتها في وقت واحد. اجمع بصمات INT4. أضف 40-60% لذاكرة التخزين المؤقت KV في الدفعة المستهدفة والسياق. هذا هو الحد الأدنى لذاكرة الوصول العشوائي للفيديو (VRAM)، الإجمالي ولكل بطاقة.
  2. حدد هدف زمن الاستجابة. معدل نقل البيانات عبر التدفق الواحد أقل من 30 يعني إمكانية استخدام أي شيء تقريبًا. أما معدل نقل البيانات عبر التدفق الواحد أعلى من 60 فيقتصر على 5090 أو Pro 6000 BW. معدل نقل البيانات المجمعة يوميًا هو مقياس مختلف ويؤثر على الإجابة.
  3. حدد نطاق استهلاك الطاقة عند الحائط. التيار أحادي الطور 16 أمبير يعني دعم 4 وحدات معالجة رسومية للمستهلكين كحد أقصى. التيار ثلاثي الأطوار 32 أمبير يعني دعم 8 وحدات معالجة رسومية. دائرة 10 أمبير للمكاتب تعني دعم L4 أو Max-Q فقط.
  4. حدد قيود الشراء. "نشتري فقط وحدات SKU الخاصة بالمؤسسات" ← خادم L40 أو Pro 6000 BW. "نشتري أي شيء متوفر" ← 5090. كن صادقًا مع نفسك؛ فهذا هو القيد الذي يُعرقل معظم عمليات البناء في المراحل الأخيرة.
  5. حدد دورة التشغيل والعمر الافتراضي. يُغطي استخدام جهاز كمبيوتر مخصص للتطوير على مدار الساعة طوال أيام الأسبوع لمدة ثلاث سنوات تكلفة وحدات تزويد الطاقة ECC و Platinum. أما جهاز الكمبيوتر المخصص للتطوير فلا يُغطي هذه التكلفة.

إذا لم تتمكن من الإجابة على جميع الأسئلة الخمسة، فلن يبدو أي خيار من خيارات وحدة معالجة الرسومات مناسبًا عند التفكير فيه لاحقًا. أما إذا تمكنت من الإجابة، فستظهر الإجابة الصحيحة من الجدول أعلاه بمجرد إجراء مكالمة واحدة. انظر W05 فيما يتعلق بالحرارة وتدفق الهواء، W06 بالنسبة لمستويات التخزين، و W01 بالنسبة لقواعد تحديد حجم ذاكرة الوصول العشوائي (RAM) إلى ذاكرة الوصول العشوائي للفيديو (VRAM) التي تدعم اختيار وحدة معالجة الرسومات (GPU).


هذا جزء من ويكي كينتينو، وهي سلسلة مرجعية حول الحوسبة الذكية، والروبوتات، والأنظمة التي تربط بينهما. نرحب بالتعليقات والتصويبات على info@kentino.com.