اختيار وحدة معالجة الرسومات لأحمال عمل الذكاء الاصطناعي: 5090، 4090، RTX Pro 6000، L40، L4 مقارنة مباشرة
لا يوجد معالج رسومات مثالي لجميع تطبيقات الذكاء الاصطناعي في عام 2026. يوجد معالج رسومات مثالي لحجم عمل محدد، واستهلاك طاقة محدد، وميزانية محددة - واختيار البطاقة الخاطئة في الهيكل المناسب يُعد خطأً مكلفًا أكثر من اختيار البطاقة المناسبة في الهيكل غير المناسب. تستعرض هذه المقالة مجموعة معالجات Kentino بشكل مباشر، مع أرقام أداء حقيقية، ومفاضلات موضوعية، ومنهجية اتخاذ قرار استخدمناها بالفعل في مكالماتنا مع العملاء. لا نتجاهل وجود معالجي H100 وA100؛ فهما موجودان، لكننا لا نبيعهما، وسنوضح بالتفصيل متى يكون هذا الفارق مهمًا.
الأوراق مكشوفة:
- RTX 5090 — 32 جيجابايت GDDR7، 1.79 تيرابايت/ثانية، 575 واط، للمستهلك.
- RTX 4090 — 24 جيجابايت GDDR6X، 1.01 تيرابايت/ثانية، 450 واط، للمستهلكين، من الجيل السابق.
- RTX Pro 6000 Blackwell Server Edition — 96 جيجابايت GDDR7 ECC، 600 واط، تبريد سلبي، عامل شكل الخادم، لا توجد منافذ عرض.
- RTX Pro 6000 Blackwell Max-Q — 96 جيجابايت GDDR7 ECC، 300 واط، مروحة ثنائية الفتحة، نفس السيليكون المستخدم في محطة العمل.
- L40 — 48 جيجابايت GDDR6 ECC، 0.86 تيرابايت/ثانية، 300 واط، عامل شكل مركز البيانات، ECC كامل.
- L4 — 24 جيجابايت GDDR6، 0.30 تيرابايت/ثانية، 72 واط، فتحة واحدة منخفضة الارتفاع، استنتاج الحافة.
المواصفات التي تهم في الواقع
تتميز جداول مواصفات وحدات معالجة الرسومات (GPU) بالتعقيد، ومعظم الأرقام لا تؤثر على قرار الشراء. إلا أن ثلاثة منها تؤثر.
- سعة ذاكرة الوصول العشوائي للفيديو (VRAM). هذا أمر ثنائي. إما أن نموذجك مناسب، أو غير مناسب. ولا يُعدّ تفريغ وحدة المعالجة المركزية بديلاً عملياً (مُغطّى في W01).
- عرض نطاق ذاكرة الوصول العشوائي للفيديو (VRAM). تعتمد عملية توليد الرموز على المحول على عرض النطاق الترددي. أما عدد عمليات الفاصلة العائمة في الثانية (TFLOPS) المذكورة في ورقة المواصفات، فهي غير ذات صلة إلى حد كبير بعملية الاستدلال.
- قوة مستدامة وشكل مميز. بطاقة بقدرة 600 واط في هيكل لا يستطيع تبريدها تُعتبر بطاقة بقدرة 300 واط مزودة بجهاز إنذار حراري. بطاقة بقدرة 72 واط في خادم 1U تختلف عن بطاقة بقدرة 575 واط في محطة عمل 4U.
| وحدة معالجة الرسوميات: | VRAM | عرض النطاق الترددي | TDP | شكل عامل | ECC | ملاحظة |
|---|---|---|---|---|---|---|
| RTX 4090 | 24 GB GDDR6X | 1.01 TB / s | 450 W | مستهلك بثلاث فتحات | لا | الجيل السابق، مسار انخفاض التكلفة |
| RTX 5090 | شنومكس غب غدرسنومكس | 1.79 TB / s | 575 W | مستهلك 2-3 فتحات | لا | Perf/€ king for ference |
| RTX Pro 6000 BW Max-Q | شنومكس غب غدرسنومكس | 1.79 TB / s | 300 W | منفاخ ذو فتحتين | نعم | كثافة عالية، طاقة أقل |
| RTX Pro 6000 BW Server Ed. | شنومكس غب غدرسنومكس | 1.79 TB / s | 600 W | سلبي ذو فتحتين | نعم | خادم من الدرجة الأولى، بدون واجهة رسومية |
| L40 | شنومكس غب غدرسنومكس | 0.86 TB / s | 300 W | سلبي ذو فتحتين | نعم | توليد بيانات مركز البيانات |
| L4 | شنومكس غب غدرسنومكس | 0.30 TB / s | 72 W | فتحة واحدة LP | نعم | استدلال الحافة / 1U |
| H100 SXM (للمرجعية، غير مباع) | 80 GB HBM3 | 3.35 TB / s | 700 W | SXM5 | نعم | مستوى مزودي خدمات الحوسبة السحابية الفائقة |
| H200 SXM (للمرجعية، غير مباع) | 141 جيجا بايت HBM3e | 4.80 TB / s | 700 W | SXM5 | نعم | ملك عرض النطاق الترددي HBM |
الاستدلال: عدد الرموز المميزة في الثانية، حسب النموذج والبطاقة
يُحسب توليد رموز الاستدلال، في تدفق واحد، تقريبًا بقسمة عرض النطاق الترددي على حجم النموذج مضروبًا في عامل كفاءة المكدس 0.6-0.8. يوضح الجدول أدناه ما قمنا بقياسه على نماذج الاختبار باستخدام vLLM 0.6+ وملف llama.cpp المُحدّث حتى الربع الثاني من عام 2026. INT4 ما لم يُذكر خلاف ذلك. معدل نقل البيانات في التدفق الواحد أولًا؛ والمعدل الإجمالي المُجمّع بين قوسين حيثما أمكن قياسه.
| الموديل | كوانت | المقاس | RTX 4090 | RTX 5090 | خادم/خدمة Pro 6000 BW | برو 6000 ماكس-كيو | L40 | L4 |
|---|---|---|---|---|---|---|---|---|
| كوين 2.5 7 ب | INT4 | ~ شنومك غيغابايت | 110-130 (220) | 180-220 (340) | 180-220 (340) | 170-200 (320) | 90-110 (200) | 35-45 (90) |
| اللاما 3.2 13 ب | INT4 | ~ شنومك غيغابايت | 70-85 (170) | 120-140 (250) | 120-140 (250) | 110-130 (230) | 60-75 (140) | 22-28 (60) |
| كوين 2.5 32 ب | INT4 | ~ شنومك غيغابايت | 32-38 (90) | 55-65 (140) | 60-70 (150) | 55-65 (140) | 28-34 (80) | لا يتناسب |
| اللاما 3.3 70 ب | INT4 | ~ شنومك غيغابايت | لا يناسب الأفراد | يحتاج إلى 2× (24–30) | 28–34 (90) بطاقة واحدة | 27-32 (85) | يحتاج إلى 2× (16–22) | لا يتناسب |
| كوين 2.5 72 ب | INT4 | ~ شنومك غيغابايت | لا يناسب الأفراد | يحتاج إلى 2× (24–30) | 28–34 (90) بطاقة واحدة | 27-32 (85) | يحتاج إلى 2× (16–22) | لا يتناسب |
| Qwen2.5-VL 72B | INT4 | ~46 جيجابايت+ | لا يناسب الأفراد | يحتاج إلى 2× (12–18) | بطاقة فردية من 18 إلى 24 عامًا | 17-22 | يحتاج إلى 2× (10–14) | لا يتناسب |
| اللاما 3.1 405 ب | INT4 | ~ شنومك غيغابايت | لا يتناسب | يحتاج إلى 8 أضعاف | 4× (عقدة واحدة) | 4× (عقدة واحدة) | يحتاج إلى 5 أضعاف | لا يتناسب |
بعض الملاحظات الهامة. هذه أرقام نموذجية على هيكل مُبرّد بشكل صحيح مع وجود الجهاز بكامل طاقته. يعتمد زمن الاستجابة الكلي (TTFT) في حالة التخزين المؤقت البارد بشكل أساسي على تخصيص ذاكرة التخزين المؤقت للقيم والقيم (KV-cache) وحسابات التعبئة المسبقة، وليس على عرض النطاق الترددي، ويتراوح بين 200 و900 مللي ثانية عبر هذه المجموعة من البطاقات. ينخفض معدل نقل البيانات المجمعة بشكل غير خطي بعد 8-16 تدفقًا متزامنًا بسبب التنافس على الموارد الحسابية. إذا كان تطبيقك تفاعليًا (مثل الدردشة أو التوجيه خطوة بخطوة)، فإن التدفق الفردي أهم من التدفق المجمع. أما إذا كان تطبيقك يعتمد على معالجة كميات كبيرة من البيانات (مثل معالجة المستندات أو التصنيف التلقائي)، فإن التدفق المجمع أهم.
تُعدّ وحدة 5090 الرباعية العمود الفقري لمجموعتنا لسبب وجيه: فهي تُكلّف ما بين 8,500 و14,000 يورو للبطاقات فقط، وتضمّ أربع وحدات معالجة رسومية في هيكل 4U مع تهوية مناسبة، وتُقدّم أداءً إجماليًا يُقارب 12,000 توك/ثانية على Llama 3.3 70B INT4 باستخدام vLLM مع التوازي الموتري. في المقابل، تُقدّم وحدة Pro 6000 Blackwell أحادية بسعر 8,500 يورو أداءً يُقارب 30 توك/ثانية للتدفق الفردي و90 توك/ثانية للدفعات على نفس الطراز. بالنسبة لخادم خدمة متعدد المستخدمين، تُعدّ وحدات 5090 هي الخيار الأمثل. أما بالنسبة لأحمال العمل ذات السياق الكبير لمستخدم واحد مع طرازات بسعة 64 جيجابايت أو أكثر، فإنّ وحدة Pro 6000 هي الخيار الأمثل. لا توجد إجابة واحدة تناسب الجميع.
حيث يكون لكل بطاقة معنى فعلي
RTX 5090 - ملكة الأداء مقابل السعر مع بعض العيوب الطفيفة. الخيار الأمثل عندما يكون عبء العمل هو الاستدلال، والميزانية محدودة، ويمكن للنظام تحمل قيدين معروفين: عدم وجود تصحيح الأخطاء ECC، وتقلبات الطاقة في الأنظمة الاستهلاكية التي تتطلب عناية خاصة بوحدة التزويد بالطاقة والهيكل (انظر W04 ). بالنسبة لطرازات 13B و32B، تُعد 5090 أسرع لكل يورو من أي خيار آخر متاح. أما بالنسبة لفئة 70B، فإن أربع بطاقات 5090 تعمل بالتوازي الموتري توفر إنتاجية إجمالية أعلى من وحدة Pro 6000 Blackwell واحدة بتكلفة رأسمالية إجمالية أقل. العيوب: استهلاك طاقة اسمي 575 واط مع تقلبات طاقة تتجاوز 600 واط، وسعة قصوى تبلغ 32 جيجابايت لكل بطاقة مما يُجبر على استخدام وحدات معالجة رسومية متعددة لفئة 32B وما فوق في السياقات العالية. اخترها عندما: يكون الاستدلال مستمرًا على مدار الساعة طوال أيام الأسبوع لفئة 7B-32B، ويكون الأداء مقابل السعر مهمًا، وتتوفر لديك تهوية جيدة للخزانة، ولا يُعد تصحيح الأخطاء ECC شرطًا أساسيًا. تجنب استخدامه عندما: يكون ECC إلزاميًا، أو بطاقة واحدة 70B+، أو لا تستطيع الغرفة نقل 24 كيلو واط من الحرارة.
بطاقة RTX 4090 - خيار اقتصادي فقط. في عام 2026، يُنصح بشرائها. نادرة في السوق، أما المستعملة منها فتتراوح أسعارها بين 1,400 و1,900 يورو. أسرع بنسبة 55% تقريبًا من بطاقة 5090 في معالجة البيانات (1.01 مقابل 1.79 تيرابايت/ثانية) وبسعة 24 جيجابايت مقابل 32 جيجابايت - تُعدّ سعة 8 جيجابايت مهمة لأن طراز 32 بايت INT4 يوفر مساحة أكبر لذاكرة التخزين المؤقت KV في بطاقة 5090. لا تزال خيارًا منطقيًا لتوسيع أسطول بطاقات 4090 الحالي مع مراعاة قيود الإنفاق الرأسمالي. هل تبدأ من الصفر؟ اشترِ بطاقات 5090.
بطاقة RTX Pro 6000 Blackwell Server Edition - الأفضل في مجال ذاكرة الفيديو (VRAM) للأحمال الثقيلة. ذاكرة GDDR7 بسعة 96 جيجابايت مع تصحيح الأخطاء ECC بسرعة 1.79 تيرابايت/ثانية تُتيح لك اختيار الطرازات التي يمكنك استضافتها. تحتوي البطاقة الواحدة على معالج Qwen2.5-VL بسعة 72 بايت وذاكرة تخزين مؤقتة من نوع KV، مما يُتيح تشغيل ما يصل إلى 20 تدفقًا متزامنًا. أما البطاقات الأربع في وحدة واحدة، فتحتوي على معالج Llama 3.1 بسعة 405 بايت وذاكرة تخزين مؤقتة من نوع INT4، كل ذلك في هيكل واحد بدون اتصال شبكي بين الوحدات. تتميز هذه البطاقة بتبريد سلبي، وتصميم يُراعي تدفق الهواء من الأمام إلى الخلف في الرف، ولا تحتوي على منافذ عرض، ومُختبرة للعمل على مدار الساعة. تستخدم نفس شريحة السيليكون المستخدمة في إصدار Workstation Edition، ونفس سعة الطاقة 600 واط، ولكن بنظام تبريد مختلف. اخترها عندما: تحتاج إلى بطاقة واحدة بسعة 70 بايت أو أكثر، أو عندما يكون تصحيح الأخطاء ECC مطلوبًا، أو عند نشرها في رف مع توفير تهوية مناسبة، أو عند دمج التدريب، أو عندما يكون استخدام عدد أقل من البطاقات ذات السعة الأكبر أفضل من استخدام عدد أكبر من البطاقات ذات السعة الأصغر من حيث مساحة الرف والطاقة.
بطاقة RTX Pro 6000 Blackwell Max-Q - كثافة عالية دون الحاجة إلى تعديلات في نظام الشبكة. نفس سعة 96 جيجابايت وسرعة نقل بيانات 1.79 تيرابايت/ثانية، مع حد أقصى لاستهلاك الطاقة 300 واط. تستهلك أربع بطاقات Max-Q طاقة 1.2 كيلوواط من وحدات معالجة الرسومات، بينما تستهلك أربع بطاقات Server Edition طاقة 2.4 كيلوواط. صحيح أن انخفاض الأداء بسبب الحد الأقصى لاستهلاك الطاقة ملحوظ، ولكنه أقل من نسبة استهلاك الطاقة الفعلية - منحنى الأداء/الواط في بطاقات Blackwell حاد عند الحد الأقصى، لذا فإن تحديد الحد الأقصى لاستهلاك الطاقة عند 300 واط يؤدي إلى خسارة 20-30% من معدل نقل البيانات، وليس 50%. اختر هذه البطاقة عندما: تكون بيئة العمل محدودة الطاقة، أو عندما ترغب في سعة 96 جيجابايت لكل بطاقة، أو عندما تكون الكثافة أهم من ذروة معدل نقل البيانات لكل بطاقة، أو عندما يكون مستوى الضوضاء مهمًا.
L40 - بطاقة استدلال مؤسسية مزودة بتقنية تصحيح الأخطاء ECC وسجل حافل. من جيل Ada. أبطأ من Blackwell من حيث عرض النطاق الترددي (0.86 مقابل 1.79 تيرابايت/ثانية) والسعة (48 مقابل 96 جيجابايت)، وسعرها مناسب لمراكز البيانات. السبب الرئيسي لشرائها هو سهولة التوريد: تصحيح أخطاء ECC كامل، برامج تشغيل معتمدة، استهلاك طاقة مستدام 300 واط، وأكثر من عامين من الاستخدام الفعلي في بيئات الإنتاج. بالنسبة للبيئات التي تمنع استخدام بطاقات المستهلكين (التأمين، الحكومة، بعض الصناعات الخاضعة للتنظيم)، تُعد هذه البطاقة الخيار الأمثل. من حيث الأداء مقابل السعر، تتفوق عليها بطاقة 5090. اخترها عندما: تمنع سياسة التوريد استخدام أجهزة المستهلكين، ويتناسب حجم العمل مع سعة 48 جيجابايت، وتكون موثوقية التشغيل على مدار الساعة أهم من الأداء مقابل السعر.
L4 - استدلال الحافة، 1U، 72 واط. البطاقة الوحيدة في هذه القائمة التي تتناسب مع خادم 1U بجانب اللوحة الأم بسلاسة، والوحيدة التي تعمل باستهلاك طاقة مماثل لاستهلاك حاسوب محمول. استهلاك طاقة 72 واط، تصميم منخفض الارتفاع بفتحة واحدة، وضع سلبي، ذاكرة 24 جيجابايت GDDR6 ECC، سرعة نقل بيانات 300 جيجابايت/ثانية. يمثل عرض النطاق الترددي عنق الزجاجة - حيث تصل سرعة نقل البيانات أحادية التدفق 7 بايت إلى 35-45 كيلوبت/ثانية، وهي سرعة مقبولة وليست سريعة. تتمثل حالة الاستخدام في التوزيع: 8 بطاقات L4 في هيكل 2U على مضيف EPYC واحد توفر 8 تدفقات استدلال متزامنة 7 بايت بتكلفة إجمالية معقولة (حوالي 20 ألف يورو للبطاقات)، وتستهلك أقل من 700 واط، وتناسب أي دائرة مكتبية. اخترها عندما: يكون النشر على الحافة، في خوادم 1U/2U، مع قيود على الطاقة، ويتناسب الطراز مع سعة 24 جيجابايت، ويكون معدل نقل البيانات لكل واط هو المعيار.
الأداء لكل يورو: الجدول الذي لا ينبغي عرضه على المدير المالي
| وحدة معالجة الرسوميات: | السعر (€) | 7B INT4 tok/s (single) | توك/توك لكل 1 يورو | 70B INT4 tok/s* | 70B tok/s لكل 1 يورو |
|---|---|---|---|---|---|
| RTX 4090 (المخزون المتبقي) | ~ € 1,700 | 120 | 70.6 | يحتاج إلى 2 × = 28 | 8.2 (على أساس مجموعة من بطاقتين) |
| RTX 5090 | ~ € 2,400 | 200 | 83.3 | يحتاج إلى 2 × = 28 | 5.8 (على أساس مجموعة من بطاقتين) |
| RTX Pro 6000 BW Max-Q | ~ € 8,500 | 185 | 21.8 | 30 بطاقة فردية | 3.5 |
| خادم RTX Pro 6000 BW | ~ € 8,800 | 200 | 22.7 | 31 بطاقة فردية | 3.5 |
| L40 | ~ € 7,800 | 100 | 12.8 | يحتاج إلى 2 × = 19 | 1.2 (على أساس بطاقتين) |
| L4 | ~ € 2,500 | 40 | 16.0 | لا يتناسب | ن / أ |
| H100 SXM (مرجع) | ~ € 28,000 | 220 | 7.9 | 60 بطاقة فردية | 2.1 |
*بالنسبة لـ 70B INT4: أرقام لكل بطاقة عندما يتناسب النموذج مع بطاقة واحدة؛ معدل نقل البيانات الإجمالي أحادي التدفق عندما تكون هناك حاجة إلى توازي الموترات متعددة البطاقات، مقسومًا على إجمالي تكلفة البطاقة.
تُعدّ بطاقة 5090 الأفضل من حيث الأداء مقابل التكلفة في جميع أحجام النماذج التي تتناسب معها. أما بطاقات Pro 6000، فتتفوق في جانب آخر: إذ يُلغي تشغيل نماذج من فئة 70 مليار على بطاقة واحدة زمن الاستجابة وتكاليف التعقيد الإضافية للتوازي الموتري. تُعتبر بطاقة L40 الأسوأ من حيث الأداء مقابل التكلفة في هذا الجدول بفارق كبير، حيث تُكلّف ما يقارب ثلاثة أضعاف تكلفة بطاقة 5090 مقابل 50% فقط من أداء الاستدلال. وتكمن قيمتها في التوافق مع متطلبات الشراء وسجلها الحافل في الإنتاج باستخدام لغة Ada، وليس في جدواها الاقتصادية البحتة. أما بطاقة L4، فهي الأفضل من حيث الأداء مقابل التكلفة تحديدًا في فئة النماذج الصغيرة ذات استهلاك الطاقة المنخفض، حيث لا تُنافسها أي بطاقة أخرى.
الأداء لكل واط: جدول لمدير مركز البيانات المشتركة
| وحدة معالجة الرسوميات: | TDP | 7B tok/s | توك/ثانية لكل واط | 70 مليار توك/ثانية* | 70B tok/s per W |
|---|---|---|---|---|---|
| L4 | 72 W | 40 | 0.56 | ن / أ | ن / أ |
| RTX Pro 6000 BW Max-Q | 300 W | 185 | 0.62 | 30 | 0.10 |
| L40 | 300 W | 100 | 0.33 | 19 (×2) | 0.03 |
| RTX 5090 | 575 W | 200 | 0.35 | 28 (×2) | 0.024 |
| RTX 4090 | 450 W | 120 | 0.27 | 28 (×2) | 0.031 |
| خادم RTX Pro 6000 BW | 600 W | 200 | 0.33 | 31 | 0.052 |
| H100 SXM (مرجع) | 700 W | 220 | 0.31 | 60 | 0.086 |
تتفوق بطاقة Max-Q في الأداء لكل واط ضمن هذه المجموعة، وبفارق كبير. يُحافظ تحديد استهلاك بطاقة Blackwell بسعة 96 جيجابايت عند 300 واط على كفاءة البطاقة، مما يُتيح لك الحصول على معظم إنتاجية إصدار Server Edition بنصف استهلاك الطاقة. في مراكز البيانات المشتركة حيث يتم قياس استهلاك الطاقة ودفع 0.18-0.30 يورو لكل كيلوواط ساعة بشكل مستمر، تُوفر بطاقة Max-Q مبالغ كبيرة على مدى سنوات عديدة مقارنةً بإصدار Server Edition. لدينا عملاء انتقلوا من إصدار Server Edition إلى Max-Q تحديدًا لتجنب ترقية نظام التبريد في مبانيهم.
ملاحظات التدريب والضبط الدقيق
لا يُعدّ التدريب الميزة الأساسية لشركة كينتينو، إذ يشتري معظم العملاء الاستدلال. لكنّ الضبط الدقيق يظهر في كل مكان، ويخضع اختيار التدريب لقيود مختلفة. لا يُعدّ التدريب الكامل للمعلمات لنماذج 70 مليار نموذج فأكثر خيارًا عمليًا على هذه المجموعة؛ إذ يتطلب ذلك 8 وحدات H100/H200 SXM أو خدمة سحابية مستأجرة، وسنوضح ذلك. يعمل الضبط الدقيق لتقنية LoRa لنماذج 7-32 مليار نموذج بكفاءة على 4 وحدات 5090 أو 4 وحدات Pro 6000 BW Max-Q. يُفضّل استخدام وحدتي Pro 6000 BW (أي إصدار) لتقنية QLoRA لنماذج 70 مليار نموذج على 4 وحدات 5090 مع FSDP، لأنّ استخدام بطاقة واحدة لكل نسخة من النموذج أبسط بكثير. قاعدة القرار: إذا كانت عمليات التدريب تستغرق أكثر من 24 ساعة دون مراقبة، فإنّ تصحيح الأخطاء ECC مهم - اختر Pro 6000 أو L40. أما إذا كانت أقل من 24 ساعة مع وجود مُراقب بشري، فإنّ 5090 خيار جيد وأسرع من حيث التكلفة.
لغة الرؤية ومسألة Pro 6000 مقابل H100
تُغيّر وحدات VLM الحسابات نظرًا لكبر حجم منطقة التنشيط وزيادة استهلاك موارد المعالجة المسبقة (ترميز الصور). بالنسبة لنموذج Qwen2.5-VL 72B INT4 (بسعة 46 جيجابايت تقريبًا)، تُقدّم بطاقة Pro 6000 BW أداءً يتراوح بين 18 و24 رمزًا/ثانية على بطاقة واحدة مع زمن تعبئة مسبقة يبلغ 1.4 ثانية تقريبًا؛ بينما تُقدّم بطاقتا 5090 في وضع المعالجة المتوازية أداءً يتراوح بين 12 و18 رمزًا/ثانية مع زمن معالجة إضافي يتراوح بين 20 و40 مللي ثانية لكل رمز. بالنسبة للاستدلال المحلي في مجال الروبوتات، تُعدّ بطاقة Pro 6000 BW الخيار الأمثل لأن نموذج Qwen2.5-VL 72B هو النموذج الذي يرغب المستخدمون في تشغيله فعليًا، كما أن استخدام بطاقة واحدة يُلغي زمن المعالجة الإضافي. أما بالنسبة لخطوط أنابيب التصنيف التلقائي وتحويل الصور إلى نصوص بكميات كبيرة حيث لا يُشكّل زمن الاستجابة عاملًا مهمًا، فإن أربع بطاقات 5090 لا تزال تتفوق من حيث الأداء مقابل التكلفة.
مقارنة صادقة: Pro 6000 BW مقابل H100
نحن لا نبيع H100. سنوضح المقايضة بالتفصيل لأن العملاء يسألون عنها.
لكل بطاقة على حدة، تتفوق بطاقة H100 SXM (ذاكرة HBM3 سعة 80 جيجابايت، سرعة نقل بيانات 3.35 تيرابايت/ثانية) على بطاقة Pro 6000 BW Server (ذاكرة GDDR7 ECC سعة 96 جيجابايت، سرعة نقل بيانات 1.79 تيرابايت/ثانية) في استدلال التدفق الأحادي المحدود بعرض النطاق الترددي بنحو 1.5 إلى 1.9 ضعف - أي 60 تيرابايت/ثانية مقابل 31 تيرابايت/ثانية على معالج Llama 3.3 70B INT4. كما تتميز H100 بتقنية NVLink وموصل SXM5 الإضافي، مما يوفر اتصالاً بين وحدات معالجة الرسومات بسرعة 900 جيجابايت/ثانية في عقدة HGX ذات 8 وحدات معالجة رسومات. أما Pro 6000 BW فتعتمد على PCIe 5.0 x16 (بسرعة فعالة تبلغ حوالي 63 جيجابايت/ثانية)، أي أبطأ بنحو 14 ضعفًا في نقل البيانات بين البطاقات.
بالنسبة لاستنتاج النماذج التي تتسع لـ 96 جيجابايت على بطاقة واحدة، يكون هذا الفرق غير ملحوظ، إذ لا يوجد تبادل بيانات بين البطاقات. أما بالنسبة لاستنتاج النماذج التي تتطلب توزيعها على 4 أو 8 بطاقات، فإن H100 مع NVLink يتفوق بنسبة 30-50% في الإنتاجية الإجمالية، لأن التوازي الموتري حساس لنوعية الاتصال البيني. أما بالنسبة للتدريب على 8 بطاقات، فإن H100 يتفوق بشكل حاسم.
يبلغ فرق السعر من 3 إلى 3.5 أضعاف لكل بطاقة، ومن 8 إلى 12 ضعفًا لكل عقدة قابلة للاستخدام (يشمل HGX H100 لوحة التوصيل ومفاتيح NVSwitches). بالنسبة لمعظم أحمال العمل غير الضخمة، لا يُعد هذا الفرق مجديًا اقتصاديًا. أما في أحمال العمل التي يكون فيها هذا الفرق مجديًا، فإن العميل لا يشتري من كينتينو، بل يشتري مباشرةً من ديل أو لينوفو أو سوبر مايكرو بصفقات ضخمة. وسنؤكد هذا الأمر عبر الهاتف أيضًا.
لن نقول إن بطاقة Pro 6000 Blackwell "بجودة" أو "بمنافسة" بطاقة H100. فهي ليست كذلك، وفقًا للمعايير التي صُممت H100 للتفوق فيها. مع ذلك، فهي البطاقة المناسبة لحالات الاستخدام التي تُحل فيها سعة 96 جيجابايت ECC بسرعة 1.79 تيرابايت/ثانية المشكلة الفعلية التي يواجهها العميل - وهي أغلب الحالات.
تدفق القرار
البداية: ما هو حجم العمل؟
-
الاستدلال فقط؟
-
تفاعلي أحادي المسار (دردشة، وكيل، صوت)؟
- هل يتناسب هذا الطراز مع ذاكرة 32 جيجابايت (7 بايت - 32 بايت INT4)؟
- الميزانية محدودة: 4 × RTX 5090
- متطلبات ECC (الامتثال): 4× L40
- مكتب ذو قدرة محدودة على توفير الطاقة: 4× Pro 6000 BW Max-Q
- يحتاج هذا الطراز إلى مساحة تخزين تتراوح بين 32 و80 جيجابايت (70 بايت INT4، و72 بايت VLM):
- أريد بساطة استخدام بطاقة واحدة: 1-2 × خادم Pro 6000 BW
- أولوية الأداء/اليورو، قبول بروتوكول نقل البيانات ثنائي الاتجاه: 4 × RTX 5090
- محدد الطاقة: 2× Pro 6000 BW Max-Q
- طراز 80 جيجابايت+ (405 بايت INT4، استضافة متعددة الطرازات):
- خادم Pro 6000 BW بأربعة أو ثمانية وحدات معالجة رسومية في هيكل ثماني وحدات معالجة رسومية
- فكّر ملياً فيما إذا كان استخدام الحوسبة السحابية هو الخيار الأمثل حقاً
- هل يتناسب هذا الطراز مع ذاكرة 32 جيجابايت (7 بايت - 32 بايت INT4)؟
-
معالجة الدفعات المجمعة (التصنيف التلقائي، معالجة المستندات)؟
- النموذج الصغير (7B–13B): 8 × L4 في 2U (الحافة) أو 4 × 5090 (رف)
- طراز كبير (70B+): 4 خوادم Pro 6000 BW or 8 × 5090
-
حافة / 1U / محدود الطاقة؟
- 1–8× L4
-
تفاعلي أحادي المسار (دردشة، وكيل، صوت)؟
-
التدريب أم الصقل؟
- LoRA / QLoRA / ضبط دقيق (معظم العملاء):
- 7B–13B: 4 × RTX 5090 (لا يُعدّ نظام التحكم الإلكتروني في السعة (ECC) أمرًا بالغ الأهمية)
- 32B–70B: 4 خوادم Pro 6000 BW (ECC + السعة)
- التشغيل لفترات طويلة دون مراقبة: اختر دائمًا قطع غيار ECC
- تدريب كامل المعايير 70B+: غير قابل للتطبيق هنا — يُنصح باستخدام الحوسبة السحابية أو من فئة DGX
- ضبط دقيق لتقنية الانتشار / VLM: برو 6000 بي دبليو بالنسبة لحجم الدفعة، 5090 للحصول على أداء/يورو على دفعات أصغر
- LoRA / QLoRA / ضبط دقيق (معظم العملاء):
-
مختلط (التدريب + الاستدلال، مختبر الأبحاث)؟
- 4-GPU: 4 خوادم Pro 6000 BW (أقصى جودة في حالة تحديد الطاقة)
- 8-GPU: ثمانية خوادم Pro 6000 BW في هيكل ثنائي EPYC
- المزج والتوفيق: 4 وحدات استدلال 5090 + وحدة تدريب Pro 6000 BW واحدة في نفس الهيكل أمر ممكن، ولكنه ليس مثاليًا.
يُعدّ الفرع الذي يُشير إلى "4× RTX 5090" هو الأكثر شيوعًا بين التكوينات التي نُشحنها. ويأتي في المرتبة الثانية الفرع الذي يُشير إلى "4× Pro 6000 BW Server". أما فرعا L4 و Max-Q فهما أقل حجمًا، لكنهما ليسا مُتخصصين في سوق مُحددة؛ ففي كل ربع سنة، نُشحن كميات كبيرة من البطاقات إلى مكاتب لا تتحمل فيها بطاقات بقدرة 600 واط التيار الكهربائي للمبنى.
ما لا نوفره في المخزون
بكل وضوح: لا تبيع شركة كينتينو أجهزة من فئة NVL، مثل H100 SXM، وH200 SXM، وA100 SXM، وB200، وGB200. يقع تصميم SXM5 ونظام لوحات HGX/NVL ضمن مستوى مختلف من سلسلة التوريد. ظهرت إصدارات PCIe H100 لفترة وجيزة، ثم اختفت من السوق. إذا كان حجم العمل لديك يتطلب فعلاً 8 منافذ H100 مع NVLink، فإن خياراتك المتاحة في مايو 2026 هي: الاستئجار من مزود خدمات سحابية متخصص، أو الشراء مباشرةً من Dell أو Lenovo أو Supermicro مع فترة انتظار تتراوح بين 12 و20 أسبوعًا، أو التعاون مع شركة تكامل أنظمة من نفس المستوى.
نحن لا نخزن AMD Instinct MI300X أو MI325X أيضًا - على الرغم من أنها قوية على الورق للاستدلال المقيد بالذاكرة (192 جيجابايت HBM3، 5.3 تيرابايت/ثانية على MI300X)، إلا أن نضج برنامج ROCm وتوافر القنوات في جمهورية التشيك ليسا في المكان الذي تتواجد فيه قاعدة العملاء لدينا اليوم.
أين ينتهي التحليل بالنسبة للمشترين العاديين؟
- مختبر الأبحاث، أول خادم استدلال: أربع بطاقات رسومات RTX 5090 على معالج EPYC Turin مع ذاكرة وصول عشوائي 192 جيجابايت، ووحدة تزويد طاقة ATX مزدوجة، وهيكل رف 4U. يشغل جميع الطرازات حتى 70B INT4 عبر TP، مع إمكانية ضبط دقيق.
- شركة ناشئة تقدم خدمات الاستدلال الإنتاجي: خادم Pro 6000 BW رباعي في وحدة 4U مع معالج EPYC Genoa/Turin، وذاكرة وصول عشوائي (RAM) بسعة 384-512 جيجابايت، ووحدة تزويد طاقة CRPS مع نظام تكرار 1+1. يدعم تصحيح الأخطاء ECC، ويعمل بدون شاشة، وببطاقة واحدة بسعة تخزين تزيد عن 70 بايت.
- مختبر الروبوتات + الحوسبة المحلية: 4 خوادم Pro 6000 BW. تتيح لك سعة 96 جيجابايت استضافة Qwen2.5-VL 72B وLLM معًا، وتُعد ECC مهمة لأن مخرجات الاستدلال تُشغل الأجهزة المادية.
- شراء مشتريات المؤسسة لأغراض الامتثال: 4 أو 8 وحدات L40 في هيكل Supermicro. أداء أسوأ لكل يورو، لكن كل بند في قائمة المكونات يجتاز التدقيق.
- مكتب فرعي، بيع بالتجزئة، حافة: 4× أو 8× L4 في 1U/2U. طاقة مكتبية، لا حاجة لنظام تكييف هواء خاص.
- توسيع أسطول 4090 الحالي: المزيد من بطاقات 4090 إذا كانت الميزانية محدودة ويمكنك العثور عليها؛ وإلا فقم بدمج بطاقات 5090 (يتعامل vLLM مع TP من الأجيال المختلطة بشكل مقبول؛ لا تخلط 4090 مع Pro 6000 - إن تفاوت عرض النطاق الترددي يفسد تأثير فوز البطاقة الأضعف).
ماذا تفعل بعد ذلك
قبل تحديد وحدات معالجة الرسومات (GPUs)، أجب عن هذه الأسئلة الخمسة:
- أدرج جميع النماذج التي تحتاج إلى استضافتها في وقت واحد. اجمع بصمات INT4. أضف 40-60% لذاكرة التخزين المؤقت KV في الدفعة المستهدفة والسياق. هذا هو الحد الأدنى لذاكرة الوصول العشوائي للفيديو (VRAM)، الإجمالي ولكل بطاقة.
- حدد هدف زمن الاستجابة. معدل نقل البيانات عبر التدفق الواحد أقل من 30 يعني إمكانية استخدام أي شيء تقريبًا. أما معدل نقل البيانات عبر التدفق الواحد أعلى من 60 فيقتصر على 5090 أو Pro 6000 BW. معدل نقل البيانات المجمعة يوميًا هو مقياس مختلف ويؤثر على الإجابة.
- حدد نطاق استهلاك الطاقة عند الحائط. التيار أحادي الطور 16 أمبير يعني دعم 4 وحدات معالجة رسومية للمستهلكين كحد أقصى. التيار ثلاثي الأطوار 32 أمبير يعني دعم 8 وحدات معالجة رسومية. دائرة 10 أمبير للمكاتب تعني دعم L4 أو Max-Q فقط.
- حدد قيود الشراء. "نشتري فقط وحدات SKU الخاصة بالمؤسسات" ← خادم L40 أو Pro 6000 BW. "نشتري أي شيء متوفر" ← 5090. كن صادقًا مع نفسك؛ فهذا هو القيد الذي يُعرقل معظم عمليات البناء في المراحل الأخيرة.
- حدد دورة التشغيل والعمر الافتراضي. يُغطي استخدام جهاز كمبيوتر مخصص للتطوير على مدار الساعة طوال أيام الأسبوع لمدة ثلاث سنوات تكلفة وحدات تزويد الطاقة ECC و Platinum. أما جهاز الكمبيوتر المخصص للتطوير فلا يُغطي هذه التكلفة.
إذا لم تتمكن من الإجابة على الأسئلة الخمسة جميعها، فلن يبدو أي اختيار لوحدة معالجة الرسومات مناسبًا عند التفكير فيه لاحقًا. أما إذا تمكنت من الإجابة، فستجد الإجابة الصحيحة في الجدول أعلاه بمجرد إجراء مكالمة واحدة. راجع القسم W05 للاطلاع على معلومات الحرارة وتدفق الهواء، والقسم W06 للاطلاع على مستويات التخزين، والقسم W01 للاطلاع على قواعد تحديد حجم ذاكرة الوصول العشوائي (RAM) إلى ذاكرة الفيديو (VRAM) التي تُبنى عليها عملية اختيار وحدة معالجة الرسومات.
هذا جزء من موسوعة كينتينو، وهي سلسلة مرجعية حول الحوسبة الذكية، والروبوتات، والأنظمة التي تربط بينهما. نرحب بالتعليقات والتصويبات على البريد الإلكتروني info@kentino.com.