الرموز المميزة في الثانية لكل يورو: اقتصاديات وحدة معالجة الرسومات للاستدلال
يطرح معظم المشترين السؤال الخاطئ. فهم يريدون معرفة أي وحدة معالجة رسومية هي "الأسرع". أما السؤال الصحيح بالنسبة لأعباء عمل الاستدلال الإنتاجية فهو: "أي وحدة معالجة رسومية تنتج أكبر عدد من الرموز المميزة لكل يورو يُنفق على مدى السنوات الثلاث القادمة للنموذج الذي أستخدمه فعليًا؟". لهذين السؤالين إجابتان مختلفتان، والفارق بينهما كبير لدرجة أن التركيز على السرعة الخام يكلف عملاء كينتينو عادةً ما بين 30% و60% من ميزانيتهم.
تُجري هذه المقالة الحسابات اللازمة. الجمهور المستهدف هو شخص يُقيّم بنية الاستدلال، وقد قرأ W01 و N03والآن عليه أن يقرر بين RTX 5090، و RTX Pro 6000 Blackwell، و L40، أو L4 - وعددها.
المعيار: لماذا تُقاس القيمة بالتوك/ثانية لكل يورو، وليس بالتوك/ثانية؟
هناك نظامان للأداء مهمان، والخلط بينهما هو الخطأ الأكثر شيوعًا في تحديد الحجم.
tok/s أحادي التدفق هذا ما يراه المستخدم أثناء انتظاره لاستجابة واحدة. وهو محدود بعرض النطاق الترددي عند إنشاء الرمز المميز، ويعتمد بشكل شبه كامل على عرض نطاق ذاكرة الوصول العشوائي للفيديو مقسومًا على حجم وزن النموذج (انظر W01). معدل نقل البيانات المستدام (توك/ثانية) هذا ما يُخرجه الخادم لعدد كبير من المستخدمين المتزامنين مع تفعيل خاصية التجميع المستمر. على أجهزة من فئة بلاكويل، يصبح هذا الأمر مُقيّدًا بقدرة الحوسبة بمجرد أن يتجاوز عدد الدفعات 16. وهو ما يهم بيئة الإنتاج.
يختلف الأداء بين الحالتين بمقدار 10-25 ضعفًا على نفس البطاقة. عند استخدام Llama 70B INT4 أحادي التدفق على بطاقة RTX Pro 6000 Blackwell، يصل معدل نقل البيانات إلى حوالي 32 توكا/ثانية. بينما عند استخدام نفس البطاقة مع معالجة دفعية 32 مع vLLM للتجميع المستمر، يصل المعدل الإجمالي إلى أكثر من 600 توكا/ثانية. يؤدي التركيز على التدفق الأحادي إلى تقليل حجم عمليات النشر التي تتطلب معدل نقل بيانات منخفضًا بمقدار عشرة أضعاف، بينما يؤدي التركيز على معدل نقل البيانات إلى زيادة حجم العمليات التي تتطلب معدل نقل بيانات منخفضًا جدًا. تعتمد حسابات التكلفة الإجمالية للملكية هنا على معدل نقل البيانات المستدام لأنه العامل الرئيسي في التكلفة.
أسعار التجزئة الحالية في الاتحاد الأوروبي (مايو 2026)
الأسعار المذكورة أدناه هي أسعار التجزئة في الاتحاد الأوروبي، باستثناء ضريبة القيمة المضافة، عبر القنوات المفتوحة - وليست عقود شراء بالجملة من الشركات المصنعة الأصلية ولا تأجير خدمات الحوسبة السحابية. تم الحصول عليها من مواقع تتبع الأسعار في الاتحاد الأوروبي وقوائم الموزعين في مايو 2026. يرجى اعتبارها نطاقات سعرية؛ حيث تُعدّ التقلبات الربع سنوية بنسبة 10-20% طبيعية.
| وحدة معالجة الرسوميات: | VRAM | TDP | سعر السوق في الاتحاد الأوروبي بدون ضريبة القيمة المضافة |
|---|---|---|---|
| RTX 5090 | شنومكس غب غدرسنومكس | 575 W | 2,500،3,000 يورو - XNUMX،XNUMX يورو |
| محطة عمل بلاكويل RTX Pro 6000 | 96 جيجا بايت ECC | 600 W | 8,000،9,500 يورو - XNUMX،XNUMX يورو |
| RTX Pro 6000 Blackwell Server Edition | 96 جيجا بايت ECC | 600 W | 8,500،10,000 يورو - XNUMX،XNUMX يورو |
| L40 | 48 جيجا بايت ECC | 300 W | 7,500،9,500 يورو - XNUMX،XNUMX يورو |
| L4 | 24 جيجا بايت | 72 W | 2,500،3,500 يورو - XNUMX،XNUMX يورو |
| H100 SXM (مرجع، غير مباع من قبل كينتينو) | 80 GB HBM3 | 700 W | 27,000،35,000 يورو - XNUMX،XNUMX يورو |
هناك ملاحظتان من هذا الجدول وحده. سعر بطاقة Pro 6000 Server Edition يُقارب ثلاثة أضعاف سعر بطاقة 5090، مع ثلاثة أضعاف سعة ذاكرة الفيديو (VRAM) ونطاق ترددي مُكافئ - فالتسعير يعتمد على سعة الذاكرة، وليس على السرعة الخام. بطاقة L4 هي الوحيدة هنا التي يقل استهلاكها للطاقة عن 100 واط. هذه الحقيقة وحدها تُغيّر التكلفة الإجمالية للملكية بمجرد إضافة تكلفة الكهرباء إلى الحساب.
أرقام قياس الأداء لوحدة معالجة الرسومات الواحدة
الأرقام أدناه مأخوذة من معايير عامة (vLLM، llama.cpp، SGLang) تم جمعها من Spheron وCloudRift وRunPod، بالإضافة إلى عمليات التشغيل المنشورة الخاصة بمشروع vLLM، من مايو 2025 إلى مايو 2026. وهي ليست معايير Kentino - لقد قمنا بالتحقق منها مقابل صناديقنا الداخلية 4×5090 و4×Pro 6000 للخلايا التي نخدمها بانتظام؛ تتوافق الأرقام العامة في حدود ±15%.
لاما 3.3 70 بايت FP8 — فك تشفير أحادي التدفق
| وحدة معالجة الرسوميات: | tok/s | ملاحظة |
|---|---|---|
| RTX 5090 | ن / أ | لا تتناسب أوزان FP8 بسعة 75 جيجابايت مع ذاكرة بسعة 32 جيجابايت |
| محطة عمل RTX Pro 6000 BW | 28-34 | يمكن وضعها على بطاقة واحدة مع مساحة رأسية KV |
| RTX Pro 6000 BW Server Ed. | 28-34 | نفس السيليكون، حرارة الخادم |
| L40 | ن / أ | 48 جيجابايت صغيرة جدًا بالنسبة لـ FP8 70B؛ INT4 فقط |
| L4 | ن / أ | خارج الفصل |
| H100 SXM (مرجع) | 55-65 | ريادة عرض النطاق الترددي HBM3 |
لاما 3.3 70 بايت INT4 (AWQ) — فك تشفير أحادي التدفق
| وحدة معالجة الرسوميات: | tok/s | ملاحظة |
|---|---|---|
| RTX 5090 | غير متوفر فردي | 40 جيجابايت من نوع INT4 تستهلك 32 جيجابايت؛ تحتاج إلى 2× |
| 2× RTX 5090 (TP=2) | 24-30 | ضريبة PCIe TP مرئية |
| RTX Pro 6000 BW | 30-36 | مريح، أكثر من 50 جيجابايت مجانية لـ KV |
| L40 | 14-18 | GDDR6 ECC، نطاق ترددي أقل |
| L4 | 4-6 | ذاكرة 24 جيجابايت بالكاد تكفي للأوزان، وبطيئة |
Qwen 2.5 32B INT4 (AWQ) — تيار واحد
| وحدة معالجة الرسوميات: | tok/s | ملاحظة |
|---|---|---|
| RTX 5090 | 55-65 | أوزان 18-20 جيجابايت، وKV في الـ 12 جيجابايت المتبقية |
| RTX Pro 6000 BW | 55-65 | مقيد بعرض النطاق الترددي مع 5090؛ أوزان ذات مساحة فائضة |
| L40 | 28-34 | عرض النطاق الترددي محدود |
| L4 | 9-12 | ذاكرة محدودة، إنتاجية محدودة |
لاما 3 8B FP16 — تيار واحد ومجمع
| وحدة معالجة الرسوميات: | رمز واحد/رموز | التجميع في الدفعة 32 |
|---|---|---|
| RTX 5090 | 90-110 | 3,200-3,800 |
| RTX Pro 6000 BW | 90-110 | 3,400-4,000 |
| L40 | 45-55 | 1,400-1,800 |
| L4 | 20-28 | 380-550 |
بعض القراءات الصادقة من هذه الجداول. يتمتع كل من جهاز بلاكويل 5090 وجهاز بلاكويل برو 6000 بنفس عرض النطاق الترددي (1.79 تيرابايت/ثانية) ونفس معدلات فك التشفير لكل رمز مميز يكمن الاختلاف في سعة ذاكرة الوصول العشوائي للفيديو (VRAM) وتقنية تصحيح الأخطاء (ECC)، وليس في السرعة. تُعدّ سرعة L40 في الاستدلال أقل بنحو النصف مقارنةً ببطاقتي Blackwell، وذلك لأن سرعة GDDR6 ECC تبلغ 860 جيجابايت/ثانية مقابل 1,790 جيجابايت/ثانية. أما L4، فهي بطاقة ذات نطاق ترددي أقل بربع النطاق، لكنها تعوّض ذلك بكثافة الذاكرة وسعرها.
بالنسبة للعمليات أحادية التدفق من فئة 70B، تُعد بطاقة Pro 6000 Blackwell البطاقة الوحيدة التي تُشغّل النموذج بدقة FP8 في فتحة واحدة. أما بطاقة 5090 فتُجبرك على استخدام INT4 والتوازي ثنائي الاتجاه للموترات - ويؤدي استخدام TP=2 على PCIe إلى خسارة 30-35% من الأداء في حالة الاختزال الكامل (انظر N03).
توسيع نطاق استخدام وحدات معالجة الرسومات المتعددة: ضريبة PCIe
لا يتناسب التوازي الموتري عبر PCIe فقط تناسبًا خطيًا. وقد تناولنا الآلية في N03إليك المعاملات التجريبية التي يجب عليك إدخالها في نموذج التكلفة الإجمالية للملكية.
| وحدات معالجة الرسومات | الاعداد | توسيع نطاق الإنتاجية الواقعي مقابل 1× |
|---|---|---|
| 1 × | خط الأساس | 1.00 |
| 2 × | TP=2 PCIe Gen5 | 1.50-1.70 |
| 4 × | TP=4 PCIe Gen5 | 2.5-3.0 |
| 8 × | TP=4 × PP=2 (مفضل) | 5.0-6.0 |
| 8 × | TP=8 PCIe (تجنب) | 4.0-4.8 |
تتوسع مسارات المعالجة المتوازية على مستوى خط الأنابيب والبيانات بشكل شبه خطي؛ بينما تتطلب المعالجة المتوازية على مستوى الموترات موارد إضافية تزداد مع عدد وحدات معالجة الرسومات. بالنسبة لنموذج من فئة 70 مليار، فإن التكوين الأمثل على 8 وحدات معالجة رسومات من نوع 5090 هو نسختان مستقلتان (DP=2 × TP=4) أو TP=4 × PP=2 — وليس TP=8. انظر كيه03 بالنسبة لقواعد التكوين.
هذا الأمر مهم بالنسبة للتكلفة، لأن مضاعفة عدد وحدات معالجة الرسومات لا تؤدي بالضرورة إلى مضاعفة الإنتاجية. إن توقعات الميزانية الساذجة التي تنص على "ضعف عدد وحدات معالجة الرسومات، ضعف الإنتاجية" تبالغ في الوعود بنسبة تتراوح بين 30 و50%.
نموذج التكلفة الإجمالية للملكية لمدة 3 سنوات
يُمثل سعر بطاقة معالجة الرسومات (GPU) حوالي نصف التكلفة الفعلية لتشغيلها على مدى ثلاث سنوات. أما النصف الآخر فيتمثل في تكلفة الكهرباء، ومساحة الهيكل، ومساحة الأرضية. النموذج الموضح أدناه هو ما نستخدمه داخليًا لتحديد حجم نظام الذكاء الاصطناعي المعرفي (K-AI).
Per-GPU 3-year TCO =
GPU cost
+ Chassis share (chassis + CPU + RAM + PSU + NIC) / GPU count
+ Electricity: TDP × utilization × 8,760 h × 3 × €0.20/kWh
+ Colo/rack space share
+ Maintenance & spares (~5% of GPU cost / year)
الافتراضات المستخدمة أدناه:
- كهرباء: 0.20 يورو/كيلوواط ساعة (سعر نموذجي في مراكز البيانات الصناعية المشتركة أو المملوكة للاتحاد الأوروبي). أما في قطاع التجزئة التشيكي، فيتراوح السعر عادةً بين 0.18 و0.22 يورو، بينما يكون أعلى في ألمانيا.
- استغلال: 60% مستدامة (حمل إنتاج واقعي - وليس رقم المعيار 100%، وليس رقم المختبر 5%).
- PUE: 1.4. تكاليف مركز البيانات (التبريد، خسائر التوزيع). يؤدي هذا إلى خفض تكلفة الكهرباء الفعلية إلى 0.28 يورو/كيلوواط ساعة من استهلاك وحدة معالجة الرسومات.
- مشاركة الهيكل: 4,000 يورو موزعة على 4 وحدات معالجة رسومات (1,000 يورو/وحدة معالجة رسومات) لجهاز Kentino 4-GPU 5090؛ 8,000 يورو موزعة على 8 (1,000 يورو/وحدة معالجة رسومات) لهيكل Pro 6000 ذي 8 وحدات معالجة رسومات.
- صيانة: 5% سنويًا من تكلفة وحدة معالجة الرسومات (صندوق احتياطي لبطاقة الرسومات + وقت التشغيل/السائق).
جدول التكلفة الإجمالية للملكية لكل وحدة معالجة رسومية
| وحدة معالجة الرسوميات: | بطاقة € | الهيكل | الكهرباء € (3 سنوات) | الصيانة (3 سنوات) | إجمالي تكلفة الملكية خلال 3 سنوات € |
|---|---|---|---|---|---|
| RTX 5090 | 2,800 | 1,000 | 2,540 | 420 | 6,760 |
| RTX Pro 6000 BW WS | 8,800 | 1,000 | 2,650 | 1,320 | 13,770 |
| RTX Pro 6000 BW SE | 9,400 | 1,000 | 2,650 | 1,410 | 14,460 |
| L40 | 8,500 | 1,000 | 1,325 | 1,275 | 12,100 |
| L4 | 3,000 | 800 | 318 | 450 | 4,568 |
| H100 SXM (مرجع) | 30,000 | 3,500 | 3,090 | 4,500 | 41,090 |
جداول استهلاك الكهرباء: TDP × 0.60 × 8,760 × 3 × 0.20 × 1.4 (PUE) / 1,000. خط L4 مذهل - تبلغ فاتورة الكهرباء المستمرة لمدة 3 سنوات 318 يورو. أما خط 5090 فتبلغ 2,540 يورو. ثمانية أضعاف استهلاك الطاقة، ثمانية أضعاف الفاتورة.
التكلفة لكل مليون رمز
الآن، اجمع التكلفة الإجمالية للملكية (TCO) مع معدل النقل المستدام المقاس على عبء عمل نموذجي - Llama 3.3 70B INT4 في الدفعة 32، أو Qwen 32B في الدفعة 32، أو Llama 8B في الدفعة 64. خذ معدل نقل الرموز المستدام للبطاقة (tok/s)، واضربه في 0.60 (معدل الاستخدام) × 3 × 8,760 × 3,600 للحصول على إجمالي الرموز التي تم معالجتها، ثم اقسم التكلفة الإجمالية للملكية (TCO) على ذلك. الأرقام أدناه توضيحية فقط؛ اضبطها وفقًا لنموذجك الفعلي ودفعتك.
| وحدة معالجة الرسوميات: | عبء العمل | توك/ث مستدام | الرموز/3 سنوات (ب) | € / Mtok |
|---|---|---|---|---|
| RTX 5090 | لاما 8B FP16 الدفعة 64 | 3,500 | 199 | 0.034 |
| RTX 5090 | كوين 32 بي INT4 الدفعة 32 | 600 | 34 | 0.20 |
| برو 6000 بي دبليو | لاما 70B FP8 الدفعة 32 | 480 | 27 | 0.51 |
| برو 6000 بي دبليو | كوين 32 بي INT4 الدفعة 32 | 650 | 37 | 0.37 |
| L40 | لاما 8B FP16 الدفعة 64 | 1,600 | 91 | 0.13 |
| L40 | كوين 32 بي INT4 الدفعة 32 | 320 | 18 | 0.67 |
| L4 | لاما 8B FP16 الدفعة 64 | 450 | 26 | 0.18 |
| L4 | لاما 8B FP8 الدفعة 128 | 650 | 37 | 0.12 |
اقرأ العمود الثالث كتكلفة لكل مليون رمز مميز مُخدّم، أي التكلفة الإجمالية للملكية عند التحميل الكامل. تتقاضى واجهات برمجة التطبيقات السحابية وOpen-router لنفس النماذج ما بين 0.10 و2.00 يورو لكل مليون رمز مميز حسب المستوى؛ وهذا يجعل التكلفة في نفس النطاق أو أقل عند التحميل المستمر. لكن الحسابات تصبح غير مجدية عند استخدام أقل من 30% من الموارد - حيث تهيمن النفقات الرأسمالية المدفوعة على التكلفة الإجمالية للملكية سواءً استخدمتَ الخدمة أم لا.
قضية عام 5090
نظرياً، تتمتع بطاقة 5090 بأفضل معدل نقل بيانات خام (توك/ثانية) لكل يورو مقارنةً بأي بطاقة أخرى في سلسلة كينتينو لمعالجة البيانات دون 72 بايت. 2,800 يورو مقابل 1.79 تيرابايت/ثانية من عرض النطاق الترددي و32 جيجابايت من ذاكرة GDDR7 تُعدّ بطاقةً ممتازة. بالنسبة لخدمة مستخدم واحد لنموذج من فئة 32 بايت، لا يوجد بديلٌ يُضاهيها في هذه النسبة.
يعيب جهاز 5090 عيبان:
- النماذج التي لا تتناسب مع سعة 32 جيجابايت بالكمية التي تريدها. يحتاج معالج FP8 بسعة 70 بايت (حوالي 75 جيجابايت) إلى 3-4 بطاقات؛ بينما يحتاج معالج INT4 بسعة 70 بايت (حوالي 40 جيجابايت) إلى بطاقتين. بمجرد استخدام تقنية Tensor-parallel عبر PCIe، ستدفع ضريبة التخفيض الشامل بنسبة 30-50%، وسينهار معدل استهلاك الذاكرة لكل بطاقة.
- توسيع نطاق استخدام وحدات معالجة الرسومات المتعددة بما يتجاوز التوازي عبر خطوط الأنابيب. إنّ 8× 5090 منتج حقيقي (نحن من نصنعه)، لكنّ معدل نقل البيانات لكل بطاقة على معالج Tensor-Paralel 70B يبلغ حوالي 0.55 ضعف معدل نقل البيانات لبطاقة واحدة. لقد اشتريت ثماني بطاقات وحصلت على معدل نقل بيانات أعلى بمقدار 4.4 ضعف، وليس 8 أضعاف.
تكمن قوة جهاز 5090 في استضافته لنسخ متعددة من نماذج أصغر. فتشغيل أربعة أجهزة 5090 تعمل بأربع نسخ مستقلة من Qwen 32B خلف موازن تحميل يتفوق على تشغيل أربعة أجهزة 5090 بالتوازي مع جهاز Llama 70B واحد من حيث الإنتاجية وزمن الاستجابة، ويتجنب تمامًا تكلفة PCIe.
حقيبة بلاكويل برو 6000
ذاكرة ECC GDDR7 بسعة 96 جيجابايت وسرعة 1.79 تيرابايت/ثانية هي الخيار الأمثل عندما تحتاج إلى بطاقة واحدة تدعم 70 بايت FP8 دون الحاجة إلى التعامل مع PCIe. تشترك إصدارات Workstation وServer في نفس الشريحة والذاكرة وعرض النطاق الترددي، ويكمن الاختلاف في عامل الشكل (التبريد النشط مقابل التبريد السلبي)، ونظام BIOS ذي الطاقة القصوى، والتوافق مع هياكل خوادم الشركات المصنعة الأصلية. يُكلف إصدار Server ما بين 700 و1,500 يورو إضافية، وهو الخيار الأمثل لأي جهاز مثبت على رف يعمل على مدار الساعة.
أين يتفوق جهاز Pro 6000 من حيث سعر صرف التوكن/ثانية لكل يورو:
- استضافة ببطاقة واحدة 70B FP8. لا يوجد معالجة متوازية للموتر، ولا رسوم PCIe. معدل نقل البيانات أحادي التدفق 30+ توكو/ثانية، ومعدل نقل البيانات المجمعة 480+ توكو/ثانية.
- التوسع الأفقي عبر النسخ المتماثلة. 4× Pro 6000 = أربع نسخ مستقلة بسرعة 70 بايت خلف جهاز توجيه. توسع خطي في الإنتاجية، وعزل سلس للأعطال.
- مركز التدريب الإلكتروني (ECC). إذا تضمن عبء العمل ضبطًا دقيقًا لبروتوكول LoRA / QLoRA أو إعادة تدريب كاملة، فإن نظام ECC يثبت جدارته (انظر W01).
متى يكون استخدام بطاقة Pro 6000 مبالغًا فيه؟ في أي تطبيق لا يتطلب أكثر من 32 جيجابايت لكل بطاقة. إذا كانت جميع نماذجك متوافقة مع بطاقة 5090، فأنت تدفع ثلاثة أضعاف السعر مقابل ذاكرة فيديو لن تستخدمها. نرى هذا الأمر بشكل متكرر - يختار المشتري بطاقة Pro 6000 لأنها البطاقة "الاحترافية"، ثم يشغل عليها نموذجًا بسعة 13 مليار بايت.
حالة L40
يقع جهاز L40 في موقع غير مناسب. فهو مزود بذاكرة ECC سعة 48 جيجابايت، من نوع GDDR6 وليس GDDR7، وعرض نطاق ترددي يبلغ 860 جيجابايت/ثانية - أي ما يقارب نصف عرض نطاق جهاز Pro 6000 Blackwell عند حساب الاستدلال، وبسعر يتراوح بين 75% و90% من سعره. أما عند حساب التكلفة الصافية (توك/ثانية لكل يورو) عند حساب الاستدلال، فإن جهاز Pro 6000 هو الأفضل.
تم بناء هيكل جهاز L40 على ثلاثة محاور أخرى:
- TDP. 300 واط مقابل 600 واط. نصف استهلاك الكهرباء على مدى ثلاث سنوات (1,325 يورو مقابل 2,650 يورو في نموذجنا). في الخوادم ذات القيود الحرارية أو الدوائر أحادية الطور، يمثل هذا الفرق بين أربع بطاقات أو بطاقتين.
- التحقق من صحة مركز البيانات. يأتي جهاز L40 مزودًا بنظام تبريد سلبي، ومعتمدًا من قبل الشركات المصنعة الأصلية (OEM) من Supermicro وDell وHPE، بالإضافة إلى ضمان مركز البيانات القياسي لمدة 5 سنوات. محطة العمل Pro 6000 غير معتمدة للتشغيل المتواصل على مدار الساعة طوال أيام الأسبوع؛ أما إصدار الخادم فهو معتمد، ولكنه أحدث في السوق.
- الحد الأقصى للموثوقية. تم تصميم L40 خصيصًا لتحمل أحمال الخوادم المستمرة. ويُعدّ متوسط الوقت بين الأعطال في أحمال عمل الاستدلال التي تعمل على مدار الساعة أفضل بشكل ملحوظ من 5090 المُشتق من الأجهزة الاستهلاكية.
بصراحة، إذا كان عميلك يهتم باستمرارية التشغيل أكثر من مجرد تكلفة المعاملات (مثل القطاعات الخاضعة للتنظيم، وعقود مستوى الخدمة عند الطلب، وأي شيء يتسبب في خسارة مالية عند تعطل البطاقة في منتصف الليل)، فإن بطاقة L40 تستحق فرق التكلفة. أما من ناحية الأداء مقابل السعر، فلا تستحق ذلك.
حالة L4
يُعدّ محرك الأقراص L4 الخيار الذي لا يسأل عنه أحد، وهو الخيار الأمثل لمعظم العملاء. بسعة 24 جيجابايت، واستهلاك طاقة 72 واط، يُركّب في فتحة واحدة، ولا يحتاج إلى موصل طاقة، ويتم تبريده بشكل سلبي. يتسع ثمانية منها في خادم 1U، وستة عشر منها في خادم 2U.
ما يجيده L4:
- نموذج من الفئة 8B يعمل على نطاق واسع. يُنتج معالج Llama 3 8B FP8 في الدفعة 64 حوالي 650 توك/ثانية لكل بطاقة. ثماني وحدات تخزين من المستوى الرابع في هيكل واحد = 5,000 توك/ثانية إجمالاً لنقطة نهاية Llama 8B. يستهلك نفس الهيكل 600 واط من طاقة وحدة معالجة الرسومات.
- كثافة النسخ المتعددة. تستضيف كل وحدة من وحدات الطبقة الرابعة (L4) نموذجًا مستقلاً بسعة 8 بايت. ثماني نسخ متماثلة خلف موازن تحميل، دون أي اتصال بين وحدات معالجة الرسومات. يؤدي تعطل بطاقة واحدة إلى فقدان ثُمن السعة، وليس الخدمة بأكملها.
- المواقع ذات الطاقة المحدودة. يمكن لدائرة كهربائية بقدرة 16 أمبير تشغيل 4 وحدة من الطبقة الرابعة بالإضافة إلى تكاليف التشغيل الإضافية للمضيف. بينما بالكاد تستطيع نفس الدائرة تشغيل ثلاث وحدات من طراز 5090.
- التكلفة لكل مليون رمز. بسعر 0.12 يورو/مليون توكو لـ 8B FP8، فإن L4 أرخص من كل واجهة برمجة تطبيقات سحابية لنفس فئة النموذج.
ما يُعاب على بطاقة L4: أي شيء يتجاوز 13 مليار بايت، وأي شيء يتطلب نطاقًا تردديًا عاليًا، والتدريب بجميع أنواعه. تُعدّ L4 بطاقة استدلال ذات وظائف ثابتة للنماذج الصغيرة والمتوسطة. إذا لم يكن حجم العمل لديك مناسبًا لذلك، فتجاهلها.
مقارنة صادقة مقابل الحوسبة السحابية
حسابات الحوسبة السحابية لبناء مماثل. تبلغ تكلفة AWS p5.48xlarge (8× H100 SXM) 98.32 دولارًا أمريكيًا/ساعة عند الطلب، أي ما يعادل 12.29 دولارًا أمريكيًا لكل ساعة استخدام لوحدة معالجة الرسومات. أما خدمات الحوسبة السحابية المتخصصة في الذكاء الاصطناعي (Lambda، RunPod، CoreWeave) فتتراوح تكلفتها بين 2.00 و4.00 دولارات أمريكية لكل ساعة استخدام لوحدة H100 عند الطلب، وتكون أقل من ذلك عند الالتزام لمدة عام واحد.
تكلفة الحوسبة السحابية عند الطلب لمدة ثلاث سنوات لفتحة استدلال واحدة مكافئة لـ H100:
- خدمة AWS عند الطلب: 12.29 دولارًا × 8,760 × 3 = $323,000
- سحابة الذكاء الاصطناعي الفورية/المخفضة: 2.50 دولار × 8,760 × 3 = $65,700
- حجز سحابة الذكاء الاصطناعي لمدة عام واحد: ~1.80 دولار × 8,760 × 3 = $47,300
نظام Kentino المحلي لثماني بطاقات Pro 6000 Server Edition: التكلفة الإجمالية للملكية حوالي 115,000 يورو على مدى ثلاث سنوات لثماني بطاقات. سعر البطاقة الواحدة 14,400 يورو. هذا تقريبًا ربع أرخص طائرة سحابية H100 محجوزة للحصول على إنتاجية قابلة للمقارنة في الاستدلال (يصل Pro 6000 BW إلى حوالي 60-70٪ من H100 SXM في أحمال العمل الاستدلالية غير المعتمدة على NVLink).
نقطة التعادل مقابل الحوسبة السحابية المحجوزة للذكاء الاصطناعي H100: يُغطي جهاز Pro 6000 ذو 8 وحدات الموجود في الموقع تكلفته عند استخدامه بنسبة 50% تقريبًا بشكل مستمر على مدى ثلاث سنوات. أقل من ذلك، استئجار. أعلى من ذلك، تملك. هذه هي نفس الحسابات التي يتوصل إليها كل مشترٍ جاد للأنظمة المحلية، وهذا هو السبب في أن الاستدلال المحلي لم يختفِ في عام 2026 على الرغم من تخفيضات تكلفة الحوسبة السحابية.
مصفوفة توصيات أحمال العمل لوحدة معالجة الرسومات
| عبء العمل | وحدة معالجة الرسومات المفضلة | لماذا |
|---|---|---|
| اللاما 8B / Qwen 7B / ميسترال 7B على نطاق واسع | L4 (متعدد) | أفضل سعر للنماذج الصغيرة (بالتوك/الدولار/اليورو)، وأقل استهلاك للطاقة |
| مستخدم واحد، فئة 32 بت، حساس لزمن الاستجابة | RTX 5090 | أفضل عرض نطاق ترددي/يورو، يناسب INT4 |
| فئة 32 بت متعددة المستخدمين، حساسة للإنتاجية | 2 بطاقات RTX 5090 أو 1 بطاقات Pro 6000 | مقياس النسخ أو بطاقة واحدة إذا سمحت الميزانية |
| استدلال 70 مليار، مستخدم واحد، جودة FP8 | RTX Pro 6000 بلاكويل | البطاقة الوحيدة التي تتسع لبطاقة 70B FP8 في فتحة واحدة |
| 70 مليار استدلال، متعدد المستخدمين، إنتاجية | 4× Pro 6000 BW (نسخ طبق الأصل من DP) | قابلية التوسع الخطي بدون ضريبة PCIe TP |
| 70B ضبط دقيق (LoRA / QLoRA) | RTX Pro 6000 Blackwell SE | نظام تصحيح الأخطاء ECC، والتحقق على مدار الساعة، ومناسب لتدريب القيم الأساسية بحجم 96 جيجابايت |
| التدريب 70B من الصفر | تشكيلة غير كينتينو | استأجر جهاز NVLink H100/B200، ثم أحضر الأوزان إلى الموقع |
| الاستدلال المختلط + التدريب الخفيف، موقع خاضع للتنظيم | L40 | مركز بيانات معتمد، موثوقية مستدامة، مركز بيانات معتمد، نظام التحكم في الأخطاء (ECC). |
| ميزانية طاقة محدودة للرف، كثافة 1U | L4 (8× لكل وحدة واحدة) | 72 واط، فتحة واحدة، لا حاجة إلى تصحيح الأخطاء (ECC) للاستدلال |
| 405B الاستدلال الكثيف | 3× برو 6000 بي دبليو (بي بي) | المسار الوحيد على أجهزة كينتينو؛ انظر كيه03 |
الرأي الصريح
معظم عملاء كينتينو يسألون عن أسرع بطاقة رسومات. بالنسبة لحجم العمل الذي يستخدمونه فعليًا - نموذج دردشة 7 أو 8 مليار، وربما نموذج استدلال 32 مليار، وربما نموذج رؤية في فئة 7-13 مليار - فإن الإجابة الصحيحة هي L4 أو 5090، وليس البطاقة الرائدة. تبلغ تكلفة بطاقة Pro 6000 Blackwell الإضافية في أسعارنا 5,000-7,000 يورو لكل بطاقة. عند استخدام أربع بطاقات لكل جهاز، فإن ذلك يعني أن العميل يدفع ما بين 20,000 و28,000 يورو من ذاكرة الوصول العشوائي للفيديو (VRAM) دون استخدامها.
تتمثل المهمة في تحديد النماذج المناسبة، ومستوى التزامن المطلوب، وسياق الاستخدام، ثم تحديد الحجم وفقًا لذلك. كلما كانت الصفقة أصغر، عاد العميل عند توسيع نطاقها.
ماذا تفعل بعد ذلك
إذا كنت تقوم بتحديد حجم جهاز كمبيوتر، فاعمل على هذه الخطوات بالترتيب التالي:
- أدرج كل نموذج تحتاج إلى تقديمه، مع تحديد الكمية والسياق. دوّنها. لاما 3.3 70B INT4 @ 8K. كوين 32B INT4 @ 32K. لاما 8B FP8 @ 16K. بدون هذه القائمة، ستكون كل خطوة لاحقة مجرد تخمين.
- احسب أكبر مساحة تخزين لذاكرة الوصول العشوائي للفيديو (VRAM) لنسخة واحدة (الأوزان + KV عند التزامن المستهدف). هذا هو الحد الأدنى لذاكرة الوصول العشوائي للفيديو لكل بطاقة.
- احسب الهدف المستدام من الـ tok/s. عدد المستخدمين المتزامنين × عدد الرموز المميزة في الثانية لكل مستخدم × دورة التشغيل. يحدد هذا عدد البطاقات المطلوبة.
- يتم تعيين الخريطة إلى وحدة معالجة الرسومات (GPU). إذا كانت سعة التخزين أقل من 32 جيجابايت، يُنصح باستخدام بطاقة 5090 أو L4. إذا كانت أقل من 48 جيجابايت، يُنصح باستخدام بطاقة L40 أو 5090 متعددة البطاقات. إذا كانت بين 48 و96 جيجابايت، يُنصح باستخدام بطاقة Pro 6000 Blackwell. إذا كانت أكبر من 96 جيجابايت، يُنصح باستخدام بطاقة PP متعددة البطاقات، وليس TP.
- احسب التكلفة الإجمالية للملكية لمدة 3 سنوات بناءً على استخدامك الفعلي. إذا كانت نسبة استخدامك أقل من 30%، فأعد النظر في خيار الحوسبة السحابية. أما إذا كانت أكثر من 50%، فالحل المحلي هو الأفضل بلا شك.
- أضف هامش 30% بغض النظر عن عدد وحدات معالجة الرسومات التي تحددها الحسابات. تتزايد أحمال العمل الحقيقية، وتزداد أحجام النماذج، وتُعدّ التقديرات المنخفضة لذاكرة التخزين المؤقت KV أمراً شائعاً.
تتناول المقالات اللاحقة في هذا المسار نفس الأرقام من زوايا مختلفة: تكلفة المليون رمز مع تفصيل التكلفة بين البنية التحتية المحلية والسحابية (T02) والاقتصاد الاستدلالي المستدام مقابل الاقتصاد الاستدلالي المتفجر (T03). وتوجد مؤسسة اختيار وحدة معالجة الرسومات في W07وخيارات التوازي التي تُحدد التكلفة الإجمالية للملكية لوحدات معالجة الرسومات المتعددة موجودة في كيه03 .
الجملة الوحيدة التي يجب تذكرها: معظم العملاء يسألون عن الأسرع بينما ينبغي عليهم أن يسألوا عن الأرخص في ظل حجم العمل الذي أقوم به. نادراً ما تكون البطاقة الأسرع هي الأرخص.
هذا جزء من ويكي كينتينو، وهي سلسلة مرجعية حول الحوسبة الذكية، والروبوتات، والأنظمة التي تربط بينهما. نرحب بالتعليقات والتصويبات على info@kentino.com.