نموذج مرجعي: مختبر للروبوتات والذكاء الاصطناعي في رف واحد

تتناول المقالات السابقة بنية النظام، ومجموعة البرامج، واستهلاك الطاقة، وتصميم الشبكة. أما هذه المقالة، فتُحدد سعرًا وقائمةً بالمكونات لكل ذلك، استنادًا إلى أجهزة حقيقية قامت شركة كينتينو بشحنها واختبارها، وليس إلى قائمة مكونات نظرية مُجمّعة من ورقة تسويقية.

الهدف من النشر هو مختبر بحثي أو مختبر تكاملي يُشغّل من روبوت واحد إلى أربعة روبوتات إلى جانب نظام استدلال محلي ومنصة تدريب. يُصنّف هذا التطبيق ضمن النطاق المتوسط: ليس جهازًا صغيرًا بالكاد يُلبي احتياجات 7 مليارات، ولا مجموعة خوادم ضخمة تتطلب فريقًا متخصصًا في المرافق. بل بيئة عمل جادة يُمكن لفريق من شخصين إلى ستة أشخاص إنشاؤها وتشغيلها وتطويرها دون الحاجة إلى فريق متخصص في DevOps.

يتناول المقال مستويين من نفس النمط المعماري. معالج الرسوميات رباعي النواة (4-GPU). مستوى التطوير هذا هو المكان الذي تبدأ منه معظم المختبرات. وحدة معالجة الرسومات الثمانية مستوى الإنتاج هذا هو المكان الذي يستقرون فيه بعد أول عبء عمل حقيقي. تختلف خيارات الأجهزة، لكن البنية متطابقة.

ما تُظهره بيانات الأسطول

نشرت شركة كينتينو أسطولًا من وحدات الحوسبة المتجانسة، كل منها مزودة بأربع وحدات معالجة رسومية (GPU). تحمل كل وحدة نفس المواصفات: معالج AMD EPYC 7542 (32 نواة / 64 خيطًا، بتردد معزز يصل إلى 2.9 جيجاهرتز)، وذاكرة DDR4 ECC LRDIMM بسعة 512 جيجابايت بسرعة 2666 ميجا نقلة/ثانية موزعة على ثمانية منافذ DIMM، وأربع وحدات معالجة رسومية RTX 4090 (ذاكرة فيديو بسعة 24 جيجابايت لكل منها، بإجمالي 96 جيجابايت)، وقرص تخزين مؤقت NVMe بسعة 2 تيرابايت، وقرص SSD SATA بسعة 512 جيجابايت لنظام التشغيل. اللوحة الأم هي ASRockRack ROMED8-2T/BCM. نظام التشغيل هو Ubuntu 24.04 LTS، نواة 6.8.0-generic، برنامج تشغيل NVIDIA 590.48.01، وCUDA 13.1/13.2.

تُنتج جميع العُقد العشر نتائج قياس أداء متطابقة. ليس هذا من قبيل الصدفة، بل هو الهدف من بناء مرجعي. عندما تُخرج كل وحدة من نفس التكوين، يصبح قياس الأداء مواصفةً دقيقة، وليس مجرد نتيجة عشوائية.

حساب GPU

عملية ضرب المصفوفات باستخدام نواة الموتر FP16 عبر البطاقات الأربع (حمل عمل 8192 × 8192):

اختبار أداء وحدة معالجة الرسومات - 4 × RTX 4090
وحدة معالجة الرسوميات‏:‏ أداء مستدام في العمليات الحسابية من نوع FP16 (TFLOPS) درجة الحرارة القصوى (الإجهاد) ذروة الطاقة (الإجهاد)
0 165.8 67 ° C 482 W
1 153.2 64 ° C 450 W
2 166.4 72 ° C 501 W
3 166.2 62 ° C 481 W
الإجمالي 651.6 ~ شنومك W

يعمل معالج الرسوميات الأول (GPU 1) باستهلاك طاقة أقل بنسبة 6% تقريبًا من معالجات الرسوميات 0 و2 و3، وهو ضمن نطاق التفاوت الطبيعي في جودة رقائق السيليكون المستخدمة في بطاقات المستهلك. اجتازت جميع المعالجات الأربعة اختبارات التشغيل المكثفة لمدة 60 ثانية، بالإضافة إلى اختبارات التشغيل المكثفة المشتركة لمعالج الرسوميات ووحدة المعالجة المركزية، دون أي أخطاء حسابية. يُعد هامش درجة الحرارة مناسبًا: حيث تبلغ عتبة خفض الأداء الحراري لبطاقة RTX 4090 83 درجة مئوية، بينما بلغت درجة حرارة أعلى بطاقة في المجموعة 73 درجة مئوية عند تشغيل معالج الرسوميات ووحدة المعالجة المركزية معًا. لم يُلاحظ أي انخفاض في الأداء في أي من البطاقات.

ملاحظة عملية حول حدود الطاقة: تأتي هذه الأجهزة بحدود طاقة مختلفة قليلاً لكل بطاقة (450 واط، 480 واط، 500 واط حسب الفتحة). للاستخدام الإنتاجي المستمر، يُنصح بتوحيد استهلاك الطاقة لجميع البطاقات الأربع عند 450 واط، مما يُحسّن من توازن استهلاك الطاقة ويقلل من عدم توازن وحدة التزويد بالطاقة. لا تتجاوز خسارة الأداء (TFLOPS) عند استخدام 450 واط مقارنةً بـ 500 واط نسبة 2%، وهي نسبة لا تُبرر الحمل غير المتماثل على خطوط الطاقة.

استدلال vLLM — Llama 3.3 70B AWQ

تمت المقارنة المعيارية باستخدام vLLM 0.19.0، tensor_parallel_size=4, gpu_memory_utilization=0.80, max_model_len=2048:

استدلال vLLM — Llama 3.3 70B AWQ، 4× RTX 4090
اختبار نتيجة
طلب واحد (512 رمزًا مميزًا) 8.0 توك/ثانية
معدل نقل البيانات على دفعات (32 دفعة متزامنة، 256 رمزًا لكل دفعة) إجمالي 179.3 توكو/ثانية
متوسط ​​زمن الاستجابة لكل طلب عند الدفعة 32 مللي 1,428
زمن استجابة P99 (مطالبة قصيرة، 16 رمزًا) مللي 2,043
وقت تحميل النموذج 95 ق

ملاحظة هامة: استخدم المعيار المرجعي awq نواة التكميم، وليس awq_marlin. awq_marlin يُعدّ المسار على معالج Ada Lovelace (RTX 4090) أسرع بمقدار 2-3 مرات من حيث زمن استجابة الطلب الواحد. يُنصح باستخدامه في بيئات الإنتاج. awq_marlin أو مسار FP8 في الإصدار vLLM 0.20+، مما يقلل الفجوة بشكل أكبر. مع awq_marlinيرتفع معدل نقل البيانات للطلب الواحد المذكور أعلاه من حوالي 8 توك/ثانية إلى ما يقارب 16-20 توك/ثانية على هذه البطاقات، وهو ما يتوافق بشكل أكبر مع تجربة المستخدمين العملية. وتكون فائدة الإنتاجية الإجمالية للدفعات أقل نسبيًا لأن عنق الزجاجة عند التزامن العالي يتحول إلى عرض نطاق الذاكرة بدلًا من الحوسبة.

هذه الأرقام خاصة بمعالج لاما 3.3 بسعة 70 مليار عند مستوى INT4 (AWQ). يعمل نموذج بسعة 7 أو 8 مليارات عند مستوى Q4 بسرعة تتراوح بين 4 و6 أضعاف لكل رمز مميز على نفس الجهاز؛ بينما يعمل نموذج بسعة 13 مليار بسرعة تقارب 2.5 ضعف. يمثل الرقم 70 مليار الحد الأدنى لحجم نماذج VLM ونماذج التخطيط الكبيرة في مجال الروبوتات.

llama.cpp — مستخدم واحد، بدون تزامن

تمت المقارنة باستخدام llama-cpp-python 0.3.20 (CUDA/cuBLAS)، Llama 3.3 70B Instruct Q4_K_M GGUF، جميع وحدات معالجة الرسومات الأربعة:

llama.cpp — اللاما 3.3 70B Q4_K_M، 4 × RTX 4090
اختبار نتيجة
إنشاء طلب واحد (256 رمزًا مميزًا) 19.9–20.3 توكو/ثانية
التقييم الفوري (1302 رمزًا) 1,568 توك/ثانية
وقت تحميل النموذج 10.8 ق

يتم تحميل ملف llama.cpp بشكل أسرع (10.8 ثانية مقابل 95 ثانية لـ vLLM) ويوفر سرعة فك تشفير أعلى للمستخدم الواحد على هذه البطاقات لأنه لا يتحمل عبء جدولة المعالجة الدفعية المستمرة. المقابل هو انعدام التزامن - مستخدم واحد في كل مرة. التفسير الصحيح لهذه الأرقام: يوفر ملف llama.cpp على عقدة بأربع وحدات معالجة رسومية للمطور نموذجًا سريع الاستجابة بحجم 70 بايت للاستخدام التفاعلي؛ بينما يُعد vLLM الخيار الأمثل عند وجود أكثر من عميل واحد.

يرى I02 للحصول على مصفوفة قرارات كاملة حول بنية الخادم. باختصار: ابدأ باستخدام vLLM في Docker، واستخدم awq_marlin التكميم، والتحويل إلى llama.cpp فقط لأجهزة التطوير أحادية المستخدم أو عمليات نشر Jetson.

عرض نطاق ذاكرة وحدة معالجة الرسومات

يبلغ عرض النطاق الترددي بين الأجهزة (على البطاقة) 920.2-920.6 جيجابايت/ثانية عبر جميع البطاقات الأربع، بفارق لا يتجاوز 0.04%، مما يؤكد أن ذاكرة GDDR6X ليست هي العامل المؤثر. أما عرض النطاق الترددي من المضيف إلى الجهاز عبر PCIe فيبلغ 26.2-26.3 جيجابايت/ثانية، مما يؤكد أن الجيل الرابع x16 يعمل بكامل طاقته تحت الضغط (يُظهر وضع الخمول الجيل الأول بسبب توفير الطاقة ASPM، وهو أمر طبيعي وليس عطلاً). وتتراوح سرعة نقل البيانات بين وحدات معالجة الرسومات عبر PCIe (بدون NVLink) بين 19 و22 جيجابايت/ثانية، وهو الحد الأقصى المتوقع لنقل البيانات بين الأجهزة عبر مجموعة PCIe الجذرية المشتركة بدون NVLink (انظر N03 (للتوضيح).

تخزين NVMe

معيار NVMe - Fanxiang S660 2 تيرابايت Gen4
اختبار الإنتاجية IOPS
قراءة متسلسلة (1 مليون كتلة) 4,589 ميغا بايت / ثانية 4,376
الكتابة المتسلسلة (1 ميجابايت من الكتل) 4,213 ميغا بايت / ثانية 4,017
قراءة عشوائية 4K، QD32 2,325 ميغا بايت / ثانية 568,000
كتابة عشوائية 4 كيلوبايت، QD32 2,273 ميغا بايت / ثانية 555,000

يقترب عرض النطاق الترددي المتسلسل من الحد الأقصى لتقنية الجيل الرابع x4. تصل عمليات الإدخال/الإخراج العشوائية في الثانية عند عمق قائمة انتظار 32 إلى أقصى حد لها: 568 ألف عملية قراءة في الثانية تتجاوز بكثير متطلبات تحميل أوزان LLM أو أنماط الوصول إلى مجموعات البيانات على مستوى عقدة واحدة. يستغرق تحميل النموذج من NVMe إلى VRAM من 10 إلى 30 ثانية حسب حجم النموذج؛ ولا يمثل هذا القرص عنق الزجاجة.

النموذج المرجعي

BOM — مستوى تطوير 4 وحدات معالجة رسومية

تُعد مرحلة التطوير نقطة البداية الصحيحة لمختبر يقوم بتشغيل روبوت واحد أو اثنين، ونموذج نشط واحد أو اثنين، وضبط دقيق لتقنية LoRA من حين لآخر.

عقدة تطوير 4 وحدات معالجة رسومية
  • إحصاء - عد: 4 × RTX 4090، AMD EPYC 7542، 512 جيجابايت DDR4 ECC
  • التخزين: 2 تيرابايت NVMe (خدش) + 512 جيجابايت SATA (نظام التشغيل)
  • شبكة: منفذ إيثرنت 10 جيجابت مدمج (منفذ مزدوج، ROMED8-2T/BCM)
  • PSU: توصيل طاقة مزدوج ATX، وتوصيل طاقة منفصل
  • الشاسيه: تركيب على رف 4U، تدفق هواء من الأمام إلى الخلف
مفتاح تور
8-16 منفذ، 10 جيجابت إيثرنت، مُدار (VLAN + QoS)
PoE لنقطة الوصول (اختياري)
نقطة وصول واي فاي 6E
شبكة لاسلكية مخصصة لأسطول الروبوتات، نطاق 6 جيجاهرتز
يو بي إس
تحويل مزدوج عبر الإنترنت بقدرة 5 كيلو فولت أمبير

مستوى التطوير: عقدة حسابية بأربع وحدات معالجة رسومية + مفتاح ToR مُدار + نقطة وصول بتردد 6 جيجاهرتز + وحدة UPS متصلة بالإنترنت بقدرة 5 كيلو فولت أمبير.

BOM — مستوى تطوير 4 وحدات معالجة رسومية (باليورو بدون ضريبة القيمة المضافة)
خط سلعة المواصفات يورو بدون ضريبة القيمة المضافة (النطاق)
وحدة معالجة الرسومات (×4) RTX 4090 24 GB 2,800-3,200 يورو للبطاقة الواحدة
وحدة المعالجة المركزية‏: AMD EPYC 7542 32C من 1,200 إلى 1,600 يورو
اللوحة الأم ASRockRack ROMED8-2T/BCM من 800 إلى 1,100 يورو
رامات 8 × 64 جيجابايت DDR4 ECC LRDIMM 1,400-1,800 يورو (مجموعة كاملة)
خدش NVMe 2 تيرابايت من الجيل الرابع NVMe من 180 إلى 260 يورو
نظام التشغيل SATA 512 GB SSD من 60 إلى 90 يورو
الهيكل + المراوح تركيب على رف 4U، صناعي من 400 إلى 600 يورو
وحدة تزويد الطاقة (×2) 2 كيلو واط ATX، توصيل مزدوج منفصل 300-450 يورو (للزوج)
تبديل تور إدارة بسرعة 10 جيجابت إيثرنت، 8-16 منفذًا من 400 إلى 700 يورو
نقطة وصول واي فاي 6E يدعم ترددات 6 جيجاهرتز، وتقنية PoE من 250 إلى 450 يورو
يو بي إس تحويل مزدوج بقدرة 5 كيلو فولت أمبير من 1,200 إلى 1,800 يورو
الكابلات + وحدة توزيع الطاقة Cat6A + وحدة توزيع الطاقة ثلاثية الطور من 300 إلى 500 يورو
إجمالي عقدة الحوسبة من 14,500 إلى 17,500 يورو
إجمالي الرف (العقدة + البنية التحتية) من 17,000 إلى 21,000 يورو

قائمة مكونات المنتج - مستوى إنتاج 8 وحدات معالجة رسومية

يُضاعف مستوى الإنتاج عدد وحدات معالجة الرسومات. يبقى النمط المعماري كما هو؛ حيث تتوسع وحدة المعالجة المركزية وذاكرة الوصول العشوائي والهيكل وفقًا لذلك لدعم ثمانية منافذ PCIe كاملة النطاق. توفر منصة AMD EPYC Genoa أو Turin ميزانية مسارات PCIe لثمانية منافذ x16 دون أي تنازلات تتعلق بالتفرع (انظر W02).

قائمة مكونات المنتج - مستوى إنتاج 8 وحدات معالجة رسومية (باليورو بدون ضريبة القيمة المضافة)
خط سلعة المواصفات يورو بدون ضريبة القيمة المضافة (النطاق)
وحدة معالجة الرسومات (×8) RTX 4090 24 GB 2,800-3,200 يورو للبطاقة الواحدة
وحدة المعالجة المركزية‏: معالج AMD EPYC Genoa / Turin (يدعم مقبسين) من 2,500 إلى 4,000 يورو
اللوحة الأم منصة جنوة/تورينو، 8× PCIe Gen4/5 x16 من 1,800 إلى 2,800 يورو
رامات 16 × 64 جيجابايت DDR5 ECC LRDIMM (1,024 جيجابايت) 3,500-5,000 يورو (مجموعة كاملة)
خدش NVMe 2× 4 تيرابايت من الجيل الرابع NVMe من 600 إلى 900 يورو
نظام التشغيل SATA محرك أقراص صلبة SSD بسعة 512 جيجابايت (×2، RAID-1) من 120 إلى 180 يورو
الهيكل + المراوح تركيب على رف 4U–6U، 8 وحدات معالجة رسومات، صناعي من 1,200 إلى 2,000 يورو
وحدة تزويد الطاقة (×2) 3 كيلو واط ATX، توصيل مزدوج منفصل 600-900 يورو (للزوج)
تبديل تور 25 جيجابت إيثرنت مُدارة، 24 منفذ (جاهزة للمجموعات) من 1,200 إلى 2,200 يورو
بطاقة شبكة جيجابت إيثرنت 25 Mellanox ConnectX-5/6، منفذ مزدوج (إضافة) من 300 إلى 600 يورو
نقطة وصول واي فاي 6E 6 جيجاهرتز، PoE من 250 إلى 450 يورو
يو بي إس تحويل مزدوج بقدرة 10 كيلو فولت أمبير من 3,000 إلى 5,000 يورو
الكابلات + وحدة توزيع الطاقة Cat6A / DAC SFP + وحدة توزيع طاقة ثلاثية الطور مزودة بعداد من 600 إلى 1,000 يورو
إجمالي عقدة الحوسبة من 38,000 إلى 50,000 يورو
إجمالي الرف (العقدة + البنية التحتية) من 44,000 إلى 60,000 يورو

ملاحظة: لا يمكن إضافة بطاقة شبكة 25 جيجابت إيثرنت إلا في هياكل 8 وحدات معالجة رسومية. لا يتوفر في هياكل 4 وحدات معالجة رسومية مساحة كافية لبطاقة شبكة إضافية، حيث أن منافذ 10 جيجابت إيثرنت المدمجة في ROMED8-2T/BCM هي الحد العملي لفئة 4 وحدات معالجة رسومية (انظر N01 وقواعد صفحة المنتج).

التخزين خارج نطاق عقدة الحوسبة

مستويات التخزين — مختبر الروبوتات
الطبقة الهدف قاعدة الحجم مرجع متقاطع
عقدة NVMe (ساخنة) أوزان النموذج النشطة، دفعة مجموعة البيانات الحالية 2-4 تيرابايت لكل عقدة -
NAS (دافئ) مجموعات بيانات التدريب، وأرشيف الحلقات، وسجل النماذج 40-200 تيرابايت قابلة للاستخدام W06
خارج الموقع / السحابة (بارد) الأرشيف طويل الأجل، استعادة البيانات بعد الكوارث كما هو مطلوب -

بالنسبة لمستوى التطوير، يوفر جهاز تخزين شبكي (NAS) بأربعة فتحات وأربعة أقراص صلبة سعة كل منها 16 تيرابايت مساحة تخزين قابلة للاستخدام تبلغ 48 تيرابايت بنظام RAID-5، وهي مساحة كافية لبيانات حلقات تجريبية لمدة عام كامل لمختبر روبوتين. قم بتوصيله بمحول ToR عبر منفذ 10 جيجابت إيثرنت، ولا تقم بتوصيله بنفس واجهة حركة بيانات الروبوتات.

الطاقة والتبريد للرف

من I04:

القوة حسب المستوى
الاعداد الحوسبة المستدامة رف كامل (يشمل الروبوتات والمكاتب والبنية التحتية)
مستوى تطوير 4 وحدات معالجة رسومية ~2.0–2.4 كيلو واط ~5–7 كيلو واط
مستوى إنتاج 8 وحدات معالجة رسومية ~4.0–5.0 كيلو واط ~10–13 كيلو واط

تؤكد بيانات اختبار الضغط على الأسطول أن عقدة المعالج الرسومي الرباعي تستهلك حوالي 1,914 واط عند أقصى حمل للمعالج الرسومي، حيث تصل جميع البطاقات الأربع إلى حدود استهلاكها للطاقة. وبإضافة استهلاك وحدة المعالجة المركزية (حوالي 120 واط بشكل مستمر)، واستهلاك وحدة تخزين NVMe، واستهلاك المروحة، يصل استهلاك العقدة إلى حوالي 2.1-2.2 كيلوواط بشكل مستمر.

التركيبات الكهربائية لمستوى التطوير: الحد الأدنى هو تغذية ثلاثية الأطوار 400 فولت 16 أمبير؛ بينما توفر التغذية ثلاثية الأطوار 32 أمبير مجالًا للتوسع. أسلاك وحدة التزويد بالطاقة على طورين منفصلين. انظر I04 و P02 بالنسبة لتصميم الأسلاك. بالنسبة لمستوى الإنتاج (10 كيلو واط للرف الكامل)، تحتاج إلى تغذية ثلاثية الأطوار 400 فولت 32 أمبير مع قدرة تبريد لا تقل عن 15 كيلو واط.

تحديد حجم وحدة UPS: حدد الحجم المناسب للخادم فقط، وليس للروبوتات. بالنسبة لبيئة التطوير، تُعد وحدة UPS بقدرة 5 كيلو فولت أمبير ذات تحويل مزدوج عبر الإنترنت الخيار الأمثل كحد أدنى. أما بالنسبة لبيئة الإنتاج، فيُوصى بوحدة بقدرة 10 كيلو فولت أمبير. يُرجى دائمًا تحديد التحويل المزدوج عبر الإنترنت. انظر P05.

مجموعة البرامج على الأجهزة المادية

أوبونتو 24.04 LTS — نواة ثابتة، حزم محفوظة
  • برنامج تشغيل NVIDIA 590.x (مثبت، وحدة نواة مفتوحة)
  • مجموعة أدوات CUDA 13.x
  • مجموعة أدوات حاويات NVIDIA
حاوية vLLM
vllm/vllm-openai:v0.20.x
  • الابتدائية: Llama 3.3 70B FP8 أو Qwen 2.5 72B AWQ
  • اختياري: VLM (Qwen2.5-VL 32B على 4 وحدات معالجة رسومات؛ 72B على 8 وحدات معالجة رسومات)
تقديم الخدمة + المراقبة
  • llama.cpp (نسخة احتياطية للمطورين/المستخدم الواحد)
  • nginx (خادم وكيل عكسي، TLS، مصادقة حاملة)
  • بروميثيوس + vLLM /المقاييس
  • مُصدِّر DCGM (استخدام وحدة معالجة الرسومات، الطاقة، درجة الحرارة، تصحيح الأخطاء ECC)
  • لوحات معلومات Grafana

مجموعة البرامج: Ubuntu مثبت + برنامج تشغيل NVIDIA → مجموعة أدوات الحاويات → vLLM + llama.cpp + nginx + المراقبة.

تثبيت برنامج التشغيل أمر لا يقبل المساومة. يعمل أسطول المركبات ببرنامج التشغيل 590.48.01؛ apt-mark hold nvidia-driver-590 هو أول شيء بعد تثبيت نظام التشغيل على الجهاز نفسه. عملية غير مراقبة apt-get upgrade أدى سحب برنامج تشغيل أحدث إلى تعطيل الاستدلال في بيئة الإنتاج بنفس عدد المرات المتوقعة. انظر L01 للاطلاع على الإجراء الكامل.

المراقبة ضرورية. تُظهر بيانات الأسطول أن وحدة معالجة الرسومات رقم 3 على إحدى العقد واجهت أخطاء PCIe AER قابلة للتصحيح (RxErr + BadTLP) أثناء اختبار الأداء - تم تصحيحها تلقائيًا بواسطة الجهاز، ولكنها تظهر في عدادات DCGM. بدون مراقبة، يظهر هذا الخطأ على شكل "أخطاء استدلال غريبة عرضية" بعد أسابيع. قم بتوصيل DCGM وضبط تنبيهًا لأخطاء ECC القابلة للتصحيح التي تتجاوز معدلًا أساسيًا. انظر L05 بالنسبة لمجموعة Prometheus + Grafana.

اختلافات في المقاسات

مستوى التطوير ذو الأربع وحدات معالجة رسومية - ما يمكنه تشغيله فعليًا

إجمالي ذاكرة الوصول العشوائي للفيديو 96 جيجابايت (4 × 24 جيجابايت) مع TP=4:

النموذج المناسب — مستوى تطوير 4 وحدات معالجة رسومات (96 جيجابايت من ذاكرة الوصول العشوائي للفيديو)
الموديل كوانت هل يناسبك؟ حوالي توك/ثانية (لمستخدم واحد)
لاما 3.3 / كوين 2.5 70B AWQ INT4 نعم (حوالي 36 جيجابايت) 16–22 (مع awq_marlin)
كوين 2.5 VL 32B AWQ INT4 نعم (حوالي 20 جيجابايت) 18-26
كوين 2.5 VL 72B AWQ INT4 لا (يحتاج إلى حوالي 44 جيجابايت، وهو ما يكفي لـ 4 × 24 جيجابايت) -
اللاما 3.3 70 ب FP8 نعم (حوالي 75 جيجابايت موزعة على 4) 14-18
نموذج الفئة 8B س4_ك_م نعم، مساحة كافية لشخصين 80-120

لا يتناسب حجم وحدة VLM 72B بشكل مريح مع 4 × 24 جيجابايت بتردد INT4 - الحسابات متقاربة، لكن نوافذ السياق التي تتجاوز دقة 4K تجعلها تتجاوز هذا الحد. إما أن تستخدم إصدار VLM 32B، أو ترقي إلى فئة 8 وحدات معالجة رسومية أو عقدة 4 × RTX Pro 6000 Blackwell (96 جيجابايت من ذاكرة الفيديو لكل منها) لفئة 72B. انظر W07 لمناقشة الفرق بين ذاكرة الوصول العشوائي للفيديو (VRAM) ومستوى النموذج.

تتولى طبقة التطوير معالجة: نموذج استدلال واحد بحجم 70 مليار وحدة يخدم من 1 إلى 3 عملاء روبوت متزامنين، ووحدة VLM واحدة (فئة 32 مليار) للاستعلامات المرئية، بالإضافة إلى ضبط دقيق لخوارزمية LoRA على نموذج أساسي أصغر حجماً. وهذا يغطي 80% من حالات استخدام مختبرات الروبوتات في عام 2026.

مستوى الإنتاج ذو 8 وحدات معالجة رسومية - مساحة إضافية

إجمالي 192 جيجابايت من VRAM (8 × 24 جيجابايت):

معدل نقل البيانات للنموذج - مستوى إنتاج 8 وحدات معالجة رسومية (192 جيجابايت من ذاكرة الوصول العشوائي للفيديو)
الموديل كوانت التكوين إجمالي التقريبية من العملات الرقمية في الثانية (32 عملية متزامنة)
اللاما 3.3 70 ب FP8 TP=4، PP=2 350-500
كوين 2.5 72 ب AWQ INT4 TP=4، نسختان 400-600
كوين 2.5 VL 72B AWQ INT4 TP=4 180-280
نموذج 8B (حوار) FP16 وحدة معالجة رسومية واحدة لكل نسخة، 8 نسخ 1,200-1,800

تتيح فئة 8 وحدات معالجة رسومية إمكانية خدمة نماذج متعددة في وقت واحد: حيث يتم تشغيل نموذج LLM بسعة 70 بايت على 4 وحدات معالجة رسومية، ونموذج VLM بسعة 32 بايت على الوحدات الأربع الأخرى، مما يتيح خدمة أسطول روبوتات متنوع بمتطلبات نماذج مختلفة في آن واحد، من وحدة واحدة. أما في فئة 4 وحدات معالجة رسومية، فيتطلب ذلك خطوة تبديل النماذج مع فترة توقف تتراوح بين 30 و120 ثانية لكل عملية تبديل.

ملاحظة حول TP=8 لـ 70B: يكون أداء TP=8 عبر PCIe من نظير إلى نظير (بدون NVLink) أسوأ من TP=4 × PP=2 عند التزامن الذي يزيد عن 8، وذلك لأن تكلفة الاتصال في وضع الاختزال الكامل تزداد مع درجة التوازي الموتري. تُظهر بيانات الاختبار المعياري أن عرض نطاق PCIe بين وحدات معالجة الرسومات يتراوح بين 19 و22 جيجابايت/ثانية، وهو كافٍ لـ TP=4، ولكن TP=8 في وضع الاختزال الكامل عند أحجام الدُفعات الكبيرة يُشبع هذه الروابط. التكوين المُوصى به لـ 70B على 8 × 4090 هو TP=4 × PP=2، كما هو موضح في I02.

تخطيط الرفوف

تخطيط الرفوف - من 12U إلى 15U، للتطوير أو الإنتاج
U مكون
1 لوحة توصيل 1U (Cat6A، منفذ ألياف ضوئية)
2 مفتاح ToR 1U (مُدار بسرعة 10/25 جيجابت إيثرنت)
3 وحدة تمديد بطارية UPS من نوع 2U (إذا لزم الأمر)
4-5 2U UPS (5 كيلو فولت أمبير / 10 كيلو فولت أمبير منتج)
6 وحدة توزيع الطاقة 1U (ثلاثية الطور، مزودة بعداد، أفقية)
7 وحدة فارغة 1U / إدارة الكابلات
8-11 عقدة حساب 4U K-AI (مطور) / عقدة حساب 6U K-AI (إنتاج)
12-13 فراغ / توسعة مستقبلية
14 مضيف قفز 1U / جهاز افتراضي لإدارة الأسطول
15 فراغ

تقع وحدة الحوسبة دائمًا أسفل المحول ووحدة التزويد المستمر للطاقة (UPS) - يتطلب تدفق الهواء من الأمام إلى الخلف دخول الهواء البارد من مقدمة الحامل (الممر البارد أو مصدر تكييف الهواء في الغرفة)، والمرور عبر الخادم، والخروج إلى الممر الساخن في الخلف. انظر W05 و I04 فيما يخص نظام تدفق الهواء.

الخادم الوسيط هو جهاز صغير الحجم (1U) مزود بمنفذ عرض، يُستخدم للتشغيل الأولي وتثبيت برامج التشغيل والصيانة عندما يتعذر الوصول إلى الخادم الرئيسي عبر الشبكة. لا يحتاج إلى وحدة معالجة رسومية (GPU). محطة عمل مستعملة أو جهاز صغير الحجم (1U) مزود بذاكرة وصول عشوائي (RAM) سعة 16 جيجابايت وقرص SSD من الجيل الثالث يُعدّ خيارًا مناسبًا.

ما لا يمثله هذا التصميم

ليس خادمًا مكتبيًا مزودًا بوحدة معالجة رسومات (GPU) داخل علبة رف. إنّ تصميم جهاز الكمبيوتر المكتبي المفتوح - حيث تُثبّت وحدات معالجة الرسومات على لوحة توسعة، بدون هيكل، والمراوح موجهة نحو السقف - ليس ما هو موصوف هنا. أجهزة الكمبيوتر المكتبية مناسبة للتطوير؛ فهي غير مصممة للتشغيل المستمر على مدار الساعة، ولا توفر تدفق الهواء الموجه من الأمام إلى الخلف الذي يحافظ على درجة حرارة تشغيل وحدات معالجة الرسومات ثابتة لأسابيع.

ليست مجموعة NVLink. لا تدعم بطاقة RTX 4090 (المخصصة للمستهلكين/محطات العمل) تقنية NVLink. تتم عمليات نقل البيانات بين وحدات معالجة الرسومات عبر منفذ PCIe بسرعة تتراوح بين 19 و22 جيجابايت/ثانية، وليس 900 جيجابايت/ثانية. هذه السرعة كافية لخدمة الاستدلال بمعدل TP=4، ولكنها تُشكل قيدًا حقيقيًا للتدريب بمعدل TP=8. إذا كان عبء العمل لديك يتطلب تدريبًا موزعًا مكثفًا على طراز 70B+، فإن بطاقة RTX Pro 6000 Blackwell (التي تدعم NVLink في إصدارها متعدد وحدات معالجة الرسومات) أو منصة مزودة بتقنية NVSwitch تُغير الحسابات، ولكنها تُغير السعر أيضًا. انظر N03.

وحدات تزويد الطاقة غير زائدة عن الحاجة. يُوزّع نظام التغذية المزدوج الطاقة على وحدتي معالجة الرسومات: تُغذّي وحدة التغذية A وحدتي معالجة الرسومات 0 و1 (بالإضافة إلى اللوحة الأم)، بينما تُغذّي وحدة التغذية B وحدتي معالجة الرسومات 2 و3. في حال تعطل وحدة التغذية A، ستفقد وحدتي معالجة رسومات واللوحة الأم. لا يوجد نظام تحويل تلقائي. هذا نظام تغذية مزدوج حقيقي - فهو يُوازن حمل الطاقة على خطوط التغذية ويُقلّل من مخاطر الاعتماد على نقطة واحدة كبيرة مقارنةً بوحدة تغذية واحدة كبيرة، ولكنه لا يُوفّر نظام التكرار N+1. انظر W04.

ليس بديلاً عن الحوسبة السحابية لكل شيء. إذا كان عبء العمل الرئيسي في مختبرك هو استدعاء نموذج واحد عشر مرات يوميًا، فإن حسابات التكلفة الإجمالية للملكية لا تبرر استخدام البنية التحتية المحلية. يُعوّض هذا الإصدار تكلفة واجهة برمجة التطبيقات السحابية عند تشغيل استدلال مستمر لعدة عملاء، أو إجراء ضبط دقيق بانتظام، أو العمل في ظل قيود على مكان تخزين البيانات. انظر T02 للحصول على التفاصيل الرياضية.

لماذا هذه الخيارات المحددة؟

AMD EPYC 7542 كوحدة معالجة مركزية مضيفة. يوفر معالج EPYC ذو 32 نواة 128 مسار PCIe 4.0 من وحدة المعالجة المركزية وحدها، وهو ما يكفي لتشغيل 4 وحدات معالجة رسومية بسرعة x16 دون الحاجة إلى تقسيم المسار، بالإضافة إلى بطاقة شبكة ووحدة تخزين ومحول PCIe للتوسعة. يُعد EPYC المنصة القياسية لخوادم الذكاء الاصطناعي متعددة وحدات معالجة الرسوميات بهذا الحجم لسبب وجيه: إذ يوفر معالج Intel Xeon بنفس عدد النوى عددًا أقل من مسارات PCIe، مما يفرض حلولًا وسطية في تكوينات 4 وحدات معالجة رسومية أو أكثر. انظر W02 لحساب عدد المسارات.

ذاكرة الوصول العشوائي للنظام 512 جيجابايت. يأتي الأسطول مزودًا بذاكرة وصول عشوائي (RAM) سعتها 512 جيجابايت (8 × 64 جيجابايت)، وهو ما يتجاوز المواصفات الاسمية البالغة 256 جيجابايت. هذا مقصود: فعمليات تحميل النماذج الكبيرة أثناء بدء تشغيل الحاويات، وجلب البيانات مسبقًا للتدريب، وذاكرة التخزين المؤقت لصفحات نظام التشغيل، كلها تستهلك ذاكرة وصول عشوائي (RAM) لا تستطيع ذاكرة الوصول العشوائي للفيديو (VRAM) استيعابها. بالنسبة لـ vLLM مع تمكين مساحة تبديل ذاكرة التخزين المؤقت للمفتاح والقيمة (KV-cache swap space)، يمكن استخدام ذاكرة الوصول العشوائي للنظام مباشرةً كمساحة فائضة - حيث تتطلب مساحة تبديل سعتها 4 جيجابايت لكل وحدة معالجة رسومية (GPU) مساحة إضافية قدرها 16 جيجابايت من ذاكرة الوصول العشوائي للنظام. توفر سعة 512 جيجابايت هذه المساحة الإضافية مع إمكانية استخدام برنامج Isaac Sim، الذي يمكنه تخزين ما بين 10 و30 جيجابايت من حالة المحاكاة في ذاكرة الوصول العشوائي للنظام أثناء تدريب السياسات.

مساحة تخزين مؤقتة 2 تيرابايت NVMe. يُظهر الاختبار المعياري سرعة قراءة متسلسلة تبلغ 4,589 ميجابايت/ثانية، وهي سرعة كافية لتحميل نموذج FP8 بحجم 70 بايت (حوالي 75 جيجابايت) في أقل من 20 ثانية. بالنسبة لمختبرات تُبدّل النماذج بشكل متكرر (سير عمل التطوير، واختبار A/B لمجموعات الاستدلال)، يُعدّ وقت التحميل عاملاً بالغ الأهمية. يُضاعف محرك أقراص الحالة الصلبة SATA الأبطأ هذا الوقت أو يُثلّثه لكل عملية تبديل.

تدفق الهواء من الأمام إلى الخلف في الرف. الخطأ الأكثر شيوعًا عند إنشاء الخوادم لأول مرة: لا يُناسب توجيه سطح المكتب (مدخل جانبي، مخرج علوي، مخرج خلفي) في خزانة مغلقة. يجب أن تستخدم وحدة الحوسبة تدفق هواء مُوجّهًا يتوافق مع نظام الممرات الباردة/الساخنة في الخزانة. انظر I01 و W05.

نظرة صريحة على أجهزة عام 2026

هذه نسخة مرجعية لشهر مايو 2026. بطاقة RTX 4090 ليست أحدث خيارات معالجات الرسوميات من كينتينو، حيث تتوفر بطاقتا RTX 5090 (بذاكرة 32 جيجابايت، وبنية بلاكويل، وsm_120) وRTX Pro 6000 Blackwell (بذاكرة 96 جيجابايت)، مما يُغير حسابات ذاكرة الرسوميات لكل بطاقة بشكل ملحوظ. توفر وحدة معالجة رسوميات رباعية مزودة ببطاقة RTX Pro 6000 Blackwell ذاكرة رسوميات إجمالية تبلغ 384 جيجابايت، وهي كافية لتشغيل لعبة Qwen 2.5 VL 72B بسلاسة على أربع بطاقات بدقة FP8، بتكلفة أعلى نسبيًا لكل بطاقة.

ما لا يتغير بين الأجيال هو النمط المعماري. معالج AMD EPYC، ووحدة معالجة رسومية متعددة PCIe، وهيكل يمتد من الأمام إلى الخلف، ووحدة تزويد طاقة مزدوجة، ونظام Ubuntu 24.04، وvLLM في Docker، وبرنامج Prometheus مع مُصدِّر DCGM. ظل هذا النمط ثابتًا عبر جيلين من وحدات معالجة الرسوميات، وسيستمر في الجيل القادم. قائمة المكونات تصبح أرخص وأسرع، لكن النمط يبقى كما هو.

الخطوة التالية - عملية تحديد الحجم

أجب عن هذه الأسئلة بالترتيب. كل سؤال يؤدي إلى السؤال التالي.

  1. ما هي النماذج التي تحتاج إلى استضافتها في وقت واحد؟ دوّن أسماء العناصر وعدد المعاملات. يتطلب تشغيل وحدة معالجة رسومية (LLM) بسعة 70 بايت ووحدة معالجة رسومية (VLM) بسعة 32 بايت في آنٍ واحد 96 جيجابايت على الأقل من ذاكرة الوصول العشوائي للفيديو (VRAM). بينما يتطلب تشغيل وحدة معالجة رسومية (LLM) بسعة 70 بايت ووحدة معالجة رسومية (VLM) بسعة 72 بايت في آنٍ واحد 192 جيجابايت من ذاكرة الوصول العشوائي للفيديو (VRAM) أو أكثر. هذا هو الحد الأدنى لذاكرة الوصول العشوائي للفيديو (VRAM) المتاحة. إذا تجاوز الحد الأدنى 96 جيجابايت، فإن طبقة التطوير ليست هي الإصدار المناسب.
  2. كم عدد عملاء الروبوت المتزامنين في ذروة الاستخدام؟ روبوت واحد مع استفسارات متقطعة ← يتم التعامل معها في بيئة التطوير. أربعة روبوتات تعمل في حلقات إدراك مستمرة (استدعاء VLM كل ثانيتين لكل منها) ← يتم دعم 8 طلبات متزامنة، وهو أمر يمكن إدارته في بيئة التطوير ولكنه يحتاج إلى قياس مقابل طول السياق. ثمانية روبوتات ← بيئة الإنتاج أو عقدتان في بيئة التطوير.
  3. هل تحتاج إلى قدرة تدريبية؟ يتطلب ضبط LoRA بدقة على نموذج 8B حوالي 20 جيجابايت من ذاكرة الفيديو، ويمكن تشغيله على بطاقة رسومات RTX 4090 واحدة. أما الضبط الكامل لنموذج 70B فيتطلب مئات الجيجابايت من ذاكرة الفيديو مع نقاط التحقق المتدرجة والتوازي ثلاثي الأبعاد، وهذا موضوع آخر. تبدأ معظم المختبرات بضبط LoRA على نماذج صغيرة، وهو ما تتولاه طبقة التطوير.
  4. ما هو نطاق الطاقة والتبريد لديك اليوم؟ كن صادقًا. قم بتشغيل جدول التحميل من I04 في حال استخدامك لدائرة كهربائية أحادية الطور بقدرة 16 أمبير مشتركة مع باقي المكاتب، فإن مرحلة التطوير تتطلب إنشاء دائرة كهربائية جديدة قبل أي شيء آخر. وهذا هو الخطأ الأكثر شيوعًا في التخطيط.
  5. هل لديكم شركة تكامل برامج؟ المكونات المادية المذكورة أعلاه لا تمثل سوى نصف النظام. برنامج تشغيل ROS 2 لروبوتك، وعميل gRPC لـ vLLM، ووحدة تخزين المشهد، وإعدادات المراقبة - كل هذا يتطلب من أسبوعين إلى ستة أسابيع من العمل الهندسي الفعلي في مختبر جديد. إذا كنت تشتري المكونات المادية دون خطة التكامل، فأنت تشتري النصف الثاني من النظام دون النصف الأول. انظر I02 و I01 لصورة التكامل.

عندما تتمكن من الإجابة على الأسئلة الخمسة جميعها، يصبح حجم المشروع واضحًا. إذا لم تتمكن من الإجابة على السؤال الأول (قائمة النماذج) أو السؤال الثالث (نطاق التدريب)، فعد لاحقًا عندما تستطيع - فهذان السؤالان يُحددان 90% من التكلفة. يستطيع فريق كينتينو تقديم عرض سعر بناءً على مجموعة إجابات مكتملة؛ أما عروض الأسعار التي تُقدم بناءً على متطلبات غامضة فتتطلب ثلاث جولات من المراجعة وقد تكون غير مناسبة.


هذا جزء من ويكي كينتينو، وهي سلسلة مرجعية حول الحوسبة الذكية، والروبوتات، والأنظمة التي تربط بينهما. نرحب بالتعليقات والتصويبات على info@kentino.com.