كينتينو AI 144 روما L4 1452TOPS — 6 × NVIDIA L4 — EPYC ميلان
منصة على مستوى المؤسسات، تم تجميعها واختبارها في الاتحاد الأوروبي.
كينتينو AI 144 روما L4 1452TOPS
خادم استدلال الحافة الصامت بسعة 144 جيجابايت من ذاكرة الوصول العشوائي للفيديو
6x NVIDIA L4 Passive | EPYC Milan | 2172 TOPS INT8
ست بطاقات بيانات سلبية من الطبقة الرابعة لمراكز البيانات. أهدأ خادم ذكاء اصطناعي في تشكيلة كينتينو - مقبول للنشر على حافة المكتب.
خادم استدلال أحادي المقبس بحجم 4U مزود بست بطاقات NVIDIA L4 سلبية (سعة كل منها 24 جيجابايت، وسعة تخزين إجمالية 144 جيجابايت)، ومعالج AMD EPYC 7643 Milan (48 نواة/96 خيطًا)، وذاكرة DDR4 ECC بسعة 384 جيجابايت، ووحدة تخزين NVMe بسعة 2 تيرابايت للتشغيل، ووحدة تزويد طاقة ATX واحدة بقدرة 2 كيلوواط مع هامش أمان بنسبة 62%. يُعد هذا الخادم أداةً أساسيةً للاستدلال على الحافة الكثيفة، وهو مثالي لتضمين أساطيل الشبكات، وخدمة LLM متعددة المستأجرين للشركات الصغيرة والمتوسطة الحجم، ونشر تطبيقات استهلاك الطاقة المنخفض (واط لكل استعلام) بالقرب من المكاتب.
أجهزة التبخير
| مكون | التفاصيل |
|---|---|
| وحدات معالجة الرسومات | 6x NVIDIA L4 24 GB (Ada Lovelace، سلبي، 72 واط، فتحة واحدة LP، PCIe Gen4 x8) |
| مجموعة ذاكرة الوصول العشوائي للفيديو | إجمالي 144 جيجابايت موزعة على 6 بطاقات |
| وحدة المعالجة المركزية: | AMD EPYC 7643 Milan (48 نواة/96 خيط، 225 واط، 128 مسار PCIe 4.0) |
| اللوحة الأم | ASRock Rack ROMED8-2T (SP3, 7x PCIe 4.0 x16, 8x DDR4 ECC, 2x 10 GbE, IPMI) |
| ذاكرة الوصول العشوائي للنظام | 384 جيجابايت DDR4-2666 ECC RDIMM (6 × 64 جيجابايت) |
| صندوق الأمتعة / التخزين | 2 تيرابايت NVMe M.2 (PCIe 4.0 x4) |
| مزود الطاقة | وحدة تزويد طاقة ATX واحدة بقدرة 2 كيلو واط |
| الهيكل | تركيب على رف 4U (تخطيط 6 بطاقات) |
| تبريد | مبرد SP3 البرجي + تدفق هواء موجه من الأمام إلى الخلف (مراوح صناعية) |
| الانرنيت | منفذان مدمجان بسرعة 10 جيجابت إيثرنت (إنتل X550) |
مغلف الطاقة
- استهلاك وحدة معالجة الرسومات: 6 × 72 واط = 432 واط
- إجمالي استهلاك الطاقة للنظام عند الحمل الكامل: ~757 واط
- إجمالي طاقة وحدة التزويد بالطاقة: 2000 واط — 62% هامش احتياطي
- تشغيل صامت، هامش حراري هائل
طوبولوجيا المسار
الطبقة الرابعة (L4) متوافقة مع PCIe Gen4 x8، مما يضمن عدم فقدان عرض النطاق الترددي مقارنةً بالخادم المضيف. يوفر ROMED8-2T سبعة منافذ x16، مع منفذ إضافي متاح لبطاقة الشبكة. لا حاجة إلى محول PCIe. لا يدعم NVLink.
ما يمكنك تشغيله
عند 144 جيجابايت إجمالي عبر 6 بطاقات فعلية، فإن النقطة المثالية هي خدمة النماذج المتعددة المتزامنة: تشغيل نموذج كثيف 70 بايت في الربع الرابع، ونموذج MoE 30 بايت، ونموذج مشفر 14 بايت، ونموذج VLM ونموذج تضمين في وقت واحد ولا يزال لديك مساحة كافية لـ KV.
ماجستير في القانون - نص / استدلال / برمجة
الحدود الصينية
- Qwen3 / Qwen3.5 (علي بابا): Qwen3-30B-A3B Q4-Q6؛ QwQ-32B Q6؛ Qwen3-32B كثيف Q6؛ Qwen3.5-122B-A10B Q4-Q5 (~75 جيجابايت بشكل مريح)؛ Qwen3-235B-A22B Q3 (~112 جيجابايت) ضيق، حجم صغير
- ديب سيك: DeepSeek-R2 32B sparse MoE Q4-Q6 (بطاقة واحدة، 6 تدفقات متزامنة، ~15-20 tok/s لكل تدفق)؛ Seed-OSS-36B Q4-Q6 مع سياق أصلي 512k
- GLM / Z.ai: GLM-4.5-Air Q4-Q5 (60-70 جيجابايت مريح)؛ Hunyuan-A13B Q4-Q6 (~48 جيجابايت)
- بايدو ERNIE-4.5-47B-A3B الربع الرابع؛ الخطوة 3.5 - فلاش الربع الثالث إلى الربع الرابع مع بعض امتداد ذاكرة الوصول العشوائي
الحدود الغربية
- ميتا لاما: لاما 3.3 70B Q4-Q6 (43-58 جيجابايت) مع KV سخي (~10-17 توكوفيرول/ثانية لتدفق واحد عبر 6x L4 متوازية الموترات)؛ لاما 4 سكاوت 109B/17B MoE Q4 (~63 جيجابايت) مريحة
- ميسترال: ميسترال صغير 3 / ماجيسترال صغير 1.2 / ديفسترال صغير 2 (24B) في bf16 (~50-65 توك/ثانية لكل بطاقة L4)؛ ميكسترال 8x22B Q4
- OpenAI (الأوزان المفتوحة): gpt-oss-120b MXFP4 أصلي (~80 جيجابايت) مع مساحة إضافية؛ gpt-oss-20b MXFP4
- جوجل جيما 3: 27B bf16؛ Phi-4 14B bf16
- إنفيديا نيموترون: اللاما-3.1-نيموترون سوبر 49B Q4-Q6؛ Pixtral 12B / Pixtral كبير Q4 (~72 جيجابايت)
نماذج الرؤية واللغة
Qwen3-VL-8B/32B، Qwen3-VL-30B-A3B MoE، InternVL3 حتى 78B Q4 (~48 جيجابايت)، InternVL3.5-38B، DeepSeek-VL2، Llama 3.2 11B Vision bf16، Llama 3.2 90B Vision Q4 (~52 جيجابايت)، Molmo 72B Q4، Gemma 3 12B/27B متعدد الأوضاع، MiniCPM-V 2.6 / MiniCPM-o 2.6، GLM-4.6V-Flash.
توليد الصور
FLUX.1 [dev] / [schnell] fp8 (~20-35 ثانية/صورة على L4 واحد عند fp8)؛ FLUX.1 Kontext [dev]؛ أدوات FLUX؛ SD 3.5 كبير (18 جيجابايت fp16 / 11 جيجابايت fp8)؛ SDXL 1.0؛ HunyuanImage-2.1 (~34 جيجابايت bf16)؛ HunyuanDiT؛ Kolors 2.0؛ AuraFlow v0.3؛ OmniGen v1؛ PixArt-Sigma.
توليد الفيديو
Wan 2.2 T2V-A14B / I2V-A14B MoE (محكم عند bf16 ~54 جيجابايت)؛ مسار سريع وان 2.2 TI2V-5B؛ HunyuanVideo 13B Q4-Q8 (~30 جيجابايت)؛ هونيوانفيديو 1.5 (8.3B)؛ com.CogVideoX-5B; Open-Sora 2.0 Q8 (~16 جيجابايت)؛ Mochi-1 Q4 (~18 جيجابايت)؛ LTX-فيديو؛ تدفق الهرم؛ سفد / SV3D / SV4D؛ نفيديا كوزموس.
الصوت / الكلام / تحويل النص إلى كلام
- ASR: Whisper v3 كبير / توربو (حوالي 50 ضعف الوقت الفعلي)؛ Parakeet-TDT؛ Canary 1B؛ Qwen3-ASR؛ SenseVoice
- تحويل النص إلى كلام: CosyVoice 2 / 3؛ Kokoro 82M؛ Stable Audio Open؛ XTTS v2؛ StyleTTS 2؛ Step-Audio-EditX
- في الوقت الحقيقي / من جهاز لآخر: كيوتاي موشي 7 ب؛ خطوة الصوت 2 ميني/R1؛ Qwen2.5-أومني-7B
- الموسيقى / المؤثرات الصوتية: MusicGen / AudioGen / Bark؛ SeamlessM4T الإصدار 2
خدمة متعددة النماذج / متعددة المستأجرين
- ستة تدفقات متزامنة من طراز Q4 بسعة 24 جيجابايت (تدفق واحد لكل بطاقة): على سبيل المثال، 6 وكلاء Qwen3-14B Q4
- أسطول مختلط: Llama 3.3 70B Q4 (معالجة متوازية باستخدام Tensor على بطاقتين) + FLUX.1 (بطاقة واحدة) + Whisper-turbo (بطاقة واحدة) + Moshi (بطاقة واحدة) + BGE-M3 embedder (بطاقة واحدة)
- خدمة تضمين بمعدل استعلامات مرتفع في الثانية - 6 تدفقات تضمين متوازية من BGE-M3 / E5 / Nomic / Cohere Embed
- مزرعة تحويل ترميز الفيديو - 6 تدفقات NVENC/NVDEC متوازية
أحمال العمل المستهدفة
- واجهة برمجة تطبيقات إدارة التعلم متعددة المستأجرين SaaS — تخدم من 20 إلى 40 مستخدمًا متزامنًا عبر نموذج 24 مليار/32 مليار مع مساحة للصور والتعرف التلقائي على الكلام إلى جانب
- نظام RAG الخلفي - مُضمِّن جانب الاستعلام + قارئ 70 مليار Q4 + مُعيد ترتيب النتائج، زمن استجابة أقل من ثانية، 50 استعلامًا في الثانية
- خط أنابيب الذكاء الاصطناعي للفيديو - تحويل ترميز مباشر + ترجمة + إدارة على 6 تدفقات متوازية
- جهاز ذكاء اصطناعي طرفي بالقرب من المكتب - مستوى ضوضاء منخفض، ولا يعتمد على مركز بيانات
- منصة بحث وتطوير متوسطة المستوى - تكرار سريع على 30-70 مليار عملية ضبط دقيقة، بطاقة واحدة لكل تجربة
الأداء المقاس
المراجع المنشورة | ورقة بيانات NVIDIA L4 + معايير الأداء المجتمعية
| مؤشر | نتيجة |
|---|---|
| معدل نقل البيانات لكل بطاقة 8 بت في الثانية (بيانات NVIDIA) | 242 TOPS |
| مجموع نقاط INT8 الأعلى (بطاقتان) | 4000 قمة |
| لاما 3.1 8B Q4 على خط L4 واحد (مجتمعي) | ~35-45 توكوفيرول/ثانية تيار واحد |
| تضمين بروتوكول QPS في BGE-M3 على الطبقة الرابعة (المجتمعية) | حوالي 800 استعلام في الثانية عند إدخال 512 رمزًا مميزًا |
| عامل الوقت الحقيقي لـ Whisper v3 turbo | ~1.5-2 ضعف الوقت الفعلي لكل بطاقة |
البيانات منشورة من مصادر خارجية، ولم يتم قياسها على أجهزة كينتينو. ستنشر كينتينو بياناتها الخاصة بعد أول إصدار للعميل.
ليست مثالية لـ
- Frontier 200B+ MoE في الربع الرابع وما بعده مع سياق طويل الأمد — 4x L40 أو 8x RTX 4090 (مجموعة 192 جيجابايت، TP متجاورة) هو الخيار الأمثل
- أحمال التدريب - يفتقر المستوى الرابع إلى دقة FP8 وعرض النطاق الترددي اللازم للتدريب الفعال
- معدل نقل البيانات الأقصى لحمل العمل الواحد - الحوسبة لكل بطاقة متواضعة مقارنة بـ L40 / RTX Pro 6000
الضمان ومدة التسليم
ضمان NVIDIA الأصلي لمدة 3 سنوات على معالج L4 بالإضافة إلى ضمان تكامل Kentino. تشمل عملية التجميع: تركيب BIOS، وتثبيت برامج التشغيل، واختبارات التحمل، والتحقق من الأداء. يعتمد وقت التسليم على توفر المكونات، ويتم تأكيده عند الطلب.
الإضافات الموصى بها
- ترقية NVMe بسعة 4 تيرابايت لتجهيز مكتبة النماذج
- خزانة رفوف مفتوحة 24U مع وحدة توزيع طاقة مُدارة
يتم الشحن من مستودعنا في الاتحاد الأوروبي. قد تتطلب المنتجات الثقيلة ترتيبات شحن خاصة - تواصلوا معنا للحصول على عرض سعر للشحن ومدة التوصيل. ضمان محدود لمدة عامين مع دعم متقدم لخدمة ما بعد الإرجاع؛ يتوفر ضمان ممتد.
أليس هذا ما تحتاجه بالضبط؟
أخبرنا عن حجم العمل الذي تقوم به وسنقوم بتحديد مواصفات هذه المنصة بناءً عليه - وحدات معالجة الرسومات والذاكرة والتخزين والتبريد التي تتناسب مع ما تقوم بتشغيله فعليًا.