Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 Blackwell AI Server
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 Blackwell AI Server
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 Blackwell AI Server
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 Blackwell AI Server
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 Blackwell AI Server
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 Blackwell AI Server
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 Blackwell AI Server
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 Blackwell AI Server
Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 Blackwell AI Server
كينتينو · خادم الذكاء الاصطناعي المخصص

Kentino AI 128 Rome 5090 6704TOPS — 4 × RTX 5090 Blackwell AI Server

منصة على مستوى المؤسسات، تم تجميعها واختبارها في الاتحاد الأوروبي.

€28.700,00السعر لا يشمل ضريبة القيمة المضافة · يتم احتساب تكلفة الشحن عند إتمام عملية الشراء
متوفر في المخزون - يشحن من مستودع الاتحاد الأوروبي
ISO 9001 · أجهزة معتمدةمستودع وضمان الاتحاد الأوروبيأكثر من 7 سنوات في مجال الذكاء الاصطناعي للمؤسساتتم اختبارها قبل الشحن
نظرة عامة
الشحن والضمان

كينتينو AI 128 روما 5090 6704 توبس

خادم استدلال بلاكويل بسعة 128 جيجابايت من ذاكرة الوصول العشوائي للفيديو
بطاقة رسومات واحدة RTX 5090 | معالج EPYC Milan | 1676 TOPS INT8

6 704
أفضل أجهزة INT8
128 جيجا بايت
مجموعة ذاكرة الوصول العشوائي للفيديو
بلاكويل
fp8 الأصلي
2.5x
مقابل 4090 أعلى

أربع وحدات معالجة رسومية من نوع Blackwell RTX 5090 مزودة بمسارات موترات fp8/fp4 أصلية. أعلى إنتاجية لنظام رباعي وحدات معالجة رسومية على منصة روما.

خادم استدلال يُثبّت في رفّ بحجم 4U، مزوّد بأربع بطاقات رسومات GeForce RTX 5090 مُجمّعة في ذاكرة فيديو بسعة 128 جيجابايت، ومعالج AMD EPYC 7643 Milan (48 نواة/96 خيطًا)، وذاكرة DDR4 ECC بسعة 512 جيجابايت (جميع فتحات DIMM الثمانية مُستخدمة لتحقيق أقصى عرض نطاق ترددي)، ووحدة تخزين NVMe بسعة 2 تيرابايت للتشغيل، ووحدتي تزويد طاقة ATX متزامنتين بقدرة 2 كيلو واط. يعمل بنظام vLLM، وSGLang، وllama.cpp، وComfyUI مع نواة استدلال Blackwell الأصلية fp8 وMXFP4.

أجهزة التبخير

مكون التفاصيل
وحدات معالجة الرسومات 4x NVIDIA GeForce RTX 5090 32 GB GDDR7 (Blackwell, 575 W, PCIe 5.0 x16)
مجموعة ذاكرة الوصول العشوائي للفيديو إجمالي سعة 128 جيجابايت موزعة على 4 بطاقات (لا يوجد NVLink على بطاقة المستهلك 5090)
وحدة المعالجة المركزية‏: AMD EPYC 7643 Milan (48 نواة/96 خيط، 225 واط، 128 مسار PCIe 4.0)
اللوحة الأم ASRock Rack ROMED8-2T (SP3, 7x PCIe 4.0 x16, 8x DDR4 ECC, 2x 10 GbE, IPMI)
ذاكرة الوصول العشوائي للنظام 512 جيجابايت DDR4-2666 ECC RDIMM (8 × 64 جيجابايت - جميع فتحات DIMM مشغولة)
صندوق الأمتعة / التخزين 2 تيرابايت NVMe M.2 (PCIe 4.0 x4)
مزود الطاقة مزود طاقة مزدوج ATX بقدرة 2 كيلو واط مع كابل مزامنة + مجموعة محول 12 فولت HPWR
الهيكل وحدة تثبيت في رف 4U، 4 وحدات معالجة رسومات، رافعات PCIe 4.0 x16 سلبية
تبريد برج التبريد Arctic Freezer 4U-M SP3 + 3 فتحات تهوية أمامية 120 مم + فتحة عادم خلفية 120 مم
الانرنيت منفذان مدمجان بسرعة 10 جيجابت إيثرنت (إنتل X550)

مغلف الطاقة

  • استهلاك وحدة معالجة الرسومات: 4 × 575 واط = 4600 واط
  • إجمالي استهلاك الطاقة للنظام عند الحمل الكامل: ~1825 واط
  • إجمالي قدرة وحدة تزويد الطاقة: 4000 واط (وحدتان متزامنتان بقدرة 2 كيلو واط) - هامش أمان 33.8%
  • وحدة تزويد طاقة مزدوجة لتوزيع الطاقة بشكل منفصل - كل وحدة تزويد طاقة تغذي جزءًا من النظام

طوبولوجيا المسار

تُوزّع بطاقة ROMED8-2T 128 مسار PCIe Gen4 من معالج EPYC مباشرةً إلى سبعة منافذ x16؛ أربعة منها مُخصصة لوحدات معالجة الرسومات Gen4 x16. لا يوجد مُبدّل PCIe. لا يوجد NVLink في بطاقة 5090 المُخصصة للمستهلكين - اتصال مباشر بين وحدات معالجة الرسومات. البطاقات أصلية من الجيل الخامس؛ بينما تدعم بطاقة Rome الجيل الرابع فقط.

ما يمكنك تشغيله

بفضل ذاكرة الوصول العشوائي للفيديو المجمعة بسعة 128 جيجابايت ومسارات موتر fp8 الأصلية من Blackwell، يرتقي هذا الخادم إلى مستوى Qwen3-235B-A22B Q4 و gpt-oss-120b MXFP4 مع مساحة KV حقيقية - تتجاوز ما يمكن أن تصل إليه 4x RTX 4090.

ماجستير في القانون - نص / استدلال / برمجة

الحدود الصينية

  • Qwen3 / Qwen3.5 (علي بابا): Qwen3-235B-A22B Q3-Q4 (بسعة 112-132 جيجابايت تقريبًا) يناسب مساحة التخزين 128 جيجابايت مع 8-16 ألف سياق - وهو التكوين الأمثل؛ Qwen3-32B بكثافة bf16 (بسعة 65 جيجابايت تقريبًا) مع KV ضخم؛ Qwen3-Coder-30B-A3B يعمل بكفاءة عند مليون سياق؛ Qwen3.5-122B-A10B Q6/fp8 (بسعة 75-80 جيجابايت تقريبًا)؛ QwQ-32B bf16 منطقي
  • ديب سيك: DeepSeek-V3/R1/V3.1/V3.2 fp8-native Q2 (~215 GB) مع امتداد ذاكرة الوصول العشوائي عبر مضيف 512 GB - مناسب للمعالجة الدفعية؛ DeepSeek-R2 32B bf16 متعدد التدفقات (4 متزامنة، واحد لكل بطاقة)
  • GLM / Z.ai: GLM-4.5-Air 106B/12B fp8 (حوالي 106 جيجابايت) أو Q6 بشكل مريح؛ GLM-4.5/4.6/4.7 Q2_K_XL (حوالي 135 جيجابايت) بشكل محكم مع خاصية MoE offload
  • تينسنت هونيوان: معالج Hunyuan-A13B يدعم FP8 بشكل أصلي (بحجم 80 جيجابايت تقريبًا) - يدعم Blackwell تقنية FP8 بدون أي تكلفة إضافية؛ معالج Hunyuan-Large Q2 يعاني من امتداد ذاكرة الوصول العشوائي (RAM)
  • بايت دانس Seed-OSS-36B bf16 مع ذاكرة أصلية 512 كيلوبايت؛ ERNIE-4.5-424B الربع الثاني (~150 جيجابايت فائض)

الحدود الغربية

  • ميتا لاما: لاما 3.3 70 مليار في الربع الرابع عبر 4x 5090 (حوالي 30-40 توكا/ثانية للتدفق الفردي، وحوالي 270+ توكا/ثانية للدفعة 32 vLLM)؛ لاما 4 سكاوت 109 مليار/17 مليار MoE fp8/Q6 (حوالي 90 جيجابايت)؛ لاما 4 مافريك 400 مليار/17 مليار في الربع الثالث (حوالي 188 جيجابايت فائض)
  • ميسترال: Mistral Small 3 / Magistral / Devstral Small 2 (24B) bf16 multi-stream; Pixtral Large / Mistral Large 2 (123B) Q6 (~88 GB)
  • OpenAI (الأوزان المفتوحة): gpt-oss-120b MXFP4 الأصلي (80 جيجابايت) مع مفتاح-قيمة حقيقي وسياق طويل - عبء عمل Blackwell hero؛ gpt-oss-20b MXFP4
  • جوجل جيما 3: 27 بايت متعدد الوسائط bf16 (~54 جيجابايت) تدفقان متزامنان؛ 12 بايت / 4 بايت
  • مايكروسوفت فاي-4 14B كثيف bf16؛ Phi-4-reasoning مقطرة
  • إنفيديا نيموترون: Llama-3.1-Nemotron Ultra 253B Q3 (~119 GB) مضغوط؛ Super 49B bf16 (~98 GB)
  • أخرى: Cohere Command R+ 104B Q6 (~85 جيجابايت)؛ Molmo 72B Q6-bf16 VLM؛ OLMo 2 32B؛ IBM Granite 4.0 H-Small

نماذج الرؤية واللغة

Qwen3-VL-235B-A22B Q3-Q4؛ Qwen3-VL-32B bf16؛ InternVL3.5-241B-A28B Q4 (~135 جيجابايت مضغوطة)؛ InternVL3 78B bf16؛ Llama 3.2 90B Vision Q6 (~74 جيجابايت)؛ Pixtral Large 124B Q6 (~88 جيجابايت)؛ Molmo 72B Q6/bf16؛ Gemma 3 27B متعدد الوسائط bf16؛ GLM-4.6V 106B fp8.

توليد الصور

FLUX.1 [dev] bf16 و fp8 (~10-18 ثانية/صورة عند fp8)؛ FLUX.1 Kontext [dev]؛ SD 3.5 Large bf16؛ HunyuanImage-2.1 bf16 و Q4؛ HunyuanImage-3.0 base (80 بايت MoE، 13 بايت نشط) bf16 (~80 جيجابايت، حجم كبير)؛ HunyuanDiT؛ Kolors / Kolors 2.0؛ AuraFlow v0.3؛ OmniGen v1؛ PixArt-Sigma.

توليد الفيديو

Wan 2.2 MoE two-expert bf16 (~54 جيجابايت، ctx كامل)؛ Wan 2.2 TI2V-5B؛ HunyuanVideo 13B bf16 both experts (~60-80 جيجابايت)؛ HunyuanVideo 1.5؛ CogVideoX-5B bf16؛ Open-Sora 2.0 11B bf16 (~24 جيجابايت)؛ Genmo Mochi-1 bf16 (~42 جيجابايت)؛ LTX-Video؛ Pyramid Flow؛ SVD / SV3D / SV4D؛ NVIDIA Cosmos.

الصوت / الكلام / تحويل النص إلى كلام

  • ASR: Whisper v3 كبير / توربو (حوالي 50 ضعف الوقت الفعلي)؛ Parakeet-TDT؛ Canary 1B؛ Qwen3-ASR؛ SenseVoice
  • تحويل النص إلى كلام: CosyVoice 2 / 3؛ Kokoro 82M؛ Stable Audio Open؛ XTTS v2؛ StyleTTS 2؛ Step-Audio-EditX
  • في الوقت الحقيقي / من جهاز لآخر: كيوتاي موشي 7 ب؛ خطوة الصوت 2 ميني/R1؛ Qwen2.5-أومني-7B
  • الموسيقى / المؤثرات الصوتية: MusicGen / AudioGen / Bark؛ SeamlessM4T الإصدار 2

خدمة متعددة النماذج / متعددة المستأجرين

  • 200 مليار وحدة طاقة في الربع الرابع مع الاستدلال الدفعي (Qwen3-235B، GLM-4.5/4.6/4.7-Air) لـ 8-16 مستخدمًا متزامنًا
  • حدود fp8 الأصلية — عائلة DeepSeek V3، Hunyuan-Large fp8 مع مسارات Blackwell الأصلية
  • مجموعة برامج مقيمة مختلطة: gpt-oss-120b MXFP4 + FLUX.1 + Whisper + Moshi على ذاكرة فيديو مقسمة
  • معالجة عالية الإنتاجية 70 بايت — vLLM / SGLang متوازية الموترات مع تجميع دفعي يزيد عن 200 توك/ثانية

أحمال العمل المستهدفة

  • إنتاج وزارة الطاقة 200 مليار+ يتم تشغيله في الربع الثالث والرابع بقيم KV حقيقية (Qwen3-235B، GLM-4.5-Air 106B)
  • الاستدلال الحدودي الأصلي لـ fp8 (DeepSeek V3/R1 fp8، Hunyuan fp8) - يعمل Blackwell بدون تحويل تلقائي
  • خدمة عالية الإنتاجية تصل إلى 70 مليار عملية - معالجة دفعية متوازية باستخدام الموترات عبر vLLM أو SGLang
  • استوديو إنتاج الفيديو في bf16 (Wan 2.2 dual-expert، HunyuanVideo 13B، Mochi-1)
  • أحمال عمل مختلطة متعددة المستأجرين — 120 مليار وحدة طاقة + توليد صور + صوت في الوقت الفعلي، جميعها مقيمة

الأداء المقاس

المراجع المنشورة | ورقة بيانات NVIDIA RTX 5090 + معايير الأداء المجتمعية

مؤشر نتيجة
معدل نقل البيانات لكل بطاقة 8 بت في الثانية (بيانات NVIDIA) 4000 قمة
مجموع نقاط INT8 الأعلى (بطاقتان) 4000 قمة
عرض نطاق الذاكرة لكل بطاقة ~1792 جيجابايت/ثانية
لاما 3.3 70B Q6 عبر vLLM (مجتمع) معدل تدفق أحادي من 60 إلى 90 توك/ثانية، ومعدل تدفق دفعة من 300 توك/ثانية فأكثر
Qwen3-235B-A22B Q3-Q4 يدعم مجموعة بيانات بسعة 128 جيجابايت مع 8-16 ألف عنصر تحكم
gpt-oss-120b MXFP4 الأصلي 80 جيجابايت - مريحة مع هامش KV

البيانات منشورة من مصادر خارجية، ولم يتم قياسها على أجهزة كينتينو. ستنشر كينتينو بياناتها الخاصة بعد أول إصدار للعميل.

ليست مثالية لـ

  • Frontier 400B+ في الربع الرابع (Kimi-K2، Mistral Large 3، Intern-S1-Pro - تتطلب 8 وحدات معالجة رسومات أو 6x RTX Pro 6000)
  • أحمال العمل الحساسة لوصلة PCIe Gen5 - اختر وحدة Genoa SKU للحصول على Gen5 x16 أصلي
  • التدريب من الصفر (لا يوجد NVLink على جهاز المستهلك 5090)
  • إنتاج حساس لتقنية تصحيح الأخطاء (ECC) على مدار الساعة طوال أيام الأسبوع — بطاقة 5090 الاستهلاكية لا تحتوي على تقنية ECC؛ يُفضل استخدام بطاقة L40 أو RTX Pro 6000 Server Edition

الضمان ومدة التسليم

2 سنة
ضمان قطع الغيار
عام واحد
ضمان العمل
10-28 أيام
المهلة

تشمل عملية التجميع، وتكوين نظام الإدخال والإخراج الأساسي (BIOS)، وتثبيت برامج التشغيل، واختبار التشغيل الأولي، والتحقق من الوظائف. يعتمد وقت التسليم على توافر المكونات، ويتم تأكيده عند الطلب.

الإضافات الموصى بها

  • قم بترقية وحدة تزويد الطاقة إلى وحدتين بقدرة 2.5 كيلو واط (FSP) لتشغيل لعبة Battlefield 16 مع الفيديو بشكل مستمر في أسوأ الظروف - يُنصح بذلك للاستخدام على مدار الساعة طوال أيام الأسبوع
  • 4 تيرابايت NVMe لمكتبة النماذج + مرحلة ترجيح MoE
  • خزانة مفتوحة بحجم 24U لنشر خوادم متعددة
  • يرجى مراعاة خيار منصة Genoa عند الطلب لوصلة Gen5 x16

يتم الشحن من مستودعنا في الاتحاد الأوروبي. قد تتطلب المنتجات الثقيلة ترتيبات شحن خاصة - تواصلوا معنا للحصول على عرض سعر للشحن ومدة التوصيل. ضمان محدود لمدة عامين مع دعم متقدم لخدمة ما بعد الإرجاع؛ يتوفر ضمان ممتد.

أليس هذا ما تحتاجه بالضبط؟

أخبرنا عن حجم العمل الذي تقوم به وسنقوم بتحديد مواصفات هذه المنصة بناءً عليه - وحدات معالجة الرسومات والذاكرة والتخزين والتبريد التي تتناسب مع ما تقوم بتشغيله فعليًا.