كينتينو AI 192 روما ثنائي 4090 5288TOPS — 8× RTX 4090 — معالج مزدوج EPYC ميلان
كينتينو AI 192 روما ثنائي 4090 5288TOPS — 8× RTX 4090 — معالج مزدوج EPYC ميلان
كينتينو AI 192 روما ثنائي 4090 5288TOPS — 8× RTX 4090 — معالج مزدوج EPYC ميلان
كينتينو AI 192 روما ثنائي 4090 5288TOPS — 8× RTX 4090 — معالج مزدوج EPYC ميلان
كينتينو AI 192 روما ثنائي 4090 5288TOPS — 8× RTX 4090 — معالج مزدوج EPYC ميلان
كينتينو AI 192 روما ثنائي 4090 5288TOPS — 8× RTX 4090 — معالج مزدوج EPYC ميلان
كينتينو AI 192 روما ثنائي 4090 5288TOPS — 8× RTX 4090 — معالج مزدوج EPYC ميلان
كينتينو AI 192 روما ثنائي 4090 5288TOPS — 8× RTX 4090 — معالج مزدوج EPYC ميلان
كينتينو AI 192 روما ثنائي 4090 5288TOPS — 8× RTX 4090 — معالج مزدوج EPYC ميلان
كينتينو · خادم الذكاء الاصطناعي المخصص

كينتينو AI 192 روما ثنائي 4090 5288TOPS — 8× RTX 4090 — معالج مزدوج EPYC ميلان

منصة على مستوى المؤسسات، تم تجميعها واختبارها في الاتحاد الأوروبي.

€32.280,00السعر لا يشمل ضريبة القيمة المضافة · يتم احتساب تكلفة الشحن عند إتمام عملية الشراء
متوفر في المخزون - يشحن من مستودع الاتحاد الأوروبي
ISO 9001 · أجهزة معتمدةمستودع وضمان الاتحاد الأوروبيأكثر من 7 سنوات في مجال الذكاء الاصطناعي للمؤسساتتم اختبارها قبل الشحن
نظرة عامة
الأسئلة الشائعة
الشحن والضمان

كينتينو AI 192 روماDual 4090 5288TOPS

خادم استدلال بذاكرة فيديو 192 جيجابايت و8 وحدات معالجة رسومات
8 بطاقات رسومات RTX 4090 | معالجين EPYC Milan | 5288 تيرابايت في الثانية (INT8)

5 288
أفضل أجهزة INT8
192 جيجا بايت
مجموعة ذاكرة الوصول العشوائي للفيديو
8-GPU
موتر متوازٍ
مزدوج
وحدة المعالجة المركزية 96 نواة/192 خيطًا

جهاز استدلال رائد للألعاب مزود بـ 8 وحدات معالجة رسومية. سعة تخزين 192 جيجابايت بأسعار تنافسية على منصة EPYC Milan ثنائية المقبس.

هيكل 7U مزود بثمانية وحدات معالجة رسومية، مبني على معالجين EPYC 7643 Milan (بإجمالي 96 نواة/192 خيطًا)، ولوحة أم ASRock Rack ROME2D32GM-NL ثنائية SP3، وذاكرة DDR4 ECC سعة 512 جيجابايت، ووحدة تخزين NVMe بسعة 2 تيرابايت للتشغيل، ومجموعة من 5 وحدات تزويد طاقة للخادم بقدرة 1200 واط لكل منها. تتصل ثماني بطاقات GeForce RTX 4090 عبر منافذ PCIe Gen4 النشطة بسرعة x16 كاملة. هذا هو الخيار الأرخص للحصول على 192 جيجابايت من بيانات استنتاج الحدود على جهاز Kentino.

أجهزة التبخير

مكون التفاصيل
وحدات معالجة الرسومات 8x NVIDIA GeForce RTX 4090 24 GB GDDR6X (Ada Lovelace, 450 W, PCIe 4.0 x16)
مجموعة ذاكرة الوصول العشوائي للفيديو إجمالي سعة 192 جيجابايت موزعة على 8 بطاقات (لا يوجد NVLink في بطاقة RTX 4090 المخصصة للمستهلكين)
وحدة المعالجة المركزية‏: 2x AMD EPYC 7643 Milan (48 نواة/96 خيط لكل منهما - 96 نواة/192 خيط إجمالاً، 225 واط لكل منهما، 2x 128 مسار PCIe 4.0)
اللوحة الأم ASRock Rack ROME2D32GM-NL (مزود بـ SP3 مزدوج، PCIe 4.0، 32 فتحة DDR4 ECC DIMM)
ذاكرة الوصول العشوائي للنظام ذاكرة DDR4-2666 ECC RDIMM بسعة 512 جيجابايت (8 × 64 جيجابايت - 4 لكل مقبس لتوازن 8 قنوات)
صندوق الأمتعة / التخزين 2 تيرابايت NVMe M.2 (PCIe 4.0 x4)
مزود الطاقة مجموعة 5 وحدات تزويد طاقة للخوادم بقدرة 1200 واط (متوافقة مع HP، قابلة للتبديل السريع) + مجموعة كاملة من محولات 12 فولت HPWR
الهيكل هيكل 7U 8-GPU (يدعم حتى 10 بطاقات PCIe بما في ذلك الرافعات)
الناهضون 8x موصلات إعادة توقيت PCIe Gen4 x16 نشطة (مطلوبة على طول الكابل)
تبريد 2x مبردات برجية من نوع Arctic Freezer 4U-M SP3 + نظام تدفق هواء أمامي إلى خلفي مثبت على الرف (مراوح صناعية)
الانرنيت منفذان مدمجان بسرعة 10 جيجابت إيثرنت (إنتل X550)

مغلف الطاقة

  • استهلاك وحدة معالجة الرسومات: 8 × 450 واط = 4600 واط
  • استهلاك المعالج: 2 × 225 واط = 450 واط
  • إجمالي استهلاك الطاقة للنظام عند الحمل الكامل: ~1825 واط
  • إجمالي قدرة وحدة تزويد الطاقة: 6000 واط (5 × 1200 واط) - هامش أمان 30.0%

طوبولوجيا المسار

توفر وحدة ROME2D32GM-NL مسارين PCIe Gen4 سعة 128 بت - مجموعة مسارات سعة 128 بت لكل مقبس EPYC - مباشرةً إلى فتحات وحدة معالجة الرسومات. مزودة بموصلات إعادة توقيت Gen4 نشطة لضمان سلامة الإشارة. لا تحتوي على محول PCIe أو NVLink. تم قياس سرعة نقل البيانات بين وحدات معالجة الرسومات من نظير إلى نظير على منصة اختبار رباعية وحدات معالجة الرسومات، حيث تراوحت بين 19 و22 جيجابايت/ثانية.

ما يمكنك تشغيله

بفضل سعة 192 جيجابايت موزعة على 8 بطاقات، يتعامل هذا الخادم مع أكثر من 200 مليار نقطة ربحية في الربع الرابع، والاستدلال المتوازي للموتر ذي 8 اتجاهات، وخدمة النماذج المتعددة المعزولة للمستأجر، وإنتاجية عالية للدفعات بأسعار اقتصادية تناسب بطاقات المستهلك.

ماجستير في القانون - نص / استدلال / برمجة

الحدود الصينية

  • Qwen3 / Qwen3.5 (علي بابا): Qwen3-235B-A22B Q4 (~132 جيجابايت) مع سياق طويل - التكوين الأمثل (~15-25 توك/ثانية تدفق واحد على 8 بطاقات RTX 4090)؛ Qwen3-Coder-480B-A35B Q2 (~160 جيجابايت)؛ Qwen3.5-122B-A10B fp8 (~75 جيجابايت) تدفقات متعددة؛ Qwen3-32B كثيف bf16 x متزامن متعدد
  • ديب سيك: DeepSeek-V3/R1 Q2 (~215 جيجابايت مع 512 جيجابايت من مساحة التخزين المضيفة)؛ DeepSeek-R2 32B bf16 — ما يصل إلى 8 تدفقات متزامنة، تدفق واحد لكل بطاقة (~30-40 توكا/ثانية لكل تدفق)
  • GLM / Z.ai: GLM-4.5 / 4.6 / 4.7 Q4 (~177 جيجابايت)؛ GLM-4.5-Air fp8 أو bf16؛ GLM-4.6V 106B
  • تينسنت هونيوان: Hunyuan-Large Q3 (~160 جيجابايت)؛ Hunyuan-A13B Q4/Q6 (RTX 4090 هو Ada — fp8 upcasts إلى bf16، استخدم كميات GGUF)
  • أخرى: بايدو إيرني-4.5-424B Q3 ​​(~180 جيجابايت)؛ InternVL3.5-241B-A28B Q4 (~135 جيجابايت)؛ Qwen3.5-397B Q3 (~170 جيجابايت)؛ MiniMax-M1 Q3 (~180 جيجابايت)

الحدود الغربية

  • ميتا لاما: Llama 3.3 70B bf16 مع KV ضخم (~20 توكا/ثانية تدفق أحادي Q4، ~179 توكا/ثانية دفعة-32 vLLM - تم قياس Kentino على منصة اختبار 4 وحدات معالجة رسومية)؛ Llama 4 Scout bf16 (~218 جيجابايت مضغوطة)؛ Llama 4 Maverick Q3 (~188 جيجابايت)
  • ميسترال: ميسترال كبير 2 / بيكسرال كبير 123B Q6 مريح أو bf16 (سعة تخزين تصل إلى 248 جيجابايت تقريبًا)؛ ميسترال صغير 3 متعدد التدفقات
  • OpenAI (الأوزان المفتوحة): gpt-oss-120b MXFP4 أصلي (80 جيجابايت) مع KV ضخم
  • إنفيديا نيموترون: Llama-3.1-Nemotron Ultra 253B Q4 (~147 جيجابايت)؛ سوبر 49 بي بي إف 16
  • أخرى: Cohere Command R+ 104B Q6 (~85 GB)؛ Google Gemma 3 27B bf16 x multiple streams

نماذج الرؤية واللغة

InternVL3.5-241B-A28B Q4 (~135 جيجابايت)؛ Qwen3-VL-235B-A22B Q4؛ Qwen3-VL-32B bf16 متعدد التدفقات؛ Llama 3.2 90B Vision bf16 (~180 جيجابايت)؛ Pixtral Large 124B Q6؛ Molmo 72B bf16؛ GLM-4.6V 106B fp8/Q6؛ Gemma 3 27B متعدد الوسائط x تدفقات متعددة.

توليد الصور

FLUX.1 [dev] bf16 — ما يصل إلى 8 تدفقات توليد متزامنة (تدفق واحد لكل بطاقة، ~15-25 ثانية/صورة عند fp8)؛ FLUX.1 Kontext [dev]؛ أدوات FLUX؛ SD 3.5 Large bf16 x 8؛ HunyuanImage-2.1 bf16 (~34 جيجابايت) x 2-4 متزامنة؛ HunyuanImage-3.0 base (80 بايت MoE، 13 بايت نشطة) bf16؛ HunyuanDiT؛ Kolors / Kolors 2.0؛ AuraFlow؛ OmniGen v1؛ PixArt-Sigma.

توليد الفيديو

Wan 2.2 MoE ثنائي الخبير bf16 مع ctx كامل - تدفقات متعددة متزامنة؛ Wan 2.2 TI2V-5B x 8 متزامنة؛ HunyuanVideo 13B bf16 كلا الخبيرين؛ HunyuanVideo 1.5؛ CogVideoX-5B bf16؛ Open-Sora 2.0 11B bf16؛ Genmo Mochi-1 bf16؛ LTX-Video x 8 متزامنة؛ Pyramid Flow؛ SVD / SV3D / SV4D؛ NVIDIA Cosmos.

الصوت / الكلام / تحويل النص إلى كلام

  • ASR: Whisper v3 كبير / توربو × 8 متزامن (حوالي 50 ضعف الوقت الفعلي لكل بث)؛ Parakeet-TDT؛ Canary 1B؛ Qwen3-ASR؛ SenseVoice
  • تحويل النص إلى كلام: CosyVoice 2/3؛ Kokoro 82M؛ XTTS v2؛ Stable Audio Open
  • في الوقت الحقيقي / من جهاز لآخر: Kyutai Moshi 7B x 8 مسارات صوتية متزامنة؛ Step-Audio 2 mini/R1؛ Qwen2.5-Omni-7B
  • الموسيقى / المؤثرات الصوتية: MusicGen / AudioGen / Bark؛ SeamlessM4T الإصدار 2

خدمة متعددة النماذج / متعددة المستأجرين

  • الاستدلال المتوازي للموتر ذو 8 اتجاهات لـ 200-250 مليار MoE في الربع الرابع (Qwen3-235B، GLM-4.5/4.6/4.7)
  • خدمة بث 8 مسارات معزولة للمستأجر - نموذج Q4 واحد بسعة 24 جيجابايت لكل بطاقة (على سبيل المثال 8 وكلاء Qwen3-14B)
  • معالجة دفعية كبيرة 70 بايت — vLLM / SGLang متوازية الموترات، تجميع دفعي 64
  • أسطول مختلط: 235B MoE على 4 بطاقات (TP4) + FLUX + فيديو + صوت في الوقت الفعلي على البطاقات الأربع المتبقية
  • مختبر الضبط الدقيق — 7-34 بايت LoRA / QLoRA مع دفعة كبيرة

أحمال العمل المستهدفة

  • استدلال متوازي باستخدام 8 وحدات معالجة رسومية في مجموعة 192 جيجابايت - Qwen3-235B Q4، GLM-4.5/4.6/4.7 Q4، Llama 4 Scout bf16
  • Dense 70B bf16 (Llama 3.3 70B) مع نطاق KV هائل لـ ctx طويل ودفعة عالية
  • بوابة استدلال دفعي عالية الإنتاجية — vLLM / SGLang متوازية الموترات في دفعات كبيرة
  • ضبط دقيق لنماذج الفئة 7-34B باستخدام تقنية LoRA / QLoRA عالية الدفعات
  • Wan 2.2 dual-expert / HunyuanImage-3.0 / FLUX.1 استوديو فيديو-صور متكامل

الأداء المقاس

اختبار كينتينو (مرجعي لأربع وحدات معالجة رسومية) | 10-04-2026 | 4x RTX 4090 + EPYC 7542 + 512 جيجابايت DDR4 + ROMED8-2T

مؤشر نتيجة
حساب مستدام (fp16، مرجع 4 بطاقات) 647 TFLOPS
vLLM — Llama 3.3 70B AWQ INT4 (مفرد) 8.0 توك/ثانية
vLLM — Llama 3.3 70B AWQ INT4 (الدفعة-32) إجمالي 179 توكو/ثانية
llama.cpp — اللاما 3.3 70B Q4_K_M (مفرد) فك تشفير 20.3 توكوفيرول/ثانية
حساب إجمالي باستخدام 8 وحدات معالجة رسومية (استقراء) ~1294 تيرافلوب fp16 متوقع (خطي تقريبًا)
235B Q4 tensor-parallel 8-way (community) معدل نقل البيانات من 15 إلى 25 توكا/ثانية في بث واحد على 8 بطاقات رسومات RTX 4090

تم قياس بيانات أربع بطاقات رسومات على أجهزة كينتينو. أما بيانات ثماني وحدات معالجة الرسومات فهي بيانات مرجعية خارجية منشورة. ستنشر كينتينو أرقامها الخاصة بثمانية وحدات معالجة رسومات بعد أول إصدار للعميل.

ليست مثالية لـ

  • أحمال العمل من الجيل 5090 (معالج Blackwell fp8 أصلي + معدل أداء أعلى) - انظر Kentino AI 256 TurinDual 5090
  • التدريب من الصفر (لا يوجد NVLink على بطاقة RTX 4090 المخصصة للمستهلكين)
  • إنتاج حساس لتقنية تصحيح الأخطاء (ECC) على مدار الساعة طوال أيام الأسبوع — بطاقة RTX 4090 المخصصة للمستهلكين لا تحتوي على تقنية ECC؛ يُفضل استخدام 4x L40 أو 2x RTX Pro 6000 Server Edition
  • Hunyuan / DeepSeek fp8 native — RTX 4090 is Ada, fp8 checkpoints upcast to bf16

الضمان ومدة التسليم

2 سنة
ضمان قطع الغيار
عام واحد
ضمان العمل
10-28 أيام
المهلة

تتضمن عملية التجميع، وتكوين BIOS مع ضبط NUMA ثنائي المقبس، وتثبيت برامج التشغيل، واختبار الأداء، واختبار الذاكرة، واختبار إجهاد كامل لثماني وحدات معالجة رسومية، وإعداد بيئة LLM. يعتمد وقت التسليم على توفر المكونات، ويتم تأكيده عند الطلب.

الإضافات الموصى بها

  • 4 تيرابايت إضافية من نوع NVMe لتخزين البيانات على مراحل وتفريغ أحمال العمل.
  • NVIDIA ConnectX-5 100 GbE لخدمة العقد المتعددة
  • ترقية ذاكرة الوصول العشوائي إلى 1 تيرابايت (16 × 64 جيجابايت) أو 2 تيرابايت (32 × 64 جيجابايت) - تدعم اللوحة 32 فتحة DIMM
  • خزانة رف كاملة 24U + وحدة تزويد طاقة غير منقطعة (UPS) متصلة بالإنترنت 5 كيلو فولت أمبير

الأسئلة التي يطرحها المشترون علينا في أغلب الأحيان قبل طلب خادم.

كم تستغرق عملية الرسم؟

تُشحن الأجهزة المُصنّعة من مكونات متوفرة لدينا بسرعة؛ أما الأجهزة التي تتطلب جيلاً مُحدداً من وحدات معالجة الرسومات (GPU) فيعتمد توفرها على ذلك. نُحدد لك موعداً قبل الدفع، وإذا طرأ أي تغيير، نُبلغك بذلك بدلاً من تركك تكتشف الأمر بنفسك.

هل يمكن تغيير الإعدادات قبل بنائها؟

في أغلب الأحيان. يتم اختيار وحدات معالجة الرسومات والذاكرة والتخزين والتبريد لكل طلب على حدة، والتكوين المذكور هو نقطة انطلاق وليس حزمة ثابتة. إذا كنت بحاجة إلى ذاكرة وصول عشوائي للفيديو أكبر، أو تخزين أسرع، أو نظام تبريد مختلف، فأخبرنا بذلك قبل الطلب وسنقدم لك عرض سعر للتغيير.

هل يمكنني استلام الخادم شخصياً؟

نعم، يمكنك ذلك. يقع مستودعنا في براغ، ونرحب باستلام الطلبات شخصيًا - حيث يستغل معظم الزوار هذه الزيارة لشرح الجهاز لمهندسنا وطرح الأسئلة التي يصعب طرحها عبر البريد الإلكتروني. أما بالنسبة للطلبات داخل جمهورية التشيك، فنحن نسعى جاهدين لتوصيلها شخصيًا وشرح كيفية تركيبها في الموقع.

هل يمكنني التحدث إلى شخص يفهم بالفعل حجم العمل؟

نعم. لدينا مهندس متخصص في أنظمة الذكاء الاصطناعي تحديدًا، وليس موظف مبيعات عام. إذا كان سؤالك يتعلق بأحجام الدُفعات، أو التكميم، أو الربط البيني، أو أين ستكون نقطة الاختناق، فلا تتردد في طرحه - فغالبًا ما تُحسّن هذه المحادثة من إعدادات النظام.

ما هو النموذج الذي يمكنني تشغيله على هذا التكوين؟

نعم. يتم تجميع كل جهاز، واختباره عمليًا، وتقييم أدائه على أحمال عمل حقيقية للذكاء الاصطناعي قبل شحنه، وبذلك نحصل على نظام إدارة التعلم (LLM) مثبت وجاهز للعمل. ما عليك سوى توصيله بالكهرباء، وربطه بشبكتك، والبدء بالعمل - القرار الوحيد المتبقي هو أي مشروع سيتم تشغيله أولًا.

كيف يتم اختبار الخادم قبل شحنه؟

نُجري الاختبارات على أحمال عمل الذكاء الاصطناعي الفعلية بدلاً من النتائج الاصطناعية: معدل نقل البيانات، وسلوك الحمل المستمر، ودرجة الحرارة أثناء التشغيل المتواصل. ستحصل على نتائج الاختبار المعياري مع الجهاز، لذا فإن الأداء الذي وُعدت به هو الأداء الذي يمكنك التحقق منه من اليوم الأول.

هل الخادم جاهز للتشغيل عند وصوله؟

نعم. يتم تجميع كل جهاز، واختباره عمليًا، وتقييم أدائه على أحمال عمل حقيقية للذكاء الاصطناعي قبل شحنه، وبذلك نحصل على نظام إدارة التعلم (LLM) مثبت وجاهز للعمل. ما عليك سوى توصيله بالكهرباء، وربطه بشبكتك، والبدء بالعمل - القرار الوحيد المتبقي هو أي مشروع سيتم تشغيله أولًا.

يتم الشحن من مستودعنا في الاتحاد الأوروبي. قد تتطلب المنتجات الثقيلة ترتيبات شحن خاصة - تواصلوا معنا للحصول على عرض سعر للشحن ومدة التوصيل. ضمان محدود لمدة عامين مع دعم متقدم لخدمة ما بعد الإرجاع؛ يتوفر ضمان ممتد.

أليس هذا ما تحتاجه بالضبط؟

أخبرنا عن حجم العمل الذي تقوم به وسنقوم بتحديد مواصفات هذه المنصة بناءً عليه - وحدات معالجة الرسومات والذاكرة والتخزين والتبريد التي تتناسب مع ما تقوم بتشغيله فعليًا.