اقتصاديات الاستدلال المستدام مقابل الاستدلال السريع: متى يكون الحل المحلي هو الأفضل، ومتى يكون الحل السحابي هو الحل الأمثل؟

يستهلك خادم الاستدلال ذو الأربع وحدات معالجة رسومية نفس كمية الكهرباء، ويشغل نفس مساحة الرف، ويتناقص سعره وفقًا لنفس الجدول الزمني، سواءً كان يخدم عشرين مليون رمز مميز يوميًا أو عشرين ألفًا. لا تعلم البطاقات أنها في وضع الخمول، لكن المحاسب يعلم. هذا التباين الوحيد - التكلفة الثابتة في البنية التحتية المحلية، والتكلفة الحدية في الحوسبة السحابية - هو السبب الرئيسي وراء اعتماد الإجابة الصحيحة على سؤال "هل يجب علينا الانتقال إلى البنية التحتية المحلية؟" على عوامل أخرى. شكل نسبة حركة المرور الخاصة بك تعتمد على الحجم.

T01 تم حساب تكلفة كل بطاقة عند نقطة استخدام واحدة. يوضح الجدول T02 تكلفة كل مليون رمز مميز مقابل واجهات برمجة التطبيقات السحابية عند أقصى حمل. هذه المقالة (T03) هي التي يحتاج مديرك المالي إلى قراءتها فعلاً: ما الذي يحدث لهذه الأرقام عندما يكون حجم البيانات متقطعاً، وعندما يكون مستمراً، وكيفية تصميم نظام لا يُفرط في الإنفاق من أي جانب.

الجمهور المستهدف هو شخص قد استنتج بالفعل أن عبء العمل قد يكون مناسبًا للأنظمة المحلية، ويحتاج الآن إلى اتخاذ القرار. كم في الموقع، وما الذي ينقذ الباقي.

فخ التكاليف الثابتة

تتفاوت تكلفة الاستدلال السحابي تبعًا للاستخدام. تبلغ تكلفة مكالمة Llama 70B واحدة على موفر OpenRouter ما يقارب 0.50 إلى 2.00 يورو لكل مليون رمز مميز (يختلف السعر حسب المستوى والموفر). لا تدفع شيئًا إذا لم ترسل أي بيانات. إذا أرسلت عشرة أضعاف البيانات، ستدفع عشرة أضعاف. العلاقة خطية وتبدأ من الصفر.

الاستدلال المحلي هو عكس ذلك. صندوق بلاكويل مزود بأربع بطاقات رسومات RTX Pro 6000 (T01 يُقدّر إجمالي تكلفة الملكية على مدى ثلاث سنوات بحوالي 58 ألف يورو شاملةً جميع التكاليف (بما في ذلك النفقات الرأسمالية المستهلكة، والكهرباء، وحصة الهيكل، والصيانة). وتُقدّر هذه التكلفة سواءً خدمت مليون رمز أو تريليون رمز. التكلفة الحدية للرمز رقم 200 مليون في الشهر هي نفسها التكلفة الحدية للرمز الثاني: أي كمية الكهرباء بالكيلوواط/ساعة اللازمة لحسابه، لا غير. وتُعتبر النفقات الرأسمالية تكلفة ثابتة منذ يوم شحن الجهاز.

إن العواقب المحاسبية قاسية ونادراً ما يستوعبها المشترون:

الاستخدام المستدام الرموز المميزة المقدمة / 3 سنوات (Pro 6000، Llama 70B FP8 الدفعة 32) السعر الفعلي باليورو/المتوك
100% 45.4 B 0.32
60% 27.2 B 0.53
30% 13.6 B 1.07
10% 4.5 B 3.21
5% 2.3 B 6.42

(نفس الأجهزة، نفس التكلفة الإجمالية للملكية البالغة 14.4 ألف يورو لكل بطاقة على مدى ثلاث سنوات؛ فقط المقام يتغير.)

يتراوح سعر خدمة الحوسبة السحابية لمنصة Llama 70B FP8 في عام 2026 بين 0.50 و1.50 يورو لكل مليون توك، وذلك حسب مستوى مزود الخدمة. يرجى مراجعة الجدول مرة أخرى مع مراعاة ذلك. عند استخدام مستدام بنسبة 5%، يكون الجهاز الموجود في الموقع أغلى من كل خيار سحابي موجود. بنسبة 30%، تتساوى مع أغلى مقدمي الخدمات. أما بنسبة 60% فأكثر، فتتفوق عليهم من الناحية الحسابية.

يكمن الفخ في أن العملاء يقارنون النفقات الرأسمالية بالحمل الحالي، ثم يكتشفون بعد ستة أشهر أن الحمل الحالي كان يمثل 8% فقط من قدرة الجهاز. لم يكن هناك أي خلل في الأجهزة، بل في حجمها.

كيف يبدو الاستخدام الفعلي للإنتاج

لدينا بيانات عامة بالإضافة إلى بياناتنا الخاصة في جميع مواقع تركيب الذكاء الاصطناعي التي نديرها أو نزورها، والصورة متسقة في جميع أنحاء الصناعة في عام 2026:

فئة عبء العمل الاستخدام المستدام النموذجي ملاحظة
دردشة موجهة للعملاء / روبوت دردشة 10–25 ٪ حركة المرور النهارية، وتفريغ السيارات في عطلة نهاية الأسبوع، ونصف يوم من الخمول
مساعد الترميز الداخلي 15–30 ٪ أمطار غزيرة من الساعة 09:00 صباحًا حتى 18:00 مساءً، وهطول أمطار تقارب الصفر طوال الليل
سير عمل استخدام الوكيل / الأداة 20–40 ٪ متقطع في كل جلسة؛ يعتمد على عدد الوكلاء
استرجاع RAG + LLM (بحث دلالي) 25–50 ٪ مستقر إلى حد ما، مدفوع بمعدل الاستعلام
المعالجة الدفعية (التصنيف التلقائي، التلخيص، استخراج المستندات) 60–90 ٪ يعتمد على نظام الطوابير، ويمكن تعديل وتيرته لملء السعة
التدريب المستمر / التحسين المستمر 90٪ + مثبت دائمًا؛ الحالة السهلة

أبرز الأرقام من عمليات النشر في بيئة الإنتاج واستطلاعات رأي المشغلين: معظم الفرق تقوم بتشغيل تقرير الاستدلال الخاص بها متوسط ​​استخدام وحدة معالجة الرسومات 20-40%، مع اقتراب الإعدادات الناضجة من 40–65 ٪أي نسبة تشغيل مستدامة تتجاوز 65% تعني إما أنها معالجة دفعية بحتة أو أن مجموعة الخوادم تعمل بكامل طاقتها لدرجة أن ذروة حركة البيانات التالية ستتراكم في قائمة الانتظار. أما النسبة الأقل من 20% فتعني أن الجهاز يعمل في الغالب لتغطية تكاليفه، وليس لخدمة المستخدمين.

الرقم الذي يُفاجئ المشترين دائمًا: التفاعلية لا يتجاوز عبء العمل - سواءً كان روبوت محادثة، أو مساعد برمجة، أو روبوت دعم عملاء - 30% تقريبًا. والسبب هو ساعات النهار. فحتى المنتجات العالمية تمر بفترات انخفاض في ساعات العمل، بينما تتمتع المنتجات الإقليمية بـ 14 ساعة من انخفاض الحمل يوميًا. وهذا يُظهر بوضوح مدى تأثير ذلك على الحسابات.

أعباء العمل المستدامة - أساس العمل

تُعدّ اقتصاديات التثبيت المحلي فعّالة للغاية لأي عبء عمل يُمكن فيه تشغيل وحدات معالجة الرسومات (GPUs) معظم ساعات اليوم. وفيما يلي ترتيب تقريبي لمدى شيوع استخدامها في عمليات تثبيت K-AI:

  • مساعد البرمجة / الواجهة الخلفية لبيئة التطوير المتكاملة لفريق يضم أكثر من 30 مهندساً. حمولة عمل ثابتة خلال أيام الأسبوع من الساعة 09:00 صباحاً حتى 18:00 مساءً، وأوقات مسائية أخف، وعطلات نهاية أسبوع شبه معدومة. متوسط ​​زيادة في العمل يتراوح بين 20 و30% على مدار الأسبوع، ويبلغ ذروته بين 60 و80% خلال ساعات العمل.
  • روبوت دردشة لدعم العملاء / المبيعات مع حركة مرور على مدار الساعة. يتبع النمط اليومي المنطقة التي يتم خدمتها؛ حيث تصل المنتجات العالمية بنسبة 25-35% بشكل مستدام، والمنتجات الإقليمية بنسبة 15-25%.
  • نظام البحث الدلالي RAG فهرسة قاعدة المعرفة الداخلية وتقديمها. معدل الاستعلامات ثابت إلى حد ما؛ إعادة الفهرسة مهمة مجدولة تُجرى ليلاً وتستهلك 95% من موارد النظام. معدل الاستخدام الإجمالي يتراوح بين 30 و50%.
  • تجهيز الدفعات - تلخيص وثائق الأمس خلال الليل، وعمليات تصنيف تلقائي أسبوعية، وإعادة تصنيف شهرية لمجموعة بيانات. عمل قائم على قائمة الانتظار فقط، بنسبة استخدام تتراوح بين 70 و90% طالما أن قائمة الانتظار غير فارغة، ومصمم للعمل حتى الاكتمال.
  • استنتاج أسطول الروبوتات — وحدات متعددة تسحب البيانات من نفس نقطة نهاية VLM خلال ساعات التشغيل، وهي في وضع الخمول بالخارج (I01, I06).

النمط هو أن أحمال العمل المستمرة إما تمتد عبر مناطق زمنية كافية لملء اليوم، أو تحتوي على مكونات دفعية تملأ الفجوات عمداً. تُعد تقنية "سد الثغرات" أهم أداة يمكن للعميل استخدامها لخفض التكلفة الإجمالية للملكية، وهي الأداة الأكثر تجاهلاً. جهاز يقوم بالدردشة التفاعلية لمدة 12 ساعة في اليوم بنسبة 30٪ ويقوم بتشغيل وضع العلامات التلقائي طوال الليل بنسبة 90٪ يحقق متوسطًا يبلغ حوالي 60٪ - أي ضعف الاستخدام الفعلي، ونصف تكلفة الرمز المميز.

أحمال العمل المفاجئة - حيث تتضرر البنية التحتية المحلية

أما الشكل المقابل فهو عبء عمل يتطلب سعة هائلة لفترة قصيرة، ولا يحتاج إلى أي سعة تقريبًا في بقية الوقت. ومن الأمثلة التي نراها بانتظام:

  • حملة تسويقية / حملة لإنتاج المحتوى. قم بإنشاء نسخ مختلفة لحملة إعلانية عبر N سوقًا في غضون 48 ساعة، ثم لا شيء لمدة شهر.
  • لحظات المحتوى الفيروسي. تطبيق للمستهلكين يطلق ميزة جديدة، ويتم عرضه في نشرة إخبارية تقنية، ويرتفع عدد الزيارات بمقدار 50 ضعف المعدل الطبيعي لمدة ست ساعات، ثم يعود إلى مستواه الطبيعي بحلول صباح اليوم التالي.
  • فعاليات تجريبية/توضيحية. جناح في معرض تجاري يعرض عروضًا توضيحية مباشرة للاستدلال لمدة ثلاثة أيام، ثم يعود إلى الصفر.
  • مهام الدفعات الدورية التي يجب أن تنتهي خلال فترة زمنية محددة. إجراء فحص امتثال شهري لمجموعة كاملة من المستندات التي يجب إكمالها بحلول الموعد النهائي التنظيمي.
  • تحليلات ليلة الانتخابات أو الأحداث المباشرة — فترة تتراوح بين 12 و 48 ساعة يكون فيها الحجم 100 ضعف الحجم الطبيعي.

مثال عملي: يتطلب عبء العمل توليد 10 ملايين رمز. عند توزيعها على مدار 24 ساعة، يبلغ معدل توليدها الإجمالي حوالي 116 رمزًا في الثانية - ويمكن لخادم L4 واحد معالجتها. أما عند ضغطها في ساعة واحدة، فيبلغ معدل توليدها 2,778 رمزًا في الثانية - مما يتطلب تشغيل جهاز Pro 6000 بأربعة معالجات رسوميات بكامل طاقته، أو ما يعادل ستة خوادم L4 تقريبًا.

لذا فإن نفس الـ 10 ملايين رمز تتطلب إما بطاقة واحدة على مدار الساعة طوال أيام الأسبوع أو ست بطاقات لمدة ساعة واحدة. بالنسبة لأحمال العمل المفاجئة، تبقى سعة التخزين المحلية خاملة لمدة 23 ساعة من كل 24 ساعة. تنهار حسابات التكلفة الإجمالية للملكية: فصندوق البطاقات الست، عند استخدام 4% فقط، يكلف ما بين 13 و25 يورو لكل مليون توكو، وفقًا لما هو موضح في الجدول أعلاه. بينما توفر خدمة الحوسبة السحابية، بسعر 1.50 يورو لكل مليون توكو، نفس الحمل مقابل 15 يورو فقط. وبالتالي، فإن نقطة التعادل بعيدة كل البعد عن ذلك.

النتيجة الحتمية: إن محاولة تحديد حجم البنية التحتية المحلية لتلبية ذروة الاستخدام هي أكثر أخطاء الإنفاق الزائد شيوعًا التي نراها. يرغب العملاء في أن يغطي الجهاز أسوأ سيناريو لعطلة نهاية الأسبوع، لذا يشترون أربعة أضعاف وحدات معالجة الرسومات التي يحتاجونها في أسبوع عادي. تصل الفاتورة على شكل نفقات رأسمالية لا يمكنهم استردادها، بالإضافة إلى أسطول معطل بنسبة 90%.

النمط الهجين

إن البنية الصحيحة لأحمال العمل الإنتاجية الحقيقية بكلا الشكلين هي خط الأساس المحلي بالإضافة إلى تجاوز سعة السحابة.

طبقة التوجيه / LB
يوجه جميع الطلبات. الأولوية للخوادم المحلية؛ والخوادم السحابية فقط عندما يتجاوز عمق قائمة الانتظار المحلية الحد المسموح به.
ابتدائي
إدارة القانون الافتراضي المحلية
مصمم لاستيعاب حمولة بنسبة 70% تقريبًا. يعمل بنسبة استخدام مستهدفة تتراوح بين 50 و70%. جميع حركة المرور العادية تمر عبره.
طبقة التوجيه / LB
عمق قائمة الانتظار > N؟
الفائض فقط
واجهة برمجة تطبيقات السحابة الاحتياطية
يتم احتساب الرسوم على أساس كل رمز مميز. يُستخدم فقط في حالات الارتفاع المفاجئ في الأسعار.

التوجيه الهجين: التوجيه المحلي أولاً، ثم التوجيه السحابي فقط عندما يتجاوز عمق قائمة الانتظار الحد المكوّن.

منطق التوجيه الصحيح هو لست "أرسل نسبة X% إلى السحابة، والباقي إلى الخوادم المحلية." هذا هو الأولوية للأنظمة المحلية، والسحابة فقط عندما تكون الأنظمة المحلية ممتلئة.الإشارة هي عمق قائمة الانتظار أو استخدام ذاكرة التخزين المؤقت KV على جانب vLLM (كيه03 (يغطي المقاييس)، وليس تقسيمًا ثابتًا.

وصفة عملية باستخدام vLLM:

  1. قم بتوصيل مجموعة الخوادم المحلية بجهاز توجيه يعرض /v1/chat/completions. NGINX، HAProxy، vLLM Router، أو بوابة مخصصة صغيرة كلها تعمل.
  2. تعرض vllm:num_requests_waiting كمقياس لعمق قائمة الانتظار. يتم تحديد عتبة، على سبيل المثال، من 8 إلى 16 انتظارًا لكل نسخة قبل بدء التشغيل الاحتياطي.
  3. في حالة تجاوز سعة الخادم، يتم توجيه المستخدم إلى نقطة نهاية سحابية تحمل نفس اسم النموذج. تدعم كل من OpenRouter وTogether وFireworks نماذج من فئة Llama. ثبّت أحدها كخادم أساسي والآخر كخادم احتياطي لتجنب انقطاع الخدمة مع مزود واحد.
  4. قم بتصنيف طلبات تجاوز سعة النظام في نظام المراقبة لديك لتتمكن من معرفة النسبة المئوية التي يتم إنفاقها يوميًا. إذا كانت النسبة أعلى من 15% في معظم الأيام، فإن مواردك المحلية غير كافية؛ أما إذا كانت أقل من 1% لأسابيع، فإن مواردك المحلية زائدة.

المنطق الاقتصادي: دفع النفقات الرأسمالية مرة واحدة مقابل الحمل الذي هو دائما هناكادفع رسومًا متغيرة للحوسبة السحابية عند ذروة الاستخدام. عند تطبيق ذلك بشكل صحيح، يصل الاستخدام الفعال للخادم المحلي إلى 50-70% (يتم ضبط عتبة التوجيه بناءً على ذلك) مع الحفاظ على التزامات زمن الاستجابة المنخفضة سليمة أثناء فترات الذروة.

بدء التشغيل البارد: واقع التوسع التلقائي

الحل الساذج المُعتمد على الحوسبة السحابية لمشكلة الأحمال المفاجئة هو "التوسع التلقائي لمجموعة الخوادم المحلية" - أي إبقاء عدد النسخ الاحتياطية عند الصفر في حالة الخمول، وتفعيلها عند الطلب. لكن هذا الحل يُسبب مشاكل كبيرة لخدمة إدارة دورة حياة التطبيقات (LLM) لسبب واحد: وقت تحميل النموذج.

تحميل ملف Llama 70B FP8 (حوالي 75 جيجابايت من الأوزان) من محرك أقراص NVMe من الجيل الخامس يستغرق 30-60 ثانية من الإدخال/الإخراج النقي بسرعة قراءة نظرية تتراوح بين 12 و14 جيجابايت/ثانية. أضف إلى ذلك تجميع نواة CUDA، وتهيئة مُجدول vLLM، وتخصيص ذاكرة التخزين المؤقت KV مسبقًا، وستكون النسخة المتماثلة الجديدة جاهزة لتلقي أول طلب لها. بعد 60-120 ثانية من بدء تشغيل الكبسولةتساعد النماذج الأصغر حجماً بشكل نسبي - حيث يمكن وضع 8B في 5-10 ثوانٍ - ولكن أي شيء يزيد عن 30B يقع في نطاق "سينتهي وقت المستخدمين".

بالنسبة لأحمال العمل الدفعية، هذا مقبول. أما بالنسبة لأحمال العمل التفاعلية، فهو كارثي. يُعدّ تأخير دقيقتين في الطلب الذي أدى إلى حدث التوسع أمرًا غير مقبول.

إجراءات التخفيف، حسب ترتيب الجهد المبذول:

  • حافظ على دفء النسخ N دائمًا. الحد الأدنى الذي يتحمل حمولتك المتوسطة. الميزان up عند الطلب، أبداً حتى الصفرإن نمط الحد الأدنى الدافئ هو ما يبني عليه المشغلون الناضجون منتجاتهم بالكامل.
  • وضع السكون vLLM. تدعم الإصدارات الأحدث من vLLM حالة "السكون" حيث تبقى الأوزان في ذاكرة وحدة معالجة الرسومات، لكن المحرك يحرر موارد الحوسبة. أما الاستيقاظ فهو أسرع بـ 18-20 مرة من حمولة جديدةمفيد عندما يكون لديك نماذج متعددة تشترك في وحدات معالجة الرسومات ولكن يتم تشغيل نموذج واحد فقط في كل مرة.
  • ذاكرة التخزين المؤقت للنماذج المُسخّنة مسبقًا على NVMe / NFS المشترك. يتم سحب الأوزان مرة واحدة إلى ذاكرة تخزين مؤقت محلية سريعة، وتقوم جميع النسخ المتماثلة بتحميلها. يتم التحميل الأولي مرة واحدة عند بدء تشغيل المجموعة؛ أما النسخ المتماثلة اللاحقة فتبدأ العمل في غضون ثوانٍ.
  • التوسيع المجدول حسب وقت اليوم. زيادة حجم الموارد مسبقًا في الساعة 08:30 تحسبًا لحركة المرور في الساعة 09:00. هذا النمط هو الأبسط والأكثر فعالية لأحمال العمل اليومية المتوقعة. إعداد CronJobs kubectl scale إنها غير عصرية لكنها فعالة.
  • مشغل NVIDIA NIM مزود بمحركات TRT-LLM مدمجة مسبقًا. محركات مصممة مسبقًا، ومخزنة مؤقتًا على القرص، ويتم تحميلها عند الطلب. بدء تشغيل بارد أسرع من التجميع الجديد، ولكنه لا يزال في حدود عشرات الثواني لـ 70 بايت.

بالنسبة لقاعدة عملاء K-AI - أساطيل صغيرة وأنماط استخدام يمكن التنبؤ بها - فإن الإجابة الصحيحة هي دائمًا تقريبًا عدد النسخ المتماثلة الدافئة + التوسع المجدول + تجاوز سعة السحابة. يُستخدم مصطلح "التوسع إلى الصفر" في المنصات التي لا تعتمد على الخوادم، حيث يتحمل شخص آخر عبء بدء التشغيل البارد.

التوسيع التلقائي: يعتمد التوسيع التلقائي عالي الأداء على ماذا؟

تعتمد خاصية HPA في Kubernetes افتراضياً على مقاييس وحدة المعالجة المركزية والذاكرة. كلاهما خاطئ بالنسبة للاستدلال باستخدام وحدة معالجة الرسومات. قد تصل نسبة استهلاك وحدة المعالجة المركزية في حاوية vLLM إلى 5% مع تحميل زائد بنسبة 100%، أو قد تصل إلى 95% مع استمرار عملها بشكل جيد. المقياس الذي تحتاجه فعليًا هو أحد المقياسين التاليين:

متري ما يقيس استخدم عندما
vllm:num_requests_waiting عمق قائمة الانتظار (الطلبات التي لم يتم جدولتها بعد) أحمال العمل التفاعلية الحساسة للتأخير
vllm:gpu_cache_usage_perc استخدام ذاكرة التخزين المؤقت KV عبر وحدات معالجة الرسومات إعدادات السياق الطويل أو الإعدادات المتزامنة المتعددة
vllm:num_requests_running الطلبات النشطة لكل نسخة توسيع نطاق تشبع الإنتاجية
request_rate_per_replica عدد الطلبات في الثانية لكل نسخة (حسابات بروميثيوس) أحمال العمل ذات المعدل الثابت
مخصص: تراكم الرموز المميزة في الثانية عدد الرموز المميزة في قائمة الانتظار × وقت فك التشفير المقدر أحمال عمل الطلبات ذات الأطوال المختلطة

الأداة المناسبة لربط هذا بـ Kubernetes هي كيدا (التوسع التلقائي القائم على الأحداث في Kubernetes)، والذي يمكنه استهلاك استعلامات Prometheus مباشرةً وتغذيتها إلى HPA. توفر حزمة vLLM الإنتاجية تكاملاً ممتازاً مع KEDA، ويعمل النمط نفسه مع KServe على OpenShift AI.

كائن ScaledObject يعمل على تغيير حجم قائمة الانتظار:

apiVersion: keda.sh/v1alpha1
kind: ScaledObject
metadata:
  name: vllm-llama70b
spec:
  scaleTargetRef:
    name: vllm-llama70b
  minReplicaCount: 2     # always-warm floor
  maxReplicaCount: 6     # cap before cloud overflow
  pollingInterval: 15
  cooldownPeriod: 300    # don't thrash on noisy queue
  triggers:
  - type: prometheus
    metadata:
      serverAddress: http://prometheus:9090
      query: avg(vllm:num_requests_waiting)
      threshold: '5'     # avg 5 waiting per replica → scale up

درسين في الإنتاج تعلمناهما من خلال التجربة والخطأ:

  1. cooldownPeriod الأمر لا يقل أهمية عن المحفز. يؤدي الازدحام في قائمة الانتظار إلى تقلبات حادة في عمليات التوسع والتقليص، وكل عملية توسع تُكلف وقت بدء التشغيل البارد. 5 دقائق هي الحد الأدنى المعقول.
  2. minReplicaCount ينبغي تحديد حجمها بناءً على الحوض، وليس الصفر. الوحدتان اللتان كانتا في وضع الخمول عند الساعة 03:00 هما الوحدتان اللتان تعاملتا مع ذروة الساعة 09:00 دون انتهاء المهلة.

المقياس الأفقي مقابل المقياس الرأسي

خيار معماري دقيق عند تحديد الحجم: هل تشتري صناديق إضافية (أفقيًا) أو عدد أكبر من وحدات معالجة الرسومات لكل صندوق (رَأسِيّ)؟

محور أفقيًا: صندوقان يحتوي كل منهما على 4 وحدات معالجة رسومات عمودي: صندوق واحد يحتوي على 8 وحدات معالجة رسومات
الإنفاق الرأسمالي أعلى (الهيكل × 2) الجزء السفلي (هيكل واحد)
نصف قطر انفجار الفشل نصف الأسطول كله
خطوة التوسع صندوق واحد في كل مرة وحدة معالجة رسومية واحدة في كل مرة (داخل الصندوق)
توسيع نطاق TP TP=4 كحد أقصى لكل عقدة TP=8 ممكن (مع ضريبة PCIe - انظر كيه03 )
الدائرة الكهربائية دائرتان كهربائيتان ثلاثيتا الأطوار بقدرة 16 أمبير دائرة كهربائية ثلاثية الأطوار 32 أمبير
أفضل ل خدمة حساسة للتأخير مع عزل النسخ المتماثلة التدريب المكثف على نموذج واحد أو الاستدلال على فئة 405B

بالنسبة لأحمال عمل الاستدلال ذات حركة المرور المتقطعة، يفوز الوضع الأفقي في أغلب الأحيان. يمكن تشغيل جهازين مزودين بأربع وحدات معالجة رسومية كأربع نسخ متماثلة (DP=2)، مع تحمل أحدهما ضغطًا إضافيًا دون انقطاع الخدمة، مما يسمح بتوسيع السعة بمقدار النصف بدلًا من الوحدات الكاملة. يُعدّ هذا الخيار الأمثل للتدريب وللاستدلال على نماذج أحادية ضخمة جدًا حيث تتطلب معالجة البيانات وجود وحدات المعالجة الرسومية في نطاق كهربائي واحد.

الفخ النفسي "وحدة معالجة الرسومات خاملة لكنني أدفع ثمنها"

غالباً ما يقوم العملاء الذين يزورون موقع التثبيت لأول مرة بفتح لوحة تحكم Grafana، ويرون أن استخدام وحدة معالجة الرسومات يبلغ 18% في الساعة 14:30 مساءً يوم الثلاثاء، ويتساءلون عن سبب دفعهم ثمن أجهزة لا تفعل شيئاً 80% من الوقت.

الجواب الصادق هو أنه بالنسبة لأي عبء عمل حساس للتأخير، بعض الخمول هو الثمن الذي تدفعه مقابل استجابة ذات زمن استجابة منخفض. الجهاز الذي يعمل بنسبة 95% من طاقته الاستيعابية يحتوي على قائمة انتظار. قائمة الانتظار تعني زمن استجابة للطلبات. العميل الذي يريد زمن استجابة 300 مللي ثانية للحصول على أول رمز مميز لا يحصل على نسبة استخدام 95% على نفس الجهاز. اختر أحد الخيارين.

المقايضة التي علبة يتم تحسينه نقل العمل الثابت إلى النوافذ الخاملة:

  • يتم جدولة مهام الدفعات (التصنيف التلقائي، واستخراج المستندات، وإنشاء التضمين للمحتوى الجديد) طوال الليل عندما يكون برنامج الدردشة الآلي هادئًا.
  • تُجرى عمليات الضبط الدقيق في عطلات نهاية الأسبوع عندما لا يكون هناك مستخدمون متصلون بالإنترنت.
  • إعادة فهرسة دورية لمخازن المتجهات خلال ساعات الصباح الباكر.

هذا هو الانضباط في التعامل مع الجهاز الموجود في الموقع كـ أصل ذو غرض مزدوجخدمة تفاعلية حساسة للتأخير خلال النهار، ومعالجة دفعية ليلاً. عند التنفيذ الأمثل، يُظهر نفس الجهاز الذي يُسجل 25% من الاستخدام على لوحة التحكم التفاعلية، 65% من الاستخدام على لوحة تحكم جميع أحمال العمل. ويرى المدير المالي النسبة الأخيرة.

ما هي تفاصيل لست الحل: زيادة معدل الطلبات بشكل مصطنع لإظهار انشغال النظام. يلجأ العملاء أحيانًا إلى هذا الحل. لكنه يزيد من تأخير الاستجابة، ويجعل المراقبة عديمة الجدوى، ولا يؤثر على الفاتورة.

مصفوفة القرار

يُحدد شكل عبء العمل، أكثر من حجمه، البنية المناسبة. حدد وضعك في الصف الأقرب:

شكل عبء العمل الرموز الشهرية مزيج المنصات الموصى بها
تفاعلي مستدام، يومي متوقع <100 م واجهات برمجة التطبيقات السحابية فقط؛ لن يتم استرداد التكاليف في البنية التحتية المحلية
تفاعلي مستدام، يومي متوقع 100 م – 1 ب صندوق L40 / 5090 واحد بأربعة معالجات رسوميات، أساسي فقط؛ تجاوز سعة السحابة
تفاعلي مستدام، يومي متوقع 1 ب – 10 ب صندوق Pro 6000 BW رباعي وحدات معالجة الرسومات يعمل بنسبة استخدام تتراوح بين 50 و70%؛ تجاوز سعة التخزين السحابي أعلى من ذلك
تفاعل مستمر، حركة مرور عالية على مدار الساعة طوال أيام الأسبوع > 10 ب صندوق Pro 6000 بثمانية معالجات رسوميات، وربما اثنين؛ مصمم ليناسب النسبة المئوية السبعين بالإضافة إلى فائض.
يهيمن عليها نظام الدفعات، وتعتمد على وتيرة قائمة الانتظار أي وقت الحل الأمثل هو الحلول المحلية؛ حجم البيانات بناءً على الحجم الإجمالي / 30 يومًا × عامل الأمان
اندفاع متواصل، أقل من 6 ساعات شهريًا أي وقت خدمة سحابية فقط؛ لا تشتري أجهزة
انفجار هجين فوق خط أساس مستدام أي وقت البنية التحتية المحلية كخط أساسي عند هدف استخدام 60%؛ فائض الحوسبة السحابية
خاضع للتنظيم / لا يمكن مغادرة البيانات أي وقت التواجد في الموقع إلزامي؛ حدد الحجم بدقة وفقًا لأوقات الذروة، واقبل انخفاض معدل الاستخدام.

هناك أمران تُصيب فيهما هذه المصفوفة بينما يُخطئ فيهما التخطيط المخصص:

  • أحمال العمل ذات التدفقات المفاجئة فقط تناسب الحوسبة السحابية. شراء أجهزة لحجم عمل لا يتجاوز أربع ساعات شهرياً هو سوء ممارسة.
  • إن الهجين "المستدام + الانفجاري" يحتاج دائمًا تقريبًا إلى كليهما. محاولة اختيار أحدهما أو الآخر عادة ما تؤدي إلى اختيار خاطئ.

الرأي الصريح

ينبغي على معظم عملاء كينتينو التخطيط لـ نسبة استخدام مستدامة تتراوح بين 30 و50% في الأنظمة المحلية واستخدم فائض الحوسبة السحابية لكل ما يزيد عن ذلك. العملاء الذين يصل استخدامهم للموارد المحلية إلى 60-80% هم من يُشغّلون عمليات معالجة الدفعات جنبًا إلى جنب مع العمليات التفاعلية - مثل وضع العلامات التلقائية ليلًا، والضبط الدقيق في عطلات نهاية الأسبوع، وتضمين عمليات التوليد في ساعات الذروة. أما العملاء الذين تتراوح نسبة استخدامهم بين 10-15% فهم من قاموا بتصميم خوادمهم لتلبية احتياجات أوقات الذروة.

أكثر الأخطاء تكلفةً هو شراء حلول تحسبًا لأسوأ سيناريو بعد ظهر يوم الثلاثاء. ثاني أكثرها تكلفةً هو الاعتماد الكامل على الحوسبة السحابية في حين أن الأحمال المستدامة ستغطي التكاليف الرأسمالية خلال 14 شهرًا. الحل الأمثل غالبًا ما يكون وسطًا: خادم محلي أصغر من المواصفات التي حددها العميل في البداية، مع توفير مسار تخزين سحابي إضافي لاستيعاب الزيادات المفاجئة في الطلب.

راجع الحسابات: بافتراض أسعار سحابية تبلغ 0.50 يورو/ميغا توكا، وتكلفة جهاز Pro 6000 رباعي المعالجات الرسومية 58 ألف يورو على مدى 3 سنوات، فإن الجهاز يُغطي تكلفته عند خدمة حوالي 14 مليار توكا. وبتوزيع متساوٍ، يُحقق هذا معدل 150 توكا/ثانية إجمالي مستدام - وهو معدل في متناول الجهاز عند استخدام 25-35% من طاقته. أقل من هذا الحجم، يُفضل استئجاره. وأكثر منه، يُفضل امتلاكه. وهذه هي نقطة التعادل نفسها. T01 و T02 الوصول من زوايا البطاقة والرمز.

ماذا تفعل بعد ذلك

فيما يخص عملية تخطيط القدرات لعملية نشر جديدة، اتبع الخطوات التالية بالترتيب:

  1. قم بقياس أو تقدير حجم الرموز المميزة الشهرية الخاصة بك خلال الأشهر الستة إلى الاثني عشر القادمة. لنكن صريحين؛ عادةً ما تكون توقعات النمو مبالغًا فيها بمقدار ضعفين إلى ثلاثة أضعاف.
  2. ارسم توزيع معدل الرموز بالساعة. ليس المتوسط، بل النسبة المئوية الخمسين والخامسة والسبعين والخامسة والتسعين والتاسعة والتسعين من الأجور بالساعة خلال الثلاثين يومًا الماضية (أو أفضل تقدير لديك). يحدد الشكل كل ما يلي.
  3. حدد حجم الهدف المحلي. استهدف معالجة الساعات التي تتراوح بين 70 و80 بالمئة من الاستخدام في البنية التحتية المحلية؛ ودع الحوسبة السحابية تتولى معالجة الساعات التي تتراوح بين 20 و30 بالمئة الأعلى. هذا سيحقق لك استخدامًا فعالًا بنسبة 50-60%، وهو ما يُحقق النتائج المرجوة.
  4. تحديد أعمال الدفعات لملء الأحواض. التصنيف التلقائي، وتحديث المحتوى المضمن، والتلخيص، والضبط الدقيق - أي شيء يمكن جدولته في الساعة 03:00 صباحًا ولا يهم متى ينتهي. بدون ذلك، سيقتصر استخدامك الفعلي على المتوسط ​​التفاعلي.
  5. صمم مسار تجاوز السعة قبل شراء الأجهزة. اختر مزود الخدمة السحابية، واحصل على مفتاح API، واكتب منطق التوجيه. لا تُضفه لاحقًا كإجراء احترازي عند انتشار الإطلاق على نطاق واسع.
  6. اضبط الحد الأدنى للتحجيم التلقائي على "الحد الأدنى" لتجاوز بدء التشغيل البارد. يُعدّ وجود نسختين احتياطيتين دافئتين الوضع الافتراضي الآمن. يبلغ زمن استجابة بدء التشغيل البارد على طرازات الفئة 70B من 30 إلى 60 ثانية؛ لذا تحتاج إلى وحدات دافئة لامتصاص ذروة الطلب أثناء تحميل الوحدات الجديدة.
  7. قم بمراقبة الاستخدام الفعلي لليورو/الميتوك شهريًا، وليس استخدام وحدة معالجة الرسومات. إجمالي تكلفة الملكية ÷ عدد الرموز المميزة المُخدّمة. إذا ارتفع هذا الرقم بمرور الوقت، فهذا يعني أن حجم الصندوق غير كافٍ للنمو أو أن حجم العمل قد تغير؛ أما إذا ظل ثابتًا أو انخفض، فقد اخترت الحجم المناسب.

تتناول الدراسات اللاحقة في هذا المسار نفس الأرقام من زوايا مختلفة: اقتصاديات كل بطاقة في T01، مقارنة الرموز المميزة بين الأنظمة المحلية والسحابية T02أما جانب البنية التحتية فيعيش في كيه03 (التجميع والتوازي)، I04 (نطاق الطاقة والتبريد الذي لا يمكنك تجاوزه)، و I06 (أسطول متعدد الروبوتات يقوم بتشغيل حمل استدلال مستدام).

الجملة الوحيدة التي يجب تذكرها: قم بتحديد حجم النظام المحلي للأحمال الموجودة دائمًا، واستخدم السحابة للأحمال غير الموجودة. إن محاولة القيام بأي من العملين باستخدام الأداة الخاطئة هي ما يؤدي إلى تجاوز الميزانية.