لماذا تحتاج الروبوتات إلى حوسبة طرفية مخصصة

إنّ الروبوت البشري الذي يمشي يُعدّ مشكلة محلولة. أما الروبوت البشري الذي يفهم ما ينظر إليه، ويخطط لمهمة متعددة الخطوات، ويتذكر ما حدث قبل خمس دقائق، فليس كذلك. فالقدرة الحاسوبية اللازمة لسدّ هذه الفجوة لا تتسع لها الروبوت، والحوسبة السحابية ليست المكان المناسب لها. تُقدّم هذه المقالة دراسةً تقنيةً تُبيّن لماذا يُعدّ خادم الاستدلال المُخصّص في الموقع الحل الأمثل في عام 2026 لأيّ تطبيق روبوتي جادّ بما يكفي لأداء عملٍ مُفيد.

يشرح القسم I01 كيفية توصيل الروبوت والخادم معًا. هذا المقال يوضح سبب شراء الخادم من الأساس. إذا كنت لا تزال تتساءل عما إذا كان التثبيت المحلي مجديًا، فاقرأ هذا أولًا.

ميزانية زمن استجابة القرار

كل إجراء يقوم به الروبوت يقع ضمن إحدى أربع مستويات زمن استجابة. لكل مستوى حد زمني تفرضه فيزياء المهمة - إذا تم تجاوزه، فسيتعطل السلوك بطريقة محددة ومعروفة.

مستويات زمن الاستجابة - ميزانية القرار حسب طبقة التحكم
الطبقة الميزانية أمثلة ماذا سيحدث إذا أخطأت؟
التحكم التفاعلي <10 ms عزم الدوران المشترك، التوازن، تبديل المحرك، زر الإيقاف الطارئ يسقط الروبوت، ويتأرجح، ويتضرر.
الإدراك الانعكاسي 10 - 50 مللي ثانية اكتشاف العوائق، والاستجابة عند التلامس، والتتبع السريع الاصطدامات، والإمساك الفاشل، والأشياء المتساقطة
التخطيط المدروس 100 مللي ثانية - 1 ثانية "اختر الكأس الأحمر"، فهم المشهد، تأكيد الحوار فترات توقف محرجة، وتأخر في المحادثة، وانتقالات متقطعة بين المهام
التفكير الاستراتيجي 1 ثانية - متعدد الثواني خطط مهام متعددة الخطوات، واستعادة الأخطاء، وحوار مطول مقبول؛ يدرك المستخدم "التفكير"

هذه ليست عشوائية. إنها ناتجة عن عرض النطاق الترددي للحلقة المغلقة التي تقع داخلها.

يعمل التحكم التفاعلي بتردد يتراوح بين 500 هرتز و1 كيلوهرتز على مستوى المفصل، وذلك لأن ديناميكيات ساق بشرية بوزن 30 كيلوغرامًا تتطلب ذلك - عند 100 هرتز، يتردد الطرف وتختلف المشية. يرث الإدراك الانعكاسي معدلات إطارات الكاميرا (30-60 إطارًا في الثانية = 16-33 مللي ثانية لكل إطار) والنطاق الزمني للتلامس الجسدي (يؤدي ضغط الإصبع على جسم ما إلى إنهاء حدث التلامس في غضون 20-40 مللي ثانية). يتقيد التخطيط المدروس بتوقعات المحادثة البشرية (ثانية واحدة تبدو سريعة الاستجابة، وثانيتان تبدوان بطيئتين) وبزمن استجابة نموذج VLM الفعال. يُعد التفكير الاستراتيجي المستوى الوحيد الذي يتمتع بمرونة حقيقية، ولهذا السبب يرغب الجميع في دفع التخطيط إليه، لكنهم يواجهون صعوبات عندما لا يستطيع نموذج VLM الخاص بهم مواكبة ذلك.

هذا ليس رأي كينتينو. الميزانية ذات المستويات الأربعة هي التقسيم الذي تعتمده جميع أنظمة التحكم الروبوتية الموثوقة - مثل ROS 2 و Isaac و Drake و OCS2. ما يختلف هو نوع الأجهزة التي يتم وضعها خلف كل مستوى.

ما يمكن وما لا يمكن للحوسبة الموجودة على متن المركبة فعله

يحمل الروبوت البشري المُصمم لعام 2026 وحدة NVIDIA Jetson AGX Orin في صدارة مواصفاته، بذاكرة موحدة سعتها 64 جيجابايت، وقدرة معالجة تصل إلى 275 تيرابايت في الثانية (138 تيرابايت في الثانية)، واستهلاك طاقة قابل للتكوين من 15 إلى 60 واط. يُعدّ هذا إنجازًا رائعًا لوحدة مُدمجة، ولكنه لا يُلبي احتياجات الروبوتات الحديثة التي تعمل بنظام VLM.

قم بإجراء الحسابات على ثلاثة نماذج قد ترغب فعلاً في أن يستخدمها الروبوت البشري:

الحد الأقصى لسعة ذاكرة الفيديو المدمجة - مقارنة بين فئات الطرازات و Jetson AGX Orin بسعة 64 جيجابايت
الموديل بارامس الحد الأدنى من ذاكرة الوصول العشوائي للفيديو (أوزان الربع الرابع + عمليات التنشيط) على جهاز Orin AGX بسعة 64 جيجابايت؟
Qwen2.5-VL 7B (INT4) 7B ~5–7 جيجابايت نعم، حوالي 5-8 إطارات في الثانية
OpenVLA 7B (BF16) 7.5B ~ شنومك غيغابايت نعم، عند التردد INT4، حوالي 3-6 هرتز
إنفيديا كوزموس-ريزون 7 بي 7B ~6–8 جيجابايت INT4 نعم، بطيء
إسحاق GR00T N1.7 ~3 ب يوصى بـ 16 جيجابايت تقريبًا للاستدلال هامشي؛ يتطلب الضبط الدقيق مساحة 40 جيجابايت أو أكثر
Qwen2.5-VL 32B (INT4) 32B ~22–26 جيجابايت ضيق؛ قابل للاستخدام ولكنه بطيء
Qwen2.5-VL 72B (INT4) 72B أوزان تتراوح بين 45 و50 جيجابايت + 10 إلى 20 جيجابايت KV رقم سوف ينفد من الذاكرة في أي سياق حقيقي.
لاما-3.1 70B (INT4) 70B أوزان تتراوح بين 38 و45 جيجابايت + KV لا على أورين تحت الحمل

سيستضيف جهاز Orin AGX بسعة 64 جيجابايت وحدة معالجة رسومية من فئة 32 بايت بمعالج INT4، شريطة قبول الاستدلال البطيء، وعدم وجود معالجة دفعية حقيقية، وعدم وجود أحمال عمل متزامنة. ولن يستضيف وحدات المعالجة الرسومية من فئة 70 بايت، والتي تُعدّ الأحدث في مجال فهم المشاهد بحلول عام 2026، مثل Qwen2.5-VL 72B، ومتغيرات Cosmos الأكبر حجمًا، والنماذج الخاصة التي لا ينشر الموردون أوزانها. فالأوزان المجمعة، وذاكرة التخزين المؤقت للقيم والمفاتيح للسياق المرئي الطويل، وأي مساحة لنموذج ثانٍ، لا تتناسب مع هذا الجهاز.

هناك رقم ثانٍ يتم تجاهله: الطاقة. يفترض رقم 275 TOPS الخاص بجهاز Orin وضع MAX_N (60 واط). أي أن المنصة التي تعمل بالبطارية تستهلك 60 واط من طاقة المعالجة بالإضافة إلى 200-800 واط من حمل المحرك. يؤدي التشغيل المستمر في وضع MAX_N إلى تقليل وقت تشغيل الروبوت إلى النصف. عمليًا، يقضي Orin معظم وقته في وضع 30 واط، مما يقلل TOPS إلى النصف تقريبًا ويدفع الاستدلال، الذي كان محدودًا أصلًا، إلى مستوى "غير قابل للاستخدام".

الترجمة: تم تصميم وحدة Jetson المدمجة لتناسب مستويات الاستجابة والتفاعل. وهي غير مصممة لتكون مضيفًا لـ VLM. أي شخص يدّعي أن روبوته البشري "يشغل Qwen2.5-VL مدمجًا" إما أنه يستخدم طراز 3B أو 7B ويعتبره كافيًا، أو أنه يستخدم الطراز الأكبر بسرعة 0.5 إطار في الثانية ويعتبره عرضًا توضيحيًا. كلا الخيارين مناسب لحالات استخدام محددة، لكنهما ليسا مناسبين لإدراك الروبوتات العامة.

لماذا تُعدّ الحوسبة السحابية حلاً خاطئاً للروبوتات ذات الحلقة المغلقة؟

الاستدلال السحابي رخيص، وقابل للتوسع بسهولة، ولا يتطلب أي نفقات رأسمالية. بالنسبة للروبوت، فإنه يواجه أربع مشاكل، مرتبة تقريبًا حسب خطورتها.

1. الحد الأدنى لزمن استجابة الشبكة الواسعة (WAN). يصل زمن الاستجابة ذهابًا وإيابًا لمكالمة سحابية مُحسَّنة داخل الاتحاد الأوروبي إلى 15-40 مللي ثانية على الشبكة الواسعة نفسها، بالإضافة إلى 5-15 مللي ثانية من زمن استجابة بروتوكولات TLS/HTTP/موازن الأحمال، بالإضافة إلى زمن استنتاج النموذج، وزمن العودة. أما المكالمات عبر المحيط الأطلسي فتضيف 80-120 مللي ثانية من زمن الاستجابة ذهابًا وإيابًا. بالنسبة لاستعلام إدراكي تلقائي - "هل يوجد عائق أمامي؟" - فإن إضافة 30-50 مللي ثانية قبل بدء النموذج تُعد تجاوزًا للميزانية. قد يكون من الممكن التغاضي عن ذلك في التخطيط المُتعمَّد الذي يستغرق 200-500 مللي ثانية، ولكن كل حزمة بيانات مفقودة، وكل إعادة إرسال، وكل عملية تحويل فاشلة بين أبراج الاتصالات الخلوية، ترفع زمن الاستجابة إلى المستوى التالي.

٢. التذبذب. زمن الاستجابة (RTT) في شبكة WAN ليس ثابتًا، بل هو توزيع. الوسيط ٢٥ مللي ثانية، وذروة التذبذب (P99) ٢٥٠ مللي ثانية، وذروة التذبذب عند P99.9 عدة ثوانٍ. لا يمكن لروبوت يعمل في بيئة حقيقية أن يتحمل توقفًا لعدة ثوانٍ بسبب تقلب مسار BGP. أما في شبكة LAN المحلية، فذروة التذبذب عند P99.9 تتراوح بين ١ و ٢ مللي ثانية.

3. التكلفة عند التحميل المستمر. تكلفة عملية استدلال VLM واحدة بحجم 70 مليار نقطة بيانات لمزود الخدمة السحابية شبه معدومة، إذ لا تتجاوز بضعة سنتات. يقوم الروبوت الذي يعمل باستمرار بإجراء استدعاء VLM واحد كل 100-500 مللي ثانية أثناء نشاطه. أي ما يعادل 7,000-36,000 استدعاء في الساعة لكل روبوت. أما أسطول من ثلاثة روبوتات تعمل ثماني ساعات يوميًا بأقصى طاقة، فيصل إلى 850,000 استدعاء. حتى مع تكلفة 0.005 دولار أمريكي لكل استدعاء على نقطة نهاية مستضافة بحجم 72 مليار نقطة بيانات، تصل التكلفة إلى 4,250 دولارًا أمريكيًا يوميًا، أي 125 ألف دولار أمريكي شهريًا. وبالتالي، فإن خادمًا محليًا مزودًا بثمانية وحدات معالجة رسومية (GPU) يسترد تكلفته في أقل من ثلاثة أشهر عند هذا الحمل.

4. سيادة البيانات. يرى الروبوت أرضية مصنع، وغرفة مريض، ومختبر أبحاث، ومستودعًا بتصميم مخزون خاص، وميدان تدريب عسكري. هذه الفيديوهات محمية بموجب قوانين حماية البيانات العامة (GDPR)، وقانون قابلية نقل التأمين الصحي والمساءلة (HIPAA)، ولوائح الاتجار الدولي بالأسلحة (ITAR)، أو لأسباب تتعلق بحساسية المنافسة. إن إرسالها إلى سحابة تابعة لجهة خارجية - حتى لو كانت موقعة على اتفاقية حماية البيانات - إما محظور أو يمثل عبئًا كبيرًا على الامتثال. أما الاستدلال المحلي فيُزيل مسألة سيادة البيانات: فالبيانات لا تغادر المبنى أبدًا.

هناك مشكلة خامسة أقل وضوحًا: احتكار المورّد . تُقدّم واجهات برمجة التطبيقات السحابية النماذج التي يرغب المورّد في تقديمها، مع التكميمات ونطاقات السياق التي اختارها. لا يمكنك تشغيل نموذج VLM مُعدّل بدقة على نقطة نهاية OpenAI. لا يمكنك تثبيت إصدار مُحدّد من نموذج مفتوح الوزن. لا يمكنك دمج نماذج من مورّدين متنافسين في مسار واحد. هذه القيود مناسبة للنماذج الأولية، لكنها غير مناسبة لنشر الروبوتات في بيئة إنتاجية، والتي يجب أن تكون قابلة للتنبؤ لسنوات.

حالة خادم الحافة المخصص

يوجد خادم استدلال مخصص محليًا على الشبكة المحلية، على بُعد خطوة أو خطوتين من الروبوت. بالنسبة لسلسلة Kentino AI، فهو خادم رفّي بحجم 4U، ومعالج EPYC أو Xeon، ووحدة معالجة رسومية (GPU) بأربعة أو ثمانية، متصل بمحول 10 جيجابت إيثرنت. أما عن مواصفاته:

مقارنة المستويات - خادم Kentino AI المدمج مقابل واجهة برمجة التطبيقات السحابية مقابل الخادم المحلي
الممتلكات على متن الطائرة (جيتسون) سحابة API خادم Kentino AI المحلي
رحلة ذهاب وإياب بين الشبكة المحلية والشبكة الواسعة غير متوفر (قيد التنفيذ) 15-120 مللي ثانية WAN 0.2–0.5 مللي ثانية شبكة محلية
أكبر وحدة إدارة افتراضية (VLM) تناسب (INT4) 7B–13B واقعي اختيار المزوّد يصل إلى 72 مليار بايت على 8 × 5090 / 8 × Pro 6000
النماذج المتزامنة 1، ربما 2 صغير واحد لكل نقطة نهاية 3-6 في وقت واحد (VLM + LLM + الذاكرة + STT)
إنتاجية مستدامة تم خفض الطاقة إلى 30 واط محدود المعدل الطاقة الكهربائية محدودة فقط
التخصيص أي شيء تقوم بشحنه أيًا كان مزود الخدمة الذي يستضيف أي نموذج مفتوح الوزن، أي تكميم، أي ضبط دقيق
خروج البيانات بدون سلوفان كل طلب لا شيء (جدار الحماية على الجهاز)
التكلفة عند الحمل المستدام غرقت (البطارية) خطي في المكالمات غرق (نفقات رأسمالية + طاقة)
وضع الفشل محلّي يعتمد على الشبكة الواسعة يعتمد على الشبكة المحلية (قابل للاسترداد)

يتفوق خيار التثبيت المحلي في جانبين رئيسيين هما معدل النقل المستدام واختيار النموذج . وهما أيضاً الجانبان الأكثر أهمية بالنسبة لأحمال العمل التي سنستعرضها لاحقاً.

يحتوي جهاز Kentino AI 256 Turin Dual النموذجي، المزود بثمانية معالجات رسومات RTX 5090، على ذاكرة وصول عشوائي للفيديو (VRAM) إجمالية بسعة 256 جيجابايت، وقدرة معالجة رسومية تتراوح بين 1.0 و1.5 كيلوواط تحت الضغط. وهذا يكفي لتشغيل ما يلي في وقت واحد:

  • Qwen2.5-VL 72B at INT4 (~45–50 GB weights + 10–20 GB KV per GPU pair, tensor-parallel across 4 GPUs)
  • Qwen2.5 32B نص فقط (تخطيط، حوار) على وحدتي معالجة رسومية
  • معالج VLA صغير (OpenVLA 7B أو Cosmos-Reason 7B) على وحدة معالجة رسومية واحدة لتحديد نية الحركة
  • ذاكرة المشهد / مخزن RAG (pgvector أو ChromaDB) على وحدة المعالجة المركزية المضيفة
  • قدرة ضبط السياسات عبر الإنترنت على وحدة معالجة الرسومات المتبقية عند توصيل الروبوت

يتراوح زمن الاستجابة (TTFT) لنظام VLM Qwen2.5-VL 72B على هذا الجهاز بين 200 و400 مللي ثانية عند تحميل طلب واحد، ويرتفع إلى ما بين 1 و4 ثوانٍ تحت ضغط تحميل متزامن عالٍ. يبلغ معدل تدفق الرموز 25-50 رمزًا في الثانية. هذا كافٍ لوضع نظام VLM 72B في مستوى التخطيط المدروس (100 مللي ثانية - ثانية واحدة) عند تحميل روبوت واحد، وفي مستوى التفكير الاستراتيجي (ثانية واحدة - عدة ثوانٍ) لأسطول صغير. لا يمثل أي من المستويين مشكلة؛ إذ يبقى المستويان التفاعلي والانعكاسي في مكانهما الصحيح.

فجوة القدرات: ما يخدمه فقط مستوى الحافة المخصص

الخادم المحلي ليس مجرد "نفس الروبوت، لكن أسرع". فهو يُمكّن من استضافة أنواع من أحمال العمل التي لا تستطيع الطبقتان الأخريان استضافتها هيكليًا. إليكم القائمة الكاملة:

1. التغذية الراجعة لفهم المشهد في الوقت الفعلي. يقوم نظام VLM 72B بمراقبة كاميرا الروبوت كل 200-500 مللي ثانية، مُعيدًا وصفًا مُهيكلًا للمشهد يستخدمه المُخطط. لا يُمكن للحوسبة السحابية القيام بذلك على نطاق واسع بسبب تذبذب الشبكة الواسعة (WAN) والتكلفة. كما لا يُمكن للأنظمة المُدمجة القيام بذلك لأن النموذج لا يتناسب مع النظام. يُنهي النظام المحلي هذه العملية في غضون 250-500 مللي ثانية إجمالًا.

٢. دمج بيانات VLM من كاميرات متعددة. يحتوي الروبوت البشري على ٣-٥ كاميرات (الرأس، معصمان، جسمان/صدر). تشغيل VLM على جميع هذه الكاميرات في وقت واحد - لتحديد الموقع المكاني، أو معالجة حالات الحجب، أو التنسيق بين اليد والعين - يزيد من عبء الاستدلال بمقدار ٥ أضعاف. يفرض النظام السحابي حدودًا على معدل البيانات أو رسومًا لكل تدفق. يدعم النظام المدمج تدفقًا واحدًا على نطاق صغير. بينما يقوم النظام المحلي بتجميع جميع التدفقات الخمسة عبر نقطة نهاية VLM واحدة.

3. تخطيط المهام على المدى البعيد مع ذاكرة مشهد مستمرة. "بالأمس تركتُ المفتاح على الرف الثاني. ابحث عنه." يتطلب هذا تشغيل VLM وLLM ومخزن متجهات معًا مع حالة مستمرة عبر جلسات الروبوت. يجب أن تكون الحالة موجودة في مكان مستقر وقابل للاستعلام وسريع. أي قاعدة بيانات على الخادم، وليس نافذة سياق سحابي لكل استدعاء، وليس 4 جيجابايت من ذاكرة الوصول العشوائي على Jetson.

٤. ضبط السياسات عبر الإنترنت. يجمع الروبوت عروضًا توضيحية للمهام خلال النهار. وفي الليل، أثناء وجوده في قاعدة الشحن، تُجرى عمليات ضبط دقيقة لـ LoRa على بيانات اليوم مقابل VLA أساسي، ثم يُضاف المحوّل المُحدّث، ليصبح الروبوت أفضل في اليوم التالي. هذا يُضاعف استهلاك الذاكرة من مرتين إلى خمس مرات مقارنةً بالاستدلال. تُفرض رسوم على التدريب والتخزين بشكل منفصل في السحابة، بينما تُدمج البيانات في النظام المحلي.

٥. تنسيق أسطول متعدد الروبوتات. روبوتان أو ثلاثة يتشاركون ذاكرة المشهد، وينسقون المهام، ويراقبون حالة بعضهم البعض. تتطلب طبقة التنسيق بين الروبوتات زمن استجابة أقل من ١٠ مللي ثانية بين الروبوتات. يوفر النظام المحلي مع خادم مشترك على الشبكة المحلية هذا الزمن. أما الحوسبة السحابية فلا تستطيع ذلك، إذ تُرسل تحديثات كل روبوت إلى منطقة معينة، ثم تعود، وتُطبق على الروبوت التالي.

٦. عملية المحاكاة والتطبيق الفعلي. يعمل برنامج Isaac Sim على نفس وحدات معالجة الرسومات المستخدمة في الاستدلال، حيث يقوم بتوليد بيانات تدريب اصطناعية، والتحقق من صحة تحديثات السياسات قبل تطبيقها على الروبوت الحقيقي. تستغرق كل دورة نصف يوم على السحابة (نقل البيانات فقط)، بينما تستغرق ٣٠ دقيقة في بيئة محلية.

لا شيء من هذا خيال علمي. جميعها أحمال عمل يقوم بها مُكاملّو أنظمة الروبوتات في عام 2026. ولا يعمل أي منها بسلاسة على أي من المستويين الآخرين.

لماذا يُعد هذا الحل الأحدث والأكثر تطوراً في عام 2026

أحدث ما توصلت إليه تقنيات إدراك الروبوتات في عام 2026 هو نموذج التعلم الآلي المرئي في الحلقة (VLM-in-the-loop) . يقوم هذا النموذج بتحليل العالم المحيط، والتفكير فيه لغوياً، ثم يُصدر خططاً مُهيكلة، ويتولى النظام تنفيذها. كانت هذه فكرة بحثية في عام 2023، ثم عُرضت كنموذج تجريبي في عام 2024، وأصبحت نموذجاً إنتاجياً في الفترة 2025-2026.

الاتجاه الذي يُجبر على استخدام البنية التحتية المحلية واضحٌ تمامًا: وحدات إدارة الأجهزة الافتراضية (VLMs) الفعّالة تزداد حجمًا، لا تصغر. يُعدّ Qwen2.5-VL 7B جيدًا، بينما يُعدّ Qwen2.5-VL 72B أفضل منه بشكلٍ ملحوظ. أما النماذج الاحتكارية التي لا تنشرها مختبرات Frontier فهي أكبر حجمًا. صحيحٌ أن خيار "وحدة إدارة الأجهزة الافتراضية الصغيرة التي تعمل على الجهاز" موجودٌ وسيظلّ قائمًا، إلا أنه متأخرٌ عن Frontier بما يتراوح بين 12 و18 شهرًا، مع وجود فجوةٍ كبيرةٍ في القدرات. إذا كنت ترغب في الحصول على أداء Frontier، فعليك استضافة نموذج Frontier. لكن نموذج Frontier لا يتوافق مع Jetson.

نظريًا، يُمكن للحوسبة السحابية مواكبة التطورات. لكن عمليًا، لا تفعل ذلك، للأسباب الأربعة المذكورة أعلاه (زمن الاستجابة، والتذبذب، والتكلفة، والسيادة)، ولأن مختبرات الأبحاث الرائدة تحصر الوصول إلى أكبر النماذج ضمن مستويات الشراكة التي لا تستطيع شركات الروبوتات الناشئة الوصول إليها. توجد بالفعل نماذج افتراضية مفتوحة المصدر من فئة 70 مليار، ويمكن استضافتها، وتعمل بكفاءة على خوادم تجارية مزودة بثمانية وحدات معالجة رسومية. هذا التزامن - نماذج رائدة مفتوحة المصدر بالإضافة إلى أجهزة تجارية متعددة وحدات المعالجة الرسومية - هو السبب في أن الحلول المحلية هي الخيار الأمثل حاليًا، بينما لم تكن كذلك في عام 2023.

هذا ليس رأي كينتينو أيضاً. فطبقة الاستدلال المحلية هي أساس حزمة Isaac من NVIDIA، وهي التي تُزوّد ​​بها منصات الروبوتات الرئيسية بنىً مرجعية، وهي ما يُجهّزه كل مُكامل أنظمة جاد تحدثنا إليه خلال الأشهر الستة الماضية. لقد لحق السوق بالأجهزة التي لحقت بدورها بالنماذج، وسيكون عام 2026 هو العام الذي سيُحقق فيه هذا التطور.

عندما يكون المسار المحلي هو الحل الخاطئ

لنكن صريحين: إن طبقة الحافة المخصصة تعتبر مبالغة في العديد من الحالات الحقيقية.

  • الروبوتات التي يتم التحكم فيها عن بعد. المُشغّل هو المُخطِّط. الروبوت عبارة عن دمية موصولة بوصلة تحكّم. لا يوجد نظام إدارة فيديو افتراضي (VLM) في الحلقة؛ يمكن تنفيذ عمليات الاستدلال البسيطة (تقدير الوضعية، ترميز الفيديو منخفض زمن الاستجابة) على Jetson. أضف خدمة سحابية لأي عمليات معالجة ثقيلة عند الحاجة. لا حاجة لخادم وحدة معالجة رسومية (GPU).
  • حيوانات رباعية الأرجل للتفتيش البسيط. لا يحتاج الروبوت من فئة Spot أو Go2، الذي يسير في مسار دورية ثابت مزودًا بتقنية كشف متطورة وكاميرا حرارية، إلى وحدة تحكم 72B VLM. يقوم جهاز Jetson المدمج بهذه المهمة. تُرسل البيانات إلى السحابة لتحليلها بعد انتهاء الدورية، وليس أثناءها.
  • عروض تجريبية وتجارب فردية. تحتاج إلى تشغيل النظام لعرض تجاري، أو لعرض تقديمي للعميل، أو لإثبات جدوى الفكرة لمدة ثلاثة أسابيع. الحوسبة السحابية تُمكّنك من ذلك في غضون ساعات. أما الاستثمار الرأسمالي في البنية التحتية المحلية فهو غير مناسب لحجم عمل سيتم إيقافه خلال شهر.
  • الاستخدام كهواية ولأغراض تعليمية. مختبر جامعي مزود بجهاز G1 EDU واحد، وميزانية محدودة، ويركز على تدريب التعلم المعزز بدلاً من الاستدلال. يمكن لجهاز Jetson ومحطة عمل 4090 واحدة استيعاب ما يكفي لإجراء بحوث ذات قيمة. أما باقة Kentino AI الكاملة (بمستوى 8x) فهي غير مناسبة.
  • أعباء العمل اللغوية البحتة. روبوت يتكلم لكنه لا يرى - مساعد صوتي فقط على أرجل. واجهة برمجة تطبيقات إدارة دورة حياة البرمجيات السحابية مناسبة. يُراعى أن يكون زمن الاستجابة مناسبًا للمحادثة، وليس للحلقة المغلقة.

النمط: إذا لم يكن الروبوت الخاص بك يشغل نظام إدارة التعلم الافتراضي الحقيقي في حلقة الإدراك المغلقة، فلن تحتاج إلى طبقة الحافة المخصصة. أما إذا كان يشغلها، فأنت بحاجة إليها.

عندما يثبت المسار المحلي صحة ذلك

يصبح مستوى الحافة المخصص هو الحل الأمثل عندما يكون واحد على الأقل مما يلي صحيحًا، ومن الأفضل أن يكون اثنان أو أكثر:

  1. نظام إدارة دورة حياة المركبة الحقيقي يكون في حلقة مغلقة. ليس "للاستفسارات العرضية" — in حلقة الإدراك إلى الفعل، التي تعمل كل 100-500 مللي ثانية. هذا هو السبب الهيكلي لوجود البنية التحتية المحلية.
  2. حمل مستمر. ثماني ساعات يومياً، خمسة أيام في الأسبوع، إلى أجل غير مسمى. يتم استهلاك النفقات الرأسمالية. تتراكم تكلفة المكالمات السحابية إلى أجل غير مسمى.
  3. لا يمكن للبيانات مغادرة المبنى. اللائحة العامة لحماية البيانات (GDPR)، وقانون قابلية نقل التأمين الصحي والمساءلة (HIPAA)، ولوائح الاتجار الدولي بالأسلحة (ITAR)، والمنافسة، أو مجرد شكوك. تبقى البيانات على الشبكة المحلية (LAN). هذا أمر غير قابل للتفاوض.
  4. روبوتات متعددة. وحدتان أو أكثر تتشاركان ذاكرة المشهد أو تنسقان المهام. يتم احتساب استهلاك الخادم المشترك لكل روبوت على حدة، وينهار هامش زمن الاستجابة بين الروبوتات.
  5. التخصيص مهم. وحدات معالجة افتراضية دقيقة، وإصدارات نماذج مثبتة، ورؤوس خاصة على هياكل أساسية مفتوحة، وتقنيات تكميم متخصصة. الحرية هي المنتج.
  6. سرعة التكرار مهمة. يقوم الفريق بتحديث السياسات أسبوعياً أو بوتيرة أسرع. وتساهم عمليات المحاكاة والتدريب على نفس الأجهزة المستخدمة في الاستدلال في تقليص مدة العملية من أيام إلى ساعات.

إذا حددت ثلاثة خيارات أو أكثر، فلن يكون السؤال هو ما إذا كان النظام مناسبًا للاستخدام المحلي، بل ما هو حجمه . يكفي نظام Kentino AI 96 رباعي المعالجات الرسومية (RTX 4090 أو 5090) لتشغيل روبوت واحد يقوم بمهام حقيقية. أما نظام Kentino AI 256 ثماني المعالجات الرسومية (5090 أو Pro 6000 Blackwell) فهو الخيار الأمثل لأسطول صغير، أو لأكبر أنظمة إدارة التعلم الافتراضية، أو لأي عملية نشر تتطلب تدريبًا بالإضافة إلى الاستدلال.

ماذا تفعل بعد ذلك

إذا كنت بصدد تحديد نطاق عملية نشر، فإن الأسئلة التي تحدد الإجابة هي:

  1. هل يوجد VLM في نظام الحلقة المغلقة الخاص بك؟ إذا كانت الإجابة بنعم، فأنت بحاجة إلى المستوى المتقدم. إذا كانت الإجابة بلا، فتجاوز الباقي.
  2. كم عدد الروبوتات، في ذروة التشغيل وفي التشغيل المستدام؟ يُحدد هذا عدد وحدات معالجة الرسومات. قاعدة عامة: يحتاج نظام إدارة الأجهزة الافتراضية (VLM) الواحد على نطاق واسع إلى 4 وحدات معالجة رسومات كحد أدنى؛ ويضيف كل روبوت إضافي في الأسطول وحدة معالجة رسومات واحدة تقريبًا من الطلب المتزامن.
  3. ما هو أكبر نموذج في خطتك المستقبلية، ليس فقط اليوم؟ اشترِ على المدى الزمني 24 شهرًا. تُعتبر قيمة الأصول الافتراضية من فئة 70 مليار دولار الحد الأدنى في عام 2026؛ ومن المرجح أن تتجاوز 100 مليار دولار بحلول عام 2027.
  4. أين يجب أن تبقى البيانات؟ إذا كانت الإجابة "داخل المبنى"، فإن الحل الوحيد الصحيح هو البنية التحتية المحلية. أما إذا كانت "داخل الاتحاد الأوروبي"، فالحل إما البنية التحتية المحلية أو سحابة سيادية تابعة للاتحاد الأوروبي. وإذا كانت "في أي مكان"، فلديك خيارات متعددة.
  5. التدريب، أم الضبط الدقيق، أم الاستدلال فقط؟ يُضاعف التدريب ميزانية وحدة معالجة الرسومات والتخزين ثلاث مرات تقريبًا. كن صادقًا مع نفسك بشأن ما إذا كان الفريق سينفذ ذلك بالفعل.
  6. نطاق الطاقة والتبريد؟ تكتشف معظم المختبرات بعد فوات الأوان أنها لا تستطيع توفير طاقة مستمرة تتراوح بين 4 و5 كيلوواط. لذا، خطط للغرفة قبل التركيب.

تتناول المقالات اللاحقة في هذه السلسلة تفاصيل أعمق حول التوصيلات ( نُشرت المقالة I01 سابقًا)، وحزمة برامج خادم الاستدلال (المقالة I02 ستُنشر لاحقًا)، والبنية المرجعية مع المكونات ومعايير الأداء (المقالة I05). خريطة القدرات الموضحة هنا تُبين السبب ؛ أما تلك فهي تُبين كيفية التنفيذ.

لا يُعدّ مستوى الاستدلال المحلي ترفًا أو خيارًا مفضلًا في عملية الشراء. بالنسبة للروبوتات التي تعمل بنظام إدارة التعلم الافتراضي (VLM) في عام 2026، فهو المستوى الوحيد الذي يُناسب الحسابات. أما أي مستوى آخر فهو حل وسط يُقدّم مع معرفة دقيقة بالقدرات التي تم التخلي عنها.


هذا جزء من موسوعة كينتينو، وهي سلسلة مرجعية حول الحوسبة الذكية، والروبوتات، والأنظمة التي تربط بينهما. نرحب بالتعليقات والتصويبات على البريد الإلكتروني info@kentino.com.

العودة إلى المدونة