لماذا تحتاج الروبوتات إلى حوسبة طرفية مخصصة
حصة
إنّ الروبوت البشري الذي يمشي يُعدّ مشكلة محلولة. أما الروبوت البشري الذي يفهم ما ينظر إليه، ويخطط لمهمة متعددة الخطوات، ويتذكر ما حدث قبل خمس دقائق، فليس كذلك. فالقدرة الحاسوبية اللازمة لسدّ هذه الفجوة لا تتسع لها الروبوت، والحوسبة السحابية ليست المكان المناسب لها. تُقدّم هذه المقالة دراسةً تقنيةً تُبيّن لماذا يُعدّ خادم الاستدلال المُخصّص في الموقع الحل الأمثل في عام 2026 لأيّ تطبيق روبوتي جادّ بما يكفي لأداء عملٍ مُفيد.
I01 ويغطي كيف الروبوت والخادم متصلان ببعضهما البعض عبر سلك. هذه المقالة لماذا هل ستشتري الخادم أصلاً؟ إذا كنت لا تزال تتساءل عما إذا كان التثبيت المحلي مجدياً، فاقرأ هذا أولاً.
ميزانية زمن استجابة القرار
كل إجراء يقوم به الروبوت يقع ضمن إحدى أربع مستويات زمن استجابة. لكل مستوى حد زمني تفرضه فيزياء المهمة - إذا تم تجاوزه، فسيتعطل السلوك بطريقة محددة ومعروفة.
| الطبقة | الميزانية | أمثلة | ماذا سيحدث إذا أخطأت؟ |
|---|---|---|---|
| التحكم التفاعلي | <10 ms | عزم الدوران المشترك، التوازن، تبديل المحرك، زر الإيقاف الطارئ | يسقط الروبوت، ويتأرجح، ويتضرر. |
| الإدراك الانعكاسي | 10 - 50 مللي ثانية | اكتشاف العوائق، والاستجابة عند التلامس، والتتبع السريع | الاصطدامات، والإمساك الفاشل، والأشياء المتساقطة |
| التخطيط المدروس | 100 مللي ثانية - 1 ثانية | "اختر الكأس الأحمر"، فهم المشهد، تأكيد الحوار | فترات توقف محرجة، وتأخر في المحادثة، وانتقالات متقطعة بين المهام |
| التفكير الاستراتيجي | 1 ثانية - متعدد الثواني | خطط مهام متعددة الخطوات، واستعادة الأخطاء، وحوار مطول | مقبول؛ يدرك المستخدم "التفكير" |
هذه ليست عشوائية. إنها ناتجة عن عرض النطاق الترددي للحلقة المغلقة التي تقع داخلها.
يعمل التحكم التفاعلي بتردد يتراوح بين 500 هرتز و1 كيلوهرتز على مستوى المفصل، وذلك لأن ديناميكيات ساق بشرية بوزن 30 كيلوغرامًا تتطلب ذلك - عند 100 هرتز، يتردد الطرف وتختلف المشية. يرث الإدراك الانعكاسي معدلات إطارات الكاميرا (30-60 إطارًا في الثانية = 16-33 مللي ثانية لكل إطار) والنطاق الزمني للتلامس الجسدي (يؤدي ضغط الإصبع على جسم ما إلى إنهاء حدث التلامس في غضون 20-40 مللي ثانية). يتقيد التخطيط المدروس بتوقعات المحادثة البشرية (ثانية واحدة تبدو سريعة الاستجابة، وثانيتان تبدوان بطيئتين) وبزمن استجابة نموذج VLM الفعال. يُعد التفكير الاستراتيجي المستوى الوحيد الذي يتمتع بمرونة حقيقية، ولهذا السبب يرغب الجميع في دفع التخطيط إليه، لكنهم يواجهون صعوبات عندما لا يستطيع نموذج VLM الخاص بهم مواكبة ذلك.
هذا ليس رأي كينتينو. إن تقسيم الميزانية إلى أربعة مستويات هو التقسيم الذي تتضمنه كل حزمة تحكم روبوتية موثوقة - ROS 2، Isaac، Drake، OCS2. ما يختلف هو نوع الأجهزة التي يتم وضعها خلف كل مستوى.
ما يمكن وما لا يمكن للحوسبة الموجودة على متن المركبة فعله
يحمل الروبوت البشري المُصمم لعام 2026 وحدة NVIDIA Jetson AGX Orin في صدارة مواصفاته، بذاكرة موحدة سعتها 64 جيجابايت، وقدرة معالجة تصل إلى 275 تيرابايت في الثانية (138 تيرابايت في الثانية)، واستهلاك طاقة قابل للتكوين من 15 إلى 60 واط. يُعدّ هذا إنجازًا رائعًا لوحدة مُدمجة، ولكنه لا يُلبي احتياجات الروبوتات الحديثة التي تعمل بنظام VLM.
قم بإجراء الحسابات على ثلاثة نماذج قد ترغب فعلاً في أن يستخدمها الروبوت البشري:
| الموديل | بارامس | الحد الأدنى من ذاكرة الوصول العشوائي للفيديو (أوزان الربع الرابع + عمليات التنشيط) | على جهاز Orin AGX بسعة 64 جيجابايت؟ |
|---|---|---|---|
| Qwen2.5-VL 7B (INT4) | 7B | ~5–7 جيجابايت | نعم، حوالي 5-8 إطارات في الثانية |
| OpenVLA 7B (BF16) | 7.5B | ~ شنومك غيغابايت | نعم، عند التردد INT4، حوالي 3-6 هرتز |
| إنفيديا كوزموس-ريزون 7 بي | 7B | ~6–8 جيجابايت INT4 | نعم، بطيء |
| إسحاق GR00T N1.7 | ~3 ب | يوصى بـ 16 جيجابايت تقريبًا للاستدلال | هامشي؛ يتطلب الضبط الدقيق مساحة 40 جيجابايت أو أكثر |
| Qwen2.5-VL 32B (INT4) | 32B | ~22–26 جيجابايت | ضيق؛ قابل للاستخدام ولكنه بطيء |
| Qwen2.5-VL 72B (INT4) | 72B | أوزان تتراوح بين 45 و50 جيجابايت + 10 إلى 20 جيجابايت KV | رقم سوف ينفد من الذاكرة في أي سياق حقيقي. |
| لاما-3.1 70B (INT4) | 70B | أوزان تتراوح بين 38 و45 جيجابايت + KV | لا على أورين تحت الحمل |
سيستضيف جهاز Orin AGX بسعة 64 جيجابايت وحدة معالجة رسومية من فئة 32 بايت بمعالج INT4، شريطة قبول الاستدلال البطيء، وعدم وجود معالجة دفعية حقيقية، وعدم وجود أحمال عمل متزامنة. ولن يستضيف وحدات المعالجة الرسومية من فئة 70 بايت، والتي تُعدّ الأحدث في مجال فهم المشاهد بحلول عام 2026، مثل Qwen2.5-VL 72B، ومتغيرات Cosmos الأكبر حجمًا، والنماذج الخاصة التي لا ينشر الموردون أوزانها. فالأوزان المجمعة، وذاكرة التخزين المؤقت للقيم والمفاتيح للسياق المرئي الطويل، وأي مساحة لنموذج ثانٍ، لا تتناسب مع هذا الجهاز.
هناك رقم ثانٍ يتم تجاهله: الطاقة. يفترض رقم 275 TOPS الخاص بجهاز Orin وضع MAX_N (60 واط). أي أن المنصة التي تعمل بالبطارية تستهلك 60 واط من طاقة المعالجة بالإضافة إلى 200-800 واط من حمل المحرك. يؤدي التشغيل المستمر في وضع MAX_N إلى تقليل وقت تشغيل الروبوت إلى النصف. عمليًا، يقضي Orin معظم وقته في وضع 30 واط، مما يقلل TOPS إلى النصف تقريبًا ويدفع الاستدلال، الذي كان محدودًا أصلًا، إلى مستوى "غير قابل للاستخدام".
ترجمة: تم تصميم وحدة Jetson المدمجة لتناسب مستويات الاستجابة والاستجابة السريعة، وليست مصممة لتكون مضيفًا لـ VLM. أي شخص يدّعي أن روبوته البشري "يشغل Qwen2.5-VL مدمجًا" إما أنه يستخدم طراز 3B أو 7B ويعتبره كافيًا، أو أنه يستخدم الطراز الأكبر بسرعة 0.5 إطار في الثانية ويعتبره عرضًا توضيحيًا. كلا الخيارين مناسب لحالات استخدام محددة، لكنهما ليسا مناسبين لإدراك الروبوتات العامة.
لماذا تُعدّ الحوسبة السحابية حلاً خاطئاً للروبوتات ذات الحلقة المغلقة؟
الاستدلال السحابي رخيص، وقابل للتوسع بسهولة، ولا يتطلب أي نفقات رأسمالية. بالنسبة للروبوت، فإنه يواجه أربع مشاكل، مرتبة تقريبًا حسب خطورتها.
1. الحد الأدنى لزمن استجابة الشبكة الواسعة (WAN). يستغرق الاتصال السحابي المُحسَّن داخل الاتحاد الأوروبي ما بين 15 و40 مللي ثانية ذهابًا وإيابًا على شبكة WAN نفسها، بالإضافة إلى ما بين 5 و15 مللي ثانية من وقت معالجة TLS/HTTP/موازنة الأحمال، بالإضافة إلى وقت استنتاج النموذج، ووقت العودة. أما الاتصال عبر المحيط الأطلسي فيضيف ما بين 80 و120 مللي ثانية من وقت الذهاب والإياب. انعكاسي إن إضافة 30-50 مللي ثانية قبل بدء تشغيل النموذج، عند طرح سؤال حول الإدراك - "هل هناك عائق أمامي؟" - يُعد تجاوزًا للميزانية. تداول قد تتحمل التخطيطات التي تتراوح بين 200 و 500 مللي ثانية، ولكن كل حزمة بيانات مفقودة، وكل إعادة إرسال، وكل عملية تحويل فاشلة بين أبراج الخلايا، ترفعك إلى المستوى التالي.
2. الارتعاش. زمن الاستجابة (RTT) في شبكة WAN ليس ثابتًا، بل هو توزيع. الوسيط 25 مللي ثانية، وذروة الاحتمال 99 (P99) 250 مللي ثانية، وذروة الاحتمال 99.9 (P99.9) عدة ثوانٍ. لا يمكن لروبوت يعمل في بيئة حقيقية أن يتحمل توقفًا لعدة ثوانٍ بسبب تقلب مسار BGP. أما في شبكة LAN المحلية، فذروة الاحتمال 99.9 تتراوح بين 1 و2 مللي ثانية.
3. التكلفة عند الحمل المستمر. تكلفة عملية استدلال VLM واحدة بحجم 70 مليار نقطة بيانات لمزود الخدمة السحابية شبه معدومة، إذ لا تتجاوز بضعة سنتات. يقوم الروبوت الذي يعمل باستمرار بإجراء استدعاء VLM واحد كل 100-500 مللي ثانية أثناء نشاطه، أي ما يعادل 7,000 إلى 36,000 استدعاء في الساعة لكل روبوت. أما أسطول من ثلاثة روبوتات تعمل ثماني ساعات يوميًا بأقصى طاقة، فيصل إلى 850,000 استدعاء. حتى مع تكلفة 0.005 دولار أمريكي لكل استدعاء على نقطة نهاية مستضافة بحجم 72 مليار نقطة بيانات، تصل التكلفة إلى 4,250 دولارًا أمريكيًا يوميًا، أي 125 ألف دولار أمريكي شهريًا. وبالتالي، فإن خادمًا محليًا مزودًا بثمانية وحدات معالجة رسومية (GPU) يسترد تكلفته في أقل من ثلاثة أشهر عند هذا الحمل.
4. سيادة البيانات. يرى الروبوت أرضية مصنع، وغرفة مريض، ومختبر أبحاث، ومستودعًا بتصميم مخزون خاص، وميدان تدريب عسكري. هذا الفيديو محمي بموجب قوانين حماية البيانات العامة (GDPR)، وقانون قابلية نقل التأمين الصحي والمساءلة (HIPAA)، ولوائح الاتجار الدولي بالأسلحة (ITAR)، أو لأسباب تتعلق بحساسية المنافسة. إرساله إلى سحابة تابعة لجهة خارجية - حتى لو كانت موقعة على اتفاقية حماية البيانات (DPA) - إما محظور أو يمثل عبئًا كبيرًا على الامتثال. أما الاستدلال المحلي فيُزيل مسألة سيادة البيانات: فالبيانات لا تغادر المبنى أبدًا.
ثمة مشكلة خامسة، وهي أقل حدة: قبضة الباعة فيتُقدّم واجهات برمجة التطبيقات السحابية النماذج التي يرغب المزوّد في تقديمها، مع تحديد الكميات ونطاقات السياق التي اختارها. لا يمكنك تشغيل نموذج VLM مُعدّل بدقة على نقطة نهاية OpenAI. لا يمكنك تثبيت إصدار مُحدّد من نموذج مفتوح الوزن. لا يمكنك دمج نماذج من موردين متنافسين في مسار واحد. هذه القيود مناسبة للنماذج الأولية، ولكنها غير مناسبة لنشر الروبوتات في بيئة إنتاجية، والتي يجب أن تكون قابلة للتنبؤ لسنوات.
حالة خادم الحافة المخصص
يوجد خادم استدلال مخصص محليًا على الشبكة المحلية، على بُعد خطوة أو خطوتين من الروبوت. بالنسبة لسلسلة Kentino K-AI، فهو خادم رفّي بحجم 4U، ومعالج EPYC أو Xeon، ووحدة معالجة رسومية (GPU) بأربع أو ثماني وحدات، متصل بمحول إيثرنت بسرعة 10 جيجابت. أما عن الميزات التي يوفرها:
| الممتلكات | على متن الطائرة (جيتسون) | سحابة API | خادم K-AI المحلي |
|---|---|---|---|
| رحلة ذهاب وإياب بين الشبكة المحلية والشبكة الواسعة | غير متوفر (قيد التنفيذ) | 15-120 مللي ثانية WAN | 0.2–0.5 مللي ثانية شبكة محلية |
| أكبر وحدة إدارة افتراضية (VLM) تناسب (INT4) | 7B–13B واقعي | اختيار المزوّد | يصل إلى 72 مليار بايت على 8 × 5090 / 8 × Pro 6000 |
| النماذج المتزامنة | 1، ربما 2 صغير | واحد لكل نقطة نهاية | 3-6 في وقت واحد (VLM + LLM + الذاكرة + STT) |
| إنتاجية مستدامة | تم خفض الطاقة إلى 30 واط | محدود المعدل | الطاقة الكهربائية محدودة فقط |
| التخصيص | أي شيء تقوم بشحنه | أيًا كان مزود الخدمة الذي يستضيف | أي نموذج مفتوح الوزن، أي تكميم، أي ضبط دقيق |
| خروج البيانات | بدون سلوفان | كل طلب | لا شيء (جدار الحماية على الجهاز) |
| التكلفة عند الحمل المستدام | غرقت (البطارية) | خطي في المكالمات | غرق (نفقات رأسمالية + طاقة) |
| وضع الفشل | محلّي | يعتمد على الشبكة الواسعة | يعتمد على الشبكة المحلية (قابل للاسترداد) |
العمودان اللذان يهيمن عليهما خيار التثبيت المحلي هما معدل نقل مستدام و اختيار النموذجوهذان العمودان هما الأكثر أهمية بالنسبة لأحمال العمل التي سنقوم بتعدادها.
يحتوي جهاز K-AI 256 Turin Dual النموذجي، المزود بثمانية معالجات رسومات RTX 5090، على ذاكرة وصول عشوائي للفيديو (VRAM) إجمالية بسعة 256 جيجابايت، وقدرة معالجة رسومية تتراوح بين 1.0 و1.5 كيلوواط تحت الضغط. وهذا يكفي لتشغيل ما يلي في وقت واحد:
- Qwen2.5-VL 72B at INT4 (~45–50 GB weights + 10–20 GB KV per GPU pair, tensor-parallel across 4 GPUs)
- Qwen2.5 32B نص فقط (تخطيط، حوار) على وحدتي معالجة رسومية
- معالج VLA صغير (OpenVLA 7B أو Cosmos-Reason 7B) على وحدة معالجة رسومية واحدة لتحديد نية الحركة
- ذاكرة المشهد / مخزن RAG (pgvector أو ChromaDB) على وحدة المعالجة المركزية المضيفة
- قدرة ضبط السياسات عبر الإنترنت على وحدة معالجة الرسومات المتبقية عند توصيل الروبوت
يتراوح زمن الاستجابة (TTFT) لنظام VLM Qwen2.5-VL 72B على هذا الجهاز بين 200 و400 مللي ثانية عند تحميل طلب واحد، ويرتفع إلى ما بين 1 و4 ثوانٍ تحت ضغط تحميل متزامن عالٍ. يبلغ معدل تدفق الرموز 25-50 رمزًا في الثانية. هذا كافٍ لوضع نظام VLM 72B في مستوى التخطيط المدروس (100 مللي ثانية - ثانية واحدة) عند تحميل روبوت واحد، وفي مستوى التفكير الاستراتيجي (ثانية واحدة - عدة ثوانٍ) لأسطول صغير. لا يمثل أي من المستويين مشكلة؛ إذ يبقى المستويان التفاعلي والانعكاسي في مكانهما الصحيح.
فجوة القدرات: ما يخدمه فقط مستوى الحافة المخصص
الخادم المحلي ليس مجرد "نفس الروبوت، لكن أسرع". فهو يُمكّن من استضافة أنواع من أحمال العمل التي لا تستطيع الطبقتان الأخريان استضافتها هيكليًا. إليكم القائمة الكاملة:
1. التغذية الراجعة لفهم المشهد في الوقت الفعلي. يقوم نظام VLM 72B بمراقبة كاميرا الروبوت كل 200-500 مللي ثانية، مُعيدًا وصفًا مُهيكلًا للمشهد يستخدمه المُخطط. لا يُمكن للحوسبة السحابية القيام بذلك على نطاق واسع بسبب تذبذب الشبكة الواسعة (WAN) والتكلفة. كما لا يُمكن للأنظمة المُدمجة القيام بذلك لأن النموذج لا يتناسب مع النظام. أما الأنظمة المحلية فتُنهي العملية في غضون 250-500 مللي ثانية إجمالًا.
2. دمج الصور متعددة الكاميرات بتقنية VLM. يحتوي الروبوت البشري على 3-5 كاميرات (الرأس، اثنتان للمعصمين، واثنتان للجسم/الصدر). تشغيل نظام إدارة التعلم الافتراضي (VLM) على جميع هذه الكاميرات في وقت واحد - لتحديد الموقع المكاني، ومعالجة حالات الحجب، أو التنسيق بين اليد والعين - يُضاعف عبء الاستدلال خمس مرات. يفرض النظام السحابي قيودًا على معدل البيانات أو رسومًا لكل تدفق. يدعم النظام المدمج تدفقًا واحدًا على نطاق صغير. بينما يقوم النظام المحلي بتجميع جميع التدفقات الخمسة عبر نقطة نهاية VLM واحدة.
3. تخطيط المهام على المدى الطويل مع ذاكرة المشهد المستمرة. "بالأمس تركتُ المفتاح على الرف الثاني. ابحث عنه." يتطلب هذا تشغيل VLM وLLM ووحدة تخزين متجهات معًا مع الحفاظ على حالة ثابتة عبر جلسات الروبوت. يجب أن تكون الحالة موجودة في مكان مستقر، وقابل للاستعلام، وسريع. أي قاعدة بيانات على الخادم، وليس نافذة سياق سحابي لكل استدعاء، وليس 4 جيجابايت من ذاكرة الوصول العشوائي على Jetson.
4. تحسين السياسات الإلكترونية. يجمع الروبوت عروضًا توضيحية للمهام خلال النهار. وفي الليل، أثناء وجوده في قاعدة الشحن، تُشغّل تقنية LoRa لتحسين أداء الروبوت بناءً على بيانات اليوم باستخدام مصفوفة VLA أساسية، ثم يُضاف المحوّل المُحدّث، ليصبح الروبوت أكثر كفاءة في اليوم التالي. هذا يُضاعف استهلاك الذاكرة من مرتين إلى خمس مرات مقارنةً بالاستدلال. تُفرض رسوم منفصلة على التدريب والتخزين في السحابة، بينما تُدمج البيانات في النظام المحلي.
5. تنسيق أسطول الروبوتات المتعددة. روبوتان أو ثلاثة يتشاركون ذاكرة المشهد، وينسقون المهام، ويراقبون حالة بعضهم البعض. تتطلب طبقة التنسيق بين الروبوتات زمن استجابة أقل من 10 مللي ثانية. يوفر النظام المحلي مع خادم مشترك على الشبكة المحلية هذا الزمن. أما الحوسبة السحابية فلا تستطيع ذلك، إذ تُرسل تحديثات كل روبوت إلى منطقة معينة، ثم تعود، وتُطبق على الروبوت التالي.
6. التكرار من المحاكاة إلى الواقع. يعمل برنامج Isaac Sim على نفس وحدات معالجة الرسومات المستخدمة في الاستدلال، حيث يقوم بتوليد بيانات تدريب اصطناعية، والتحقق من صحة تحديثات السياسات قبل تطبيقها على الروبوت الحقيقي. يستغرق هذا نصف يوم لكل دورة على السحابة (نقل البيانات فقط)، بينما تستغرق كل دورة 30 دقيقة على الخادم المحلي.
لا شيء من هذا خيال علمي. جميعها أحمال عمل يقوم بها مُكاملّو أنظمة الروبوتات في عام 2026. ولا يعمل أي منها بسلاسة على أي من المستويين الآخرين.
لماذا يُعد هذا الحل الأحدث والأكثر تطوراً في عام 2026
أحدث ما توصلت إليه تقنيات إدراك الروبوتات في عام 2026 هو VLM-in-the-loopينظر النموذج إلى العالم، ويحلله لغوياً، ويصدر خططاً منظمة، ثم تنفذها السياسة. كانت هذه فكرة بحثية في عام 2023، وعرضاً توضيحياً للمنتج في عام 2024، ونمطاً إنتاجياً في الفترة 2025-2026.
الاتجاه الذي يُجبر على استخدام البنية التحتية المحلية واضحٌ تمامًا: وحدات إدارة الأجهزة الافتراضية (VLMs) الفعّالة تزداد حجمًا، لا تصغر. يُعدّ Qwen2.5-VL 7B جيدًا، بينما يُعدّ Qwen2.5-VL 72B أفضل منه بشكلٍ ملحوظ. أما النماذج الاحتكارية التي لا تنشرها مختبرات Frontier فهي أكبر حجمًا. صحيحٌ أن خيار "وحدة إدارة الأجهزة الافتراضية الصغيرة التي تعمل على الجهاز" موجودٌ وسيظلّ قائمًا، إلا أنه متأخرٌ عن Frontier بما يتراوح بين 12 و18 شهرًا، مع وجود فجوةٍ كبيرةٍ في القدرات. إذا كنت ترغب في الحصول على أداء Frontier، فعليك استضافة نموذج Frontier. لكن نموذج Frontier لا يتوافق مع Jetson.
نظرياً، يمكن للحوسبة السحابية مواكبة التطورات. لكن عملياً، لا تفعل ذلك، للأسباب الأربعة المذكورة أعلاه (زمن الاستجابة، والارتعاش، والتكلفة، والسيادة)، ولأن مختبرات الأبحاث الرائدة تحصر الوصول إلى أكبر النماذج ضمن مستويات الشراكة التي لا تستطيع الشركات الناشئة في مجال الروبوتات الوصول إليها. وحدات إدارة دورة حياة افتراضية مفتوحة الوزن من فئة 70 مليار do يوجد، علبة يمكن استضافتها وتشغيلها بكفاءة على خوادم قياسية مزودة بثمانية وحدات معالجة رسومية. هذا التوافق - نماذج مفتوحة المصدر من الفئة الرائدة بالإضافة إلى أجهزة قياسية متعددة وحدات معالجة الرسوميات - هو السبب في أن الحلول المحلية هي الحل الأمثل الآن، بينما لم تكن كذلك في عام 2023.
هذا ليس رأي كينتينو أيضاً. طبقة الاستدلال المحلية هي أساس حزمة Isaac من NVIDIA، وهي أساس البنى المرجعية لمنصات الروبوتات الرئيسية، وهي ما يقوم بتوفيره كل مُكامل أنظمة جاد تحدثنا إليه خلال الأشهر الستة الماضية. لقد لحق السوق بالأجهزة، ولحقت الأجهزة بالنماذج، وعام 2026 هو العام الذي انتهى فيه الأمر.
عندما يكون المسار المحلي هو الحل الخاطئ
لنكن صريحين: إن طبقة الحافة المخصصة تعتبر مبالغة في العديد من الحالات الحقيقية.
- الروبوتات التي يتم التحكم فيها عن بعد. المُشغّل هو المُخطِّط. الروبوت عبارة عن دمية موصولة بوصلة تحكّم. لا يوجد نظام إدارة فيديو افتراضي (VLM) في الحلقة؛ يمكن تنفيذ عمليات الاستدلال البسيطة (تقدير الوضعية، ترميز الفيديو منخفض زمن الاستجابة) على Jetson. أضف خدمة سحابية لأي عمليات معالجة ثقيلة عند الحاجة. لا حاجة لخادم وحدة معالجة رسومية (GPU).
- حيوانات رباعية الأرجل للتفتيش البسيط. لا يحتاج الروبوت من فئة Spot أو Go2، الذي يسير في مسار دورية ثابت مزودًا بتقنية كشف متطورة وكاميرا حرارية، إلى وحدة تحكم 72B VLM. يقوم جهاز Jetson المدمج بهذه المهمة. تُرسل البيانات إلى السحابة لتحليلها بعد انتهاء الدورية، وليس أثناءها.
- عروض تجريبية وتجارب فردية. تحتاج إلى تشغيل النظام لعرض تجاري، أو لعرض تقديمي للعميل، أو لإثبات جدوى الفكرة لمدة ثلاثة أسابيع. الحوسبة السحابية تُمكّنك من ذلك في غضون ساعات. أما الاستثمار الرأسمالي في البنية التحتية المحلية فهو غير مناسب لحجم عمل سيتم إيقافه خلال شهر.
- الاستخدام كهواية ولأغراض تعليمية. مختبر جامعي مزود بجهاز G1 EDU واحد، وميزانية محدودة، ويركز على تدريب التعلم المعزز بدلاً من الاستدلال. يمكن لجهاز Jetson ومحطة عمل 4090 واحدة استيعاب ما يكفي لإجراء بحوث ذات قيمة. أما باقة K-AI الكاملة (8×) فهي غير مناسبة.
- أعباء العمل اللغوية البحتة. روبوت يتكلم لكنه لا يرى - مساعد صوتي فقط على أرجل. واجهة برمجة تطبيقات إدارة دورة حياة البرمجيات السحابية مناسبة. يُراعى أن يكون زمن الاستجابة مناسبًا للمحادثة، وليس للحلقة المغلقة.
النمط: إذا لم يكن الروبوت الخاص بك يشغل نظام إدارة التعلم الافتراضي الحقيقي في حلقة الإدراك المغلقة، فلن تحتاج إلى طبقة الحافة المخصصة. أما إذا كان يشغلها، فأنت بحاجة إليها.
عندما يثبت المسار المحلي صحة ذلك
يصبح مستوى الحافة المخصص هو الحل الأمثل عندما يكون واحد على الأقل مما يلي صحيحًا، ومن الأفضل أن يكون اثنان أو أكثر:
- نظام إدارة دورة حياة المركبة الحقيقي يكون في حلقة مغلقة. ليس "للاستفسارات العرضية" — in حلقة الإدراك إلى الفعل، التي تعمل كل 100-500 مللي ثانية. هذا هو السبب الهيكلي لوجود البنية التحتية المحلية.
- حمل مستمر. ثماني ساعات يومياً، خمسة أيام في الأسبوع، إلى أجل غير مسمى. يتم استهلاك النفقات الرأسمالية. تتراكم تكلفة المكالمات السحابية إلى أجل غير مسمى.
- لا يمكن للبيانات مغادرة المبنى. اللائحة العامة لحماية البيانات (GDPR)، وقانون قابلية نقل التأمين الصحي والمساءلة (HIPAA)، ولوائح الاتجار الدولي بالأسلحة (ITAR)، والمنافسة، أو مجرد شكوك. تبقى البيانات على الشبكة المحلية (LAN). هذا أمر غير قابل للتفاوض.
- روبوتات متعددة. وحدتان أو أكثر تتشاركان ذاكرة المشهد أو تنسقان المهام. يتم احتساب استهلاك الخادم المشترك لكل روبوت على حدة، وينهار هامش زمن الاستجابة بين الروبوتات.
- التخصيص مهم. وحدات معالجة افتراضية دقيقة، وإصدارات نماذج مثبتة، ورؤوس خاصة على هياكل أساسية مفتوحة، وتقنيات تكميم متخصصة. الحرية هي المنتج.
- سرعة التكرار مهمة. يقوم الفريق بتحديث السياسات أسبوعياً أو بوتيرة أسرع. وتساهم عمليات المحاكاة والتدريب على نفس الأجهزة المستخدمة في الاستدلال في تقليص مدة العملية من أيام إلى ساعات.
إذا قمت بتحديد ثلاثة أو أكثر من تلك الخيارات، فإن السؤال لم يعد مطروحًا. if محليًا ولكن أي مقاستكفي وحدة معالجة الرسومات K-AI 96 ذات الأربع وحدات (RTX 4090 أو 5090) لتشغيل روبوت واحد في مهام حقيقية. أما وحدة معالجة الرسومات K-AI 256 ذات الثماني وحدات (5090 أو Pro 6000 Blackwell) فهي الخيار الأمثل لأسطول صغير، أو أكبر وحدات VLM، أو أي عملية نشر تتطلب تدريبًا بالإضافة إلى الاستدلال.
ماذا تفعل بعد ذلك
إذا كنت بصدد تحديد نطاق عملية نشر، فإن الأسئلة التي تحدد الإجابة هي:
- هل يوجد VLM في نظام الحلقة المغلقة الخاص بك؟ إذا كانت الإجابة بنعم، فأنت بحاجة إلى المستوى المتقدم. إذا كانت الإجابة بلا، فتجاوز الباقي.
- كم عدد الروبوتات، في ذروة التشغيل وفي التشغيل المستدام؟ يُحدد هذا عدد وحدات معالجة الرسومات. قاعدة عامة: يحتاج نظام إدارة الأجهزة الافتراضية (VLM) الواحد على نطاق واسع إلى 4 وحدات معالجة رسومات كحد أدنى؛ ويضيف كل روبوت إضافي في الأسطول وحدة معالجة رسومات واحدة تقريبًا من الطلب المتزامن.
- ما هو أكبر نموذج في خطتك المستقبلية، ليس فقط اليوم؟ اشترِ على المدى الزمني 24 شهرًا. تُعتبر قيمة الأصول الافتراضية من فئة 70 مليار دولار الحد الأدنى في عام 2026؛ ومن المرجح أن تتجاوز 100 مليار دولار بحلول عام 2027.
- أين يجب أن تبقى البيانات؟ إذا كانت الإجابة "داخل المبنى"، فإن الحل الوحيد الصحيح هو البنية التحتية المحلية. أما إذا كانت "داخل الاتحاد الأوروبي"، فالحل إما البنية التحتية المحلية أو سحابة سيادية تابعة للاتحاد الأوروبي. وإذا كانت "في أي مكان"، فلديك خيارات متعددة.
- التدريب، أم الضبط الدقيق، أم الاستدلال فقط؟ يُضاعف التدريب ميزانية وحدة معالجة الرسومات والتخزين ثلاث مرات تقريبًا. كن صادقًا مع نفسك بشأن ما إذا كان الفريق سينفذ ذلك بالفعل.
- نطاق الطاقة والتبريد؟ تكتشف معظم المختبرات بعد فوات الأوان أنها لا تستطيع توفير طاقة مستمرة تتراوح بين 4 و5 كيلوواط. لذا، خطط للغرفة قبل التركيب.
تتناول المقالات اللاحقة في هذه السلسلة موضوع الأسلاك بمزيد من التفصيل (I01 (منشورة سابقًا)، ومجموعة برامج خادم الاستدلال (I02 لاحقًا)، والنسخة المرجعية مع الأجزاء والمعايير (I05). خريطة القدرات الموضحة هنا هي لماذاهؤلاء هم كيف.
لا يُعدّ مستوى الاستدلال المحلي ترفًا أو خيارًا مفضلًا في عملية الشراء. بالنسبة للروبوتات التي تعمل بنظام إدارة التعلم الافتراضي (VLM) في عام 2026، فهو المستوى الوحيد الذي يُناسب الحسابات. أما أي مستوى آخر فهو حل وسط يُقدّم مع معرفة دقيقة بالقدرات التي تم التخلي عنها.
هذا جزء من موسوعة كينتينو، وهي سلسلة مرجعية حول الحوسبة الذكية، والروبوتات، والأنظمة التي تربط بينهما. نرحب بالتعليقات والتصويبات على البريد الإلكتروني info@kentino.com.