تصنيف البيئة تلقائيًا: نماذج العالم المدفوعة بتقنية VLM للروبوتات
مشاركة
في عام 2023، تطلّب إنشاء مجموعة بيانات موثوقة للروبوتات المنزلية ألف ساعة عمل بشرية لرسم مربعات حول الأكواب والكراسي. أما في عام 2026، فسيتم إنتاج نفس مجموعة البيانات في ليلة واحدة بواسطة مجموعة من نماذج الرؤية واللغة تعمل على خادم واحد مزود بثمانية وحدات معالجة رسومية. لا يزال العنصر البشري حاضرًا، ولكن فقط كمراجع لطبقة مختارة، وليس كمصنف رئيسي. تتناول هذه المقالة هذا التحول - ما يعنيه "التصنيف التلقائي" فعليًا للروبوت اليوم، وكيف تبدو آلية العمل، وأين تكمن نقاط الضعف، ولماذا يُعدّ حجم الحوسبة العامل الحاسم في قدرة فريقك على إنجاز هذه المهمة.
هذا جزء من مسار الروبوتات في ويكي كينتينو. وهو يشير إلى المراجع المتبادلة RX450 (حجة زمن الاستجابة للحوسبة الطرفية المخصصة) و I01 (بنية الذكاء الاصطناعي الطرفية مع الاستدلال المحلي). سيتناول إصدار I05 القادم بالتفصيل البنية المرجعية المصممة خصيصًا لهذا النوع من أحمال العمل.
ما معنى التسمية التلقائية في مجال الروبوتات
كانت عملية معالجة الصور الحاسوبية التقليدية تفترض ندرة البيانات المصنفة وارتفاع تكلفتها. فرسم مربع محيط حول "كوب" كان يكلف الإنسان عشر ثوانٍ وبضعة سنتات. أما قناع التجزئة الدقيق على مستوى البكسل فكان يكلف دقيقة ودولاراً واحداً. بينما كان قناع التجزئة إطاراً بإطار عبر مقطع فيديو مدته ثلاثون ثانية يكلف ثمن سيارة صغيرة.
تُعدّ مجموعات بيانات الروبوتات غير ملائمة لهذا النموذج. ينتج عن عملية مسح واحدة لروبوت رباعي الأرجل لمدة ثلاثين دقيقة بمعدل 30 إطارًا في الثانية 54,000 إطار. بينما ينتج عن جلسة تحكم عن بُعد لروبوت بشري على مدار يوم عمل مئات الآلاف من الإطارات. كل إطار، في الوضع الأمثل، يحتاج إلى:
- مربعات إحاطة الكائنات (مفردات مفتوحة، وليس فقط فئات COCO الثمانين)
- أقنعة تجزئة المثيلات (حتى تتمكن السياسة من التفكير في المناطق القابلة للفهم)
- وصف المشهد بلغة طبيعية (بحيث يمكن ربط مصفوفة التعلم الافتراضية بها)
- تتبع الهوية عبر الإطارات (بحيث يبقى "الكوب الأحمر" هو نفس الكوب)
- اختياري: تقديرات الموقع ثلاثية الأبعاد، مدمجة مع بيانات العمق أو بيانات LiDAR
تتلاشى جدوى الاعتماد على المُعلِّق البشري في أيٍّ من هذه التقنيات عند أول ألف إطار. "التصنيف التلقائي" هو المصطلح الشامل لاستخدام النماذج الأساسية - مثل نماذج التعلم المرئي، وكاشفات المفردات المفتوحة، ومجزئات النصوص القابلة للتوجيه - لإنتاج هذه التصنيفات بسرعة الاستدلال بدلاً من سرعة نقرة المستخدم.
إن التحول الذي طرأ منذ عام 2023 ليس تحولاً فلسفياً، بل هو تحول آلي. فقد تغيرت ثلاثة أشياء خلال فترة الثمانية عشر شهراً نفسها:
- أصبح اكتشاف المفردات المفتوحة قابلاً للاستخدام. انتقلت عمليات تأريض الديناصورات، وOWLv2، وFlorence-2 من "عرض توضيحي مثير للاهتمام" إلى "مستوى إنتاجي لحوالي 80٪ من الأشياء الشائعة" بين منتصف عام 2024 وأواخر عام 2025.
- تم إطلاق ميزة تقسيم الفيديو القابلة للتوجيه. أتاح نظام SAM 2 (منتصف عام 2024) ونظام SAM 3 (الذي صدر في نوفمبر 2025) إمكانية تتبع الأقنعة عبر مقاطع الفيديو بتكلفة منخفضة عند إدخال عبارة اسمية. ويقبل نظام SAM 3 تحديدًا عبارات مفاهيمية مباشرة - مثل "حافلة مدرسية صفراء" - ويعيد الأقنعة بالإضافة إلى هويات ثابتة.
- تم إيقاف تشغيل أجهزة VLM. يُخرج برنامج Qwen2.5-VL (أوائل عام 2025) وعائلة Qwen3-VL اللاحقة مربعات إحاطة على شبكة البكسل الحقيقية بتنسيق JSON ثابت. يمكنك إدخال أمر "list every object in this image as JSON with bbox and one-sating description" إلى نموذج VLM بحجم 72 بايت، وستحصل على بيانات يمكنك استخدامها في حلقة التدريب.
إن أحدث التقنيات في عام 2026 ليست نموذجاً واحداً، بل هي عبارة عن خط أنابيب متكامل.
بنية خط الأنابيب
تبدو مجموعة أدوات التسمية التلقائية المرجعية كما يلي:
يتم تخزينها على وحدة تخزين NVMe محلية، ثم تتم مزامنتها مع الخادم
في: مفردات الإطار + التعليق (أو التعليق الحر الذي تم إنشاؤه بواسطة VLM)
خارج: مربعات الإحاطة + تسميات الفئات لكل إطار
خارج: أقنعة لكل حالة، تتبع الهوية عبر المقطع
في: إطار + صناديق/أقنعة من المرحلتين 1 و2
خارج: شرح لكل إطار، شرح لكل عنصر، العلاقات بين العناصر ("الكوب على الطاولة")
عرض الملصقات في شكل ثلاثي الأبعاد عبر العمق ووضع الكاميرا
إزالة التكرارات بين طرق العرض، وبناء مخزن مثيلات الكائنات
قام المراجع بتصحيح الأخطاء في Roboflow / Labelbox / V7
تُعتبر التصحيحات بمثابة إشارة تدريبية
أو ربط سياسة التلاعب بالمسارات المحددة
مسار التسمية التلقائية ذو الست مراحل: التسجيل ← التأريض ← التجزئة ← الوصف ← التجميع ← المراجعة ← التدريب
هناك بعض الأمور التي يجدر ذكرها قبل أن ننتقل إلى موضوع آخر.
أولا، غالباً ما يتم دمج المرحلتين 1 و 2 في نظام الدفاع الجوي الأرضي 2تُعدّ هذه المنصة المفتوحة من IDEA-Research بمثابة خط أنابيب يربط بين Grounding DINO (أو Florence-2 أو DINO-X) وSAM 2 دفعةً واحدة. ويُعتبر نصّ التسمية التلقائية في هذا المستودع تطبيقًا نموذجيًا لـ "المربعات والأقنعة من عبارة اسمية". ومع واجهة SAM 3 التي تعتمد على مُوجّهات المفاهيم، يُصبح الأمر أكثر بساطةً - إذ تُدخل الكلمات، فتُعرض لك الأقنعة المُتعثّرة.
الثاني، المرحلة الثالثة هي المرحلة المكلفة وهذا هو الجانب الذي يُعد فيه اختيار النموذج بالغ الأهمية. فنموذج VLM ذو 7 بت (Qwen2.5-VL 7B، Florence-2 كبير) يُنتج تعليقات توضيحية متماسكة بتكلفة منخفضة، ولكنه يُغفل بعض التفاصيل الدقيقة. أما نموذج الفئة 72 بت فيُنتج أوصافًا أكثر ثراءً بشكل ملحوظ، ويُحدد العلاقات بدقة أكبر، وهو أكثر فائدة بكثير لتدريب VLA اللاحق - بتكلفة تُقارب عشرة أضعاف لكل إطار.
الثالث، المرحلة الرابعة هي ما يقصده الناس عندما يقولون "النموذج العالمي" في هذا السياق. ليس نموذج فيديو توليديًا مثل Cosmos Predict، بل هو مخزن بيانات ثلاثي الأبعاد دائم يُحدد "ما هي الأشياء الموجودة في هذه الغرفة، وأين هي، وكيفية ارتباطها ببعضها". يُعد ConceptGraphs النموذج الأمثل مفتوح المصدر؛ وقد أثبت OK-Robot قدرته على التوسع ليشمل حوالي 170 مهمة التقاط ووضع في عشرة منازل. نموذج العالم هو ما يجعل التصنيفات قابلة لإعادة الاستخدام: فعندما يعود الروبوت غدًا، لا يبدأ من الصفر.
ما الذي تجيده وحدات إدارة الخوادم الافتراضية، وأين تفشل
جدول صادق، لأن المواد التسويقية لكل نموذج من هذه النماذج مضللة في اتجاهات مختلفة:
| مهمة | جودة حزمة VLM (2026) |
|---|---|
| الكشف عن الأشياء الشائعة (المطبخ، المكتب) | أسعار — نسبة تذكر تزيد عن 90%، نسبة هلوسة منخفضة |
| فئات الروايات ذات المفردات المفتوحة | جيد ولكنه غير متساوٍ - يعتمد على الصياغة |
| تجزئة دقيقة على مستوى البكسل مع مراعاة المربع الجيد | أسعار — تم حل مسألة SAM 2/3 بشكل أساسي |
| تتبع الهوية عبر مقطع فيديو مدته 30 ثانية | جيد مع نظام SAM 3، متوسط مع نظام SAM 2 وحده |
| عدّ (عدد الأكواب على الطاولة) | فقير — تُصاب أجهزة VLM بالهلوسة العددية بشكل مستمر |
| أشياء صغيرة / بعيدة | فقير — تنخفض المربعات إلى أقل من 20 بكسل بشكل موثوق |
| حركة سريعة (مقبض، ذراع متأرجح، جسم ساقط) | فقير — يؤدي تشويش الحركة إلى تعطيل كل من الكشف والتجزئة |
| ظروف الإضاءة القصوى (الوهج، الإضاءة المنخفضة، الأشعة تحت الحمراء) | فقير — لا يشمل توزيع التدريب هذا الأمر |
| أشياء متطابقة متكررة (صناديق مكدسة) | فقير — يصبح تتبع الهوية مربكاً |
| فئات جديدة من مجال صناعي متخصص | مسبح — المفردات المفتوحة "مفتوحة" ضمن نطاق ImageNet |
| وصف المشهد الحر (فقرة) | أسعار — وحدات VLM 72B جيدة حقًا هنا |
| العلاقات المكانية (على، تحت، خلف) | جيد — جهاز Qwen2.5-VL يتعامل مع هذا الأمر بشكل موثوق |
أهم مكالمة صادقة على الإطلاق: تُصدر أجهزة وضع الملصقات التلقائية ضوضاء. في الدراسات المنشورة خلال عامي 2025 و2026، تراوحت نسبة الخطأ في اكتشاف المفردات المفتوحة في المجالات غير الموزعة بين 5% و15%، وذلك بحسب طريقة القياس. وأشارت ورقة بحثية بعنوان "GroundCount" نُشرت في أوائل عام 2026 إلى تحسن بنسبة 6.6 نقطة مئوية في دقة العد بمجرد إضافة تأريض صريح للكاشف إلى نموذج المفردات الافتراضية (VLM)، مما يعني أن نماذج المفردات الافتراضية وحدها لا تزال تعاني من أخطاء كبيرة في العد. لا يُعدّ هذا عيبًا جوهريًا، ولكنه يعني أن استخدام مسار تصنيف تلقائي غير مُراجع بشكل كامل غير آمن لبيانات التدريب الحساسة للسلامة.
إن إجراءات التخفيف التي تُجدي نفعاً في الواقع هي مراجعة العينات على مرحلتينتقوم بتصنيف جميع البيانات تلقائيًا، ثم تسحب من 1 إلى 5% من الإطارات للمراجعة البشرية بناءً على مؤشر عدم اليقين (إنتروبيا رمز VLM، وثقة الكاشف، واختلاف النماذج المتعددة). يقوم المراجعون بالتصحيح، وتُستخدم هذه التصحيحات إما كبيانات تدريب مباشرة أو كمعلومات مرجعية لإعادة ضبط عتبات ثقة المصنف التلقائي. هذه هي نفس الحلقة التي تم تدريب مجموعة بيانات Florence-2 عليها - حيث تم بناء مجموعة بيانات FLD-5B من مايكروسوفت عن طريق دمج نماذج متخصصة ثم أخذ عينات للمراجعة.
البصمة الحاسوبية - لماذا يتم تثبيت هذا محليًا
هذا هو الجزء الذي يفاجئ الأشخاص الذين لم يجروا الحسابات.
لنأخذ مثالاً نموذجياً: ساعة واحدة من لقطات الروبوت بسرعة 10 إطارات في الثانية من كاميرا ستيريو بدقة 1080 بكسل. هذا يعني 36,000 إطار. أنت تريد جميع أنواع التسميات الأربعة: المربعات، والأقنعة، والتعليقات التوضيحية، والهوية المُتعقبة.
التكلفة التقريبية لكل إطار على بطاقة RTX 5090 واحدة (32 جيجابايت، بلاكويل، ~104 تيرافلوب FP16):
| المرحلة | لكل إطار | 36000 إطار |
|---|---|---|
| تأريض الديناصور (صغير) | ~30 مللي ثانية | 18 دقيقة تقريبًا |
| SAM 2 كبير، قناع + انتشار | ~25 مللي ثانية | 15 دقيقة تقريبًا |
| شرح Qwen2.5-VL 7B | ~250 مللي ثانية | ~ 2.5 ساعات |
| Qwen2.5-VL 72B caption (INT4, batch) | ~1.5–3 ثوانٍ | ~15–30 ساعة |
| فلورنسا-2 كبير (شرح فقط) | ~80 مللي ثانية | 48 دقيقة تقريبًا |
هذه الأرقام تقريبية، وتفترض معالجة دفعية معقولة، وخدمة vLLM، وتكميم FP16/INT4 عند الاقتضاء. يعمل SAM 2 وحده بسرعة 44 إطارًا في الثانية تقريبًا على معالج A100 في الاختبار المعياري الأصلي، لذا فإن 50-60 إطارًا في الثانية تقريبًا على معالج 5090 أمر واقعي.
الخط المثير للاهتمام هو VLM 72B. إذا كنت ترغب في الحصول على أوصاف غنية للمشاهد لكل إطار من VLM من فئة 72B، لا يمكنك القيام بذلك على وحدة معالجة رسومية واحدة في الوقت الفعلي. انت ايضا:
- يتم تقليل حجم العينة بشكل كبير - يتم إضافة تعليق كل 10 إطارات، ويتم استكمال الباقي. هذا ما تفعله معظم عمليات الإنتاج في الواقع.
- استخدم VLM أصغر (فئة 7B–11B) لكل إطار واحتفظ بـ 72B للإطارات الرئيسية فقط.
- أضف المزيد من وحدات معالجة الرسومات (GPUs) - وعند هذه النقطة يصبح وجود ثماني وحدات 5090 في هيكل واحد هو الحد الأدنى للنطاق العملي.
تبلغ التكلفة الإجمالية لعملية وضع العلامات التلقائية الكاملة على ساعة واحدة من لقطات بمعدل 10 إطارات في الثانية باستخدام جهاز 72B في الحلقة ما يلي: حوالي 4-8 ساعات من تشغيل وحدة معالجة الرسومات على شريحة بلاكويل الاستهلاكيةويمكن لهيكل 8× 5090 K-AI 256 أن ينهي ذلك في أقل من ساعة واحدة من وقت التشغيل الفعلي مع التوازي عبر وحدات معالجة الرسومات.
والآن، لننتقل إلى حسابات الحوسبة السحابية. نفس حجم العمل على منصة سحابية فائقة التوسع:
- الحساب: مماثل، وربما أرخص في أسعار السوق الفورية.
- خروج البيانات: كارثي. يبلغ حجم تسجيل ستيريو بدقة 1080p بمعدل 10 إطارات في الثانية لمدة ساعة حوالي 30-80 جيجابايت من البيانات الخام، وقد يزيد هذا الحجم إذا احتفظت بعمق الصورة. تكلفة تخزين هذه البيانات في السحابة واستخراج البيانات منها ضئيلة للغاية، حيث تتراوح بين بضعة سنتات عند التخزين وعشرات الدولارات عند الاستخراج. وقد أوضحت ورقة بحثية صادرة عن شركة Robo-DM من جامعة بيركلي عام 2025 هذه التكلفة بدقة: إذ تبلغ تكلفة تخزين 8.9 تيرابايت من بيانات Open-X على Google Cloud 172 دولارًا شهريًا، بينما تتراوح تكلفة كل عملية تنزيل كاملة بين 172 و1,540 دولارًا حسب مستوى الخدمة. وإذا ما تم تطبيق هذه التكلفة على أسطول من أجهزة التسجيل التي تسجل مئات الساعات أسبوعيًا، فإن تكلفة الاستخراج وحدها تتجاوز تكلفة استهلاك رأس المال لخادم محلي واحد خلال عام واحد.
- زمن الاستجابة في الحلقة: طويل. يكمن جوهر نظام الوسم التلقائي في الحلقة المغلقة - التسجيل اليوم، والوسم الليلة، والضبط الدقيق غدًا، ونشر السياسة المحسّنة بحلول الصباح. وتضيف عملية النقل ذهابًا وإيابًا عبر السحابة ساعات من وقت التحميل على وصلة الإرسال النموذجية للمختبر.
- الخصوصية: مشكلة. نفس حجة البيانات المنظمة من RX450 ينطبق هذا هنا. لا يتم إرسال فيديو الروبوت الخام من غرفة المريض أو أرضية المصنع أو مختبر الدفاع إلى وحدة معالجة الرسومات الخاصة بأي شخص آخر.
لهذا السبب، يمتلك كل مختبر روبوتات جاد في عام 2026 جهاز حاسوب خاصًا بالوسم التلقائي. يُعدّ جهاز K-AI 256 Turin Dual المزود بثمانية معالجات رسومية RTX 5090 مناسبًا تمامًا لهذا النوع من العمل - ذاكرة وصول عشوائي (RAM) بسعة 256 جيجابايت، وثمانية معالجات رسومية لمراحل المعالجة المتوازية، ووحدة تخزين NVMe لتخزين البيانات. أما خيار الترقية فهو جهاز Blackwell المزود بأربعة معالجات رسومية RTX Pro 6000، عندما يرغب الفريق في تشغيل 72B بدقة FP16 بدلًا من INT4، مع الاحتفاظ بعدد أكبر من النماذج المتزامنة.
الحلقة المغلقة
إن السبب في أن البنية التحتية المحلية تؤتي ثمارها ليس في خاصية وضع العلامات التلقائية نفسها، بل في الحلقة التي تتيحها.
حلقة مغلقة يومية — تسجيل ← تصنيف تلقائي ← مراجعة ← ضبط دقيق ← تحقق ← نشر
هذه هي الحلقة التي صُممت من أجلها وصفة OpenVLA-OFT (مارس 2025): ضبط دقيق أسرع بمقدار 25-50 مرة من OpenVLA الأساسية، ومصممة لتناسب خادم GPU واحد من فئة محطات العمل. FLaRe (مؤتمر ICRA 2025) هو نظير التعلم المعزز. يتيح لك العمل المستمر على الضبط الدقيق القائم على المحولات (OMLA، LifeLong-RFT) التكيف دون نسيان كارثي.
لا شيء من هذا يعمل بوتيرة ذهاب وإياب البيانات السحابية. الحلقة هي القيمة، وتتطلب الحلقة أن تكون البيانات والحوسبة في نفس المبنى.
مثال ملموس - روبوت منزلي
ولجعل هذا الأمر ملموساً، تخيل أبسط مسار قابل للتطبيق لوضع العلامات التلقائية لإنسان آلي يقوم بالمهام المنزلية (تحميل غسالة الصحون، طي الملابس، جلب العناصر من صندوق مُصنف).
تسجيل: يحتوي الروبوت البشري على كاميرات ستيريو RGB بمعدل 30 إطارًا في الثانية، وكاميرات للمعصم بمعدل 15 إطارًا في الثانية، وتقنية العمق من خلال الستيريو النشط، وحالات المفاصل بمعدل 200 هرتز. وتنتج جلسة عمل لمدة ساعتين حوالي 250 جيجابايت من البيانات الخام على وحدة التخزين NVMe المدمجة.
مزامنة: في نهاية الجلسة، يقوم الروبوت بتحميل البيانات إلى خادم K-AI الخاص بالمختبر عبر الاتصال السلكي أو Wi-Fi 6E، ويستغرق ذلك حوالي 5-10 دقائق لـ 250 جيجابايت.
المرحلة 1+2 (الأرضي-سام 2): كشف المفردات المفتوحة باستخدام مفردات مجال تضم حوالي 200 اسم منزلي (مثل: كوب، ملعقة مسطحة، سلة غسيل، منشفة أطباق زرقاء...) بالإضافة إلى أدوات التنفيذ الخاصة بالوكيل. يقوم SAM 2 بنشر الأقنعة عبر المقاطع. مدة التشغيل على 8× 5090: حوالي 45 دقيقة.
المرحلة 3 (Qwen2.5-VL): 7 بايت VLM في كل إطار لعرض تعليق موجز، و72 بايت في كل إطار عاشر لعرض وصف أكثر تفصيلاً بالإضافة إلى العلاقات بين العناصر. مدة التشغيل: حوالي 3 ساعات.
المرحلة الرابعة (مخطط المشهد): يقوم نظام تجميع البيانات، على غرار ConceptGraphs، بإنشاء رسم بياني ثلاثي الأبعاد ثابت للشقة. وبحلول نهاية الأسبوع، يكون كل عنصر رآه الروبوت موجودًا في الرسم البياني، مع مُعرّف ثابت، ووصف لغوي، وموقع ثلاثي الأبعاد تقريبي. المدة التقريبية: بضع دقائق لكل جلسة، موزعة على فترات زمنية.
المرحلة الخامسة (مراجعة): تُحدد أداة داخلية الإطارات التي تقل فيها ثقة تصنيف نموذج التعلم المرئي عن 0.6، أو التي يختلف فيها تصنيف المرحلة الأولى عن تصنيف المرحلة الثالثة. يُراجع كل مُراجع حوالي 500 إطار في الساعة. وبمعدل عينة 5% في جلسة مدتها ساعتان، يُعادل ذلك ساعة عمل بشرية تقريبًا يوميًا.
المرحلة السادسة (التدريب): تُغذي التصنيفات المصححة عملية ضبط دقيقة لخوارزمية VLA على غرار تقنية OFT. يقوم خادم K-AI بتشغيل هذه العملية طوال الليل على نفس الجهاز الذي قام بعملية التصنيف التلقائي - حيث يتم تنفيذ مهام العمل بالتسلسل، وليس بالتزامن.
هذا ليس مجرد تجربة فكرية بحثية. هذا ما ستفعله فعلياً شركات 1X وSkilld AI والمجموعات البحثية المنشورة التي تستخدم OpenVLA في عام 2026، مع بعض الاختلافات الداخلية. المنصة مفتوحة، والنماذج متاحة للجميع، والعائق يكمن في القدرة الحاسوبية والجهد الهندسي، وليس في الوصول إلى الخوارزميات.
حدود صادقة
ثلاثة أمور لا ينبغي لهذه المقالة أن تتجاهلها دون الإشارة إليها:
الهلوسة حقيقية ومستمرة. حتى مع وجود نظام مراجعة ثنائي المراحل، لا يُمكن الاعتماد على الملصقات التلقائية غير المُراجعة في التدريب على السلامة (تجنب الاصطدام، قرارات التلامس، أي شيء قد يُؤدي فيه ملصق خاطئ إلى إلحاق الضرر بالروبوت أو الإنسان). استخدمها لتدريب القدرات، وليس لتدريب السلامة. ففي مجال السلامة، لا تزال البيانات المُدققة ضرورية.
يؤدي التأريض خارج نطاق التوزيع إلى تدهور سريع. سيكون أداء نظام تصنيف الصور الافتراضي (VLM) المدرب بشكل أساسي على صور الويب ممتازًا في المطابخ والمكاتب، ولكنه سيكون أقل كفاءة بشكل ملحوظ في ورش تصنيع آلات CNC أو أجنحة المستشفيات. يكمن الحل في ضبط نظام التصنيف التلقائي نفسه بدقة بما يتناسب مع كل مجال، وهو ما يتطلب تكلفة إضافية.
إن النموذج العالمي هشٌّ تجاه التغيرات البيئية. تفترض المخططات المفاهيمية وما شابهها أن العالم ثابت تقريبًا بين الزيارات. عند تحريك الأثاث، يلزم إعادة بناء مخطط المشهد أو إعادة التحقق منه بشكل مكثف. هناك عمل جارٍ على هذا (مخططات المشاهد ذات المفردات المفتوحة على الإنترنت، وورقة بحثية من مختبرات نيفر لعام 2025، وغيرها)، ولكن يجب التعامل مع نموذج العالم على أنه استشاري وليس مرجعًا نهائيًا.
التقديرات الحسابية هنا تقريبية. تعتمد جميع الأرقام لكل إطار على استراتيجية التجميع، والتكميم، وطول الإشارة، ودقة الصورة. اعتبر الجدول بمثابة ترتيب تقريبي. هذا الترتيب التقريبي هو ما يهم في تحديد حجم المربع.
ماذا تفعل بعد ذلك
إذا كنت بصدد تقييم ما إذا كان ينبغي إنشاء نظام تصنيف تلقائي:
- حدد ما تحتاج فعلاً إلى وضع ملصقات عليه. يكفي استخدام Grounded-SAM 2 على وحدة معالجة رسومية واحدة فقط لإنشاء الصناديق والأقنعة. أما بالنسبة للتعليقات التوضيحية والعلاقات، فأنت بحاجة إلى حجم بيانات افتراضية (VLM) لا يقل عن 7-11 مليار. وللحصول على أوصاف غنية لتدريب VLA، فأنت بحاجة إلى حجم بيانات افتراضية من فئة 72 مليار، ويجب عليك تخصيص ساعات استخدام وحدة المعالجة الرسومية بدقة.
- قم بمراجعة نطاقك. هل الأشياء التي تهمك موجودة ضمن توزيع التدريب الخاص بكاشفات المفردات المفتوحة؟ إذا كنت تعمل في الغالب في المطابخ أو المكاتب أو المستودعات، فالإجابة هي نعم. أما في المجالات الصناعية أو الطبية المتخصصة، فخطط لضبط نظام التصنيف التلقائي بدقة قبل الاعتماد عليه.
- خطط لمستوى المراجعة من اليوم الأول. اختر أداة (مثل Roboflow أو Labelbox أو V7 أو أداة محلية الصنع تعتمد على أخذ العينات بناءً على عدم اليقين) وخصص ميزانية لمراجع واحد على الأقل بدوام كامل لكل عشر ساعات عمل للروبوت يوميًا. لا يحل نظام التصنيف التلقائي محل البشر، بل يغير طريقة عملهم.
- حدد حجم الحساب للخطوة 72B. يمكن تركيب المراحل الأخرى على أي جهاز. يُعدّ معالج VLM ذو سعة 72 بت عند استخدامه على نطاق واسع هو ما يبرر الحاجة إلى خادم ثماني وحدات معالجة رسومية. إذا كان خط أنابيبك يستخدم فقط معالجات VLM من فئة 7 بت، فإن جهازًا بأربع وحدات معالجة رسومية يكفي. أما إذا كنت ترغب في الحصول على أوصاف أكثر تفصيلًا وضبط دقيق للحلقة المغلقة، فستحتاج إلى تكوين ثماني وحدات معالجة رسومية.
- ضع طبقة التخزين على NVMe والطبقة الباردة على القرص الدوار. يبلغ حجم بيانات تسجيل أسطول المركبات لمدة أسبوع تيرابايتات. ويكون أداء نظام التصنيف التلقائي مقيدًا بعمليات الإدخال/الإخراج أكثر من قدرة معالجة وحدة معالجة الرسومات عند استخدام النماذج الأصغر حجمًا.
تشكيلة كينتينو تضم K-AI 256 Turin Dual / 8× RTX 5090 تم تصميمها لتناسب هذا العبء من جانب المستهلك-السيليكون، و K-AI 4× RTX Pro 6000 Blackwell في الطرف ذي سعة ذاكرة الفيديو العالية، عندما ترغب في تشغيل عدة وحدات VLM كبيرة الحجم في وقت واحد. تجد تفاصيل الأسعار والتكوين في صفحات المنتج ذات الصلة، وفي مقال لاحق ضمن سلسلة I05 يشرح بالتفصيل التكوين المرجعي الكامل.
تتطور أحدث تقنيات هذه البنية كل ثلاثة أشهر - فـ SAM 3 مضى عليها ستة أشهر، وQwen3-VL صدرت حديثًا، وCosmos Reason 2 حديثة الإصدار - لذا ستصبح النماذج المحددة في هذه المقالة قديمة أسرع من البنية نفسها. أما البنية نفسها فهي مستقرة الآن. مربعات، أقنعة، تعليقات توضيحية، مخطط المشهد، مراجعة، تدريب، نشر. هذه الدورة مستمرة ولن تتغير.
هذا جزء من موسوعة كينتينو، وهي سلسلة مرجعية حول الحوسبة الذكية، والروبوتات، والأنظمة التي تربط بينهما. نرحب بالتعليقات والتصويبات على البريد الإلكتروني info@kentino.com.