تصنيف البيئة تلقائيًا: نماذج العالم المدفوعة بتقنية VLM للروبوتات
مشاركة
في عام 2023، تطلّب إنشاء مجموعة بيانات موثوقة للروبوتات المنزلية ألف ساعة عمل بشرية لرسم مربعات حول الأكواب والكراسي. أما في عام 2026، فسيتم إنتاج نفس مجموعة البيانات في ليلة واحدة بواسطة مجموعة من نماذج الرؤية واللغة تعمل على خادم واحد مزود بثمانية وحدات معالجة رسومية. لا يزال العنصر البشري حاضرًا، ولكن فقط كمراجع لطبقة مختارة، وليس كمصنف رئيسي. تتناول هذه المقالة هذا التحول - ما يعنيه "التصنيف التلقائي" فعليًا للروبوت اليوم، وكيف تبدو آلية العمل، وأين تكمن نقاط الضعف، ولماذا يُعدّ حجم الحوسبة العامل الحاسم في قدرة فريقك على إنجاز هذه المهمة.
هذا جزء من مسار الروبوتات في ويكي كينتينو. وهو يشير إلى R08 (حجة زمن الاستجابة للحوسبة الطرفية المخصصة) و I01 (بنية الذكاء الاصطناعي الطرفية مع الاستدلال المحلي). سيتناول الإصدار I05 القادم بالتفصيل البنية المرجعية المصممة خصيصًا لهذا النوع من أحمال العمل.
ما معنى التسمية التلقائية في مجال الروبوتات
كانت عملية معالجة الصور الحاسوبية التقليدية تفترض ندرة البيانات المصنفة وارتفاع تكلفتها. فرسم مربع محيط حول "كوب" كان يكلف الإنسان عشر ثوانٍ وبضعة سنتات. أما قناع التجزئة الدقيق على مستوى البكسل فكان يكلف دقيقة ودولاراً واحداً. بينما كان قناع التجزئة إطاراً بإطار عبر مقطع فيديو مدته ثلاثون ثانية يكلف ثمن سيارة صغيرة.
تُعدّ مجموعات بيانات الروبوتات غير ملائمة لهذا النموذج. ينتج عن عملية مسح واحدة لروبوت رباعي الأرجل لمدة ثلاثين دقيقة بمعدل 30 إطارًا في الثانية 54,000 إطار. بينما ينتج عن جلسة تحكم عن بُعد لروبوت بشري على مدار يوم عمل مئات الآلاف من الإطارات. كل إطار، في الوضع الأمثل، يحتاج إلى:
- مربعات إحاطة الكائنات (مفردات مفتوحة، وليس فقط فئات COCO الثمانين)
- أقنعة تجزئة المثيلات (حتى تتمكن السياسة من التفكير في المناطق القابلة للفهم)
- وصف المشهد بلغة طبيعية (بحيث يمكن ربط مصفوفة التعلم الافتراضية بها)
- تتبع الهوية عبر الإطارات (بحيث يبقى "الكوب الأحمر" هو نفس الكوب)
- اختياري: تقديرات الموقع ثلاثية الأبعاد، مدمجة مع بيانات العمق أو بيانات LiDAR
تتلاشى جدوى الاعتماد على المُعلِّق البشري في أيٍّ من هذه التقنيات عند أول ألف إطار. "التصنيف التلقائي" هو المصطلح الشامل لاستخدام النماذج الأساسية - مثل نماذج التعلم المرئي، وكاشفات المفردات المفتوحة، ومجزئات النصوص القابلة للتوجيه - لإنتاج هذه التصنيفات بسرعة الاستدلال بدلاً من سرعة نقرة المستخدم.
إن التحول الذي طرأ منذ عام 2023 ليس تحولاً فلسفياً، بل هو تحول آلي. فقد تغيرت ثلاثة أشياء خلال فترة الثمانية عشر شهراً نفسها:
- أصبح اكتشاف المفردات المفتوحة قابلاً للاستخدام. انتقلت عمليات تأريض الديناصورات، وOWLv2، وFlorence-2 من "عرض توضيحي مثير للاهتمام" إلى "مستوى إنتاجي لحوالي 80٪ من الأشياء الشائعة" بين منتصف عام 2024 وأواخر عام 2025.
- تم إطلاق ميزة تقسيم الفيديو القابلة للتوجيه. أتاح نظام SAM 2 (منتصف عام 2024) ونظام SAM 3 (الذي صدر في نوفمبر 2025) إمكانية تتبع الأقنعة عبر مقاطع الفيديو بتكلفة منخفضة عند إدخال عبارة اسمية. ويقبل نظام SAM 3 تحديدًا عبارات مفاهيمية مباشرة - مثل "حافلة مدرسية صفراء" - ويعيد الأقنعة بالإضافة إلى هويات ثابتة.
- تم إيقاف تشغيل أجهزة VLM. يُخرج برنامج Qwen2.5-VL (أوائل عام 2025) وعائلة Qwen3-VL اللاحقة مربعات إحاطة على شبكة البكسل الحقيقية بتنسيق JSON ثابت. يمكنك إدخال أمر "list every object in this image as JSON with bbox and one-sating description" إلى نموذج VLM بحجم 72 بايت، وستحصل على بيانات يمكنك استخدامها في حلقة التدريب.
إن أحدث التقنيات في عام 2026 ليست نموذجاً واحداً، بل هي عبارة عن خط أنابيب متكامل.
بنية خط الأنابيب
تبدو مجموعة أدوات التسمية التلقائية المرجعية كما يلي:
يتم تخزينها على وحدة تخزين NVMe محلية، ثم تتم مزامنتها مع الخادم
في: مفردات الإطار + التعليق (أو التعليق الحر الذي تم إنشاؤه بواسطة VLM)
خارج: مربعات الإحاطة + تسميات الفئات لكل إطار
خارج: أقنعة لكل حالة، تتبع الهوية عبر المقطع
في: إطار + صناديق/أقنعة من المرحلتين 1 و2
خارج: شرح لكل إطار، شرح لكل عنصر، العلاقات بين العناصر ("الكوب على الطاولة")
عرض الملصقات في شكل ثلاثي الأبعاد عبر العمق ووضع الكاميرا
إزالة التكرارات بين طرق العرض، وبناء مخزن مثيلات الكائنات
قام المراجع بتصحيح الأخطاء في Roboflow / Labelbox / V7
تُعتبر التصحيحات بمثابة إشارة تدريبية
أو ربط سياسة التلاعب بالمسارات المحددة
مسار التسمية التلقائية ذو الست مراحل: التسجيل ← التأريض ← التجزئة ← الوصف ← التجميع ← المراجعة ← التدريب
هناك بعض الأمور التي يجدر ذكرها قبل أن ننتقل إلى موضوع آخر.
أولًا، غالبًا ما تُدمج المرحلتان 1 و2 في Grounded-SAM 2 ، وهي منصة مفتوحة المصدر من IDEA-Research تربط Grounding DINO (أو Florence-2 أو DINO-X) بـ SAM 2 دفعة واحدة. يُعدّ نصّ التسمية التلقائية في هذا المستودع التطبيقَ الأمثلَ لـ "المربعات والأقنعة من عبارة اسمية". مع واجهة SAM 3 التي تعتمد على مُوجّهات المفاهيم، يُصبح هذا الدمج أكثر سهولة - إذ تُدخل الكلمات، فتُعرض لك الأقنعة المُتعثّرة.
ثانيًا، المرحلة الثالثة هي الأكثر تكلفة، وفيها يكون لاختيار النموذج أهمية بالغة. يُنتج نموذج VLM ذو 7 بت (مثل Qwen2.5-VL 7B و Florence-2 large) تعليقات توضيحية متماسكة بتكلفة منخفضة، ولكنه يُغفل بعض التفاصيل الدقيقة. أما نموذج VLM ذو 7 بت، فيُنتج أوصافًا أكثر ثراءً بشكل ملحوظ، ويُحدد العلاقات بدقة أكبر، وهو أكثر فائدة بكثير لتدريب VLA اللاحق، بتكلفة تُقارب عشرة أضعاف لكل إطار.
ثالثًا، المرحلة الرابعة هي ما يُقصد بـ"نموذج العالم" في هذا السياق. إنه ليس نموذج فيديو توليدي مثل Cosmos Predict، بل هو مخزن بيانات ثلاثي الأبعاد ومستمر، يُحدد "ما هي الأشياء الموجودة في هذه الغرفة، وأين هي، وكيفية ارتباطها ببعضها". يُعد ConceptGraphs النموذج الأمثل مفتوح المصدر؛ وقد أثبت OK-Robot قابليته للتوسع ليشمل حوالي 170 مهمة التقاط ووضع في عشرة منازل. نموذج العالم هو ما يجعل التصنيفات قابلة لإعادة الاستخدام: فعندما يعود الروبوت غدًا، لن يبدأ من الصفر.
ما الذي تجيده وحدات إدارة الخوادم الافتراضية، وأين تفشل
جدول صادق، لأن المواد التسويقية لكل نموذج من هذه النماذج مضللة في اتجاهات مختلفة:
| مهمة | جودة حزمة VLM (2026) |
|---|---|
| الكشف عن الأشياء الشائعة (المطبخ، المكتب) | أسعار — نسبة تذكر تزيد عن 90%، نسبة هلوسة منخفضة |
| فئات الروايات ذات المفردات المفتوحة | جيد ولكنه غير متساوٍ - يعتمد على الصياغة |
| تجزئة دقيقة على مستوى البكسل مع مراعاة المربع الجيد | أسعار — تم حل مسألة SAM 2/3 بشكل أساسي |
| تتبع الهوية عبر مقطع فيديو مدته 30 ثانية | جيد مع نظام SAM 3، متوسط مع نظام SAM 2 وحده |
| عدّ (عدد الأكواب على الطاولة) | فقير — تُصاب أجهزة VLM بالهلوسة العددية بشكل مستمر |
| أشياء صغيرة / بعيدة | فقير — تنخفض المربعات إلى أقل من 20 بكسل بشكل موثوق |
| حركة سريعة (مقبض، ذراع متأرجح، جسم ساقط) | فقير — يؤدي تشويش الحركة إلى تعطيل كل من الكشف والتجزئة |
| ظروف الإضاءة القصوى (الوهج، الإضاءة المنخفضة، الأشعة تحت الحمراء) | فقير — لا يشمل توزيع التدريب هذا الأمر |
| أشياء متطابقة متكررة (صناديق مكدسة) | فقير — يصبح تتبع الهوية مربكاً |
| فئات جديدة من مجال صناعي متخصص | مسبح — المفردات المفتوحة "مفتوحة" ضمن نطاق ImageNet |
| وصف المشهد الحر (فقرة) | أسعار — وحدات VLM 72B جيدة حقًا هنا |
| العلاقات المكانية (على، تحت، خلف) | جيد — جهاز Qwen2.5-VL يتعامل مع هذا الأمر بشكل موثوق |
أهمّ ما يُمكن قوله بصراحة: التصنيفات التلقائية غير دقيقة. ففي الدراسات المنشورة بين عامي 2025 و2026، تراوحت نسبة الخطأ في اكتشاف المفردات المفتوحة في المجالات غير المُوزّعة بين 5% و15%، وذلك بحسب طريقة القياس. وقد أشارت ورقة بحثية بعنوان "GroundCount" نُشرت في أوائل عام 2026 إلى تحسّن بنسبة 6.6 نقطة مئوية في دقة العدّ بمجرّد إضافة تأريض صريح للكاشف إلى نموذج المفردات الافتراضية (VLM)، ممّا يعني أن نماذج المفردات الافتراضية وحدها لا تزال تُخطئ بشكل كبير في العدّ. لا يُعدّ هذا عيبًا جوهريًا، لكنّه يعني أن استخدام مسار تصنيف تلقائي غير مُراجع بشكل كامل ليس آمنًا لبيانات التدريب الحساسة للسلامة.
الحل العملي الفعال هو مراجعة العينات على مرحلتين : يتم تصنيف جميع الصور تلقائيًا، ثم تُسحب نسبة تتراوح بين 1% و5% من الإطارات للمراجعة البشرية بناءً على مؤشر عدم اليقين (مثل إنتروبيا رمز VLM، وثقة الكاشف، واختلاف النماذج المتعددة). يقوم المراجعون بالتصحيح، وتُستخدم هذه التصحيحات إما كبيانات تدريب مباشرة أو كمعلومات مرجعية لإعادة ضبط عتبات ثقة نظام التصنيف التلقائي. هذه هي نفس الحلقة التي دُرِّب عليها نموذج Florence-2 نفسه - فقد بُنيت مجموعة بيانات FLD-5B من مايكروسوفت من خلال دمج نماذج متخصصة ثم أخذ عينات للمراجعة.
البصمة الحاسوبية - لماذا يتم تثبيت هذا محليًا
هذا هو الجزء الذي يفاجئ الأشخاص الذين لم يجروا الحسابات.
لنأخذ مثالاً نموذجياً: ساعة واحدة من لقطات الروبوت بمعدل 10 إطارات في الثانية من كاميرا ستيريو بدقة 1080 بكسل. هذا يعادل 36,000 إطار. أنت بحاجة إلى جميع أنواع التصنيفات الأربعة: المربعات، والأقنعة، والتعليقات التوضيحية، والهوية المُتعقبة.
التكلفة التقريبية لكل إطار على بطاقة RTX 5090 واحدة (32 جيجابايت، بلاكويل، ~104 تيرافلوب FP16):
| المرحلة | لكل إطار | 36000 إطار |
|---|---|---|
| تأريض الديناصور (صغير) | ~30 مللي ثانية | 18 دقيقة تقريبًا |
| SAM 2 كبير، قناع + انتشار | ~25 مللي ثانية | 15 دقيقة تقريبًا |
| شرح Qwen2.5-VL 7B | ~250 مللي ثانية | ~ 2.5 ساعات |
| Qwen2.5-VL 72B caption (INT4, batch) | ~1.5–3 ثوانٍ | ~15–30 ساعة |
| فلورنسا-2 كبير (شرح فقط) | ~80 مللي ثانية | 48 دقيقة تقريبًا |
هذه الأرقام تقريبية، وتفترض معالجة دفعية معقولة، وخدمة vLLM، وتكميم FP16/INT4 عند الاقتضاء. يعمل SAM 2 وحده بسرعة 44 إطارًا في الثانية تقريبًا على معالج A100 في الاختبار المعياري الأصلي، لذا فإن 50-60 إطارًا في الثانية تقريبًا على معالج 5090 أمر واقعي.
الخط المثير للاهتمام هو VLM 72B. إذا كنت ترغب في الحصول على أوصاف غنية للمشاهد لكل إطار من VLM من فئة 72B، فلا يمكنك القيام بذلك على وحدة معالجة رسومية واحدة في الوقت الفعلي. أمامك خياران:
- يتم تقليل حجم العينة بشكل كبير - يتم إضافة تعليق كل 10 إطارات، ويتم استكمال الباقي. هذا ما تفعله معظم عمليات الإنتاج في الواقع.
- استخدم VLM أصغر (فئة 7B–11B) لكل إطار واحتفظ بـ 72B للإطارات الرئيسية فقط.
- أضف المزيد من وحدات معالجة الرسومات (GPUs) - وعند هذه النقطة يصبح وجود ثماني وحدات 5090 في هيكل واحد هو الحد الأدنى للنطاق العملي.
تبلغ التكلفة الإجمالية لعملية وضع العلامات التلقائية الكاملة على ساعة واحدة من لقطات 10 إطارات في الثانية مع وجود 72B في الحلقة حوالي 4-8 ساعات من وقت وحدة معالجة الرسومات على رقائق Blackwell الاستهلاكية ، ويمكن لهيكل Kentino AI 256 8× 5090 إنهاء ذلك في أقل من ساعة واحدة من وقت التشغيل الفعلي مع التوازي عبر وحدات معالجة الرسومات.
والآن، لننتقل إلى حسابات الحوسبة السحابية. نفس حجم العمل على منصة سحابية فائقة التوسع:
- الحساب: مماثل، وربما أرخص في أسعار السوق الفورية.
- خروج البيانات: كارثي. يبلغ حجم تسجيل ستيريو بدقة 1080p بمعدل 10 إطارات في الثانية لمدة ساعة حوالي 30-80 جيجابايت من البيانات الخام، وقد يزيد هذا الحجم إذا احتفظت بعمق الصورة. تكلفة تخزين هذه البيانات في السحابة واستخراج البيانات منها ضئيلة للغاية، حيث تتراوح بين بضعة سنتات عند التخزين وعشرات الدولارات عند الاستخراج. وقد أوضحت ورقة بحثية صادرة عن شركة Robo-DM من جامعة بيركلي عام 2025 هذه التكلفة بدقة: إذ تبلغ تكلفة تخزين 8.9 تيرابايت من بيانات Open-X على Google Cloud 172 دولارًا شهريًا، بينما تتراوح تكلفة كل عملية تنزيل كاملة بين 172 و1,540 دولارًا حسب مستوى الخدمة. وإذا ما تم تطبيق هذه التكلفة على أسطول من أجهزة التسجيل التي تسجل مئات الساعات أسبوعيًا، فإن تكلفة الاستخراج وحدها تتجاوز تكلفة استهلاك رأس المال لخادم محلي واحد خلال عام واحد.
- زمن الاستجابة في الحلقة: طويل. يكمن جوهر نظام الوسم التلقائي في الحلقة المغلقة - التسجيل اليوم، والوسم الليلة، والضبط الدقيق غدًا، ونشر السياسة المحسّنة بحلول الصباح. وتضيف عملية النقل ذهابًا وإيابًا عبر السحابة ساعات من وقت التحميل على وصلة الإرسال النموذجية للمختبر.
- الخصوصية: مشكلة. نفس حجة البيانات المنظمة من RX450 ينطبق هذا هنا. لا يتم إرسال فيديو الروبوت الخام من غرفة المريض أو أرضية المصنع أو مختبر الدفاع إلى وحدة معالجة الرسومات الخاصة بأي شخص آخر.
لهذا السبب، يمتلك كل مختبر روبوتات جاد في عام 2026 جهاز حاسوب خاصًا بالوسم التلقائي. يُعدّ جهاز Kentino AI 256 Turin Dual المزود بثمانية معالجات رسومية RTX 5090 مناسبًا تمامًا لهذا النوع من العمل - ذاكرة وصول عشوائي (RAM) بسعة 256 جيجابايت، وثمانية معالجات رسومية لمراحل المعالجة المتوازية، ووحدة تخزين NVMe لتخزين البيانات. أما خيار الترقية فهو جهاز Blackwell المزود بأربعة معالجات رسومية RTX Pro 6000، عندما يرغب الفريق في تشغيل 72B بدقة FP16 بدلًا من INT4، والاحتفاظ بعدد أكبر من النماذج المتزامنة.
الحلقة المغلقة
إن السبب في أن البنية التحتية المحلية تؤتي ثمارها ليس في خاصية وضع العلامات التلقائية نفسها، بل في الحلقة التي تتيحها.
حلقة مغلقة يومية — تسجيل ← تصنيف تلقائي ← مراجعة ← ضبط دقيق ← تحقق ← نشر
هذه هي الحلقة التي صُممت من أجلها وصفة OpenVLA-OFT (مارس 2025): ضبط دقيق أسرع بمقدار 25-50 مرة من OpenVLA الأساسية، ومصممة لتناسب خادم GPU واحد من فئة محطات العمل. FLaRe (مؤتمر ICRA 2025) هو نظير التعلم المعزز. يتيح لك العمل المستمر على الضبط الدقيق القائم على المحولات (OMLA، LifeLong-RFT) التكيف دون نسيان كارثي.
لا شيء من هذا يعمل بوتيرة ذهاب وإياب البيانات السحابية. الحلقة هي القيمة، وتتطلب الحلقة أن تكون البيانات والحوسبة في نفس المبنى.
مثال ملموس - روبوت منزلي
ولجعل هذا الأمر ملموساً، تخيل أبسط مسار قابل للتطبيق لوضع العلامات التلقائية لإنسان آلي يقوم بالمهام المنزلية (تحميل غسالة الصحون، طي الملابس، جلب العناصر من صندوق مُصنف).
التسجيل: يحتوي الروبوت البشري على كاميرات ستيريو RGB بمعدل 30 إطارًا في الثانية، وكاميرات معصم بمعدل 15 إطارًا في الثانية، وعمق من ستيريو نشط، وحالات المفاصل بمعدل 200 هرتز. تنتج جلسة مدتها ساعتان حوالي 250 جيجابايت من البيانات الخام على وحدة التخزين NVMe المدمجة.
المزامنة: في نهاية الجلسة، يقوم الروبوت بتحميل البيانات إلى خادم Kentino AI الخاص بالمختبر عبر الاتصال السلكي أو Wi-Fi 6E، ويستغرق ذلك حوالي 5-10 دقائق لـ 250 جيجابايت.
المرحلة 1+2 (Grounded-SAM 2): كشف المفردات المفتوحة باستخدام مفردات مجال تضم حوالي 200 اسم منزلي ("كوب"، "ملعقة مسطحة"، "سلة غسيل"، "منشفة أطباق زرقاء"...) بالإضافة إلى أدوات التنفيذ الخاصة بالوكيل. يقوم SAM 2 بنشر الأقنعة عبر المقاطع. مدة التشغيل على 8× 5090: حوالي 45 دقيقة.
المرحلة 3 (Qwen2.5-VL): 7 بايت VLM في كل إطار لعرض تعليق موجز، و72 بايت في كل إطار عاشر لعرض وصف أكثر تفصيلاً بالإضافة إلى العلاقات بين العناصر. المدة الزمنية: حوالي 3 ساعات.
المرحلة الرابعة (مخطط المشهد): يقوم مُجمِّع البيانات، على غرار ConceptGraphs، ببناء مخطط مشهد ثلاثي الأبعاد ثابت للشقة. بحلول نهاية الأسبوع، يكون كل عنصر رآه الروبوت موجودًا في المخطط مع مُعرِّف ثابت، ووصف لغوي، وموقع ثلاثي الأبعاد تقريبي. الوقت المُستغرق: بضع دقائق لكل جلسة، مُوزَّع على فترات زمنية مُتباعدة.
المرحلة الخامسة (المراجعة): تقوم أداة داخلية بتحديد الإطارات التي تقل فيها ثقة تصنيف نموذج التعلم المرئي عن 0.6، أو التي يختلف فيها تصنيف الإطار بين المرحلتين الأولى والثالثة. يتولى المراجع معالجة حوالي 500 إطار في الساعة. وبمعدل عينة 5% في جلسة مدتها ساعتان، فإن ذلك يعادل ساعة عمل بشرية تقريبًا يوميًا.
المرحلة السادسة (التدريب): تُستخدم التصنيفات المصححة في عملية ضبط دقيق لخوارزمية VLA باستخدام تقنية OFT. يقوم خادم Kentino AI بتشغيل هذه العملية طوال الليل على نفس الجهاز الذي قام بعملية التصنيف التلقائي - حيث يتم تنفيذ مهام العمل بالتسلسل، وليس بالتزامن.
هذا ليس مجرد تجربة فكرية بحثية. هذا ما ستفعله فعلياً شركات 1X وSkilld AI والمجموعات البحثية المنشورة التي تستخدم OpenVLA في عام 2026، مع بعض الاختلافات الداخلية. المنصة مفتوحة، والنماذج متاحة للجميع، والعائق يكمن في القدرة الحاسوبية والجهد الهندسي، وليس في الوصول إلى الخوارزميات.
حدود صادقة
ثلاثة أمور لا ينبغي لهذه المقالة أن تتجاهلها دون الإشارة إليها:
الهلوسة حقيقية ومستمرة. حتى مع المراجعة على مرحلتين، لا يمكنك الاعتماد على التصنيفات التلقائية غير المراجعة في التدريب على السلامة (تجنب الاصطدام، قرارات التلامس، أي شيء قد يؤدي فيه تصنيف خاطئ إلى إلحاق الضرر بالروبوت أو الإنسان). استخدمها لتدريب القدرات، وليس لتدريب السلامة. أما فيما يخص السلامة، فلا تزال البيانات المُدققة ضرورية.
يؤدي استخدام بيانات غير مُدربة على نطاق واسع إلى تدهور الأداء بسرعة. فمثلاً، سيكون أداء نظام تصنيف الصور الافتراضي (VLM) المُدرّب بشكل أساسي على صور الويب ممتازًا في المطابخ والمكاتب، ولكنه سيكون أقل كفاءة بشكل ملحوظ في ورش تصنيع آلات CNC أو أجنحة المستشفيات. يكمن الحل في ضبط نظام التصنيف التلقائي نفسه بدقة بما يتناسب مع كل مجال، وهو ما يتطلب تكلفة إضافية.
يُعدّ نموذج العالم هشًا أمام التغيرات البيئية. تفترض برامج مثل ConceptGraphs أن العالم ثابت تقريبًا بين الزيارات. بتغيير مكان الأثاث، يصبح من الضروري إعادة بناء مخطط المشهد أو إعادة التحقق منه بشكل جذري. هناك جهود حثيثة تُبذل في هذا الصدد (مخططات المشاهد ذات المفردات المفتوحة على الإنترنت، وورقة بحثية من مختبرات Naver لعام 2025، وغيرها)، ولكن يجب التعامل مع نموذج العالم على أنه استشاري وليس مرجعًا نهائيًا.
التقديرات الحسابية هنا تقريبية. تعتمد جميع الأرقام لكل إطار على استراتيجية التجميع، والكمية، وطول الموجه، ودقة الصورة. اعتبر الجدول بمثابة تقدير تقريبي. هذا التقدير التقريبي هو ما يهم في تحديد حجم المربع.
ماذا تفعل بعد ذلك
إذا كنت بصدد تقييم ما إذا كان ينبغي إنشاء نظام تصنيف تلقائي:
- حدد ما تحتاج فعلاً إلى وضع ملصقات عليه. يكفي استخدام Grounded-SAM 2 على وحدة معالجة رسومية واحدة فقط لإنشاء الصناديق والأقنعة. أما بالنسبة للتعليقات التوضيحية والعلاقات، فأنت بحاجة إلى حجم بيانات افتراضية (VLM) لا يقل عن 7-11 مليار. وللحصول على أوصاف غنية لتدريب VLA، فأنت بحاجة إلى حجم بيانات افتراضية من فئة 72 مليار، ويجب عليك تخصيص ساعات استخدام وحدة المعالجة الرسومية بدقة.
- قم بمراجعة نطاقك. هل الأشياء التي تهمك موجودة ضمن توزيع التدريب الخاص بكاشفات المفردات المفتوحة؟ إذا كنت تعمل في الغالب في المطابخ أو المكاتب أو المستودعات، فالإجابة هي نعم. أما في المجالات الصناعية أو الطبية المتخصصة، فخطط لضبط نظام التصنيف التلقائي بدقة قبل الاعتماد عليه.
- خطط لمستوى المراجعة من اليوم الأول. اختر أداة (مثل Roboflow أو Labelbox أو V7 أو أداة محلية الصنع تعتمد على أخذ العينات بناءً على عدم اليقين) وخصص ميزانية لمراجع واحد على الأقل بدوام كامل لكل عشر ساعات عمل للروبوت يوميًا. لا يحل نظام التصنيف التلقائي محل البشر، بل يغير طريقة عملهم.
- حدد حجم الحساب للخطوة 72B. يمكن تركيب المراحل الأخرى على أي جهاز. يُعدّ معالج VLM ذو سعة 72 بت عند استخدامه على نطاق واسع هو ما يبرر الحاجة إلى خادم ثماني وحدات معالجة رسومية. إذا كان خط أنابيبك يستخدم فقط معالجات VLM من فئة 7 بت، فإن جهازًا بأربع وحدات معالجة رسومية يكفي. أما إذا كنت ترغب في الحصول على أوصاف أكثر تفصيلًا وضبط دقيق للحلقة المغلقة، فستحتاج إلى تكوين ثماني وحدات معالجة رسومية.
- ضع طبقة التخزين على NVMe والطبقة الباردة على القرص الدوار. يبلغ حجم بيانات تسجيل أسطول المركبات لمدة أسبوع تيرابايتات. ويكون أداء نظام التصنيف التلقائي مقيدًا بعمليات الإدخال/الإخراج أكثر من قدرة معالجة وحدة معالجة الرسومات عند استخدام النماذج الأصغر حجمًا.
تتضمن تشكيلة كينتينو معالج Kentino AI 256 Turin Dual / 8× RTX 5090 المصمم خصيصًا لهذا النوع من الأحمال في فئة المعالجات الاستهلاكية، ومعالج Kentino AI 4× RTX Pro 6000 Blackwell ذو سعة ذاكرة الفيديو العالية، والذي يُستخدم لتشغيل العديد من وحدات إدارة الأجهزة الافتراضية الكبيرة في وقت واحد. تتوفر تفاصيل الأسعار والمواصفات في صفحات المنتجات ذات الصلة، وفي مقال لاحق ضمن سلسلة I05 يشرح بالتفصيل مواصفات الجهاز المرجعي.
تتطور أحدث تقنيات هذه البنية كل ثلاثة أشهر - فـ SAM 3 مضى عليها ستة أشهر، وQwen3-VL صدرت حديثًا، وCosmos Reason 2 حديثة الإصدار - لذا ستصبح النماذج المحددة في هذه المقالة قديمة أسرع من البنية نفسها. أما البنية نفسها فهي مستقرة الآن. مربعات، أقنعة، تعليقات توضيحية، مخطط المشهد، مراجعة، تدريب، نشر. هذه الدورة مستمرة ولن تتغير.
هذا جزء من موسوعة كينتينو، وهي سلسلة مرجعية حول الحوسبة الذكية، والروبوتات، والأنظمة التي تربط بينهما. نرحب بالتعليقات والتصويبات على البريد الإلكتروني info@kentino.com.