النقاط الرئيسية
- ينقسم ذكاء الروبوت إلى طبقة استدلال بطيئة (VLM/VLA، معدل قرار ~1–10 هرتز) وطبقة تحكم سريعة (تحكم كلاسيكي، 100–1000 هرتز) — لا يُطلب من VLA أبدًا إغلاق حلقة التحكم مباشرة.
- تدرج NVIDIA صراحةً Isaac GR00T N1.5 كنموذج يعمل على Jetson Thor؛ كما تذكر أن Llama وQwen وDeepSeek (نماذج LLM) وQwen2.5-VL وLlama 3.2 Vision (نماذج VLM) تعمل على اللوحة نفسها لطبقة اللغة/وصف المشهد.
- صمّمت Google DeepMind نموذج Gemini Robotics On-Device خصيصًا للعمل محليًا دون اتصال بالإنترنت — أوضح إشارة إلى أن الاستدلال على متن الروبوت أصبح الآن هدف نشر من الدرجة الأولى، لا مجرد فضول بحثي.
- القيد الملزم لما يستطيع الروبوت فعله بواسطة VLA هو معدل القرار القابل للتحقيق للنموذج بالنسبة لعدد الكاميرات والعتاد المستخدم — وليس رقم TOPS الأقصى للمُسرّع.
- تبقى أزرار التوقف المصنّفة سلامةً ووظائف السلامة المعتمدة الأخرى ضمن منطق حتمي خالٍ من النماذج — وهذا ضرورة هندسية (الشبكة العصبية غير قابلة للتحقق الرسمي) وفي الوقت نفسه، وفقًا لقراءتنا الخاصة لنطاق لائحة الآلات الأوروبية، خيار يبسّط عبء الامتثال، وليس أمرًا نشرت بشأنه أي جهة تنظيمية توجيهات محددة.
- تشغّل الروبوتات المتنقلة المستقلة (AMR) والآلات الزراعية استقلالية تجارية على نطاق واسع اليوم؛ تحظى الروبوتات الشبيهة بالإنسان بالتغطية الإعلامية لكنها الفئة الأقل انتشارًا من بين الفئات التي يناقشها هذا المقال.
- يُعد SmolVLA (~450 مليون معامل) الخيار المفتوح الواقعي للأهداف منخفضة الطاقة؛ أما OpenVLA (7 مليارات) فهو خط الأساس الأكاديمي الشائع، لا خيارًا مناسبًا للاستخدام على متن الجهاز منخفض زمن الاستجابة.
ما الذي يتحلل إليه فعليًا "الذكاء الاصطناعي على روبوت"
تضم حزمة برمجيات الروبوت خمس مهام متمايزة على الأقل، ولا يمثل سوى اثنتين منها اليوم مجالًا واقعيًا لنموذج LLM أو VLA. إن معاملة "الذكاء الاصطناعي في الروبوتات" ككتلة واحدة غير متمايزة هو أكثر أخطاء التأطير شيوعًا في تغطية هذا المجال — وهو يقود إلى السؤال الخاطئ ("هل يمكنه تشغيل LLM؟") بدلًا من السؤال المفيد ("أي من هذه المهام الخمس يتولاها النموذج فعليًا، وبأي معدل؟").
المهام الخمس، بترتيب تدفق البيانات عبرها: الإدراك (تحويل بيانات الكاميرا/الليدار/وحدة القياس بالقصور الذاتي إلى تمثيل منظّم للعالم)، وتقدير الحالة (دمج تلك البيانات عبر الزمن للحصول على تقدير مستقر لوضعية الروبوت ذاته وحالة العالم)، وتخطيط المهام (تحديد *ما* يجب فعله بعد ذلك — "التقط الكوب الأزرق"، "توجّه إلى رصيف التحميل")، وتخطيط الحركة (ترجمة المهمة إلى مسار قابل للتنفيذ — زوايا المفاصل، مسار، طريقة إمساك)، والتحكم (تحويل المسار المخطط إلى أوامر محرك، لحظة بلحظة، مع رفض الاضطرابات).
الإدراك هو المجال الذي تقوم فيه نماذج VLM ونماذج الرؤية الخفيفة بعمل حقيقي بالفعل — كشف الأجسام، وصف المشهد، الوسم الدلالي — عادةً ضمن نطاق 5–30 هرتز الذي ينتجه بث الكاميرا. تخطيط المهام هو المجال الذي يضيف فيه VLA أو LLM قيمة حقيقية: ترجمة هدف باللغة الطبيعية أو بصريًا إلى هدف فرعي رمزي يمكن لنظام لاحق أن يتصرف بناءً عليه. هاتان هما المهمتان اللتان يعاملهما هذا المقال كمجال شرعي لـVLA/LLM.
تختلف طبيعة تقدير الحالة وتخطيط الحركة والتحكم عن ذلك اختلافًا جوهريًا. عادةً ما يعمل تقدير الحالة عبر مرشح كالمان أو مرشح جسيمي — رياضيات حتمية ومفهومة جيدًا لا تحسّنها الشبكة العصبية في مسألة التقدير الأساسية. يهيمن على تخطيط الحركة محسّنات مسار كلاسيكية (CHOMP، RRT*، مخططات قائمة على MPC) لأنها بالتحديد توفر تحقق قيود قابلًا للتحقق — خاصية لا تمتلكها مخرجات نموذج لغوي. أما التحكم فهو الأسرع والأقل ملاءمة للنماذج على الإطلاق: فهو يشغّل حلقة تغذية راجعة ضد خطأ المستشعر بمعدلات لا يستطيع مرور أمامي عبر نموذج محول (transformer) الاقتراب منها.
📍 في جملة واحدة
من بين المراحل الخمس في حزمة برمجيات الروبوت — الإدراك، وتقدير الحالة، وتخطيط المهام، وتخطيط الحركة، والتحكم — لا يمثل مجالًا واقعيًا اليوم لنموذج LLM أو VLA سوى الإدراك وتخطيط المهام.
💬 بعبارات بسيطة
الإدراك = "ماذا أرى الآن". تقدير الحالة = "أين أنا الآن". تخطيط المهام = "ما الذي يجب أن أفعله بعد ذلك". تخطيط الحركة = "كيف أصل إلى هناك". التحكم = "حرّك المحركات، الآن." يعيش VLA في المهمة الأولى والثالثة؛ وتتولى شفرة كلاسيكية وحتمية بقية المهام.
أي جزء من حزمة برمجيات الروبوت يمكن لنموذج LLM أو VLA استبداله فعليًا؟
الإدراك (وصف المشهد، تحديد الأجسام) وتخطيط المهام (تحويل هدف إلى هدف فرعي). أما تقدير الحالة وتخطيط الحركة والتحكم فتبقى كلاسيكية — مرشحات كالمان/الجسيمات، ومحسّنات المسار، وحلقات التحكم بالتغذية الراجعة على التوالي — لأنها تحتاج إلى سلوك حتمي وقابل للتحقق لا توفره مخرجات النموذج.
اختبار واقع معدل التحكم
القيد الملزم لما يستطيع الروبوت فعله بواسطة VLA هو عدد القرارات في الثانية القابل للتحقيق للنموذج — وليس تصنيف TOPS الأقصى للمُسرّع. ورقة بيانات عتاد تذكر 100 TOPS لا تخبرنا شيئًا عن عدد مرات تنفيذ نموذج VLA بحجم 2–7 مليارات معامل لمرور أمامي كامل في الثانية وإنتاج إجراء قابل للاستخدام؛ يعتمد هذا الرقم على حجم النموذج والتكميم وحجم الدفعة وعدد الكاميرات وعرض النطاق الترددي للذاكرة معًا، وعادةً ما يكون أقل بكثير مما توحي به قيمة TOPS بالنسبة لحمل عمل بمسار واحد ومنخفض زمن الاستجابة.
تتحمل الحلقات المختلفة زمن استجابة مختلفًا تمامًا. تحتاج حلقة توازن الحركة في روبوت ذي أرجل أو ذاتي التوازن إلى تصحيحات بأجزاء من الألف من الثانية أحادية الرقم — وهذه حلقة تحكم بمعدل 100–1000 هرتز، ولا توجد أي بنية VLA منشورة تعمل بهذا المعدل. أما حلقة تخطيط مهام التلاعب (تحديد "الوصول إلى الكوب" مقابل "الوصول إلى الوعاء") فتتحمل زمن استجابة يتراوح بين 100 و1000 ملي ثانية دون أن يتدهور السلوك بشكل ملحوظ — وهذا هو نطاق 1–10 هرتز الذي يعمل فيه VLA واقعيًا. أما حلقة إعادة التخطيط على مستوى الملاحة (إعادة التوجيه حول عائق) فغالبًا ما تتحمل عدة ثوانٍ.
لهذا السبب فإن معدل مخرجات النموذج، لا عدد عمليات الفاصلة العائمة (FLOPs) الأساسية للنموذج، هو الرقم الذي يجب وضع الميزانية على أساسه. قد يكون لنموذجي VLA بعدد معاملات متقارب معدلات هرتز قابلة للتحقيق مختلفة جدًا، حسب مقدار ما يقع من خط الأنابيب (مُرمّز الرؤية، فاكّ ترميز الإجراء، الترميز الرمزي) على المسار الحرج لكل قرار — وحسب عدد بثوث الكاميرا التي تغذّي المرور الأمامي نفسه، إذ تعامل معظم بنى VLA كل كاميرا إضافية كسياق إضافي، لا كتوازٍ إضافي.
وجود نموذج داخل حلقة التحكم مسألة سلامة، لا مسألة أداء فقط. مخرجات الشبكات العصبية غير قابلة للتحقق الرسمي كما هي هوامش استقرار وحدة تحكم PID أو MPC — لا يوجد دليل على أن نموذج المحول لن ينتج أبدًا إجراءً غير آمن لتوزيع مدخلات لم يُرَ من قبل. هذا هو السبب الجوهري وراء بقاء أزرار التوقف المصنّفة سلامةً وحدود العزم وأقفال تجنب التصادم ضمن شفرة تحكم حتمية في كل حزمة روبوت إنتاجية نعرفها، بغض النظر عن مدى قدرة نموذج طبقة الاستدلال: فوظيفة السلامة القابلة للاعتماد تحتاج إلى سلوك يمكن توصيفه بشكل شامل، وهذا ما لا تستطيع شبكة عصبية كبيرة تقديم ضمان بشأنه حاليًا.
- حلقة تحكم التوازن/الحركة: تحتاج 100–1000 هرتز — تبقى ضمن التحكم الكلاسيكي، وليس في VLA أبدًا
- حلقة تخطيط مهام التلاعب: تتحمل زمن استجابة 100–1000 ملي ثانية — نطاق التشغيل الواقعي لـVLA
- حلقة إعادة تخطيط الملاحة: غالبًا ما تتحمل عدة ثوانٍ
- يضاعف عدد الكاميرات حمل العمل لكل قرار في معظم بنى VLA — إعداد بأربع كاميرات ليس "مجانيًا" مقارنة بإعداد بكاميرا واحدة عند المعدل نفسه للقرار
- تبقى أزرار التوقف المصنّفة سلامةً وحدود العزم ضمن منطق حتمي خالٍ من النماذج على مستوى الصناعة — وليس تفويضًا تنظيميًا محددًا يمكننا الاستشهاد به، بل نتيجة مباشرة لمتطلبات وظائف السلامة القابلة للاعتماد (انظر قسم السياق التنظيمي)
لماذا لا يستطيع نموذج VLA أكبر وأكثر قدرة تشغيل حلقة التحكم مباشرة؟
لسببين مستقلين. أولًا، زمن الاستجابة: تحتاج حلقة التحكم إلى تصحيح بمعدل 100–1000 هرتز، ومرور أمامي لنموذج بمليارات المعاملات — حتى بعد التكميم، وحتى على مسرّعات مخصصة — أبطأ من ذلك بمراتب من الحجم. ثانيًا، قابلية التحقق: تحتاج وظيفة سلامة معتمدة (توقف طارئ، حد عزم) إلى سلوك يمكن توصيفه بشكل شامل مسبقًا، ولا يمكن حاليًا التحقق من فضاء مخرجات الشبكة العصبية بالطريقة نفسها التي يمكن بها التحقق من هوامش استقرار وحدة تحكم PID.
هل TOPS طريقة جيدة لمقارنة العتاد لأحمال عمل VLA؟
ليست وحدها كافية. تقيس TOPS الإنتاجية النظرية القصوى، لكن الرقم الذي يحدد ما إذا كان معدل القرار قابلًا للتحقيق هو القرارات في الثانية لنموذج وتكميم وعدد كاميرات محددين قيد الاستخدام — وهذا يعتمد بشدة على عرض النطاق الترددي للذاكرة وعلى مقدار ما يقع من خط الأنابيب على المسار الحرج لكل قرار، لا على القدرة الحاسوبية الخام فقط.
قدّر ميزانية الاستدلال لروبوتك
استخدم الحاسبة أدناه لتقدير معدل القرار الذي يمكن أن يحققه فعليًا مزيج معين من العتاد وعدد الكاميرات، قبل الالتزام بنموذج أو لوحة معينة. هذه التقديرات تقريبات هندسية للميزانية المبكرة، وليست معايير أداء من مورّد — تحقق منها مقابل النموذج والعتاد الفعليين قبل وضع اللمسات الأخيرة على أي تصميم.
Estimated slow-tier inference budget
Achievable frequency: 15.0 Hz
Headroom: +10.0 Hz — This fits the onboard slow-reasoning tier. The fast control loop (100–1,000 Hz) still needs to run in classical control code, not through this model.
مقارنة نماذج VLA: ما المفتوح، وما يناسب أين
تغطي خمسة نماذج VLA معظم المشهد المفتوح وشبه المفتوح الذي تقيّمه فرق الروبوتات في عام 2026، إضافة إلى نموذج واحد ذي وصول مقيّد يستحق المتابعة لمعرفة اتجاه هذا المجال. أعداد المعاملات أدناه المشار إليها بعلامة "~" مستمدة من تقارير ثانوية وليس من ورقة مواصفات أساسية من المورّد — تعامل معها كتقدير اتجاهي لا كقيمة دقيقة.
يُعد NVIDIA Isaac GR00T N1 ونسخته المعدَّلة N1.5 نموذجي VLA موجّهين للروبوتات الشبيهة بالإنسان، مُصدَران بشكل مفتوح، بحوالي ~2.2 مليار معامل (رقم من مصدر ثانوي). تذكر NVIDIA صراحةً أن GR00T N1.5 يعمل على لوحة Jetson Thor الخاصة بها — وهذا هدف نشر على متن الجهاز مؤكد من المورّد، وليس مُستنتَجًا.
π0 (باي-زيرو) من Physical Intelligence هو نموذج VLA قائم على "flow-matching" بحوالي ~3 مليارات معامل (مصدر ثانوي)، صدر بأوزان مفتوحة، ومبني على نموذج أساس رؤية-لغة من فئة PaliGemma (هذا التفصيل أيضًا من مصدر ثانوي). حظي باهتمام لتوليده إجراءات سلسة وعالية التردد مقارنة بتصاميم VLA السابقة.
يُعد OpenVLA، بحجم 7 مليارات معامل، خط الأساس الأكاديمي الشائع لأبحاث VLA — مفتوح، موثّق جيدًا، ويُستخدم على نطاق واسع كمرجع للمقارنة. يجعله حجمه نقطة مرجعية لسؤال "ما مدى الحجم الذي يحتاجه VLA قدير"، لكنه عادةً ليس الخيار الأول لميزانية زمن استجابة محدودة على متن الجهاز.
يتميز Gemini Robotics On-Device من Google DeepMind بعدد معاملات غير معلن ووصول مقيّد/مخصص للشركاء — وهو ليس خيارًا متاحًا لمعظم الفرق اليوم. ما يجعله جديرًا بالمتابعة رغم ذلك: تذكر Google DeepMind أنه صُمّم صراحةً ليعمل محليًا على الروبوت دون اتصال بالإنترنت. هذه أوضح إشارة من مختبر كبير على أن الاستدلال على متن الروبوت أصبح الآن هدف نشر من الدرجة الأولى، لا فكرة بحثية لاحقة أُلحقت بنظام مُصمَّم أولًا للسحابة.
يُعد SmolVLA نموذج VLA مفتوحًا ومدمجًا بحوالي ~450 مليون معامل (مصدر ثانوي) — الخيار الواقعي عندما يكون العتاد المستهدف منخفض الطاقة فعليًا (مُسرّع صغير بدلًا من لوحة كاملة من فئة Jetson)، حيث لا يتسع بصمة الذاكرة وزمن استجابة المرور الأمامي لنموذج بحجم 2–7 مليارات معامل ضمن الميزانية ببساطة.
يُعد Octo وRT-2 بنيتي VLA من أجيال سابقة، مفيدتان بشكل أساسي للتأطير التاريخي لكيفية وصول هذا المجال إلى تصاميم "flow-matching" والإجراءات المرمّزة رمزيًا الحالية — وليستا توصية حالية لقرار نشر في عام 2026.
خارج فئة VLA، تذكر NVIDIA أن نماذج Llama وQwen وDeepSeek عامة الغرض (نماذج LLM)، إلى جانب Qwen2.5-VL وLlama 3.2 Vision (نماذج VLM)، تعمل على Jetson Thor. تتولى هذه النماذج طبقة فهم اللغة ووصف المشهد في حزمة روبوت لا يكون فيها نموذج VLA كامل ضروريًا — فروبوت خدمي يجيب عن سؤال شفهي، أو ذراع تلاعب يقرأ ملصقًا نصيًا، لا يحتاج إلى أي نموذج ذي مخرجات إجرائية على الإطلاق.
النموذج | المعاملات | الوصول | الهدف على متن الجهاز |
|---|---|---|---|
| Isaac GR00T N1 / N1.5 | ~2.2 مليار (ثانوي) | مفتوح | Jetson Thor (مؤكد من NVIDIA) |
| Physical Intelligence π0 | ~3 مليارات (ثانوي) | أوزان مفتوحة | لوحات فئة Jetson |
| OpenVLA | 7 مليارات | مفتوح | فئة AGX Orin/Thor |
| Gemini Robotics On-Device | غير معلن | مقيّد/للشركاء | محلي بالتصميم (بلا إنترنت) |
| SmolVLA | ~450 مليون (ثانوي) | مفتوح | مسرّعات منخفضة الطاقة |
| Octo / RT-2 | متغير | مفتوح (بحثي) | مرجع تاريخي فقط |
للاطلاع على تفاصيل مستويات العتاد (Hailo-10H، Jetson Orin Nano/NX، AGX Orin، AGX Thor — نطاقات الطاقة وفئات الأسعار)، راجع عتاد الذكاء الاصطناعي الطرفي لنماذج LLM المحلية بدلًا من إعادة اشتقاق المواصفات هنا — يركّز هذا المقال على ما يعمل وأين، لا على الشرائح نفسها.
ما الفرق بين VLA وVLM في سياق الروبوتات؟
يأخذ VLM (نموذج رؤية-لغة) صورة ونصًا وينتج نصًا — وصف مشهد، إجابة، تسمية. يأخذ VLA (نموذج رؤية-لغة-إجراء) المدخلات نفسها لكنه ينتج إجراء روبوت — وضعية مستهدفة، مسار مفصلي، نقطة إمساك. غالبًا ما تستخدم حزمة الروبوت VLM لطبقة الإدراك/فهم المشهد وVLA لطبقة تخطيط المهام، وأحيانًا لا تحتاج سوى VLM إذا لم يكن هناك حاجة إلى إجراء مستقل.
هل يُعد OpenVLA خيارًا جيدًا لنشر على متن الجهاز حساس لزمن الاستجابة؟
إنه خط الأساس الأكاديمي القياسي بحجم 7 مليارات معامل، ما يجعله أثقل من بدائل مصمَّمة خصيصًا مثل Isaac GR00T N1.5 (~2.2 مليار، مصدر ثانوي) أو SmolVLA (~450 مليون، مصدر ثانوي) بالنسبة لميزانية زمن استجابة محدودة على متن الجهاز. يظل مفيدًا كنقطة مرجعية موثّقة جيدًا لمقارنة نماذج أحدث وأصغر.
طبقة التكامل: ROS 2 وTensorRT وعملية التسليم
يُعد ROS 2 الحد العملي الفاصل بين طبقة الاستدلال البطيئة وطبقة التحكم السريعة في معظم حزم الروبوتات الإنتاجية. تنشر عقدة VLA نية على مستوى المهمة — وضعية مستهدفة، هدف فرعي، نقطة إمساك — كرسالة ROS 2، وتشترك عقدة تحكم كلاسيكية منفصلة في تلك الرسالة وتنفذها بمعدلات حلقة التحكم. لا يتحدث VLA أبدًا مباشرة مع المحركات؛ بل يتحدث إلى موضوع (topic)، وتمتلك عقدة حتمية كل ما هو بعد ذلك الموضوع.
على عتاد NVIDIA (فئات Jetson Orin وThor)، تُعد TensorRT وTensorRT-LLM المسار المعتاد لتشغيل نموذج VLA أو LLM مُكمَّم للوصول إلى معدل استدلاله القابل للتحقيق — فهي تتولى دمج النوى ومعايرة الدقة (FP8/INT8/INT4) والتحسين الخاص بالعتاد الذي تتركه حلقة استدلال PyTorch البسيطة على الطاولة. تخطي هذه الخطوة هو السبب الأكثر شيوعًا وراء أن نموذجًا "يفترض" أن يصل إلى معدل هرتز مستهدف نظريًا لا يصل إليه عمليًا.
بالنسبة للأهداف الأصغر على متن الجهاز التي لا تعتمد على NVIDIA — مسرّع Hailo-10H، أو لوحة مدمجة قائمة على ARM — تُعد ExecuTorch وllama.cpp مساري التشغيل ذوي الصلة لمكونات اللغة/الإدراك. لا يُعد أي منهما اليوم بيئة تشغيل VLA جاهزة للاستخدام المباشر؛ إذ تشغّل الفرق التي تستهدف هذه اللوحات الأصغر في الغالب نموذج VLM مدمجًا (للإدراك/وصف المشهد) أكثر من VLA كامل، مع تبسيط تخطيط المهام إلى منطق قائم على قواعد أو تشغيله بتردد أقل بمعدل يستطيع المسرّع الأصغر تحمّله.
نمط التكامل العملي، بالترتيب: (1) تعمل عقدة VLA/VLM بشكل غير متزامن بمعدل هرتز القابل للتحقيق لديها، وتنشر النية إلى موضوع ROS 2؛ (2) يشترك مخطط كلاسيكي في ذلك ويحوّل النية إلى مسار؛ (3) تنفذ عقدة تحكم المسار بمعدل 100–1000 هرتز، مستخدمة حلقة تغذية راجعة خاصة بها من المستشعرات — دون انتظار مخرجات VLA التالية للتصرف أبدًا. إذا توقفت عقدة VLA أو تأخرت، تواصل عقدة التحكم تنفيذ آخر مسار صالح أو تحافظ بأمان على الوضعية؛ فهي لا تنتظر الطبقة البطيئة.
- 1تعمل عقدة VLA/VLM بشكل غير متزامن
Why it matters: تنشر نية على مستوى المهمة إلى موضوع ROS 2 بمعدلها القابل للتحقيق (1–10 هرتز) — ولا تقع أبدًا على المسار الحرج لحلقة التحكم. - 2يشترك مخطط كلاسيكي في تلك النية
Why it matters: يحوّل هدفًا فرعيًا ("الوصول إلى الكوب") إلى مسار محدد ومتحقَّق من القيود باستخدام شفرة تخطيط حركة حتمية. - 3تنفذ عقدة تحكم المسار بشكل مستقل
Why it matters: إذ تعمل بمعدل 100–1000 هرتز مع تغذية راجعة خاصة بها من المستشعرات، فهي لا تنتظر أبدًا مخرجات VLA التالية — وإذا توقفت الطبقة البطيئة، تحافظ الطبقة السريعة على الوضعية أو تواصل تنفيذ آخر خطة صالحة. - 4التكميم والترجمة باستخدام TensorRT/TensorRT-LLM على أهداف NVIDIA
Why it matters: عادةً ما يكون دمج النوى ومعايرة الدقة (FP8/INT8/INT4) الفارق بين معدل هرتز النظري والمُحقق للنموذج — وتخطي هذه الخطوة هو السبب الأكثر شيوعًا لضعف أداء الاستدلال على متن الجهاز. - 5بالنسبة للأهداف الصغيرة غير التابعة لـNVIDIA، حصر حمل العمل في VLM لا في VLA كامل
Why it matters: تغطي ExecuTorch وllama.cpp مسار تشغيل اللغة/الإدراك على اللوحات المدمجة، لكن لا توجد بيئة تشغيل شائعة منخفضة الطاقة اليوم تجعل VLA كاملًا عمليًا ضمن نطاقات الطاقة تلك.
هل يتحدث نموذج VLA مباشرة مع محركات الروبوت؟
لا. في الحزم الإنتاجية، تنشر عقدة VLA نية على مستوى المهمة (وضعية مستهدفة، هدف فرعي) إلى موضوع ROS 2. تشترك عقدة تحكم كلاسيكية منفصلة في ذلك الموضوع وتحوّله إلى أوامر محرك بمعدلات حلقة التحكم. لا يقع VLA أبدًا على مسار أوامر المحرك.
ماذا يحدث إذا تأخرت عقدة VLA أو توقفت؟
لا تنتظرها طبقة التحكم السريعة. فهي تواصل تنفيذ آخر مسار صالح أو تحافظ على وضعية آمنة باستخدام حلقة التغذية الراجعة الخاصة بها من المستشعرات، بشكل مستقل عن وتيرة طبقة الاستدلال — وهذا الفصل هو السبب في استخدام البنية ثنائية الطبقة من الأساس.
واقع النشر حسب فئة الآلة
تمثل الروبوتات المتنقلة المستقلة (AMR) في المستودعات والآلات الزراعية واقع النشر الفعلي لاستقلالية الروبوتات اليوم — تحظى الروبوتات الشبيهة بالإنسان بالتغطية الإعلامية لكنها الفئة الأقل انتشارًا من بين الفئات التي يناقشها هذا المقال. تهم هذه الفجوة كل من يقرر أين يستثمر وقت الهندسة: الفئة الأكثر كثافة حسابية والأكثر نقاشًا من الروبوتات هي أيضًا الفئة التي تضم أقل عدد من الوحدات العاملة فعليًا في بيئات الإنتاج الآن.
تُعد الروبوتات الشبيهة بالإنسان الفئة الأكثر كثافة حسابية والأقل انتشارًا: فهي تحمل أكبر عدد من المستشعرات ودرجات الحرية، وبالتبعية أثقل حمل عمل لطبقة الاستدلال (بثوث كاميرا متعددة، تخطيط مهام على مستوى الجسم بالكامل)، وهذا بالضبط سبب كونها الهدف الأساسي لأحدث وأقدر الشرائح على متن الجهاز (Jetson Thor) وأحدث بنى VLA (GR00T N1.5). حجم انتشارها اليوم صغير مقارنة بالاهتمام الذي تتلقاه.
الروبوتات المتنقلة المستقلة (AMR) — الروبوتات ذات العجلات التي تنقل المخزون في المستودعات — تُنشر تجاريًا بحجم كبير ومفيد منذ سنوات، وتشغّل حزم ملاحة وتجنب عوائق كلاسيكية. ما يتغير في عام 2026 هو إضافة طبقة واجهة لغة/رؤية فوق حزمة استقلالية ناضجة بالفعل: نموذج VLM لوصف المشهد أو طبقة تخطيط مهام خفيفة تتيح للإنسان إعطاء تعليمات بلغة طبيعية، وليس استبدالًا كاملًا لمنطق الملاحة الأساسي.
تقع أذرع الصناعة في خلايا التصنيع الثابتة بين هذين الطرفين: عادةً ما يظل تخطيط الحركة والتحكم كلاسيكيَين بالكامل منذ عقود (ذراع لحام أو التقاط ووضع لا يحتاج إلى VLA لتكرار مسار تم تعليمه)، لكن طبقات الإدراك — كشف العيوب، تحديد القطع — تستخدم بشكل متزايد نماذج رؤية خفيفة، حيث يجعل موضع كاميرا ثابت ومهمة مقيّدة نموذجًا أصغر ومُدرَّبًا لغرض محدد كافيًا دون الحاجة إلى VLA كامل.
تُعد الآلات الزراعية فئة النشر الأكثر إغفالًا في تغطية "الروبوتات المدعومة بالذكاء الاصطناعي"، رغم أنها نشرت استقلالية تجارية — قيادة موجّهة بنظام تحديد المواقع العالمي (GPS)، كشف عوائق على الجرارات وحصادات الحبوب — على نطاق واسع منذ سنوات، قبل موجة VLA الحالية بكثير. ما يُضاف الآن فوقها يتبع النمط نفسه في AMR: طبقة واجهة لغة/رؤية (تحديد المحاصيل أو الأعشاب الضارة، أوامر مشغّل بلغة طبيعية) فوق أنظمة ملاحة وتحكم كانت بالفعل مستقلة وكلاسيكية.
- الروبوتات الشبيهة بالإنسان: أعلى حوسبة لكل وحدة، أحدث بنى VLA، أصغر أسطول منتشر اليوم
- الروبوتات المتنقلة المستقلة (المستودعات): حزمة استقلالية كلاسيكية ناضجة منذ سنوات؛ إضافات VLM/VLA هي طبقة واجهة، لا بديل
- أذرع الصناعة: الحركة/التحكم كلاسيكيان بالكامل منذ عقود؛ طبقة الإدراك هي حيث تُضاف نماذج الرؤية الخفيفة
- الآلات الزراعية: استقلالية تجارية (قيادة بنظام GPS، كشف عوائق) منتشرة على نطاق واسع منذ سنوات، سابقة لموجة VLA الحالية
أي فئة روبوت لديها اليوم أكبر عدد من نماذج VLA العاملة فعليًا في الإنتاج؟
لا تشغّل أي منها حاليًا VLA كآلية تحكم أساسية في الإنتاج على نطاق واسع — تشغّل الروبوتات المتنقلة المستقلة والآلات الزراعية حزم استقلالية كلاسيكية ناضجة، مع اقتصار إضافات VLM/VLA على طبقة واجهة (وصف مشهد، أوامر بلغة طبيعية). الروبوتات الشبيهة بالإنسان هي أحدث هدف لتكامل VLA لكنها تضم أصغر أسطول منتشر من بين الفئات التي يناقشها هذا المقال.
دليل الشراء: ما الذي يجب البحث عنه فعليًا
تغطي ثلاث فئات من العتاد معظم بناء استدلال على متن الروبوت: عدة تطوير من فئة Jetson لطبقة الاستدلال، وكاميرا عمق/استيريو واحدة أو أكثر لمدخلات الإدراك، ومنصة تطوير روبوت لتركيب كل شيء عليها. يسمي هذا القسم فئات، لا أرقام منتجات محددة أو أسعارًا أو ادعاءات من موردين — تحقق من المواصفات والأسعار الحالية مباشرة مع كل مورّد قبل الشراء، إذ يتغير كلاهما أسرع مما يستطيع أي مقال تتبعه.
تُعد عُدد تطوير Jetson Orin وJetson Thor نقطة البداية المعتادة لتقييم VLA أو VLM على متن الجهاز — راجع عتاد الذكاء الاصطناعي الطرفي لنماذج LLM المحلية للاطلاع على التصنيف مستوى بمستوى (من Orin Nano إلى AGX Thor) الذي يغطي نطاق الطاقة والحوسبة النسبية.
تُعد كاميرات العمق أو الاستيريو مدخل الإدراك المعتاد لـVLA — تفترض معظم أبحاث VLA المنشورة وتصاميم المورّدين المرجعية مدخل RGB-D أو استيريو بدلًا من RGB أحادي العين فقط، إذ يبسّط العمق تقدير نقطة الإمساك والمسافة عن العوائق التي تعتمد عليها طبقة مخرجات الإجراء.
تُعد منصة تطوير الروبوت — منصة مرجعية ذات عجلات أو قائمة على ذراع بدلًا من بناء ميكانيكي من الصفر — نقطة البداية العملية لفريق يتحقق من صحة تكامل VLA قبل الالتزام بعتاد مخصص.
- عدة تطوير Jetson Orin/Thor — هدف الحوسبة لطبقة الاستدلال
- كاميرا (كاميرات) عمق/استيريو — مدخل الإدراك المعتاد لـVLA
- منصة تطوير روبوت (عدة مرجعية ذات عجلات أو قائمة على ذراع) — التحقق من التكامل قبل العتاد المخصص
ما الذي يبقى خارج الروبوت
تبقى أربعة أحمال عمل خارج الروبوت حتى في بنية محلية أولاً بقوة: التعلم عبر الأسطول، وتحديثات النموذج، ومشاركة السياق بين الروبوتات، والمحاكاة الثقيلة. لا يتسم أي منها بالحساسية لزمن الاستجابة كما هو حال الإدراك أو تخطيط المهام، وكلها تستفيد من حوسبة وبيانات لا يستطيع أي روبوت منفرد الوصول إليها.
التعلم عبر الأسطول — تجميع الخبرة من روبوتات منتشرة كثيرة لتحسين سياسة أو نموذج مشترك — يحتاج بطبيعته إلى بيانات من وحدات أكثر مما يحمله روبوت واحد، وتتجاوز حوسبة التدريب المطلوبة إلى حد بعيد ميزانية أو غرض مسرّع على متن الجهاز.
تُدفَع تحديثات النموذج (نقطة تفتيش VLA جديدة، نموذج إدراك مُعدَّل بدقة) إلى الروبوت بدلًا من تدريبها عليه؛ فالروبوت هدف استدلال، لا عقدة تدريب، في كل نمط نشر إنتاجي مستخدَم اليوم تقريبًا.
يتطلب السياق بين الروبوتات — استفادة روبوت مما لاحظه روبوت آخر في الأسطول نفسه للتو — واجهة خلفية مشتركة، إذ لا توجد آلية مفيدة على متن الجهاز تتيح لروبوت الوصول مباشرة إلى سجل مستشعرات روبوت آخر.
تعمل المحاكاة الثقيلة — أحمال عمل الفيزياء والتصيير واسعة النطاق المستخدمة لتوليد بيانات تدريب أو التحقق من صحة سياسة قبل النشر — على حوسبة من فئة مراكز البيانات للسبب نفسه الذي يفسّر التعلم عبر الأسطول: لا يوجد لميزانية الحوسبة تلك مكافئ على متن الجهاز.
- التعلم عبر الأسطول عبر وحدات منتشرة كثيرة
- تحديثات نموذج/نقطة تفتيش تُدفَع إلى الروبوت
- السياق بين الروبوتات والحالة المشتركة للأسطول
- المحاكاة الثقيلة لتوليد بيانات التدريب والتحقق من صحة السياسات
السياق التنظيمي: قانون الذكاء الاصطناعي الأوروبي ولائحة الآلات
في الاتحاد الأوروبي، يُعامَل مكوّن ذكاء اصطناعي يعمل كمكوّن سلامة في آلة على أنه عالي المخاطر بموجب قانون الذكاء الاصطناعي الأوروبي، وتشترط لائحة الآلات الأوروبية (2023/1230) — السارية اعتبارًا من يناير 2027 — بشكل منفصل تقييم مطابقة للآلات ذات وظيفة سلامة مدفوعة بالذكاء الاصطناعي. قد يحتاج روبوت به نموذج ضمن مسار وظيفة سلامة إلى استيفاء الإطارين كليهما، لا أحدهما فقط.
فيما يلي تحليلنا المنطقي الخاص، لا توجيهات تنظيمية منشورة: من المرجح أن تقلل البنية ثنائية الطبقة الموصوفة في هذا المقال بأكمله — إبقاء وظائف السلامة (التوقف الطارئ، حدود العزم، أقفال تجنب التصادم) ضمن شفرة تحكم كلاسيكية وحتمية، وحصر طبقة استدلال VLA/LLM في أدوار استشارية أو على مستوى المهمة لا تتحكم مباشرة أبدًا في وظيفة سلامة — من عبء تقييم المطابقة، لأن وظيفة السلامة القابلة للاعتماد تحتاج إلى سلوك يمكن توصيفه بشكل شامل مسبقًا، وهذا ما يمكن أن توفره الشفرة الحتمية ولا تستطيعه حاليًا شبكة عصبية كبيرة. لا علم لنا بأن أي جهة تنظيمية نشرت توجيهات محددة تؤكد هذا التأطير؛ فتعامل معه كحجة هندسية-امتثالية يجب تقييمها مع مستشارك القانوني الخاص، لا كضمان امتثال.
هذا ليس استشارة قانونية. يعتمد نطاق تقييم المطابقة والمعايير المنسّقة المطبقة والتصنيف المحدد لوظائف السلامة لروبوت معين على تصميم النظام الفعلي والولاية القضائية للبيع — استشر مستشارًا قانونيًا وتنظيميًا مؤهلًا قبل اتخاذ قرار امتثال لمنتج محدد.
هل إبقاء وظائف سلامة الروبوت خارج نموذج الذكاء الاصطناعي يضمن الامتثال الأوروبي؟
لا. إنها استراتيجية هندسية-امتثالية معقولة تستند إلى الطريقة التي يعامل بها تقييم المطابقة عمومًا المكونات الحتمية مقابل غير الحتمية، لكنها لا تُغني عن تقييم مطابقة رسمي بموجب قانون الذكاء الاصطناعي الأوروبي ولائحة الآلات (سارية اعتبارًا من يناير 2027)، ولا نستشهد بها كتوجيهات تنظيمية رسمية. استشر مستشارًا قانونيًا مؤهلًا بشأن منتج محدد.
الأسئلة الشائعة
هل يمكن لنموذج بحجم 7 مليارات معامل العمل على روبوت في الوقت الفعلي؟
يعتمد ذلك على ما يعنيه "الوقت الفعلي" بالنسبة للمهمة. يستطيع نموذج VLA بحجم 7 مليارات مثل OpenVLA العمل بمعدلات تخطيط مهام (حوالي 1–10 هرتز) على عتاد على متن الجهاز قادر مثل Jetson AGX Orin أو Thor — وهذا وقت فعلي بالنسبة لقرار "الوصول إلى الكوب". لا يستطيع العمل بمعدل 100–1000 هرتز الذي تحتاجه حلقة تحكم توازن أو حركة، وهذا ليس مطلوبًا منه أصلًا؛ تبقى تلك الحلقة ضمن شفرة تحكم كلاسيكية.
ما الفرق بين VLA وتشغيل LLM على روبوت؟
يعالج LLM (أو VLM) اللغة و/أو الرؤية وينتج نصًا — مفيد لوصف المشهد أو الرد على أمر شفهي. أما VLA (نموذج رؤية-لغة-إجراء) فينتج إجراء روبوت مباشرة — وضعية مستهدفة، مسارًا، نقطة إمساك. تستخدم حزم روبوت كثيرة كليهما: LLM/VLM لفهم اللغة ووصف المشهد، وVLA لتحويل هدف إلى إجراء ملموس.
ما العتاد على متن الجهاز الذي يشغّل Isaac GR00T N1.5؟
تذكر NVIDIA أن GR00T N1.5 يعمل على لوحة Jetson Thor الخاصة بها — وهذا هدف نشر مؤكد من المورّد. يشغّل Jetson Thor أيضًا نماذج LLM عامة الغرض (Llama وQwen وDeepSeek) ونماذج VLM (Qwen2.5-VL وLlama 3.2 Vision) وفقًا لـNVIDIA، لطبقة اللغة/وصف المشهد حيث لا يكون نموذج VLA كامل ضروريًا.
لماذا لا يستخدم الروبوت ببساطة نموذجًا واحدًا لكل شيء؟
لأن المهام لديها متطلبات متعارضة من زمن الاستجابة وقابلية التحقق. يتحمل تخطيط المهام زمن استجابة من 100 إلى 1000 ملي ثانية ويستفيد من نموذج كبير ومرن. يحتاج التحكم إلى 100–1000 هرتز وإلى سلوك قابل للتوصيف رسميًا لوظائف مصنّفة سلامةً — وهو متطلب لا تستوفيه أي شبكة عصبية كبيرة حالية. تقسيم الحزمة إلى طبقة استدلال بطيئة وطبقة تحكم سريعة هو الطريقة التي توفّق بها الروبوتات الإنتاجية بين الاحتياجين معًا.
هل يُعد SmolVLA خيارًا واقعيًا لمنتج حقيقي، أم مجرد لعبة بحثية؟
يُوضَع بوصفه الخيار المفتوح الواقعي مخصصًا لأهداف منخفضة الطاقة — مسرّعات مقيَّدة أكثر من اللازم لبصمة الذاكرة وزمن استجابة المرور الأمامي لنموذج بحجم 2–7 مليارات معامل. يُعد عدد معاملاته البالغ حوالي ~450 مليون (مصدر ثانوي) مقايضة هندسية حقيقية للفرق التي تستهدف عتادًا أصغر من فئة Jetson AGX، لا مجرد عرض توضيحي بحثي.
هل يعني Gemini Robotics On-Device أنني أستطيع الحصول على ترخيص له لروبوتي الخاص اليوم؟
ليس بالضرورة. وصفته Google DeepMind بأنه مقيّد الوصول/مخصص للشركاء، وعدد معاملاته غير معلن. ما يمكن التحقق منه هو نية التصميم: تذكر Google DeepMind أنه بُني ليعمل محليًا على الروبوت دون اتصال بالإنترنت، وهو ما يشير إلى الاتجاه الذي يسلكه هذا المجال حتى بالنسبة للفرق التي لا تستطيع الوصول إلى هذا النموذج المحدد بعد.
كم عدد بثوث الكاميرا التي يستطيع Jetson Orin NX دعمها فعليًا للاستدلال بمستوى VLA؟
يعتمد ذلك على النموذج ومعدل القرار المستهدف — تعامل معظم بنى VLA كل كاميرا إضافية كسياق إضافي لكل مرور أمامي بدلًا من بثّ يمكن توازيه بشكل منفصل، لذا فإن إضافة كاميرات تقلل معدل الهرتز القابل للتحقيق بشكل تقريبي متناسب، وليس مجانًا. استخدم حاسبة ميزانية الاستدلال في هذه الصفحة لتقدير ذلك بالنسبة لمزيج محدد من العتاد/الكاميرات/النموذج قبل الالتزام بتصميم معين؛ إنه تقدير هندسي، لا معيار أداء من مورّد.
هل تمر أزرار التوقف الطارئ المصنّفة سلامةً يومًا عبر نموذج VLA؟
لا، ليس في أي حزمة روبوت إنتاجية نعرفها. تعمل أزرار التوقف المصنّفة سلامةً وحدود العزم وأقفال تجنب التصادم ضمن منطق تحكم حتمي ومعتمد — لا يمكن حاليًا التحقق من فضاء مخرجات شبكة عصبية بشكل شامل بالطريقة التي يمكن بها التحقق من هوامش استقرار وحدة تحكم كلاسيكية، وهذا هو السبب الهندسي الجوهري وراء استمرار هذا الفصل، بغض النظر عن مدى قدرة نموذج طبقة الاستدلال.
هل ينطبق قانون الذكاء الاصطناعي الأوروبي على روبوت يستخدم VLA فقط لتخطيط المهام، ولا يستخدمه أبدًا لوظيفة سلامة؟
من الممكن أن ينطبق رغم ذلك، حسب النظام المحدد — يتعلق تصنيف المخاطر العالية في قانون الذكاء الاصطناعي الأوروبي للذكاء الاصطناعي الذي يعمل كمكوّن سلامة في آلة بدور الذكاء الاصطناعي في النظام، ولدى لائحة الآلات الأوروبية (2023/1230، السارية اعتبارًا من يناير 2027) محفزات تقييم مطابقة خاصة بها. هذا ليس استشارة قانونية؛ استشر جهة مؤهلة بشأن تصنيف منتج محدد.
قراءات ذات صلة
- عتاد الذكاء الاصطناعي الطرفي لنماذج LLM المحلية — مستويات العتاد (Hailo-10H، Jetson Orin Nano/NX، AGX Orin، AGX Thor) المشار إليها في هذا المقال بأكمله
- تحليل فيديو VLM للطائرات المسيّرة وكاميرات الحافة — المقال الشقيق من جانب المراقبة مقابل تركيز هذا المقال على جانب الفعل، بمشاركة الشرائح نفسها لكن بقيد زمن استجابة مختلف
- أفضل نماذج LLM المحلية 2026 — مشهد عام لنماذج LLM المحلية يتجاوز نماذج VLA الخاصة بالروبوتات التي يغطيها هذا المقال
- نماذج الرؤية المحلية: LLaVA وOllama 2026 — تشغيل نماذج رؤية-لغة محليًا خارج سياق الروبوتات
