Skip to main content
PromptQuorum
الرئيسية/LLM المحلية المتقدمة/نماذج VLM في الكاميرات والطائرات المسيّرة 2026: فهم الفيديو على الجهاز
Mobile & Edge LLMs

نماذج VLM في الكاميرات والطائرات المسيّرة 2026: فهم الفيديو على الجهاز

·13 دقائق للقراءة·بقلم Hans Kuepper · مؤسس PromptQuorum، أداة إرسال الذكاء الاصطناعي متعددة النماذج · PromptQuorum

تنقل الكاميرات والطائرات المسيّرة الاستدلال إلى الجهاز لأن قيود عرض النطاق الترددي والوصلة — لا الخصوصية — تجعل بث الفيديو الخام أمرًا غير عملي. تكلفة بث أمني رباعي الدقة (4K) مستمر، على مدى فترة الاحتفاظ بالبيانات، تفوق في النقل والتخزين تكلفة المسرّع (accelerator) الذي يعالجه مباشرة داخل الكاميرا. أما الطائرة المسيّرة على مدى تشغيلي فتواجه وصلة راديوية متقطعة ومنخفضة عرض النطاق وأحيانًا معرّضة للتشويش، ما يجعل الحوسبة على متنها الوسيلة الوحيدة للتصرف بناءً على ما تراه. كلا الحالتين تدعمان التحول نفسه: من كشف الأجسام بفئات ثابتة إلى بحث VLM بمفردات مفتوحة يجد حدثًا موصوفًا بدلًا من مطابقة قائمة فئات ثابتة.

تشترك الكاميرات والطائرات المسيّرة في قيد واحد يحدد أين يعمل ذكاء الفيديو الاصطناعي: عرض النطاق الترددي (bandwidth)، وليس القدرة الحاسوبية، هو السبب في انتقال الاستدلال (inference) إلى الجهاز نفسه. يقارن هذا الدليل بين معماريات المعالجة داخل الكاميرا وعلى جهاز طرفي (edge appliance) وفي السحابة لتحليل الفيديو، ويشرح التحول من الكشف بفئات ثابتة إلى بحث VLM بمفردات مفتوحة، ويغطي منصات الحوسبة المستخدمة اليوم فعليًا في الكاميرات وعلى هياكل الطائرات المسيّرة.

نماذج VLM في الكاميرات والطائرات المسيّرة 2026: فهم الفيديو على الجهاز

النقاط الرئيسية

  • قيود عرض النطاق الترددي والوصلة، لا الخصوصية، هي سبب انتقال استدلال الكاميرات والطائرات المسيّرة إلى الجهاز: بث 4K مستمر تكلفته في النقل والتخزين أعلى من الشريحة التي تعالجه محليًا.
  • ينتقل تحليل الفيديو من الكشف بفئات ثابتة إلى بحث VLM بمفردات مفتوحة — وصف حدث بلغة طبيعية بدلًا من مطابقته مع قائمة فئات مدرَّبة مسبقًا.
  • شرائح الكاميرا: تستهدف Hailo-10H وHailo-15 GenAI مدمجًا في الكاميرا بأقل من 5 واط؛ وتضيف سلسلة Ambarella N (أُطلقت في CES 2026) شريحة رؤية بالذكاء الاصطناعي على الحافة بدقة 8K مع إدراك متعدد المستشعرات.
  • الأجهزة الطرفية (NVIDIA Jetson Orin/Thor) تجمّع تدفقات كاميرات كثيرة محليًا؛ يدعم Jetson Thor حتى 32 مدخل كاميرا MIPI CSI-2.
  • تشغّل الطائرات المسيّرة الحوسبة على الهيكل نفسه: يجمع Qualcomm QRB5165 عبر ModalAI VOXL 2 بين الطيار الآلي والملاحة البصرية-القصورية بلا GPS والاستدلال في وحدة تزن نحو 16 غرامًا.
  • معظم عمليات النشر الفعلية هجينة — يعمل كاشف خفيف بفئات ثابتة باستمرار؛ ولا يعالج VLM سوى المقاطع المُفعَّلة، لا كل إطار.
  • لا يحل VLM محل الكشف بفئات ثابتة — بل يضيف بحثًا بمفردات مفتوحة فوق كاشف يواصل عمل الفرز المستمر إطارًا بإطار.

لماذا ينتقل ذكاء الفيديو إلى الحافة قبل أن تُطرح مسألة الخصوصية أصلًا؟

قيود عرض النطاق الترددي والوصلة الفيزيائية هي السبب الرئيسي في انتقال استدلال الكاميرات والطائرات المسيّرة إلى الجهاز — الحجة الاقتصادية تسبق حجة الخصوصية. تولّد كاميرا 4K تبث باستمرار بمعدل 15–30 إطارًا في الثانية معدل بيانات مستمرًا يتراكم، عبر عدة كاميرات في موقع واحد ونافذة احتفاظ مدتها 30 يومًا، تكاليف نقل وتخزين تفوق سرعةً التكلفة الأحادية لمسرّع مدمج في الكاميرا أو جهاز طرفي. تتيح الآلة الحاسبة أسفل هذه الصفحة إجراء هذا الحساب لعدد الكاميرات ونافذة الاحتفاظ الخاصة بك.

تواجه الطائرات المسيّرة القيد نفسه من الاتجاه المعاكس: بدلًا من بيانات كثيرة يصعب نقلها بتكلفة منخفضة، لديها وصلة موثوقة قليلة يمكن الاعتماد عليها. تملك الطائرة المسيّرة على مدى تشغيلي وصلة راديوية متقطعة ومنخفضة عرض النطاق وأحيانًا معرّضة للتشويش — ومهمة تعتمد على اتصال سحابي مستمر لتفسير ما تراه الطائرة تفشل بالضبط حين تحتاج الطائرة إلى التصرف بشكل مستقل، كما في حالة تشويش GPS أو خارج مدى الرؤية المباشرة.

يختلف هذا الإطار عن حجة الخصوصية أولًا التي يميل إليها محتوى هذا الموقع الحالي عن نماذج LLM المحلية لأغراض الاستهلاك وأجهزة سطح المكتب. بالنسبة للكاميرات والطائرات المسيّرة، أول سؤال يطرحه المشتري هو "هل يمكنني تحمّل نقل هذا القدر من الفيديو، وهل يمكنني الاعتماد على استقرار الوصلة؟" — الخصوصية وإقامة البيانات محليًا فوائد ثانوية حقيقية، وليستا سبب وجود هذه المعمارية.

📍 في جملة واحدة

ينتقل ذكاء الفيديو إلى الجهاز لأن تكاليف النقل والتخزين، إلى جانب وصلات راديوية غير موثوقة، تجعل الاستدلال المعتمد على السحابة غير عملي حتى قبل أن تصبح الخصوصية عاملًا.

💬 بعبارات بسيطة

نقل فيديو كل كاميرا إلى خادم يكلّف مالًا ويتطلب وصلة تبقى مستقرة؛ معالجته حيث يُلتقط يتجنب المشكلتين معًا.

هل تُشغّل الاستدلال داخل الكاميرا، أم على جهاز طرفي، أم في السحابة؟

ثلاث معماريات تتعامل اليوم مع ذكاء فيديو الكاميرات، ومعظم عمليات النشر الإنتاجية تجمع بين اثنتين منها على الأقل. يعتمد الاختيار الصحيح على عدد الكاميرات لكل موقع، ومتطلبات الاحتفاظ، ومقدار التكلفة لكل وحدة التي تستطيع ميزانية العتاد استيعابها.

الاستدلال داخل الكاميرا يدمج المسرّع داخل الكاميرا نفسها — تستهدف Hailo-10H وHailo-15 بالضبط نقطة التصميم هذه باستهلاك أقل من 5 واط. استخدم هذا حين تحتاج كل كاميرا لاتخاذ قرارها الخاص (تسجيل مُفعَّل بالحركة، كشف عبث على الجهاز) وتستطيع قائمة مكونات الكاميرا استيعاب شريحة واحدة لكل وحدة.

الجهاز الطرفي المحلي يجمّع تدفقات كاميرات كثيرة في جهاز واحد يعمل بـ NVIDIA Jetson Orin أو Jetson Thor. استخدم هذا حين يضم موقع كاميرات أكثر مما يُعقل تجهيزه فرديًا — دعم Jetson Thor لحتى 32 مدخل كاميرا MIPI CSI-2 إشارة قوية إلى أن هذه المنصة صُممت بالضبط لدور تجميع متعدد الكاميرات، لا لاستدلال تدفق واحد.

المعالجة السحابية لا تزال مناسبة للمواقع ذات عدد الكاميرات القليل وبلا متطلب زمن حقيقي، حيث يهم البحث الرجعي في الأرشيف الكامل عبر أشهر أكثر من زمن استجابة المقطع الواحد، وحيث تكون تكلفة عرض النطاق لعدد قليل من التدفقات مقبولة.

عمليًا، معظم عمليات النشر الموصوفة لاحقًا في هذا المقال هجينة: يعمل الكشف بفئات ثابتة باستمرار داخل الكاميرا أو على الجهاز الطرفي، ويحتفظ التخزين السحابي بأرشيف للبحث الرجعي، ولا يعمل استدلال VLM إلا على المقاطع التي سبق أن رصدها كاشف أقل تكلفة.

كيف يتحول تحليل الفيديو من الكشف إلى الوصف؟

ينتقل تحليل الفيديو من كشف الأجسام بفئات ثابتة إلى بحث VLM بمفردات مفتوحة — وهو أحدث تحول في هذا السوق. يجيب الكاشف بفئات ثابتة عن سؤال "هل يوجد شخص أو مركبة أو إحدى نحو 80 فئة COCO مدرَّبة مسبقًا في هذا الإطار؟" أما VLM بمفردات مفتوحة فيجيب عن استعلام موصوف — "ابحث عن المقطع الذي ترك فيه شخص حقيبة قرب رصيف التحميل" — على لقطات لم يُدرَّب الكاشف بفئات ثابتة قط على التعرف عليها كفئة.

لا يحل VLM محل الكاشف بفئات ثابتة — بل يعمل فوقه. لن يعمل نموذج رؤية-لغة بمعدل 30 إطارًا في الثانية لكل تدفق ضمن ميزانية طاقة أقل من 5 واط؛ فتكلفة الحوسبة وزمن الاستجابة للاستدلال الكامل بـ VLM مرتفعة جدًا للمعالجة المستمرة إطارًا بإطار عند هذا المستوى من الطاقة. بدلًا من ذلك، يواصل الكاشف بفئات ثابتة عمل الفرز المستمر منخفض الاستهلاك — الحركة والوجود والتصنيف الأساسي — ولا يُرسَل إلى VLM سوى المقاطع التي يرصدها للوصف أو البحث بمفردات مفتوحة.

هذا التصميم ذو المستويين هو سبب وصف شرائح مدمجة في الكاميرا مثل Hailo-10H بأنها مسرّع "GenAI على الحافة" بدلًا من معالج VLM لكل إطار: فالشريحة مصمَّمة لاستدلال VLM مُفعَّل ومتقطع فوق كشف خفيف مستمر، لا لتشغيل نموذج رؤية-لغة بمعدل إطارات كامل.

📍 في جملة واحدة

يجد بحث VLM بمفردات مفتوحة حدثًا موصوفًا في لقطات لم يتعلم كاشف بفئات ثابتة قط التعرف عليها كفئة، لكنه يعمل على مقاطع مُفعَّلة، لا في كل إطار.

💬 بعبارات بسيطة

الطريقة القديمة: "ارصد كل ما يطابق شخص/سيارة/كلب". الطريقة الجديدة: "ابحث عن المقطع الذي ترك فيه شخص حقيبة قرب الرصيف" — بكلماتك الخاصة، بعد أن يكون كاشف أرخص قد رصد المقطع بالفعل.

  • الكشف بفئات ثابتة: مستمر، منخفض الاستهلاك، يجيب "هل هذا واحد من N فئة مدرَّبة مسبقًا؟"
  • بحث VLM بمفردات مفتوحة: مُفعَّل، استهلاك أعلى، يجيب عن وصف بلغة طبيعية لمقطع محدد
  • الاثنان يتكاملان، لا يتنافسان — الكاشف يقرر ما يُعرض على VLM، لا العكس
  • تشترك إعدادات VLM على سطح المكتب والخوادم (LLaVA وQwen3-VL ونماذج مشابهة) في عائلات النماذج نفسها المستخدمة في تحليل المقاطع المُفعَّل هذا — راجع مقارنة VLM لسطح المكتب أدناه قبل تقييم عملية نشر مدمجة

كم يحتاج موقع الكاميرات لديك فعليًا من عرض النطاق والتخزين؟

أدخل أدناه عدد الكاميرات والدقة ومعدل الإطارات ونافذة الاحتفاظ لتقدير عرض النطاق المستمر وتكلفة التخزين. استخدم هذا قبل الاختيار بين معمارية داخل الكاميرا أو جهاز طرفي أو سحابة — الرقم الناتج يحسم النقاش عادةً بمفرده.

Estimated bandwidth & storage

Continuous bandwidth (all streams): 128 Mbps

Storage for the retention window: 41.5 TB

Estimates from typical H.264 surveillance-quality bitrates, scaled linearly with frame rate. Actual bitrate varies with scene complexity and codec.

كيف تُقيّم عملية نشر VLM للكاميرا أو الطائرة المسيّرة؟

ست فحوصات تفصل بين عملية نشر تعمل في الميدان وأخرى تفشل فيه. نفّذها بهذا الترتيب قبل الالتزام بمنصة شرائح محددة.

  1. 1
    حدّد المُحفِّز، لا التدفق
    Why it matters: قرر أي حدث يُفعِّل استدلال VLM (حركة، إنذار من كاشف بفئات ثابتة، فاصل زمني مجدول) قبل اختيار العتاد — تشغيل VLM على كل إطار من كل تدفق ليس ميزانية طاقة أو تكلفة واقعية في عام 2026.
  2. 2
    قِس ميزانية الوصلة قبل اختيار الشريحة
    Why it matters: بالنسبة للطائرات المسيّرة، قِس عرض نطاق الرفع المتاح وأسوأ زمن استجابة عند المدى التشغيلي قبل اختيار منصة الحوسبة — وصلة الراديو الخاصة بالهيكل، لا شريحة الحوسبة، هي عادةً القيد الملزم.
  3. 3
    أبقِ الكشف والوصف مرحلتين منفصلتين
    Why it matters: شغّل كاشفًا خفيفًا بفئات ثابتة باستمرار ووجّه إلى VLM المقاطع المرصودة فقط — هذه الطريقة الوحيدة لجعل استدلال VLM يناسب ميزانية طاقة الكاميرا أو الطائرة المسيّرة.
  4. 4
    طابق ميزانية الطاقة مع الهيكل الفيزيائي
    Why it matters: يحدّ غلاف كاميرا بلا مروحة ميزانية الحرارة إلى نحو 5 واط؛ وتُقيَّد حمولة الطائرة المسيّرة بالوزن ومقايضات مدة الطيران، لا بالاستهلاك وحده — صمّم الشريحة وفق الغلاف، لا العكس.
  5. 5
    تحقق من التشغيل بلا GPS إذا كانت المهمة قد تفقد GPS أو وصلة القيادة
    Why it matters: يجب اختبار الملاحة البصرية-القصورية (VIO) تحديدًا، لا افتراض عملها، قبل الاعتماد عليها خارج مدى الرؤية المباشرة أو في بيئات كهرومغناطيسية متنازع عليها.
  6. 6
    جرّب على موقع واحد أو هيكل واحد قبل التوسع
    Why it matters: تحقق من معدل الإيجابيات الكاذبة، وزمن استجابة الاستعلامات، وسلوك البطارية/الحرارة في عملية نشر واحدة قبل الالتزام بميزانية لنشر على مستوى الأسطول بأكمله.

لماذا تعالج الطائرات المسيّرة الفيديو على متنها بدلًا من بثه؟

تنقل الطائرات المسيّرة الحوسبة إلى الهيكل لثلاثة أسباب: هامش الوصلة، وزمن الاستجابة، والملاحة بلا GPS — وليس لأن الحوسبة على المتن أرخص. تتدهور وصلة راديو الطائرة المسيّرة مع المدى والتضاريس والتشويش بطريقة لا يعرفها كابل إيثرنت لكاميرا ثابتة أبدًا؛ ومهمة تعتمد على اتصال سحابي مستمر لتفسير الفيديو تفشل بالضبط حين تكون الطائرة في أبعد نقطة عن مشغّلها وأكثر ما تحتاج إليه هو الاستقلالية.

يُعد VOXL 2 من ModalAI، المبني حول Qualcomm QRB5165، المنصة المرجعية لتصميم الحوسبة على متن الهيكل. إنه متوافق مع PX4، ويدعم الملاحة البصرية-القصورية (VIO) بلا GPS للتنقل عندما يكون تحديد الموقع بالأقمار الصناعية غير متاح أو مشوَّشًا، ويجمع الطيار الآلي والحوسبة ومستشعرات الملاحة في وحدة من فئة الطيار الآلي تزن نحو 16 غرامًا — صغيرة بما يكفي لتنافس الحمولة والبطارية على ميزانية الوزن نفسها، لا مصدر طاقة منفصل.

الوزن والطاقة قيدان صارمان على الهيكل بطريقة لا ينطبقان بها على كاميرا مثبَّتة على جدار. كل غرام من الحوسبة على المتن هو غرام غير متاح لسعة البطارية أو حمولة المستشعرات أو مدة الطيران — لا يمكن لمنصة طائرة مسيّرة أن تضيف ببساطة وحدة رف كما يمكن لموقع كاميرات محلي أن يضيف جهازًا طرفيًا.

  • هامش الوصلة: يتدهور الاتصال الراديوي مع المدى والتضاريس والطيف المتنازع عليه بطريقة لا تعرفها بنية الكاميرات السلكية
  • زمن الاستجابة: قرار فوري (تجنب عقبة، تتبع هدف) لا يمكنه انتظار رحلة ذهاب وإياب إلى خادم سحابي
  • الملاحة بلا GPS: تتيح الملاحة البصرية-القصورية للطائرة الحفاظ على موقعها واتجاهها عندما يكون تحديد الموقع بالأقمار الصناعية غير متاح
  • ميزانية الوزن: وحدة حوسبة من فئة الطيار الآلي تزن نحو 16 غرامًا تنافس مباشرة البطارية والحمولة، بخلاف غلاف كاميرا ثابتة

أين تُستخدم نماذج VLM للكاميرات والطائرات المسيّرة تجاريًا فعليًا؟

أربع فئات تجارية تمثل معظم عمليات النشر الإنتاجية اليوم: تفتيش البنية التحتية والمرافق، والزراعة الدقيقة، والمسح ورسم الخرائط، والأمن العام.

  • تفتيش البنية التحتية والمرافق: طائرات مسيّرة مزوَّدة بحوسبة على المتن تفتش خطوط النقل والأنابيب وأبراج الاتصالات، وترصد العيوب المرئية دون بث اللقطات الخام للمراجعة
  • الزراعة الدقيقة: تميّز الرؤية على المتن إجهاد المحاصيل وضغط الأعشاب الضارة ومشكلات الري لكل حقل، وتغذّي القرارات في أنظمة إدارة المزارع دون الاعتماد على اتصال سحابي مستمر في مناطق ريفية ذات اتصال ضعيف
  • المسح ورسم الخرائط: تعالج طائرات القياس التصويري والتفتيش الصور على المتن أو على جهاز طرفي لتقليل حجم البيانات الخام التي يجب نقلها وتخزينها لكل رحلة
  • الأمن العام: تجمع شبكات الكاميرات الثابتة بين الكشف المستمر بفئات ثابتة وبحث VLM المُفعَّل — مثل استرجاع حادث موصوف من أرشيف بدلًا من مراجعة ساعات من اللقطات يدويًا

📌ملاحظة: تُشكّل البرامج العسكرية أيضًا سوق الشرائح هذا. اختير برنامج Hivemind للاستقلالية من Shield AI لبرنامج الطائرة المقاتلة التعاونية (CCA) YFQ-44A التابع لسلاح الجو الأمريكي، واختُبر برنامج Lattice من Anduril على الهيكل نفسه. هذا الطلب على مستوى البرامج على منظومات الاستقلالية أحد محركات الاستثمار في شرائح الاستدلال على الحافة، رغم أن مسار الاعتماد والجهة المشترية ومتطلبات برامج الدفاع تختلف كليًا عن عمليات النشر التجارية الموصوفة أعلاه، وتقع خارج نطاق هذا الدليل.

مقارنة: منصات الحوسبة للكاميرات والطائرات المسيّرة

راجع دليل شرائح الحافة للمواصفات الكاملة لـ Jetson Orin وJetson Thor — يبقى هذا الجدول مركّزًا على المنصات المخصصة للكاميرات والطائرات المسيّرة الأكثر صلة بتحليل الفيديو.

المنصة
ميزانية الطاقة
الأنسب لـ
الحالة
Hailo-10H / Hailo-15أقل من 5 واطGenAI مدمج بالكاميرا، فرز VLMعُرض في ISC West 2026
Ambarella N-seriesشريحة رؤية IA على الحافةإدراك متعدد المستشعرات 8Kأُطلق في CES 2026
NVIDIA Jetson Orin / Thorفئة 15–130 واطجهاز طرفي متعدد الكاميراتThor: حتى 32 كاميرا MIPI
Qualcomm QRB5165 (VOXL 2)وحدة فئة طائرة مسيّرةطيار آلي + VIO + استدلالمتوافق PX4، نحو 16 غ

ما العتاد الذي تحتاجه للبدء؟

أربع فئات من العتاد تغطي معظم مشاريع VLM للكاميرات والطائرات المسيّرة؛ تحقق من عروض الموزعين وتجار التجزئة الحالية لأن الأسعار تتغير باستمرار.

  • وحدات الكاميرا وأطقم التطوير: لوحات كاميرا مرجعية مقترنة بمسرّع طرفي، تُستخدم لتجربة نموذج أولي لخط معالجة داخل الكاميرا قبل الالتزام بتصميم كاميرا مخصص
  • وحدات مسرّع Hailo M.2: تضيف استدلال ذكاء اصطناعي بأقل من 5 واط إلى كاميرا أو لوحة حوسبة مدمجة موجودة عبر منفذ M.2، دون إعادة تصميم اللوحة الرئيسية للكاميرا
  • أجهزة فيديو طرفية: أطقم تطوير NVIDIA Jetson Orin وJetson Thor، تُستخدم لتجربة معمارية تجميع متعدد الكاميرات الموصوفة أعلاه قبل نشر أسطول من الأجهزة الطرفية المحلية
  • منصات تطوير الطائرات المسيّرة: أطقم تطوير ModalAI VOXL 2، تُستخدم لتجربة خطوط معالجة طيار آلي مبنية على PX4 واستدلال على المتن قبل الدمج في هيكل إنتاجي

ما الذي لا يعمل بعد على الجهاز؟

ثلاث قدرات لا تزال، حتى عام 2026، على مستوى السحابة أو في مرحلة البحث، ولا يغيّر أي مسرّع من فئة الكاميرات أو الطائرات المسيّرة ذلك هذا العام.

  • فهم الفيديو طويل المدى: الاستدلال عبر تسجيل يمتد ساعات عدة في تمريرة واحدة، بدلًا من تحليل مقاطع مُفعَّل، لا يزال يتجاوز ميزانية الذاكرة والحوسبة لمسرّعات الحافة
  • إعادة التعرف عبر الكاميرات على نطاق واسع: تتبّع شخص موصوف بشكل موثوق عبر تدفقات كاميرات ومواقع كثيرة لا يزال عملًا يناسب أكثر نظامًا مركزيًا يملك وصولًا إلى الأرشيف الكامل متعدد الكاميرات
  • سياق كبير عبر ساعات من اللقطات: استعلام بمفردات مفتوحة يحتاج إلى الاستدلال عبر تسجيل يوم كامل، بدلًا من مقطع محدد مرصود، لا يزال يحتاج إلى سياق وحوسبة أكبر مما تدعمه ميزانية طاقة مسرّع الحافة

ما الاختصاص القانوني وقواعد الشراء المطبَّقة؟

تختلف قواعد تشغيل الطائرات المسيّرة التجارية بشكل كبير بين دول الخليج، إذ تطلب سلطات الطيران المدني المحلية — مثل هيئة الطيران المدني في الإمارات (GCAA) — التسجيل والتصاريح للعمليات التجارية، مع اختلاف تفاصيل القواعد بشكل ملحوظ من دولة إلى أخرى. يجب على مهندس تكامل الأنظمة الذي يبيع في هذه الأسواق التحقق من متطلبات التسجيل والتصريح المحددة لدى الجهة التنظيمية المختصة في كل دولة قبل تحديد مواصفات العتاد ووظائف الاستقلالية، لا بعدها، نظرًا لعدم وجود إطار تنظيمي موحّد واحد يغطي المنطقة بأكملها.

الأسئلة الشائعة

لماذا تشغّل أنظمة ذكاء الكاميرات والطائرات المسيّرة الاستدلال على الجهاز بدلًا من السحابة؟

قيود عرض النطاق الترددي والوصلة، لا الخصوصية، هي السبب الرئيسي. بث كاميرا 4K مستمر تكلفته في النقل والتخزين، على مدى فترة الاحتفاظ، أعلى من المسرّع الذي يعالجه محليًا، وطائرة مسيّرة على مدى تشغيلي تملك وصلة راديوية متقطعة وأحيانًا معرّضة للتشويش لا يمكن أن تتحمل الاعتماد على السحابة.

ما الفرق بين الكشف بفئات ثابتة وبحث VLM بمفردات مفتوحة؟

يجيب الكاشف بفئات ثابتة عن سؤال ما إذا كان الإطار يحتوي واحدة من مجموعة فئات مدرَّبة مسبقًا (نحو 80 فئة في نموذج نموذجي مدرَّب على COCO). أما VLM بمفردات مفتوحة فيجيب عن استعلام موصوف — مثل "ابحث عن المقطع الذي ترك فيه شخص حقيبة قرب رصيف التحميل" — على محتوى لم يُدرَّب الكاشف بفئات ثابتة قط على التعرف عليه كفئة.

هل يمكن لنموذج رؤية-لغة أن يعمل في الزمن الحقيقي على مسرّع كاميرا بأقل من 5 واط؟

ليس بمعدل إطارات كامل. لن يعمل VLM بمعدل 30 إطارًا في الثانية لكل تدفق ضمن ميزانية طاقة أقل من 5 واط. عمليًا، يعمل كاشف خفيف بفئات ثابتة باستمرار وباستهلاك منخفض، ولا يُمرَّر إلى VLM سوى المقاطع التي يرصدها للوصف بمفردات مفتوحة — يعمل VLM على مقاطع مُفعَّلة، لا في كل إطار.

ما منصة الحوسبة التي تستخدمها الطائرات المسيّرة التجارية لذكاء اصطناعي على المتن؟

يُعد VOXL 2 من ModalAI، المبني حول Qualcomm QRB5165، منصة مرجعية واسعة الاستخدام. إنه متوافق مع PX4، ويدعم الملاحة البصرية-القصورية بلا GPS للتنقل، ويجمع الطيار الآلي والحوسبة ومستشعرات الملاحة في وحدة تزن نحو 16 غرامًا.

كم من عرض النطاق الترددي تحتاجه فعليًا كاميرا أمنية واحدة بدقة 4K؟

يعتمد ذلك على معدل الإطارات وتعقيد المشهد والترميز — استخدم آلة حساب عرض النطاق في هذه الصفحة لتقدير عرض النطاق المستمر وتكلفة التخزين لعدد الكاميرات والدقة ومعدل الإطارات ونافذة الاحتفاظ الخاصة بك، بدلًا من الاعتماد على رقم تقريبي واحد.

هل يجب اختيار Hailo-10H أم سلسلة Ambarella N لتصميم كاميرا جديد؟

تستهدف الشريحتان موقعين متداخلين لكنهما متمايزان: تركّز Hailo-10H وHailo-15 على استدلال GenAI مدمج بالكاميرا بأقل من 5 واط، بينما تُموضَع سلسلة Ambarella N (أُطلقت في CES 2026) كشريحة رؤية ذكاء اصطناعي على الحافة بدقة 8K مع إدراك متعدد المستشعرات. يعتمد الاختيار الصحيح على الدقة المستهدفة وميزانية الطاقة وما إذا كنت تحتاج إلى دمج متعدد المستشعرات في الشريحة نفسها.

لماذا تحتاج الطائرات المسيّرة إلى ملاحة بلا GPS، وكيف يتعامل VOXL 2 معها؟

يمكن تشويش إشارات GPS أو انتحالها أو ببساطة عدم توفرها داخل المباني أو في بيئات متنازع عليها. يدعم VOXL 2 الملاحة البصرية-القصورية (VIO)، التي تدمج بيانات الكاميرا والمستشعرات القصورية لتقدير الموقع والاتجاه دون الاعتماد على تحديد الموقع بالأقمار الصناعية.

هل تُقيَّد الطائرات المسيّرة الصينية المنشأ في بعض الأسواق التجارية والحكومية؟

تفرض بعض الأسواق، وأبرزها المشتريات الفيدرالية الأمريكية والجهات المرتبطة بها، قيودًا على عتاد الطائرات المسيّرة الصينية المنشأ عبر أطر تنظيمية محلية خاصة بها. أما في دول الخليج، فتختلف القواعد حسب الجهة التنظيمية في كل دولة، ويجب على مهندس تكامل الأنظمة التحقق من متطلبات الاعتماد والتسجيل المحلية قبل تحديد منصة بعينها لمشروع معين.

هل أحتاج إلى جهاز طرفي، أم يمكن لكل كاميرا تشغيل الاستدلال بمفردها؟

يعتمد ذلك على عدد الكاميرات لكل موقع. يمكن لعدد قليل من الكاميرات أن تشغّل كل منها الاستدلال داخل الكاميرا باستقلالية (شرائح من فئة Hailo-10H/15). أما الموقع ذو الكاميرات الكثيرة فعادةً ما يستفيد من جهاز طرفي محلي (NVIDIA Jetson Orin أو Thor) يجمّع التدفقات مركزيًا — دعم Jetson Thor لحتى 32 مدخل كاميرا MIPI CSI-2 في جهاز واحد إشارة قوية على دوره المقصود متعدد الكاميرات.

ما الذي لا تستطيع نماذج VLM على الجهاز فعله بعد في تحليل الفيديو؟

ثلاث قدرات لا تزال، حتى عام 2026، على مستوى السحابة أو في مرحلة البحث: الاستدلال طويل المدى عبر تسجيل يمتد ساعات عدة في تمريرة واحدة، وإعادة التعرف عبر الكاميرات على نطاق واسع لشخص واحد، والاستعلامات بمفردات مفتوحة التي تحتاج إلى سياق يغطي تسجيل يوم كامل بدلًا من مقطع محدد مرصود.

← العودة إلى LLM المحلية المتقدمة