Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/VLM en cámaras y drones 2026: comprensión de vídeo en el dispositivo
Mobile & Edge LLMs

VLM en cámaras y drones 2026: comprensión de vídeo en el dispositivo

·13 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Cámaras y drones mueven la inferencia al dispositivo porque los límites de ancho de banda y de enlace — no la privacidad — hacen impracticable transmitir vídeo en bruto. Un flujo de seguridad 4K continuo cuesta, durante su ventana de retención, más en transporte y almacenamiento que el acelerador que lo procesa directamente en la cámara. Un dron en rango operativo enfrenta un enlace de radio intermitente, de bajo ancho de banda y a veces disputado, por lo que el cómputo a bordo es la única forma de actuar sobre lo que observa. Ambos casos respaldan el mismo cambio: de la detección de objetos por clases fijas hacia la búsqueda VLM de vocabulario abierto, que encuentra un evento descrito en lugar de comparar contra una lista fija de clases.

Cámaras y drones comparten una restricción que decide dónde se ejecuta la IA de vídeo: el ancho de banda, no el cómputo, es la razón por la que la inferencia se traslada al dispositivo. Esta guía compara las arquitecturas en cámara, en appliance de borde y en la nube para el análisis de vídeo, explica el cambio de la detección por clases fijas a la búsqueda VLM de vocabulario abierto, y cubre las plataformas de cómputo que hoy se envían en cámaras y drones.

VLM en cámaras y drones 2026: comprensión de vídeo en el dispositivo

Conclusiones clave

  • Los límites de ancho de banda y de enlace, no la privacidad, explican por qué la inferencia de cámaras y drones se mueve al dispositivo: un flujo 4K continuo cuesta más en transporte y almacenamiento que el chip que lo procesa localmente.
  • El análisis de vídeo pasa de la detección por clases fijas a la búsqueda VLM de vocabulario abierto — describir un evento en lenguaje natural en lugar de compararlo con una lista de clases preentrenada.
  • Silicio de cámara: Hailo-10H y Hailo-15 apuntan a GenAI en cámara por debajo de 5 W; la serie N de Ambarella (lanzada en CES 2026) suma un SoC de visión IA edge de 8K con percepción multisensor.
  • Los appliances de borde (NVIDIA Jetson Orin/Thor) agregan muchas cámaras en un mismo sitio; Jetson Thor admite hasta 32 entradas de cámara MIPI CSI-2.
  • Los drones ejecutan cómputo en la aeronave: Qualcomm QRB5165 vía ModalAI VOXL 2 combina piloto automático, odometría visual-inercial sin GPS e inferencia en un módulo de unos 16 g.
  • La mayoría de los despliegues reales son híbridos — un detector ligero por clases fijas corre de forma continua; el VLM solo procesa clips activados, no cada fotograma.
  • Un VLM no sustituye la detección por clases fijas — añade búsqueda de vocabulario abierto sobre un detector que sigue haciendo el trabajo continuo de triaje por fotograma.

¿Por qué la IA de vídeo se mueve al borde antes de que la privacidad entre en juego?

Los límites de ancho de banda y de enlace físico son la razón principal por la que la inferencia de cámaras y drones se mueve al dispositivo — el argumento económico llega antes que el argumento de privacidad. Una cámara 4K en streaming continuo a 15–30 fps genera una tasa de bits sostenida que, multiplicada por varias cámaras en un mismo sitio y una ventana de retención de 30 días, acumula costes de transporte y almacenamiento más rápido que el coste único de un acelerador en cámara o de un appliance de borde. La calculadora más abajo en esta página permite hacer ese cálculo para su propio número de cámaras y ventana de retención.

Los drones enfrentan la misma restricción desde la dirección opuesta: en lugar de demasiados datos que mover a bajo coste, tienen muy poco enlace fiable en el que confiar. Un dron en rango operativo tiene un enlace de radio intermitente, de bajo ancho de banda y a veces disputado — una misión que depende de una conexión continua a la nube para interpretar lo que ve el dron falla precisamente cuando la aeronave necesita actuar de forma autónoma, por ejemplo durante interferencia de GPS o fuera del alcance visual directo.

Este planteamiento difiere del argumento centrado en la privacidad que suele usar el contenido existente de este sitio sobre LLM locales para IA de consumo y escritorio. Para cámaras y drones, la primera pregunta del comprador es "¿puedo permitirme mover tanto vídeo, y puedo contar con que el enlace se mantenga estable?" — la privacidad y la residencia de datos son beneficios secundarios reales, no la razón de ser de la arquitectura.

📍 En una frase

La IA de vídeo se mueve al dispositivo porque los costes de transporte y almacenamiento, junto con enlaces de radio poco fiables, hacen impracticable la inferencia dependiente de la nube antes de que la privacidad sea siquiera un factor.

💬 En términos simples

Mover el vídeo de cada cámara a un servidor cuesta dinero y exige un enlace que se mantenga estable; procesarlo donde se capta evita ambos problemas.

¿Debe ejecutar la inferencia en cámara, en un appliance de borde o en la nube?

Hoy existen tres arquitecturas para la IA de vídeo de cámaras, y la mayoría de los despliegues en producción combinan al menos dos. La elección correcta depende del número de cámaras por sitio, los requisitos de retención y cuánto coste por unidad puede absorber el presupuesto de hardware.

La inferencia en cámara integra el acelerador dentro de la propia cámara — Hailo-10H y Hailo-15 apuntan exactamente a este punto de diseño con un consumo por debajo de 5 W. Úsela cuando cada cámara deba tomar su propia decisión (grabación activada por movimiento, detección de manipulación en el dispositivo) y la lista de materiales de la cámara pueda absorber un chip por unidad.

El appliance de borde en las instalaciones agrega muchas cámaras en un solo equipo con NVIDIA Jetson Orin o Jetson Thor. Úselo cuando un sitio tenga más cámaras de las que tiene sentido instrumentar individualmente — que Jetson Thor admita hasta 32 entradas de cámara MIPI CSI-2 es una señal clara de que esta plataforma está pensada precisamente para este rol de agregación multi-cámara, no para inferencia de un solo flujo.

El procesamiento en la nube sigue siendo adecuado para sitios con pocas cámaras sin requisito de tiempo real, donde la búsqueda retroactiva en el archivo completo durante meses importa más que la latencia por clip y donde el coste de ancho de banda de unos pocos flujos es aceptable.

En la práctica, la mayoría de los despliegues descritos más adelante en este artículo son híbridos: la detección por clases fijas corre de forma continua en cámara o en el appliance de borde, el almacenamiento en la nube conserva un archivo para búsqueda retroactiva, y la inferencia VLM solo se ejecuta contra clips que un detector más económico ya ha marcado.

¿Cómo está cambiando el análisis de vídeo de la detección a la descripción?

El análisis de vídeo pasa de la detección de objetos por clases fijas a la búsqueda VLM de vocabulario abierto — el cambio más reciente en este mercado. Un detector por clases fijas responde "¿hay una persona, un vehículo, o una de las aproximadamente 80 categorías COCO preentrenadas en este fotograma?". Un VLM de vocabulario abierto responde a una consulta descrita — "encuentra el clip donde alguien dejó una bolsa cerca del muelle de carga" — sobre metraje que el detector por clases fijas nunca fue entrenado para reconocer como categoría.

Un VLM no sustituye al detector por clases fijas — trabaja sobre él. Un modelo de visión-lenguaje no se ejecutará a 30 fotogramas por segundo por flujo dentro de un presupuesto de potencia inferior a 5 W; el coste de cómputo y latencia de la inferencia VLM completa es demasiado alto para el procesamiento continuo fotograma a fotograma en ese margen de potencia. En su lugar, el detector por clases fijas sigue haciendo el trabajo continuo de triaje de bajo consumo — movimiento, presencia, clasificación básica — y solo los clips que marca se pasan al VLM para descripción o búsqueda de vocabulario abierto.

Este diseño de dos niveles explica por qué el silicio en cámara como Hailo-10H se describe como acelerador de "GenAI en el borde" en lugar de un procesador VLM a fotograma completo: el chip está dimensionado para inferencia VLM activada e intermitente sobre una detección ligera continua, no para ejecutar un modelo de visión-lenguaje a plena tasa de fotogramas.

📍 En una frase

La búsqueda VLM de vocabulario abierto encuentra un evento descrito en metraje que un detector por clases fijas nunca aprendió a reconocer como categoría, pero se ejecuta sobre clips activados, no en cada fotograma.

💬 En términos simples

La forma antigua: "marca todo lo que coincida con persona/coche/perro". La forma nueva: "encuentra el clip donde alguien dejó una bolsa junto al muelle" — con tus propias palabras, después de que un detector más económico ya haya marcado el clip.

  • Detección por clases fijas: continua, bajo consumo, responde "¿es esto una de N categorías preentrenadas?"
  • Búsqueda VLM de vocabulario abierto: activada, mayor consumo, responde a una descripción en lenguaje natural sobre un clip específico
  • Ambas se suman, no compiten — el detector decide qué se muestra al VLM, no al revés
  • Las configuraciones VLM de escritorio y servidor (LLaVA, Qwen3-VL y modelos similares) comparten las mismas familias de modelos usadas para este análisis de clips activado — vea la comparativa de VLM de escritorio más abajo antes de evaluar un despliegue embebido

¿Cuánto ancho de banda y almacenamiento necesita realmente su sitio de cámaras?

Introduzca abajo su número de cámaras, resolución, tasa de fotogramas y ventana de retención para estimar el ancho de banda continuo y el coste de almacenamiento. Úselo antes de elegir entre arquitectura en cámara, appliance de borde o nube — la cifra resultante suele zanjar el debate por sí sola.

Estimated bandwidth & storage

Continuous bandwidth (all streams): 128 Mbps

Storage for the retention window: 41.5 TB

Estimates from typical H.264 surveillance-quality bitrates, scaled linearly with frame rate. Actual bitrate varies with scene complexity and codec.

¿Cómo se evalúa un despliegue VLM de cámara o dron?

Seis comprobaciones separan un despliegue que funciona de uno que falla sobre el terreno. Realícelas en este orden antes de comprometerse con una plataforma de silicio específica.

  1. 1
    Defina el disparador, no el flujo
    Why it matters: Decida qué evento activa la inferencia VLM (movimiento, una alarma de un detector por clases fijas, un intervalo programado) antes de elegir el hardware — ejecutar un VLM contra cada fotograma de cada flujo no es un presupuesto de potencia o coste realista en 2026.
  2. 2
    Mida el presupuesto de enlace antes de elegir el silicio
    Why it matters: Para drones, mida el ancho de banda de subida disponible y la latencia en el peor caso al rango operativo antes de elegir una plataforma de cómputo — el enlace de radio de la aeronave, no el chip de cómputo, suele ser la restricción vinculante.
  3. 3
    Mantenga la detección y la descripción como etapas separadas
    Why it matters: Ejecute un detector ligero por clases fijas de forma continua y envíe al VLM solo los clips marcados — es la única forma de encajar la inferencia VLM en un presupuesto de potencia de cámara o dron.
  4. 4
    Ajuste el presupuesto de potencia al recinto físico
    Why it matters: Un recinto de cámara sin ventilador limita el presupuesto térmico a unos 5 W; una carga útil de dron está limitada por el peso y los compromisos de autonomía de vuelo, no solo por el consumo — dimensione el silicio para el recinto, no al revés.
  5. 5
    Valide la operación sin GPS si la misión puede perder el GPS o el enlace de mando
    Why it matters: La odometría visual-inercial (VIO) debe probarse específicamente, no darse por hecha, antes de confiar en ella más allá del alcance visual directo o en entornos electromagnéticos disputados.
  6. 6
    Pilote en un sitio o una aeronave antes de escalar
    Why it matters: Valide la tasa de falsos positivos, la latencia de consultas y el comportamiento de batería/térmico en un único despliegue antes de comprometer presupuesto para un despliegue a escala de flota.

¿Por qué los drones procesan el vídeo a bordo en lugar de transmitirlo?

Los drones trasladan el cómputo a la aeronave por tres razones: margen de enlace, latencia y navegación sin GPS — no porque el cómputo a bordo sea más barato. El enlace de radio de un dron se degrada con el alcance, el terreno y las interferencias de una forma que el cable ethernet de una cámara fija jamás experimenta; una misión que depende de una conexión continua a la nube para interpretar el vídeo falla precisamente cuando la aeronave está más lejos de su operador y más necesita autonomía.

El VOXL 2 de ModalAI, construido alrededor del Qualcomm QRB5165, es la plataforma de referencia para el diseño de cómputo a bordo de la aeronave. Es compatible con PX4, admite odometría visual-inercial (VIO) sin GPS para navegar cuando el posicionamiento satelital no está disponible o está interferido, y empaqueta piloto automático, cómputo y sensores de navegación en un módulo de clase piloto automático de unos 16 gramos — lo bastante pequeño como para competir con la carga útil y la batería por el mismo presupuesto de peso, no con una fuente de alimentación separada.

El peso y la potencia son restricciones estrictas en una aeronave de una forma que no lo son para una cámara atornillada a una pared. Cada gramo de cómputo a bordo es un gramo no disponible para capacidad de batería, carga útil de sensores o autonomía de vuelo — una plataforma de dron no puede simplemente añadir una unidad de rack como puede hacerlo un sitio de cámaras en las instalaciones con un appliance de borde.

  • Margen de enlace: la conectividad de radio se degrada con el alcance, el terreno y el espectro disputado de una forma que la infraestructura de cámara cableada no experimenta
  • Latencia: una decisión en tiempo real (evitar obstáculos, seguimiento de objetivo) no puede esperar un viaje de ida y vuelta a un servidor en la nube
  • Navegación sin GPS: la odometría visual-inercial permite a la aeronave mantener posición y rumbo cuando el posicionamiento satelital no está disponible
  • Presupuesto de peso: un módulo de cómputo de clase piloto automático de unos 16 g compite directamente con la batería y la carga útil, a diferencia del recinto de una cámara estacionaria

¿Dónde se usan ya comercialmente los VLM de cámara y dron?

Cuatro categorías comerciales explican la mayoría de los despliegues en producción hoy: inspección de infraestructura y servicios públicos, agricultura de precisión, levantamiento y cartografía, y seguridad pública.

  • Inspección de infraestructura y servicios públicos: drones equipados con cómputo a bordo inspeccionan líneas de transmisión, oleoductos y torres de telefonía, marcando defectos visibles sin transmitir el metraje bruto para su revisión
  • Agricultura de precisión: la visión a bordo distingue el estrés del cultivo, la presión de malezas y problemas de riego por parcela, alimentando decisiones en sistemas de gestión agrícola sin depender de una conexión continua a la nube en zonas rurales con conectividad débil
  • Levantamiento y cartografía: los drones de fotogrametría e inspección procesan imágenes a bordo o en un appliance de borde para reducir el volumen de datos brutos que hay que transportar y almacenar por vuelo
  • Seguridad pública: las redes de cámaras fijas combinan detección continua por clases fijas con búsqueda VLM activada — por ejemplo, para recuperar un incidente descrito de un archivo en lugar de revisar manualmente horas de metraje

📌Nota: Los programas militares también están moldeando este mercado de silicio. El software de autonomía Hivemind de Shield AI fue seleccionado para el programa Collaborative Combat Aircraft (CCA) YFQ-44A de la Fuerza Aérea de EE. UU., y el software Lattice de Anduril ha sido probado en la misma aeronave. Esta demanda a nivel de programa por pilas de autonomía es uno de los impulsores de la inversión en silicio de inferencia en el borde, aunque el camino de certificación, el comprador y los requisitos de los programas de defensa son completamente distintos de los despliegues comerciales descritos arriba y quedan fuera del alcance de esta guía.

Comparativa: plataformas de cómputo para cámaras y drones

Consulte la guía de silicio de borde para las especificaciones completas de Jetson Orin y Jetson Thor — esta tabla se centra en las plataformas específicas de cámaras y drones más relevantes para el análisis de vídeo.

Plataforma
Presupuesto de potencia
Ideal para
Estado
Hailo-10H / Hailo-15<5 WGenAI en cámara, triaje VLMMostrado en ISC West 2026
Ambarella serie NSoC visión IA edgePercepción multisensor 8KLanzado en CES 2026
NVIDIA Jetson Orin / ThorClase 15–130 WAppliance multi-cámaraThor: hasta 32 cámaras MIPI
Qualcomm QRB5165 (VOXL 2)Módulo clase dronPiloto automático + VIO + inferenciaCompatible PX4, ~16 g

¿Qué hardware necesita para empezar?

Cuatro categorías de hardware cubren la mayoría de los proyectos VLM de cámara y dron; verifique las ofertas actuales de distribuidores y minoristas, ya que los precios cambian con frecuencia.

  • Módulos de cámara y kits de desarrollo: placas de cámara de referencia combinadas con un acelerador de borde, usadas para prototipar un pipeline en cámara antes de comprometerse con un diseño de cámara a medida
  • Módulos aceleradores Hailo M.2: añaden inferencia de IA por debajo de 5 W a una cámara o placa de cómputo embebido existente mediante un slot M.2, sin rediseñar la placa principal de la cámara
  • Appliances de vídeo de borde: kits de desarrollo NVIDIA Jetson Orin y Jetson Thor, usados para prototipar la arquitectura de agregación multi-cámara descrita arriba antes de desplegar una flota de appliances en las instalaciones
  • Plataformas de desarrollo para drones: kits de desarrollo ModalAI VOXL 2, usados para prototipar pipelines de piloto automático basado en PX4 e inferencia a bordo antes de integrarlos en una aeronave de producción

¿Qué no funciona aún en el dispositivo?

Tres capacidades siguen siendo de nivel nube o etapa de investigación en 2026, y ningún acelerador de clase cámara o dron cambia eso este año.

  • Comprensión de vídeo a largo horizonte: razonar sobre una grabación de varias horas en una sola pasada, en lugar de un análisis de clip activado, sigue superando el presupuesto de memoria y cómputo de los aceleradores de borde
  • Re-identificación entre cámaras a escala: seguir de forma fiable a un sujeto descrito a través de muchas cámaras y sitios sigue siendo una carga de trabajo mejor adaptada a un sistema centralizado con acceso al archivo completo multi-cámara
  • Gran contexto sobre horas de metraje: una consulta de vocabulario abierto que necesite razonar sobre la grabación de un día entero, en lugar de un clip específico marcado, sigue necesitando más contexto y cómputo del que soporta el presupuesto de potencia de un acelerador de borde

¿Qué normas jurídicas y de adquisición se aplican?

En la UE, las categorías de drones de la EASA — Abierta, Específica, Certificada — determinan el nivel de autonomía permitido por operación, y el marcado CE junto con la Directiva de Equipos Radioeléctricos (RED) se aplican al hardware. Para un proyecto de cámara o dron en España o la UE, la categoría de operación no es un mero trámite — determina qué funciones de autonomía (por ejemplo, una lógica automatizada de detección y reacción) pueden operarse sin autorización adicional. Un integrador de sistemas debería aclarar la categoría EASA prevista antes de especificar el hardware y las funciones de autonomía, no después. Para proyectos fuera de la UE (por ejemplo, en Latinoamérica), las reglas de operación de drones varían por país y deben verificarse por separado con la autoridad de aviación civil correspondiente.

Preguntas frecuentes

¿Por qué los sistemas de IA de cámaras y drones ejecutan la inferencia en el dispositivo en lugar de en la nube?

Los límites de ancho de banda y de enlace, no la privacidad, son la razón principal. Un flujo de cámara 4K continuo cuesta, durante su ventana de retención, más en transporte y almacenamiento que el acelerador que lo procesa localmente, y un dron en rango operativo tiene un enlace de radio intermitente, a veces disputado, que una dependencia de la nube no puede tolerar.

¿Cuál es la diferencia entre la detección por clases fijas y la búsqueda VLM de vocabulario abierto?

Un detector por clases fijas responde si un fotograma contiene una de un conjunto de categorías preentrenadas (unas 80 en un modelo típico entrenado con COCO). Un VLM de vocabulario abierto responde a una consulta descrita — por ejemplo, "encuentra el clip donde alguien dejó una bolsa cerca del muelle de carga" — sobre contenido que el detector por clases fijas nunca fue entrenado para reconocer como categoría.

¿Puede un modelo de visión-lenguaje ejecutarse en tiempo real en un acelerador de cámara de menos de 5 W?

No a plena tasa de fotogramas. Un VLM no se ejecuta a 30 fotogramas por segundo por flujo dentro de un presupuesto de potencia inferior a 5 W. En la práctica, un detector ligero por clases fijas corre de forma continua con bajo consumo, y solo los clips que marca se pasan al VLM para descripción de vocabulario abierto — el VLM se ejecuta sobre clips activados, no en cada fotograma.

¿Qué plataforma de cómputo usan los drones comerciales para la IA a bordo?

El VOXL 2 de ModalAI, construido alrededor del Qualcomm QRB5165, es una plataforma de referencia ampliamente utilizada. Es compatible con PX4, admite odometría visual-inercial sin GPS para navegación, y empaqueta piloto automático, cómputo y sensores de navegación en un módulo de unos 16 gramos.

¿Cuánto ancho de banda necesita realmente una sola cámara de seguridad 4K?

Depende de la tasa de fotogramas, la complejidad de la escena y el códec — use la calculadora de ancho de banda de esta página para estimar el ancho de banda continuo y el coste de almacenamiento para su número de cámaras, resolución, tasa de fotogramas y ventana de retención específicos, en lugar de confiar en una única cifra genérica.

¿Debería elegir Hailo-10H o la serie N de Ambarella para un nuevo diseño de cámara?

Apuntan a posiciones que se solapan pero son distintas: Hailo-10H y Hailo-15 se centran en la inferencia GenAI en cámara por debajo de 5 W, mientras que la serie N de Ambarella (lanzada en CES 2026) se posiciona como un SoC de visión IA de 8K con percepción multisensor. La elección correcta depende de la resolución objetivo, el presupuesto de potencia y si necesita fusión multisensor en el mismo chip.

¿Por qué los drones necesitan navegación sin GPS, y cómo la maneja el VOXL 2?

Las señales GPS pueden ser interferidas, suplantadas o simplemente no estar disponibles en interiores o en entornos disputados. El VOXL 2 admite odometría visual-inercial (VIO), que fusiona datos de cámara y sensores inerciales para estimar posición y rumbo sin depender del posicionamiento satelital.

¿Qué categoría EASA se aplica a la inspección comercial por dron en la UE?

Depende de la operación: la EASA distingue las categorías Abierta (bajo riesgo, reglas estándar), Específica (normalmente se requiere una evaluación de riesgo con autorización de operación específica para inspección de infraestructura e instalaciones industriales) y Certificada (comparable a la aviación tripulada). Un integrador de sistemas debería aclarar la categoría antes de especificar el hardware y las funciones de autonomía, no después.

¿Necesito un appliance de borde, o cada cámara puede ejecutar la inferencia por su cuenta?

Depende del número de cámaras por sitio. Un puñado de cámaras puede ejecutar cada una la inferencia en cámara de forma independiente (chips de clase Hailo-10H/15). Un sitio con muchas cámaras suele beneficiarse de un appliance de borde en las instalaciones (NVIDIA Jetson Orin o Thor) que agrega los flujos de forma centralizada — Jetson Thor admite hasta 32 entradas de cámara MIPI CSI-2 en un solo equipo, una señal clara de su rol multi-cámara previsto.

¿Qué no pueden hacer todavía los VLM en el dispositivo para el análisis de vídeo?

Tres capacidades siguen siendo de nivel nube o etapa de investigación en 2026: el razonamiento a largo horizonte sobre una grabación de varias horas en una sola pasada, la re-identificación entre cámaras de un sujeto a escala, y las consultas de vocabulario abierto que necesitan contexto que abarque la grabación de un día entero en lugar de un clip específico marcado.

← Volver a LLM locales avanzados