Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/LLaVA: análisis (2026) — el modelo de investigación que inició la IA visual local
Voice, Speech & Multimodal

LLaVA: análisis (2026) — el modelo de investigación que inició la IA visual local

·13 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

LLaVA (Large Language and Vision Assistant) es un modelo visión-lenguaje de código abierto que combina un codificador visual con un LLM generador de texto para responder preguntas sobre imágenes. Creado por investigadores de la Universidad de Wisconsin-Madison, Microsoft Research y la Universidad de Columbia, se distribuye en GitHub y, más comúnmente hoy, se ejecuta mediante Ollama (ollama run llava). Su código tiene licencia Apache-2.0, pero los checkpoints preentrenados dependen de la licencia del LLM base a partir del cual fueron ajustados (Vicuna, que a su vez lleva la licencia comunitaria de Llama 2) — un matiz que conviene entender antes de un uso comercial. Para una comparación más amplia de los modelos de visión locales actuales, consulta la guía de modelos de visión locales de PromptQuorum.

LLaVA (Large Language and Vision Assistant) es el modelo visión-lenguaje de código abierto que estableció cómo se construye hoy la mayoría de la IA multimodal local: un codificador visual que alimenta a un LLM generador de texto. Creado por investigadores de la Universidad de Wisconsin-Madison, Microsoft Research y la Universidad de Columbia, y distribuido en GitHub y a través de la biblioteca de Ollama, ahora se puede ejecutar con un solo comando (ollama run llava). Este análisis cubre qué es realmente LLaVA, comandos reales de instalación y uso, su licencia de dos niveles (código Apache-2.0 más licencias de pesos dependientes del modelo base), y dónde se sitúa hoy frente a modelos de visión locales más recientes — el panorama honesto para 2026.

LLaVA: análisis (2026) — el modelo de investigación que inició la IA visual local

Conclusiones clave

  • Modelo visión-lenguaje que combina un codificador visual CLIP con un decodificador de texto Vicuna (basado en Llama 2).
  • Licencia del código: Apache-2.0. Los checkpoints preentrenados heredan la licencia comunitaria de Llama 2 a través de su base Vicuna.
  • Se ejecuta mediante ollama pull llava en tres tamaños: 7B, 13B y 34B.
  • Sin commits en el repositorio oficial de GitHub desde el 11 de mayo de 2024; más de 25.000 estrellas, no archivado.
  • Estableció el patrón arquitectónico que usan la mayoría de los modelos visión-lenguaje locales posteriores.
  • Modelos más recientes (Qwen2.5-VL, Llama 3.2 Vision, MiniCPM-V) ahora lo superan en OCR, gráficos y documentos multilingües.

📍 En una frase

LLaVA es el modelo visión-lenguaje de código abierto de la UW-Madison, Microsoft Research y la Universidad de Columbia que estableció la arquitectura codificador-visual-más-LLM que aún usa la mayoría de la IA multimodal local, con licencia Apache-2.0 para el código y condiciones de licencia derivadas de Llama 2 para los checkpoints preentrenados, ejecutable hoy con un solo comando mediante Ollama.

💬 En términos simples

Es un modelo de IA gratuito que puede mirar una imagen y responder preguntas sobre ella — el proyecto de investigación que demostró que esto podía funcionar bien y de forma económica, hoy ejecutable de la forma más simple escribiendo ollama run llava y apuntando a un archivo de imagen.

📌Nota: La página original del proyecto LLaVA indica que sus datos, código y checkpoint están "destinados y con licencia solo para uso de investigación", una afirmación anterior y más estricta que la licencia Apache-2.0 aplicada después al código del repositorio de GitHub. Lee tanto el archivo LICENSE de GitHub como la página del proyecto antes de un uso comercial — ver la sección Licencia y costo más abajo.

Historia: de un artículo de investigación a un estándar de IA local

LLaVA fue creado por Haotian Liu, Chunyuan Li, Qingyang Wu y Yong Jae Lee, investigadores afiliados a la Universidad de Wisconsin-Madison, Microsoft Research y la Universidad de Columbia, y presentado en el artículo de 2023 "Visual Instruction Tuning", aceptado como presentación oral en NeurIPS 2023.

La idea central del artículo fue generar datos de entrenamiento multimodales de seguimiento de instrucciones usando GPT-4, y luego usar esos datos para enseñar a un codificador visual y un modelo de lenguaje de código abierto a seguir instrucciones visuales — describir imágenes, responder preguntas sobre ellas y razonar sobre contenido visual en formato conversacional, a una fracción del costo de entrenamiento de construir un modelo multimodal propietario desde cero.

LLaVA-1.5, lanzado en octubre de 2023, logró resultados de vanguardia en 11 benchmarks con solo modificaciones simples a la arquitectura original — principalmente un conector visión-lenguaje de mayor capacidad y datos de entrenamiento orientados a tareas académicas — mientras se entrenaba en aproximadamente un día en 8 GPU A100, según la propia página del proyecto.

LLaVA-NeXT (también llamado LLaVA-1.6), lanzado en enero de 2024, añadió soporte para entrada de imágenes de mayor resolución mediante parcheo dinámico (hasta 672×672, o 336×1344 para imágenes anchas/altas), junto con OCR y razonamiento visual mejorados, y soporte para LLMs base adicionales más allá de Vicuna.

**El repositorio público de GitHub haotian-liu/LLaVA ha acumulado más de 25.000 estrellas**, y no está marcado como archivado — pero PromptQuorum no encontró commits en su rama principal desde el 11 de mayo de 2024, según el historial público de commits del propio proyecto. Esto es consistente con una publicación de investigación universitaria que cumplió su objetivo (establecer y popularizar la arquitectura) en lugar de un producto comercial en desarrollo continuo.

¿Quién creó LLaVA?

LLaVA fue creado por Haotian Liu, Chunyuan Li, Qingyang Wu y Yong Jae Lee, investigadores afiliados a la Universidad de Wisconsin-Madison, Microsoft Research y la Universidad de Columbia, y presentado en el artículo de 2023 "Visual Instruction Tuning", una presentación oral en NeurIPS 2023.

Qué hace realmente LLaVA

LLaVA conecta un codificador visual con un modelo de lenguaje grande para que el sistema combinado pueda aceptar una imagen y un prompt de texto juntos, y luego generar una respuesta en lenguaje natural sobre la imagen — respondiendo preguntas, describiendo escenas, leyendo texto visible y razonando sobre contenido visual de forma conversacional.

  • Codificador CLIP más decodificador LLM. LLaVA usa un codificador visual CLIP ViT-L/14 para convertir una imagen en una secuencia de características visuales, proyecta esas características en el mismo espacio de embeddings que los tokens de texto del modelo de lenguaje mediante un módulo conector, y alimenta la secuencia combinada a un modelo Vicuna (basado en Llama 2) o, en versiones posteriores, Mistral u otro LLM base para generar una respuesta.
  • Ajuste por instrucciones visuales. En lugar de entrenar con pares imagen-descripción crudos, LLaVA fue ajustado con LLaVA-Instruct-150K, un conjunto de datos de conversaciones visuales multi-turno generadas al pedirle a GPT-4 descripciones de imágenes y anotaciones de detección de objetos — enseñando al modelo a seguir instrucciones visuales abiertas en lugar de solo generar descripciones.
  • Tres tamaños de modelo mediante Ollama. La biblioteca de Ollama empaqueta LLaVA en tamaños 7B (4,7 GB), 13B (8,0 GB) y 34B (20 GB) — los modelos más grandes generalmente producen descripciones más detalladas y precisas, a costa de más VRAM e inferencia más lenta.
  • Mejoras de resolución de LLaVA-1.6 (LLaVA-NeXT). La versión actual soportada mediante Ollama y el repositorio oficial maneja resoluciones de entrada más altas mediante parcheo dinámico, lo que mejora notablemente las tareas de lectura de texto y detalle fino en comparación con la versión original de 2023.
  • Entrenamiento centrado en inglés. LLaVA-Instruct-150K y los benchmarks subyacentes con los que fue evaluado son predominantemente en inglés, por lo que el rendimiento en texto no inglés dentro de imágenes es más débil de fábrica que en modelos entrenados específicamente con datos documentales multilingües.

Instalar y ejecutar LLaVA: paso a paso

Esta guía cubre el camino más rápido y común (Ollama) y menciona el propio camino del repositorio original como referencia.

  1. 1
    Instalar Ollama.
    Why it matters: Descarga e instala [Ollama](https://ollama.com) para macOS, Linux o Windows. Esta es la forma oficialmente listada de ejecutar LLaVA según su [página en la biblioteca de Ollama](https://ollama.com/library/llava), y toma menos de dos minutos.
  2. 2
    Descargar un tamaño de modelo LLaVA.
    Why it matters: Ejecuta `ollama pull llava` para el modelo predeterminado de 7B (~4,7 GB), o `ollama pull llava:13b` (~8,0 GB) o `ollama pull llava:34b` (~20 GB) para mayor calidad a costa de más VRAM y espacio en disco.
  3. 3
    Ejecutarlo con una imagen desde la CLI.
    Why it matters: Ejecuta `ollama run llava "describe this image: ./photo.jpg"`, referenciando directamente una ruta de archivo de imagen local en el texto del prompt — no se requiere una bandera separada.
  4. 4
    (Alternativa) Usar el repositorio original para control de nivel de investigación.
    Why it matters: Clona [haotian-liu/LLaVA](https://github.com/haotian-liu/LLaVA), instala su `requirements.txt`, y descarga un checkpoint desde Hugging Face para acceso completo a scripts de entrenamiento, arneses de evaluación y la demo web de Gradio — útil para investigación o ajuste fino, pero una barrera de instalación notablemente más alta que Ollama.
  5. 5
    (Opcional) Llamarlo programáticamente mediante la API de Ollama.
    Why it matters: Envía una solicitud POST a `http://localhost:11434/api/generate` con la imagen como una cadena codificada en base64 en un arreglo `images`, o usa la biblioteca oficial de Python o JavaScript `ollama` — ver el ejemplo de código a continuación.

Ejemplos de uso reales

Estos ejemplos usan la sintaxis CLI documentada de Ollama y su API HTTP — la forma principal y compatible de ejecutar LLaVA hoy.

  • Referenciar una ruta de archivo en el prompt de la CLI es suficiente — Ollama detecta la ruta .jpg/.png y adjunta la imagen automáticamente; no existe una bandera --image separada.
  • Los tamaños de modelo más grandes cuestan más VRAM y tiempo. El modelo 7B es la opción más rápida y con menor consumo de VRAM; usa 13B o 34B cuando la precisión de la descripción importe más que la velocidad.
bash
# Instalar y descargar el modelo
# (descarga primero Ollama desde https://ollama.com)
ollama pull llava

# CLI: describir una imagen referenciando su ruta de archivo en el prompt
ollama run llava "describe this image: ./photo.jpg"

# --- API HTTP (documentada en el docs/api.md propio de Ollama) ---
# /api/generate con una imagen codificada en base64
curl http://localhost:11434/api/generate -d '{
  "model": "llava",
  "prompt": "What is in this picture?",
  "stream": false,
  "images": ["<datos de imagen codificados en base64>"]
}'

# /api/chat con una imagen codificada en base64 (conversaciones multi-turno)
curl http://localhost:11434/api/chat -d '{
  "model": "llava",
  "messages": [
    { "role": "user", "content": "What is in this image?", "images": ["<datos de imagen codificados en base64>"] }
  ]
}'

# --- Ejemplo en Python usando la biblioteca oficial ollama ---
import ollama

response = ollama.chat(
    model="llava",
    messages=[{
        "role": "user",
        "content": "What is in this image?",
        "images": ["photo.jpg"],
    }],
)
print(response["message"]["content"])

Licencia y costo

**El código de LLaVA, en el repositorio oficial de GitHub, tiene licencia Apache-2.0**, confirmado mediante el archivo LICENSE del repositorio y sus metadatos de licencia reportados por GitHub. Apache-2.0 es una licencia permisiva: puedes usar, modificar y redistribuir el código, incluso comercialmente, con atribución y una concesión de patente, y una restricción mínima adicional.

Los checkpoints preentrenados son otra historia: heredan condiciones de su LLM base. Los checkpoints de LLaVA publicados oficialmente están ajustados a partir de Vicuna, un chatbot ajustado por instrucciones construido a su vez sobre Llama 2 de Meta, y la propia documentación del proyecto indica que los usuarios "deben cumplir con todos los términos y condiciones" de las licencias originales — nombrando específicamente los términos de licencia de Llama 2, Vicuna, CLIP, y los términos de uso de OpenAI (porque GPT-4 se usó para generar los datos de entrenamiento). Esto significa que el uso permitido del checkpoint se rige por los términos de la licencia comunitaria de Llama 2 (incluidas sus restricciones de uso aceptable y el requisito de que los despliegues comerciales muy grandes obtengan una licencia separada de Meta), no solo por Apache-2.0.

La página original del proyecto LLaVA (un sitio separado del repositorio de GitHub) añade una afirmación más estricta y más antigua: describe los "datos, código y checkpoint" como "destinados y con licencia solo para uso de investigación", y señala por separado la designación CC BY-NC 4.0 (no comercial) del conjunto de datos de entrenamiento. Esto es anterior, y más estricto, que la licencia de código Apache-2.0 mostrada ahora en GitHub — una combinación genuinamente confusa de afirmaciones del mismo proyecto en dos páginas diferentes, que vale la pena señalar en lugar de elegir la que resulte más conveniente.

Nada de esto es asesoría legal. Antes de lanzar LLaVA — o cualquier checkpoint ajustado construido sobre él — en un producto comercial, lee el archivo LICENSE de GitHub, los términos indicados en la página del proyecto, la licencia comunitaria de Llama 2, y consulta a un abogado para tu modelo base y despliegue específicos.

¿Qué licencia usa LLaVA?

El código de LLaVA en GitHub tiene licencia Apache-2.0, una licencia permisiva que permite el uso comercial. Sus checkpoints preentrenados publicados oficialmente están ajustados a partir de Vicuna (construido sobre Llama 2 de Meta), por lo que su uso también se rige por los términos de la licencia comunitaria de Llama 2. Una página de inicio separada del proyecto describe además los datos, el código y los checkpoints como destinados solo a investigación, y los datos de entrenamiento como no comerciales (CC BY-NC 4.0) — una afirmación más antigua y estricta que la licencia de GitHub. Esto no es asesoría legal; lee todo lo anterior tú mismo antes del uso comercial de un checkpoint específico.

Para qué no es bueno LLaVA

LLaVA sigue siendo un modelo genuinamente útil y bien documentado, pero ya no es la opción más potente para toda tarea de visión en 2026. Es la herramienta equivocada para las siguientes situaciones:

  • Tareas puramente de texto. LLaVA es un modelo visión-lenguaje; para una conversación puramente textual sin imagen involucrada, usa un LLM de texto dedicado (mediante Ollama o de otra forma) — ejecutar un modelo multimodal para chat solo de texto desperdicia el VRAM que ocupa su codificador visual sin ningún beneficio.
  • Necesitar la OCR o comprensión documental local más potente disponible. A partir de 2026, modelos lanzados después de LLaVA-NeXT — MiniCPM-V, Qwen2.5-VL y Llama 3.2 Vision — lo superan en OCR de documentos, tablas y extracción estructurada, según la comparación de modelos de visión locales de PromptQuorum. El codificador visual de LLaVA fue diseñado y entrenado antes de que existiera esta generación de datos de entrenamiento de mayor resolución y enfocados en documentos.
  • Leer texto no inglés en imágenes. LLaVA-Instruct-150K y los datos de entrenamiento centrales del modelo son predominantemente en inglés. Para OCR de documentos en chino, japonés, coreano u otra escritura no latina, un modelo entrenado específicamente en corpus documentales multilingües (Qwen2.5-VL) lo superará notablemente.
  • Extracción numérica precisa de gráficos y diagramas. Como prácticamente todos los modelos visión-lenguaje locales en 2026, LLaVA no es confiable para leer valores exactos en gráficos complejos — verifica cualquier número extraído contra los datos de origen, sin importar qué modelo uses.
  • Asumir un desarrollo activo continuo. Sin commits en el repositorio oficial desde el 11 de mayo de 2024, no esperes nuevas funciones, correcciones de errores o checkpoints más recientes del proyecto original — las propias actualizaciones del motor multimodal de Ollama y familias de modelos más recientes lo han sustituido efectivamente como la opción activamente desarrollada.
  • Una historia de licencia única y simple. Como el código (Apache-2.0) y los checkpoints publicados oficialmente (Apache-2.0 más términos heredados de la licencia comunitaria de Llama 2, más una afirmación más estricta de solo investigación en la página de inicio separada del proyecto) se rigen por tres afirmaciones superpuestas no totalmente alineadas, LLaVA no ofrece la claridad de licencia de una línea que ofrece un proyecto como Bark (completamente MIT, sin condiciones adicionales).

Alternativas a LLaVA

Llama 3.2 Vision (vía Ollama)

Mejor para:
Mejor calidad general de Q&A de imágenes local; tamaños 11B y 90B
Licencia:
Licencia comunitaria de Llama 3.2

Qwen2.5-VL (vía Ollama)

Mejor para:
OCR local y comprensión documental multilingüe más potentes
Licencia:
Licencia Qwen (Apache-2.0 para tamaños menores)

MiniCPM-V (vía Ollama)

Mejor para:
Alta precisión de OCR documental con bajo (~6 GB) VRAM
Licencia:
Derivada de Apache-2.0 (OpenBMB)

Idefics3 (Hugging Face)

Mejor para:
VLM de investigación abierto con sólidos benchmarks de documentos/OCR, aún no empaquetado para Ollama
Licencia:
Apache-2.0 (aplican términos del modelo base para la variante Llama3)

APIs VLM en la nube (GPT-4o, Claude, Gemini Vision)

Mejor para:
La mayor capacidad multimodal disponible, sin hardware local necesario
Licencia:
Propietaria (API de pago)

Preguntas frecuentes

¿Qué es LLaVA?

LLaVA (Large Language and Vision Assistant) es un modelo visión-lenguaje de código abierto creado por investigadores de la Universidad de Wisconsin-Madison, Microsoft Research y la Universidad de Columbia, que combina un codificador visual con un modelo de lenguaje grande para responder preguntas sobre imágenes, presentado en el artículo de 2023 "Visual Instruction Tuning".

¿Puedo usar LLaVA comercialmente?

El código de LLaVA en GitHub tiene licencia Apache-2.0, que permite el uso comercial. Sin embargo, sus checkpoints preentrenados publicados oficialmente están ajustados a partir de Vicuna, construido sobre Llama 2 de Meta, por lo que su uso también se rige por los términos de la licencia comunitaria de Llama 2. Una página de inicio separada del proyecto describe además los datos, el código y los checkpoints como destinados solo a investigación, y los datos de entrenamiento como no comerciales (CC BY-NC 4.0) — una afirmación más antigua y estricta que la licencia de GitHub. Esto no es asesoría legal; lee todas las licencias aplicables antes de cualquier despliegue comercial de un checkpoint específico.

¿Cómo ejecuto LLaVA?

La forma más común es mediante Ollama: instala Ollama, ejecuta ollama pull llava, luego ollama run llava "describe this image: ./photo.jpg". El repositorio original también ofrece sus propios scripts de inferencia en Python y una demo de Gradio para control de nivel de investigación.

¿Cuál es la diferencia entre LLaVA, LLaVA-1.5 y LLaVA-NeXT (LLaVA-1.6)?

LLaVA (2023) fue la arquitectura original. LLaVA-1.5 (octubre de 2023) mejoró los resultados de benchmark con un conector de mayor capacidad y mejores datos de entrenamiento. LLaVA-NeXT, también llamado LLaVA-1.6 (enero de 2024), añadió entrada de imágenes de mayor resolución mediante parcheo dinámico y mejoró la OCR y el razonamiento visual. La versión distribuida mediante Ollama y el repositorio actual de GitHub refleja las mejoras de LLaVA-1.6/NeXT.

¿Sigue LLaVA activamente mantenido?

El repositorio oficial de GitHub no está marcado como archivado, pero PromptQuorum no encontró commits desde el 11 de mayo de 2024. Trátalo como una publicación de investigación completada en lugar de software activamente desarrollado — modelos más recientes y las propias actualizaciones del motor multimodal de Ollama lo han sustituido en gran medida para nuevos proyectos.

¿Cómo se compara LLaVA con modelos más recientes como Qwen2.5-VL o Llama 3.2 Vision?

LLaVA estableció la arquitectura que también siguen estos modelos más recientes, pero a partir de 2026 es superado por Qwen2.5-VL y Llama 3.2 Vision en OCR de documentos, lectura de gráficos y (específicamente para Qwen2.5-VL) texto no inglés, según la comparación de modelos de visión locales de PromptQuorum. LLaVA sigue siendo relevante por su facilidad de instalación, gran comunidad y amplia cobertura de tutoriales.

¿Realmente soporta Ollama la ejecución de LLaVA?

Sí — ollama run llava es un modelo oficialmente listado en la biblioteca de Ollama, disponible en tamaños 7B, 13B y 34B, y es una de las formas más comunes de ejecutar LLaVA hoy, junto a los propios scripts de inferencia del repositorio original.

¿Qué hardware necesito para ejecutar LLaVA?

El modelo 7B requiere aproximadamente 4,7 GB de espacio en disco y puede ejecutarse en una GPU con 6-8 GB de VRAM (o en CPU, más lentamente); los modelos 13B y 34B necesitan proporcionalmente más VRAM y espacio en disco para mejor calidad de descripción.

Veredicto

LLaVA se ganó su lugar en la historia de la IA local: demostró que un codificador visual modesto conectado a un LLM de código abierto, ajustado con datos de instrucción generados por GPT-4, podía ofrecer una comprensión de imágenes genuinamente útil sin un presupuesto de entrenamiento propietario — y el patrón codificador-visual-más-LLM que estableció sigue siendo la base de la mayoría de los modelos multimodales locales hoy. Su licencia de código (Apache-2.0) es permisiva, pero sus checkpoints publicados oficialmente llevan términos derivados de Llama 2 a través de su base Vicuna, más una afirmación más antigua y estricta de solo investigación en la página de inicio separada del proyecto — lee las tres antes de cualquier uso comercial. En capacidad pura para 2026, LLaVA ya no es el modelo de visión local más potente: sin commits desde mayo de 2024, y opciones más recientes como Qwen2.5-VL, Llama 3.2 Vision y MiniCPM-V lo superan en OCR, gráficos y documentos multilingües. Si quieres la instalación más simple, la comunidad más grande y la mayor cantidad de tutoriales existentes, ollama run llava sigue siendo un punto de partida genuinamente bueno. Si la precisión documental o el texto no inglés importa, combina este análisis con la comparación de modelos de visión locales y la guía de modelos de visión de Ollama de PromptQuorum antes de elegir un modelo.

Fuentes

← Volver a LLM locales avanzados