Skip to main content
PromptQuorum
Inicio/El directorio completo de software LLM local: 224 herramientas para ejecutar IA en tu propio hardware (2026)
Overview & Reference

El directorio completo de software LLM local: 224 herramientas para ejecutar IA en tu propio hardware (2026)

·28 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Este directorio actualizado de 2026 (última actualización en agosto de 2026) mapea 224 herramientas LLM local, herramientas de despliegue, frameworks y sistemas de IA visual en diez capas. El ecosistema de LLM local en 2026 se divide claramente en diez capas. Los runtimes (Ollama, llama.cpp, vLLM) procesan tokens a través del modelo; las apps de escritorio (LM Studio, Jan, GPT4All) envuelven un runtime en una interfaz de chat; las interfaces web (Open WebUI, LibreChat) hacen lo mismo en el navegador; las integraciones IDE (Continue.dev, PearAI, Windsurf) conectan un modelo local a tu editor de código; las herramientas de terminal (Aider, ShellGPT, aichat) gestionan flujos de trabajo en línea de comandos; los sistemas RAG (AnythingLLM, PrivateGPT) lo apuntan a tus documentos; los frameworks de agentes (LangChain, CrewAI, LangGraph, SuperAGI) encadenan llamadas en flujos de trabajo de varios pasos; los stacks de voz y audio (Whisper.cpp, Piper, XTTS) lo extienden más allá del texto; los clientes móviles (MLC Chat, PocketPal AI) lo llevan al teléfono; los plugins de productividad especializados (Obsidian, Logseq, AutoGPT) lo integran en herramientas que ya usas; y los sistemas de generación de imágenes (Stable Diffusion, ComfyUI, Invoke AI) gestionan tareas de IA visual. Elige primero un runtime (Ollama para casi todo el mundo), luego agrega una o dos capas encima. El directorio a continuación lista cada proyecto que vale la pena conocer en cada capa junto con su licencia, para que puedas planificar un stack completamente open-source de principio a fin si eso te importa.**

224 herramientas de LLM local en 7 categorías — Run & Serve, Chat & Assistants, Code & Development, Knowledge & Retrieval, Voice & Audio, Images & Video y Train & Operate. Filtra, busca y compara a continuación.

224 herramientas

Totalmente local: 121Híbrido: 103Nube: 0

Ollama

Motores de inferencia
100 % local

El más fácil en general — instalación de un comando, API compatible con OpenAI, enorme biblioteca de modelos

Funciona con su propio motorGratis
Depende del modelo que uses
Línea de comandosAplicación de escritoriomacOSWindowsLinux
180,722283 artículos
Artículo destacado

llama.cpp

Motores de inferencia
100 % local

Motor C++ fundamental detrás de la mayoría de las otras herramientas, funciona en cualquier lugar incluyendo Apple Silicon

Funciona con su propio motorGratis
Depende del modelo que uses
Línea de comandosBiblioteca / SDKmacOSWindowsLinux
126,800150 artículos
Artículo destacado

vLLM

Motores de inferencia
100 % local

Serving de alto rendimiento para despliegues GPU multiusuario

Funciona con su propio motorGratis
Depende del modelo que uses
Línea de comandosBiblioteca / SDKLinux
90,80091 artículos
Artículo destacado

text-generation-webui

Motores de inferencia
100 % local

Interfaz para usuarios avanzados con extenso ecosistema de plugins

Funciona con su propio motorGratis
Depende del modelo que uses
Aplicación webLínea de comandosWindowsLinuxmacOS
47,60015 artículos
Artículo destacado

exo

Motores de inferencia
100 % local

Inferencia distribuida: ejecuta modelos grandes agrupando la potencia de cómputo de varios dispositivos cotidianos

Funciona con su propio motorGratis
Depende del modelo que uses
Línea de comandosmacOSLinux
47,2602 artículos
Artículo destacado

SGLang

Motores de inferencia
100 % local

Serving de inferencia estructurada para pipelines de agentes

Funciona con su propio motorGratis
Depende del modelo que uses
Línea de comandosBiblioteca / SDKLinux
33,5009 artículos
Artículo destacado

Llamafile

Motores de inferencia
100 % local

Ejecución LLM portable en un solo archivo por Mozilla

Funciona con su propio motorGratis
Depende del modelo que uses
Línea de comandosmacOSWindowsLinux
25,9006 artículos
Artículo destacado

MLC LLM

Motores de inferencia
100 % local

Runtime de despliegue para dispositivos móviles y edge

Funciona con su propio motorGratis
Depende del modelo que uses
Biblioteca / SDKAplicación móvilmacOSWindowsLinuxiOSAndroid
23,1346 artículos
Artículo destacado

oMLX

Motores de inferencia
100 % local

Servidor de inferencia local basado en MLX para Apple Silicon con caché SSD paginada, diseñado para impulsar agentes de codificación locales

Funciona con su propio motorGratis
Claude CodeCursorOpenClaw
Depende del modelo que uses
Aplicación de escritorioLínea de comandosmacOS
21,8596 artículos
Artículo destacado

TensorRT-LLM

Motores de inferencia
100 % local

Inferencia optimizada por NVIDIA para configuraciones GPU enterprise

Funciona con su propio motorGratis
Depende del modelo que uses
Línea de comandosBiblioteca / SDKWindowsLinux
14,50010 artículos
Artículo destacado

OpenLLM

Motores de inferencia
Híbrido

Servidor de inferencia autoalojable que ejecuta LLMs de código abierto como DeepSeek y Llama tras una API compatible con OpenAI

Funciona con su propio motorGratis
LlamaDeepSeekQwen
Depende del modelo que uses
Línea de comandosBiblioteca / SDK
12,5351 artículo
Artículo destacado

KoboldCpp

Motores de inferencia
100 % local

Wrapper ligero de llama.cpp con interfaz integrada

Funciona con su propio motorGratis
Depende del modelo que uses
Línea de comandosAplicación webWindowsLinuxmacOS
11,60013 artículos
Artículo destacado

MLX-LM

Motores de inferencia
100 % local

Runtime nativo de Apple Silicon por Apple Research

Funciona con su propio motorGratis
Depende del modelo que uses
Línea de comandosBiblioteca / SDKmacOS
8,90010 artículos
Artículo destacado

NVIDIA Dynamo

Motores de inferencia
100 % local

Framework auto-hospedado de inferencia distribuida a escala de centro de datos para grandes implementaciones de LLM en múltiples GPU y nodos

Requiere Ollama/LM StudioGratis
vLLMTensorRT-LLMSGLangKubernetes
Depende del modelo que uses
Línea de comandosBiblioteca / SDKLinux
8,1133 artículos
Artículo destacado

LMDeploy

Motores de inferencia
100 % local

Kit de herramientas autoalojado para comprimir, cuantizar y servir LLM con un motor de inferencia de alto rendimiento compatible con OpenAI

Funciona con su propio motorGratis
InternLMLlamaQwenBaichuanDeepSeek
Depende del modelo que uses
Línea de comandosBiblioteca / SDKLinux
8,0805 artículos
Artículo destacado

TurboFieldfare

Motores de inferencia
100 % local

Runtime nativo en Swift y Metal que ejecuta Gemma 4 26B-A4B localmente con unos 2 GB de RAM en cualquier MacBook serie M

Funciona con su propio motorGratis
Gemma
Mín. 2 GB de RAM
Aplicación de escritorioLínea de comandosmacOS
6,7682 artículos
Artículo destacado

Shimmy

Motores de inferencia
100 % local

Servidor de inferencia compatible con OpenAI en un solo binario de Rust puro que sirve modelos GGUF y SafeTensors locales sin depender de Python ni llama.cpp

Funciona con su propio motorGratis
GGUFSafeTensors
Depende del modelo que uses
Línea de comandosmacOSWindowsLinux
5,8902 artículos
Artículo destacado

ExLlamaV2

Motores de inferencia
100 % local

Inferencia cuantizada rápida optimizada para GPUs RTX

Funciona con su propio motorGratis
Mín. 8 GB de VRAM
Línea de comandosBiblioteca / SDKWindowsLinux
4,6004 artículos
Artículo destacado

LoRAX

Motores de inferencia
100 % local

Servidor de inferencia autoalojado que sirve miles de adaptadores LoRA ajustados en una sola GPU sin coste por adaptador

Motor propio + externoGratis
HuggingFacePEFTLudwigDocker
Depende del modelo que uses
Línea de comandosBiblioteca / SDKLinux
3,8322 artículos
Artículo destacado

Rapid-MLX

Motores de inferencia
100 % local

Motor de inferencia local compatible con OpenAI para Apple Silicon, construido como backend listo para usar con Claude Code, Cursor y Aider

Funciona con su propio motorGratis
Claude CodeCursorAiderCline
Mín. 8 GB de RAM
Línea de comandosmacOS
3,7734 artículos
Artículo destacado

claude-code-local

Motores de inferencia
100 % local

Servidor local nativo de MLX que permite ejecutar Claude Code 100% en el dispositivo con Apple Silicon, sin nube ni tarifas de API

Funciona con su propio motorGratis
Claude Code
Depende del modelo que uses
Línea de comandosmacOS
3,3141 artículo
Artículo destacado

Lucebox

Motores de inferencia
100 % local

Servidor de inferencia LLM local con kernels ajustados a mano y decodificación especulativa para GPUs de consumo específicas

Funciona con su propio motorGratis
Claude CodeCodexOpenCodeOpen WebUIGGUF
Depende del modelo que uses
Línea de comandosBiblioteca / SDKLinux
2,8671 artículo
Artículo destacado

vllm-mlx

Motores de inferencia
100 % local

Servidor de inferencia compatible con OpenAI y Anthropic que lleva el procesamiento por lotes continuo al estilo vLLM a Apple Silicon mediante MLX nativo.

Funciona con su propio motorGratisCompatible con MCP
Claude CodeOpenAI APIAnthropic API
Depende del modelo que uses
Línea de comandosmacOS
1,5803 artículos
Artículo destacado

mlx-serve

Motores de inferencia
100 % local

Servidor de inferencia nativo en Zig para Apple Silicon que sirve modelos MLX y GGUF a través de API compatibles con OpenAI y Anthropic, con una app de barra de menú de macOS incluida.

Funciona con su propio motorGratisCompatible con MCP
Claude CodeContinueCursorOpen WebUI
Depende del modelo que uses
Línea de comandosAplicación de escritoriomacOS
1,3731 artículo
Artículo destacado

Esta página contiene enlaces de referencia a productos de terceros. PromptQuorum no participa en ningún programa de afiliados — son enlaces simples que no generan comisión. Hacer clic en los enlaces y los pasos siguientes son de su entera responsabilidad. Estos enlaces no representan ningún respaldo ni verificación por parte de PromptQuorum.

Stacks comunes en producción

Para los lectores que no quieren leer las nueve categorías, elige el stack más cercano y cópialo. Cada fila empareja un objetivo real con una combinación probada y el hardware mínimo en el que realmente funciona.

Objetivo
Stack
Hardware mínimo
Chat casualLM Studio standalone16 GB RAM, sin GPU
Mejor equilibrio para usuarios avanzadosOllama + Open WebUI16 GB RAM, GPU opcional
Chat de documentosOllama + AnythingLLM16 GB RAM, GPU opcional
CódigoOllama + Continue.dev16 GB RAM + GPU recomendada
Juego de rol / creativoKoboldCpp + SillyTavern16 GB RAM, GPU recomendada
Empresa con privacidad ante todoOllama + Open WebUI + PrivateGPT32 GB RAM + 12 GB VRAM
Móvil / en movimientoMLC Chat o PocketPal AIiPhone 13+ / Pixel 7+
Apple SiliconOllama (backend MLX) o LM StudioM2/M3/M4/M5 con 16+ GB unificada
Equipo multiusuariovLLM + Open WebUI32+ GB RAM + multi-GPU
9 stacks LLM locales comunes según el objetivo: desde LM Studio standalone (16 GB RAM, sin GPU) hasta vLLM + Open WebUI para equipos multiusuario (32 GB RAM + multi-GPU), con Ollama + Open WebUI como el mejor equilibrio por defecto con 16 GB RAM.
9 stacks LLM locales comunes según el objetivo: desde LM Studio standalone (16 GB RAM, sin GPU) hasta vLLM + Open WebUI para equipos multiusuario (32 GB RAM + multi-GPU), con Ollama + Open WebUI como el mejor equilibrio por defecto con 16 GB RAM.

Conclusiones clave

  • Diez capas, 224 proyectos, un mapa. Runtimes, apps de escritorio, interfaces web, integraciones IDE, herramientas de terminal, sistemas RAG, frameworks de agentes, voz/audio/visión, clientes móviles, plugins de productividad especializados y generación de imágenes — casi todos los proyectos populares de 2026 encajan exactamente en una capa.
  • Elige primero un runtime. Ollama es la opción predeterminada adecuada para ~95% de los lectores; llama.cpp es el motor fundamental detrás de la mayoría de las otras herramientas; vLLM es la opción de producción para despliegues multiusuario en GPU real.
  • La mayoría de las capas por encima del runtime son opcionales. Una app de escritorio O una interfaz web es suficiente para el chat. Agrega una integración IDE solo cuando quieras asistencia de código; herramientas de terminal solo cuando quieras workflows CLI; un sistema RAG solo cuando quieras chatear con tus propios documentos; un framework de agentes solo cuando las llamadas de un solo paso dejen de ser suficientes; generación de imágenes solo cuando necesites salida visual.
  • La licencia importa para el uso comercial. MIT y Apache 2.0 dominan el ecosistema. AGPL aparece en algunas interfaces (text-generation-webui, KoboldCpp, Jan, SillyTavern) — perfecto para uso personal, más deliberado para despliegues comerciales. La columna "Licencia" a continuación nombra cada una explícitamente.
  • Los stacks multiherramienta son la norma. Ollama + Open WebUI + AnythingLLM + Continue.dev + Stable Diffusion es una configuración de una sola máquina que cubre chat, RAG, código y generación de imágenes sin compromiso. La tabla "Stacks comunes en producción" a continuación nombra las recetas que realmente funcionan en 2026.
Las 10 capas de un stack LLM local: 224 proyectos en mantenimiento activo que abarcan runtimes (Ollama, llama.cpp, vLLM), apps de escritorio (LM Studio, Jan, GPT4All), interfaces web, editores IDE, herramientas de terminal, sistemas RAG, frameworks de agentes, voz y audio, clientes móviles, herramientas de productividad especializadas y generación de imágenes (Stable Diffusion, ComfyUI).
Las 10 capas de un stack LLM local: 224 proyectos en mantenimiento activo que abarcan runtimes (Ollama, llama.cpp, vLLM), apps de escritorio (LM Studio, Jan, GPT4All), interfaces web, editores IDE, herramientas de terminal, sistemas RAG, frameworks de agentes, voz y audio, clientes móviles, herramientas de productividad especializadas y generación de imágenes (Stable Diffusion, ComfyUI).

Cómo se mantiene actualizado este directorio

Este directorio se revisa cada tres meses, con actualizaciones mensuales específicas entre revisiones — última actualización en agosto de 2026, próxima revisión programada en noviembre de 2026. La expansión de agosto de 2026 añadió 72+ herramientas nuevas en todos los niveles, dividió voz/multimodal en tres capas específicas (STT, TTS, visión), dividió los asistentes de código en integraciones IDE (4a) y herramientas de terminal (4b), y añadió un nivel completamente nuevo de generación de imágenes. Todos los enlaces y licencias se reverificaron; las nuevas entradas (PearAI, Windsurf, Sourcegraph Cody, SuperAGI, Leon AI, Draw Things, Fooocus, StableSwarmUI y otras) se validaron por mantenimiento activo. Criterios de inclusión: el proyecto está en mantenimiento activo (commits en los últimos 90 días), tiene una licencia open-source verificable o una declaración clara de uso comercial, y o bien tiene una cuota de usuarios significativa en 2026 o llena un nivel que de otro modo estaría vacío. Los proyectos que quedan inactivos durante más de dos ciclos de versión se eliminan; los nuevos participantes que cumplan los criterios se añaden en la próxima revisión. Para sugerir un proyecto para su inclusión, abre un issue o PR contra el repositorio de PromptQuorum — incluye la URL del proyecto, la licencia y una descripción de una oración en el formato anterior.

Fuentes

Preguntas frecuentes

¿Cuál es la diferencia entre un runtime LLM local y una app de escritorio?

Un runtime (Ollama, llama.cpp, vLLM) es el motor que carga los pesos del modelo y sirve una API — típicamente compatible con OpenAI. Una app de escritorio (LM Studio, Jan, GPT4All) es una interfaz de chat que llama a un runtime por detrás. Algunas apps incluyen su propio runtime (LM Studio incorpora llama.cpp), otras requieren que instales un runtime por separado (Open WebUI llama a Ollama). El runtime decide qué es posible; la app decide qué es conveniente.

¿Puedo usar varias herramientas de esta lista al mismo tiempo?

Sí — la mayoría de los stacks combinan 2-4 herramientas. Una configuración común: Ollama como runtime, Open WebUI para chat, AnythingLLM para chat de documentos y Continue.dev para código — las cuatro funcionan con la misma instancia de Ollama en una sola máquina. La tabla "Stacks comunes en producción" arriba lista las recetas que funcionan sin conflicto.

¿Qué herramientas funcionan completamente offline sin telemetría?

Ollama, llama.cpp, vLLM, Jan, GPT4All, Open WebUI, AnythingLLM, PrivateGPT, Continue.dev, Aider, KoboldCpp, Llamafile, MLX-LM y la mayoría de las apps con licencia AGPL/MIT de este directorio funcionan completamente offline una vez descargado el modelo. LM Studio y varias herramientas de código cerrado tienen análisis opcionales que se pueden desactivar en la configuración — verifica con una captura de paquetes una vez después de instalar. Las interfaces web (Open WebUI, LibreChat) son solo locales cuando se configuran para usar un backend local.

¿Alguna de estas herramientas tiene licencia comercial (no gratuita para uso comercial)?

Algunas: LM Studio, Msty, Backyard AI, Layla y Cursor son de código cerrado — generalmente gratuitas para usar pero no redistribuibles, y los términos comerciales varían. Private LLM es de pago. Las herramientas con licencia AGPL (Jan, KoboldCpp, text-generation-webui, SillyTavern, Khoj, Copilot for Obsidian) son gratuitas para cualquier uso incluyendo comercial, pero los términos AGPL requieren divulgar el código fuente si las modificas y las alojas públicamente. Los proyectos Apache 2.0 y MIT (la mayoría) son utilizables en cualquier contexto incluyendo comercial sin restricciones de atribución más allá del texto de la licencia.

¿Qué herramientas soportan Apple Silicon (chips de la serie M) de forma nativa?

Ollama, llama.cpp, MLX-LM, LM Studio, Jan, Enchanted, GPT4All, MLC Chat, AnythingLLM y la mayoría de las apps Electron/Tauri funcionan de forma nativa en Apple Silicon y usan el backend Metal. MLX-LM es específico de Apple y el más rápido para modelos grandes en chips M-series. vLLM, TensorRT-LLM y ExLlamaV2 están centrados en NVIDIA y no funcionan o funcionan mal en Apple Silicon — para usuarios de Apple, Ollama con el backend Metal es la opción por defecto.

¿Todas estas herramientas soportan el formato de modelo GGUF?

GGUF es el formato nativo de llama.cpp y cualquier herramienta que lo envuelva (Ollama, LM Studio, Jan, GPT4All, KoboldCpp, Llamafile). vLLM y TensorRT-LLM usan sus propios formatos optimizados (típicamente AWQ o FP16) para mayor rendimiento. ExLlamaV2 usa cuantización EXL2. MLX-LM usa pesos convertidos a MLX. La mayoría de las herramientas listadas aceptan GGUF; algunas (vLLM, TensorRT-LLM, ExLlamaV2, MLX-LM) requieren un paso de conversión único desde los pesos originales de Hugging Face.

¿Qué herramientas son mejores para usuarios sin experiencia en código?

GPT4All tiene la instalación más sencilla (un clic, funciona con 8 GB RAM), aunque sus propias actualizaciones se han ralentizado últimamente. LM Studio es la más completa en funciones sin necesitar terminal. Jan es la opción sin código más centrada en la privacidad. Para chat de documentos sin trabajo en línea de comandos, AnythingLLM es la más fácil. Las cuatro están listadas en la categoría de Aplicaciones de escritorio (GUI) arriba.

¿Puedo ejecutar estas herramientas en un servidor y acceder a ellas de forma remota?

La mayoría de las herramientas con capacidad de servidor (Ollama, vLLM, LocalAI, Open WebUI, LibreChat, PrivateGPT, AnythingLLM) exponen una API HTTP y se vinculan a una interfaz de red configurable en la configuración. Patrón estándar: ejecutar Ollama en un servidor doméstico o VPS, ejecutar una interfaz en tu laptop o teléfono apuntando a la IP del servidor. Trata la API como cualquier servicio web — vincular a localhost detrás de un proxy inverso, o a una red privada con autenticación adecuada. Open WebUI incluye soporte multiusuario de forma nativa.

¿Qué herramientas soportan configuraciones multiusuario / de equipo?

Open WebUI, LibreChat, h2oGPT, AnythingLLM (con funciones de administrador habilitadas) y Dify están diseñados para uso multiusuario, con control de acceso basado en roles e historial de conversaciones por usuario. vLLM es la capa de serving correcta por debajo cuando la inferencia concurrente importa — agrupa solicitudes de múltiples usuarios para un rendimiento inalcanzable con Ollama a una concurrencia por encima de ~3.

¿Con qué frecuencia se actualiza este directorio?

Cada tres meses, con actualizaciones mensuales específicas entre revisiones — última revisión en julio de 2026, la próxima actualización programada es en noviembre de 2026. Los cambios mensuales (un proyecto queda inactivo, una nueva herramienta gana cuota significativa, una licencia cambia) se aplican como parches a la entrada existente. Las categorías o capas completamente nuevas esperan a la revisión trimestral para mantener estable la estructura. La sección "Fuentes" arriba lista los índices comunitarios utilizados para monitorear lo que el ecosistema está haciendo entre revisiones.

¿Puedo generar imágenes localmente sin llamadas a la nube?

Sí — Stable Diffusion, ComfyUI, Invoke AI, AUTOMATIC1111 WebUI y otras herramientas del Nivel 10 funcionan completamente en hardware local. Stable Diffusion necesita 6+ GB VRAM (RTX 3060, RTX 4060 o equivalente); Fooocus y otras interfaces optimizadas pueden funcionar con tarjetas de 4-6 GB. Real-ESRGAN amplía las imágenes generadas; ControlNet añade control espacial (bordes, poses, mapas de profundidad); AnimateDiff genera video a partir de texto. Todas funcionan sin enviar datos a servidores externos.

Navega por las diapositivas o descárgalas en PDF para consultarlas sin conexión. Descargar tarjeta de referencia (PDF)

About this data

This directory is compiled with AI-assisted research from public sources (project READMEs, official sites, GitHub repositories). It is not exhaustive and may contain errors — hardware requirements, pricing, and platform support change frequently and some fields have not been independently verified yet.

Most entries carry no status badge: they are listed from public sources but not independently reviewed. A "Verified" badge means core facts (license, platforms, pricing) have been manually checked. A "PromptQuorum-tested" badge is only shown for tools PromptQuorum has actually installed and run — most entries do not have this badge yet.

The "PromptQuorum-tested" badge is reserved for tools we have personally installed and run — an untested tool never carries it, regardless of popularity or stars.

Spotted something wrong? Email hello@promptquorum.com and we will correct it.

← Volver a LLM locales avanzados