Conclusiones clave
- 46 herramientas, tres tipos: motores de inferencia (30), runtimes y gestores (13), routers y gateways (4). Ollama aparece en dos grupos porque es a la vez un motor y un runtime.
- La tabla se genera a partir del registro de cada herramienta y se contrasta con su README o sitio oficial; un guion significa "no indicado en la documentación", nunca "no". En algunas herramientas conocidas, la documentación citada aquí no dice nada sobre una función concreta, por lo que sus celdas muestran un guion.
- Cada nombre de herramienta de la tabla enlaza con su propio análisis en PromptQuorum, donde se explican los pasos de instalación y los límites.
📍 En una frase
Ejecutar modelos en local implica tres tipos de herramienta — motores de inferencia, runtimes y gestores, y routers y gateways — por lo que las 46 herramientas del directorio de PromptQuorum se comparan dentro de cada tipo, con una tabla generada a partir de los mismos datos que el análisis propio de cada herramienta.
💬 En términos simples
Un motor es la parte que ejecuta realmente el modelo, un runtime o gestor descarga y ejecuta modelos por ti, y un gateway enruta las solicitudes entre ellos. Comparar un motor con un gateway por soporte de GPU no tiene sentido, así que esta guía compara elementos del mismo tipo.
Cómo comparamos
Los datos de cada herramienta — precio, licencia, plataformas, requisitos de hardware y atributos específicos de la categoría — se guardan una sola vez, en el registro de esa herramienta en el directorio. La tabla comparativa de más abajo se genera a partir de esos registros, y el análisis de cada herramienta se basa en el mismo registro, por lo que ambos no pueden indicar valores distintos.
Los atributos específicos de la categoría (por ejemplo, API compatible con OpenAI o soporte para GPU AMD) se tomaron del README o del sitio web oficial de cada proyecto y se contrastaron con la redacción exacta allí. Cuando la documentación no dice nada, la tabla muestra un guion en lugar de suponer; cuando una afirmación está matizada (experimental, prevista o disponible solo a través de un proyecto aparte), el atributo se deja fuera de la tabla y se trata en el análisis de la herramienta.
Solo las herramientas con análisis propio en PromptQuorum figuran en la tabla. Las herramientas que aparecen únicamente como servidores de API (h2oGPT, Tabby y OpenAI Edge TTS) se comparan en sus propias categorías. La comparativa enumera herramientas que se ejecutan en tu propio hardware; no las clasifica, porque la adecuada depende de tu restricción.
Tabla comparativa
Elige a continuación un tipo de herramienta y lee cada fila de izquierda a derecha. Haz clic en el nombre de una herramienta para abrir su análisis completo en PromptQuorum.
| Herramienta | Precio | Licencia | Plataformas | Ejecución | Hardware | Versión | API compatible con OpenAI | GPU NVIDIA | Apple Silicon | GPU AMD | Inferencia en CPU | Multi-GPU / multinodo | Análisis | enlace de producto · divulgado |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| candle-vllm | Gratis | MIT | macOS, Windows, Linux | Local | Depende del modelo | v0.9.1 | Sí | Sí | Sí | — | — | Sí | Leer análisis → | candle-vllm |
| claude-code-local | Gratis | MIT | macOS | Local | Depende del modelo | v0.3.0 | — | — | Sí | — | — | — | Leer análisis → | claude-code-local |
| ExLlamaV2 | Gratis | MIT | Windows, Linux | Local | 8 GB de VRAM | v0.3.2 | — | Sí | — | — | — | Sí | Leer análisis → | ExLlamaV2 |
| exo | Gratis | Apache-2.0 | macOS, Linux | Local | Depende del modelo | — | Sí | — | Sí | — | Sí | Sí | Leer análisis → | exo |
| KoboldCpp | Gratis | AGPL-3.0 | Windows, Linux, macOS | Local | Depende del modelo | v1.121 | Sí | Sí | Sí | Sí | Sí | — | Leer análisis → | KoboldCpp |
| KServe | Gratis | Apache-2.0 | Linux | Local | Basta con CPU | v0.20.0 | Sí | — | — | — | — | Sí | Leer análisis → | KServe |
| llama.cpp | Gratis | MIT | macOS, Windows, Linux | Local | Depende del modelo | v0.4.1 | Sí | Sí | Sí | Sí | Sí | — | Leer análisis → | llama.cpp |
| Llamafile | Gratis | Apache-2.0 | macOS, Windows, Linux | Local | Depende del modelo | 0.10.6 | — | — | — | — | — | — | Leer análisis → | Llamafile |
| LMDeploy | Gratis | Apache-2.0 | Linux | Local | Depende del modelo | v0.17.0 | — | Sí | — | — | — | Sí | Leer análisis → | LMDeploy |
| LocalAI | Gratis | MIT | macOS, Windows, Linux | Local | Depende del modelo | — | Sí | Sí | Sí | Sí | Sí | Sí | Leer análisis → | LocalAI |
| LoRAX | Gratis | Apache-2.0 | Linux | Local | Depende del modelo | v0.12.1 | Sí | Sí | — | — | — | Sí | Leer análisis → | LoRAX |
| Lucebox | Gratis | Apache-2.0 | Linux | Local | Depende del modelo | — | Sí | Sí | — | Sí | — | Sí | Leer análisis → | Lucebox |
| MLC LLM | Gratis | Apache-2.0 | macOS, Windows, Linux, iOS, Android | Local | Depende del modelo | — | Sí | Sí | Sí | Sí | — | — | Leer análisis → | MLC LLM |
| MLX-LM | Gratis | MIT | macOS | Local | Depende del modelo | — | — | — | Sí | — | — | Sí | Leer análisis → | MLX-LM |
| mlx-serve | Gratis | MIT | macOS | Local | Depende del modelo | v26.9.4 | Sí | — | Sí | — | — | — | Leer análisis → | mlx-serve |
| mlxcel | Gratis | Apache-2.0 | macOS, Linux | Local | Depende del modelo | v0.7.0 | Sí | Sí | Sí | — | — | Sí | Leer análisis → | mlxcel |
| NVIDIA Dynamo | Gratis | Apache-2.0 | Linux | Local | Depende del modelo | v1.4–v1.6 | Sí | — | — | — | — | Sí | Leer análisis → | NVIDIA Dynamo |
| Ollama | Gratis | MIT | macOS, Windows, Linux | Local | Depende del modelo | — | — | — | — | — | — | — | Leer análisis → | Ollama |
| OlliteRT | Gratis | Apache-2.0 | Android | Local | Basta con CPU | — | Sí | — | — | — | Sí | — | Leer análisis → | OlliteRT |
| oMLX | Gratis | Apache-2.0 | macOS | Local | Depende del modelo | v0.6.4 | Sí | — | Sí | — | — | Sí | Leer análisis → | oMLX |
| OpenLLM | Gratis | Apache-2.0 | — | Híbrido | Depende del modelo | — | Sí | — | — | — | — | — | Leer análisis → | OpenLLM |
| Rapid-MLX | Gratis | Apache-2.0 | macOS | Local | 8 GB de RAM | — | Sí | — | Sí | — | — | — | Leer análisis → | Rapid-MLX |
| SGLang | Gratis | Apache-2.0 | Linux | Local | Depende del modelo | — | — | Sí | — | Sí | Sí | Sí | Leer análisis → | SGLang |
| Shimmy | Gratis | Apache-2.0 | macOS, Windows, Linux | Local | Depende del modelo | — | Sí | Sí | Sí | Sí | — | — | Leer análisis → | Shimmy |
| SwiftLM | Gratis | MIT | macOS, iOS | Local | Depende del modelo | — | Sí | — | Sí | — | — | — | Leer análisis → | SwiftLM |
| TensorRT-LLM | Gratis | Apache-2.0 | Windows, Linux | Local | Depende del modelo | — | — | Sí | — | — | — | — | Leer análisis → | TensorRT-LLM |
| text-generation-webui | Gratis | AGPL-3.0 | Windows, Linux, macOS | Local | Depende del modelo | — | Sí | Sí | Sí | Sí | Sí | — | Leer análisis → | text-generation-webui |
| TurboFieldfare | Gratis | Apache-2.0 | macOS | Local | 2 GB de RAM | — | — | — | Sí | — | — | — | Leer análisis → | TurboFieldfare |
| vLLM | Gratis | Apache-2.0 | Linux | Local | Depende del modelo | — | Sí | Sí | — | Sí | Sí | Sí | Leer análisis → | vLLM |
| vllm-mlx | Gratis | Apache-2.0 | macOS | Local | Depende del modelo | — | Sí | — | Sí | — | — | — | Leer análisis → | vllm-mlx |
«—» significa que la documentación del propio proyecto no lo indica, no que la función no exista. Los valores proceden del README oficial o del sitio de cada proyecto y se vuelven a comprobar cuando se actualiza el análisis de una herramienta.
Motores de inferencia: en qué se diferencian
- API compatible con OpenAI. candle-vllm, NVIDIA Dynamo, exo, KoboldCpp, KServe, llama.cpp, LocalAI, LoRAX, Lucebox, MLC LLM, mlx-serve, mlxcel, OlliteRT, oMLX, OpenLLM, Rapid-MLX, Shimmy, SwiftLM, text-generation-webui, vllm-mlx y vLLM documentan una API HTTP compatible con OpenAI, de modo que las aplicaciones escritas para la API de OpenAI pueden apuntar a ellos.
- GPU NVIDIA. candle-vllm, ExLlamaV2, KoboldCpp, llama.cpp, LMDeploy, LocalAI, LoRAX, Lucebox, MLC LLM, mlxcel, SGLang, Shimmy, TensorRT-LLM, text-generation-webui y vLLM documentan soporte para GPU NVIDIA (CUDA).
- Apple Silicon. candle-vllm, claude-code-local, exo, KoboldCpp, llama.cpp, LocalAI, MLC LLM, MLX-LM, mlx-serve, mlxcel, oMLX, Rapid-MLX, Shimmy, SwiftLM, text-generation-webui, TurboFieldfare y vllm-mlx documentan soporte para Apple Silicon, Metal o MLX.
- GPU AMD. KoboldCpp, llama.cpp, LocalAI, Lucebox, MLC LLM, SGLang, Shimmy, text-generation-webui y vLLM documentan soporte para GPU AMD.
- Inferencia en CPU. exo, KoboldCpp, llama.cpp, LocalAI, OlliteRT, SGLang, text-generation-webui y vLLM documentan la ejecución de inferencia en una CPU.
- Multi-GPU y multinodo. candle-vllm, NVIDIA Dynamo, ExLlamaV2, exo, KServe, LMDeploy, LocalAI, LoRAX, Lucebox, MLX-LM, mlxcel, oMLX, SGLang y vLLM documentan inferencia multi-GPU, con paralelismo tensorial o multinodo.
- Licencia. La mayoría de los motores aquí son Apache-2.0 (19 herramientas) o MIT (9); KoboldCpp y text-generation-webui usan AGPL-3.0. Las licencias copyleft imponen condiciones a la distribución de versiones modificadas — consulta Licencias de herramientas de IA explicadas.
Runtimes y gestores: en qué se diferencian
- API compatible con OpenAI. Docker Model Runner, Foundry Local, GPUStack, Jan, Lemonade y Osaurus documentan una API compatible con OpenAI.
- Aplicación de escritorio. GPT4All, Jan, LM Studio, Osaurus y Ypipe documentan una aplicación de escritorio instalable.
- Biblioteca de modelos integrada. Foundry Local, GPUStack, Jan, Lemonade, LM Studio y Ollama documentan una forma integrada de buscar y descargar modelos.
- Modo sin interfaz o servidor. DreamServer, GPUStack, Lemonade y Osaurus documentan la ejecución como servicio en segundo plano o servidor sin la interfaz gráfica.
- Licencia y precio. Cuatro runtimes aquí son Apache-2.0 y cuatro son MIT. LM Studio y Docker Model Runner son propietarios (LM Studio es de uso gratuito; Docker Model Runner viene incluido con Docker Desktop), Msty es de código cerrado con un nivel gratuito, y RunAnywhere y YPipe usan términos propios o no documentados — consulta cada análisis.
Routers y gateways: en qué se diferencian
- Endpoint compatible con OpenAI. AIClient2API y litellm documentan un endpoint compatible con OpenAI.
- Enrutamiento a modelos locales. litellm documenta modelos locales o autoalojados (como Ollama) entre sus proveedores compatibles.
- Respaldo (fallback) y balanceo de carga. AIClient2API, ClawRouter y litellm documentan respaldo, reintentos o balanceo de carga entre modelos o proveedores.
- Licencia. Dos de las cuatro son MIT, una es GPL-3.0 y una es Apache-2.0.
Lo que esta comparativa no puede decirte
- Compara capacidades documentadas, no rendimiento. No dice nada sobre tokens por segundo, uso de memoria ni latencia — PromptQuorum no los ha medido para estas herramientas, y dependen en gran medida de tu hardware y de tu modelo.
- Los guiones son lagunas en la documentación que consultamos, no hallazgos negativos. Algunas herramientas pueden admitir una función que su README no menciona; esto se nota sobre todo en unas pocas herramientas muy usadas cuyos README breves dicen poco (por ejemplo, las funciones del motor de Ollama).
- El soporte de hardware es lo que indica la documentación, no una garantía de buena experiencia en ese hardware; lee el análisis de la herramienta para conocer los requisitos reales.
- Las herramientas cambian rápido. El análisis de cada herramienta indica la versión con la que se contrastó, y esta guía se actualiza cuando se actualiza un análisis.
Preguntas frecuentes
¿Cuál es la diferencia entre un motor de inferencia, un runtime y un gateway?
Un motor de inferencia ejecuta el modelo en tu hardware (por ejemplo, llama.cpp o vLLM). Un runtime o gestor descarga modelos y los ejecuta por ti, a menudo con una aplicación de escritorio o una biblioteca de modelos (por ejemplo, Ollama o LM Studio). Un router o gateway se sitúa por delante de uno o varios modelos o proveedores y reenvía las solicitudes. Hacen trabajos distintos, por lo que se comparan por separado.
¿Qué significa un guion en la tabla comparativa?
Significa que la documentación del propio proyecto no indica ese atributo. No significa que la función no exista; consulta el análisis de la herramienta o su repositorio.
¿Por qué aparece Ollama en dos grupos?
Ollama es a la vez un motor de inferencia y un runtime que gestiona modelos, por lo que figura en ambos. Su README indica pocos de los atributos comparados aquí, así que muchas de sus celdas muestran un guion.
¿Alguna de estas herramientas tiene un enlace de afiliado?
No. PromptQuorum no tiene ninguna relación de afiliación con ninguna herramienta de esta comparativa en el momento de escribir esto, y ningún enlace aquí genera comisión.
¿Con qué frecuencia se actualiza esta comparativa?
Se actualiza dos veces al año y cada vez que se actualiza el análisis de alguna de las herramientas incluidas, porque la tabla se genera a partir de los mismos datos que esos análisis.
Fuentes
- El README o sitio web oficial de cada herramienta, indicado en el análisis de esa herramienta en PromptQuorum (enlazado desde la tabla comparativa).
- Directorio de apps de IA local de PromptQuorum — el registro a partir del cual se genera cada fila de la tabla.
- Licencias de herramientas de IA explicadas — qué significan las familias de licencias mencionadas arriba.