Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/Motores de inferencia, runtimes y gateways locales: comparativa (2026) para ejecutar y servir modelos
Overview & Reference

Motores de inferencia, runtimes y gateways locales: comparativa (2026) para ejecutar y servir modelos

·10 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

Las 46 herramientas locales de ejecución y servicio del directorio de PromptQuorum se dividen en tres tipos que conviene comparar por separado: motores de inferencia (30 herramientas), runtimes y gestores (13) y routers y gateways (4). Entre los motores, 15 documentan soporte para GPU NVIDIA, 17 documentan soporte para Apple Silicon y 21 documentan una API compatible con OpenAI; entre los runtimes, 6 documentan una API compatible con OpenAI. Usa la tabla comparativa de más abajo y lee el análisis de cada herramienta antes de instalarla.

Ejecutar un modelo en tu propio hardware implica tres tipos de herramienta distintos — motores de inferencia que ejecutan el modelo, runtimes y gestores que descargan y ejecutan modelos por ti, y routers y gateways que se colocan por delante de ellos — y ninguna lista de funciones única los compara de forma justa. Esta guía compara 46 herramientas gratuitas y freemium, un tipo cada vez, con una tabla comparativa generada a partir de los mismos datos que el análisis propio de cada herramienta en PromptQuorum, de modo que la tabla y los análisis no pueden contradecirse.

Esta página contiene enlaces de referencia a productos de terceros. PromptQuorum no participa en ningún programa de afiliados — son enlaces simples que no generan comisión. Hacer clic en los enlaces y los pasos siguientes son de su entera responsabilidad. Estos enlaces no representan ningún respaldo ni verificación por parte de PromptQuorum.

Conclusiones clave

  • 46 herramientas, tres tipos: motores de inferencia (30), runtimes y gestores (13), routers y gateways (4). Ollama aparece en dos grupos porque es a la vez un motor y un runtime.
  • La tabla se genera a partir del registro de cada herramienta y se contrasta con su README o sitio oficial; un guion significa "no indicado en la documentación", nunca "no". En algunas herramientas conocidas, la documentación citada aquí no dice nada sobre una función concreta, por lo que sus celdas muestran un guion.
  • Cada nombre de herramienta de la tabla enlaza con su propio análisis en PromptQuorum, donde se explican los pasos de instalación y los límites.

📍 En una frase

Ejecutar modelos en local implica tres tipos de herramienta — motores de inferencia, runtimes y gestores, y routers y gateways — por lo que las 46 herramientas del directorio de PromptQuorum se comparan dentro de cada tipo, con una tabla generada a partir de los mismos datos que el análisis propio de cada herramienta.

💬 En términos simples

Un motor es la parte que ejecuta realmente el modelo, un runtime o gestor descarga y ejecuta modelos por ti, y un gateway enruta las solicitudes entre ellos. Comparar un motor con un gateway por soporte de GPU no tiene sentido, así que esta guía compara elementos del mismo tipo.

Cómo comparamos

Los datos de cada herramienta — precio, licencia, plataformas, requisitos de hardware y atributos específicos de la categoría — se guardan una sola vez, en el registro de esa herramienta en el directorio. La tabla comparativa de más abajo se genera a partir de esos registros, y el análisis de cada herramienta se basa en el mismo registro, por lo que ambos no pueden indicar valores distintos.

Los atributos específicos de la categoría (por ejemplo, API compatible con OpenAI o soporte para GPU AMD) se tomaron del README o del sitio web oficial de cada proyecto y se contrastaron con la redacción exacta allí. Cuando la documentación no dice nada, la tabla muestra un guion en lugar de suponer; cuando una afirmación está matizada (experimental, prevista o disponible solo a través de un proyecto aparte), el atributo se deja fuera de la tabla y se trata en el análisis de la herramienta.

Solo las herramientas con análisis propio en PromptQuorum figuran en la tabla. Las herramientas que aparecen únicamente como servidores de API (h2oGPT, Tabby y OpenAI Edge TTS) se comparan en sus propias categorías. La comparativa enumera herramientas que se ejecutan en tu propio hardware; no las clasifica, porque la adecuada depende de tu restricción.

Tabla comparativa

Elige a continuación un tipo de herramienta y lee cada fila de izquierda a derecha. Haz clic en el nombre de una herramienta para abrir su análisis completo en PromptQuorum.

HerramientaPrecioLicenciaPlataformasEjecuciónHardwareVersiónAPI compatible con OpenAIGPU NVIDIAApple SiliconGPU AMDInferencia en CPUMulti-GPU / multinodoAnálisisenlace de producto · divulgado
candle-vllmGratisMITmacOS, Windows, LinuxLocalDepende del modelov0.9.1Leer análisiscandle-vllm
claude-code-localGratisMITmacOSLocalDepende del modelov0.3.0Leer análisisclaude-code-local
ExLlamaV2GratisMITWindows, LinuxLocal8 GB de VRAMv0.3.2Leer análisisExLlamaV2
exoGratisApache-2.0macOS, LinuxLocalDepende del modeloLeer análisisexo
KoboldCppGratisAGPL-3.0Windows, Linux, macOSLocalDepende del modelov1.121Leer análisisKoboldCpp
KServeGratisApache-2.0LinuxLocalBasta con CPUv0.20.0Leer análisisKServe
llama.cppGratisMITmacOS, Windows, LinuxLocalDepende del modelov0.4.1Leer análisisllama.cpp
LlamafileGratisApache-2.0macOS, Windows, LinuxLocalDepende del modelo0.10.6Leer análisisLlamafile
LMDeployGratisApache-2.0LinuxLocalDepende del modelov0.17.0Leer análisisLMDeploy
LocalAIGratisMITmacOS, Windows, LinuxLocalDepende del modeloLeer análisisLocalAI
LoRAXGratisApache-2.0LinuxLocalDepende del modelov0.12.1Leer análisisLoRAX
LuceboxGratisApache-2.0LinuxLocalDepende del modeloLeer análisisLucebox
MLC LLMGratisApache-2.0macOS, Windows, Linux, iOS, AndroidLocalDepende del modeloLeer análisisMLC LLM
MLX-LMGratisMITmacOSLocalDepende del modeloLeer análisisMLX-LM
mlx-serveGratisMITmacOSLocalDepende del modelov26.9.4Leer análisismlx-serve
mlxcelGratisApache-2.0macOS, LinuxLocalDepende del modelov0.7.0Leer análisismlxcel
NVIDIA DynamoGratisApache-2.0LinuxLocalDepende del modelov1.4–v1.6Leer análisisNVIDIA Dynamo
OllamaGratisMITmacOS, Windows, LinuxLocalDepende del modeloLeer análisisOllama
OlliteRTGratisApache-2.0AndroidLocalBasta con CPULeer análisisOlliteRT
oMLXGratisApache-2.0macOSLocalDepende del modelov0.6.4Leer análisisoMLX
OpenLLMGratisApache-2.0HíbridoDepende del modeloLeer análisisOpenLLM
Rapid-MLXGratisApache-2.0macOSLocal8 GB de RAMLeer análisisRapid-MLX
SGLangGratisApache-2.0LinuxLocalDepende del modeloLeer análisisSGLang
ShimmyGratisApache-2.0macOS, Windows, LinuxLocalDepende del modeloLeer análisisShimmy
SwiftLMGratisMITmacOS, iOSLocalDepende del modeloLeer análisisSwiftLM
TensorRT-LLMGratisApache-2.0Windows, LinuxLocalDepende del modeloLeer análisisTensorRT-LLM
text-generation-webuiGratisAGPL-3.0Windows, Linux, macOSLocalDepende del modeloLeer análisistext-generation-webui
TurboFieldfareGratisApache-2.0macOSLocal2 GB de RAMLeer análisisTurboFieldfare
vLLMGratisApache-2.0LinuxLocalDepende del modeloLeer análisisvLLM
vllm-mlxGratisApache-2.0macOSLocalDepende del modeloLeer análisisvllm-mlx

«—» significa que la documentación del propio proyecto no lo indica, no que la función no exista. Los valores proceden del README oficial o del sitio de cada proyecto y se vuelven a comprobar cuando se actualiza el análisis de una herramienta.

Motores de inferencia: en qué se diferencian

Runtimes y gestores: en qué se diferencian

  • API compatible con OpenAI. Docker Model Runner, Foundry Local, GPUStack, Jan, Lemonade y Osaurus documentan una API compatible con OpenAI.
  • Aplicación de escritorio. GPT4All, Jan, LM Studio, Osaurus y Ypipe documentan una aplicación de escritorio instalable.
  • Biblioteca de modelos integrada. Foundry Local, GPUStack, Jan, Lemonade, LM Studio y Ollama documentan una forma integrada de buscar y descargar modelos.
  • Modo sin interfaz o servidor. DreamServer, GPUStack, Lemonade y Osaurus documentan la ejecución como servicio en segundo plano o servidor sin la interfaz gráfica.
  • Licencia y precio. Cuatro runtimes aquí son Apache-2.0 y cuatro son MIT. LM Studio y Docker Model Runner son propietarios (LM Studio es de uso gratuito; Docker Model Runner viene incluido con Docker Desktop), Msty es de código cerrado con un nivel gratuito, y RunAnywhere y YPipe usan términos propios o no documentados — consulta cada análisis.

Routers y gateways: en qué se diferencian

  • Endpoint compatible con OpenAI. AIClient2API y litellm documentan un endpoint compatible con OpenAI.
  • Enrutamiento a modelos locales. litellm documenta modelos locales o autoalojados (como Ollama) entre sus proveedores compatibles.
  • Respaldo (fallback) y balanceo de carga. AIClient2API, ClawRouter y litellm documentan respaldo, reintentos o balanceo de carga entre modelos o proveedores.
  • Licencia. Dos de las cuatro son MIT, una es GPL-3.0 y una es Apache-2.0.

Lo que esta comparativa no puede decirte

  • Compara capacidades documentadas, no rendimiento. No dice nada sobre tokens por segundo, uso de memoria ni latencia — PromptQuorum no los ha medido para estas herramientas, y dependen en gran medida de tu hardware y de tu modelo.
  • Los guiones son lagunas en la documentación que consultamos, no hallazgos negativos. Algunas herramientas pueden admitir una función que su README no menciona; esto se nota sobre todo en unas pocas herramientas muy usadas cuyos README breves dicen poco (por ejemplo, las funciones del motor de Ollama).
  • El soporte de hardware es lo que indica la documentación, no una garantía de buena experiencia en ese hardware; lee el análisis de la herramienta para conocer los requisitos reales.
  • Las herramientas cambian rápido. El análisis de cada herramienta indica la versión con la que se contrastó, y esta guía se actualiza cuando se actualiza un análisis.

Preguntas frecuentes

¿Cuál es la diferencia entre un motor de inferencia, un runtime y un gateway?

Un motor de inferencia ejecuta el modelo en tu hardware (por ejemplo, llama.cpp o vLLM). Un runtime o gestor descarga modelos y los ejecuta por ti, a menudo con una aplicación de escritorio o una biblioteca de modelos (por ejemplo, Ollama o LM Studio). Un router o gateway se sitúa por delante de uno o varios modelos o proveedores y reenvía las solicitudes. Hacen trabajos distintos, por lo que se comparan por separado.

¿Qué significa un guion en la tabla comparativa?

Significa que la documentación del propio proyecto no indica ese atributo. No significa que la función no exista; consulta el análisis de la herramienta o su repositorio.

¿Por qué aparece Ollama en dos grupos?

Ollama es a la vez un motor de inferencia y un runtime que gestiona modelos, por lo que figura en ambos. Su README indica pocos de los atributos comparados aquí, así que muchas de sus celdas muestran un guion.

¿Alguna de estas herramientas tiene un enlace de afiliado?

No. PromptQuorum no tiene ninguna relación de afiliación con ninguna herramienta de esta comparativa en el momento de escribir esto, y ningún enlace aquí genera comisión.

¿Con qué frecuencia se actualiza esta comparativa?

Se actualiza dos veces al año y cada vez que se actualiza el análisis de alguna de las herramientas incluidas, porque la tabla se genera a partir de los mismos datos que esos análisis.

Fuentes

← Volver a LLM locales avanzados