Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/mlx-serve Review 2026: servidor de inferencia nativo en Zig para Apple Silicon
Overview & Reference

mlx-serve Review 2026: servidor de inferencia nativo en Zig para Apple Silicon

·11 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

mlx-serve es un servidor de inferencia gratuito y de código abierto (código fuente en github.com/ddalcu/mlx-serve) escrito en Zig, que ejecuta modelos de IA de forma nativa en Mac con Apple Silicon, exponiendo simultáneamente APIs compatibles con OpenAI, Anthropic y Ollama desde un único binario. No tiene un nivel de pago: el archivo LICENSE de GitHub es la Licencia MIT, con copyright de David Dalcu, con algunos componentes de terceros incluidos bajo la Apache License 2.0, listados en el archivo NOTICE del repositorio. mlx-serve requiere macOS 26.2 o posterior en hardware Apple Silicon, despacha de forma nativa a MLX para las familias de modelos compatibles y a un llama.cpp integrado para los modelos GGUF, y viene con una app para la barra de menú de macOS llamada MLX Core, para chat, llamadas a herramientas de agentes y generación de medios.

mlx-serve (github.com/ddalcu/mlx-serve) es un servidor de inferencia gratuito y de código abierto escrito en Zig que ejecuta modelos de lenguaje grandes de forma nativa en Mac con Apple Silicon, exponiendo APIs compatibles con OpenAI, Anthropic y Ollama desde un único binario de ~7 MB, sin necesidad de un entorno de ejecución de Python. Despacha a MLX para los modelos nativos de Apple Silicon e incorpora llama.cpp para los modelos GGUF, y viene con una app complementaria para la barra de menú de macOS llamada MLX Core, para chat, flujos de trabajo con agentes y generación de medios. Esta reseña cubre qué hace realmente mlx-serve, sus métodos de instalación, su conjunto real de funciones, y su lugar junto a otros servidores de inferencia del ecosistema MLX.

Conclusiones clave

  • mlx-serve es gratuito y de código abierto; el LICENSE oficial en GitHub es la Licencia MIT, con algunos componentes de terceros incluidos bajo la Apache License 2.0
  • Se ejecuta de forma nativa en Apple Silicon a través de MLX para las familias de modelos compatibles, y a través de un llama.cpp integrado para modelos GGUF
  • Ofrece las APIs compatibles chat/completions y Responses de OpenAI, la Anthropic Messages API, y la API de Ollama simultáneamente en un solo puerto
  • Incluye una app complementaria para la barra de menú de macOS, MLX Core, con chat multi-sesión, modo agente con soporte de herramientas MCP, y paneles de generación de imagen/video/música/voz/3D
  • Un único binario de ~7 MB sin dependencia de un entorno de ejecución de Python
  • Lanzadores preconfigurados para agentes de codificación, incluyendo Claude Code, OpenCode y Cursor
  • Requiere macOS 26.2 o posterior en hardware Apple Silicon (serie M) — sin soporte para Windows, Linux, ni Mac Intel
  • Desarrollado por David Dalcu; publica lanzamientos etiquetados casi diarios al momento de esta reseña

📍 En una frase

mlx-serve es un servidor de inferencia Zig gratuito y de código abierto para Mac con Apple Silicon que ofrece APIs compatibles con OpenAI, Anthropic y Ollama desde un único binario, sin nivel de pago.

💬 En términos simples

En lugar de instalar Python y varios paquetes separados para ejecutar un servidor de modelo local, mlx-serve es un programa pequeño que se instala con Homebrew. Ejecuta los modelos directamente usando el framework MLX de Apple o, para modelos GGUF, una copia integrada de llama.cpp, y responde a las solicitudes con el mismo formato que usan OpenAI, Anthropic y Ollama, por lo que las herramientas ya construidas para esas APIs funcionan sin cambios.

📌Nota: Esta reseña es el análisis en profundidad complementario a la entrada de mlx-serve en el Directorio de Software de LLM Local — consulta esa página para ver de un vistazo cómo se compara mlx-serve con docenas de otras herramientas de IA local.

¿Qué es mlx-serve?

mlx-serve es un servidor de inferencia nativo para Mac con Apple Silicon que ejecuta modelos de IA en el dispositivo y los expone a través de APIs compatibles con OpenAI, Anthropic y Ollama. Su propia descripción en GitHub dice: "Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling." El servidor en sí está escrito en Zig, un lenguaje de programación de sistemas, razón por la cual se distribuye como un único binario pequeño en lugar de una aplicación Python con dependencias que instalar.

  • Función principal: un servidor de inferencia local que carga un modelo una vez y lo expone por HTTP en tres formatos de API diferentes al mismo tiempo
  • Despacho nativo de modelos: MLX — el propio framework de computación con arrays de Apple para Apple Silicon — para las familias de modelos compatibles, y un llama.cpp integrado para modelos en formato GGUF
  • Compatibilidad de API: los endpoints chat/completions y Responses de OpenAI, la Anthropic Messages API, y la API de Ollama, todos en el puerto 11234 por defecto
  • App complementaria: MLX Core, una aplicación integrada para la barra de menú de macOS para chat, flujos de trabajo con agentes y generación de medios, instalada como un cask de Homebrew independiente junto al servidor
  • Desarrollador: David Dalcu, un desarrollador individual según el aviso de copyright del repositorio de GitHub en su archivo LICENSE
  • Repositorio canónico: github.com/ddalcu/mlx-serve — el proyecto original; varios forks y al menos un proyecto no relacionado, con un autor distinto, comparten un nombre similar, así que verifica que estás apuntando específicamente a este repositorio

Historial de versiones de mlx-serve

El repositorio de GitHub de mlx-serve se creó en febrero de 2026, y el proyecto ha publicado lanzamientos etiquetados casi diarios desde entonces, añadiendo decodificación especulativa, lanzadores para agentes de codificación y generación de medios ampliada. Se trata de un proyecto joven y en rápida evolución, no de uno maduro con un largo historial — hay que tenerlo en cuenta en cualquier evaluación.

  1. 1
    v26.8.9 — 18 de agosto de 2026: lanzadores para agentes de codificación
    Why it matters: Añadió lanzadores preconfigurados para agentes de codificación (según las notas de la versión: "launch your coding agent"), junto con chat más completo y decodificación más rápida, según la [página oficial de lanzamientos](https://github.com/ddalcu/mlx-serve/releases).
  2. 2
    v26.8.10 — 26 de agosto de 2026: descarga de prellenado al Neural Engine
    Why it matters: Añadió descarga de prellenado al Neural Engine y decodificación por lotes, una optimización orientada a usar el hardware Neural Engine dedicado de Apple para parte del pipeline de inferencia.
  3. 3
    v26.8.11 — 29 de agosto de 2026: MLX 0.32.2 y Qwen 3.8 Flash Next
    Why it matters: Actualizó la versión del framework MLX incluido y añadió soporte para una variante más reciente del modelo Qwen.
  4. 4
    v26.9.1 — 3 de septiembre de 2026: contexto de 1M y decodificación Flash más rápida
    Why it matters: Añadió terminales en la barra lateral de la app complementaria MLX Core, además de soporte para una ventana de contexto de 1 millón de tokens en modelos compatibles.
  5. 5
    v26.9.2 — 9 de septiembre de 2026: ajustes por modelo y proveedores de chat
    Why it matters: Añadió configuración por modelo y opciones adicionales de proveedores de chat, además de nuevas mejoras en la velocidad de decodificación.
  6. 6
    v26.9.3 — 16 de septiembre de 2026: decodificación especulativa para todos los modelos
    Why it matters: Amplió el soporte de decodificación especulativa más allá de un conjunto reducido de modelos, según las notas de la versión, junto con trabajo de rendimiento de Flash en Mac de 64 GB.
  7. 7
    v26.9.4 — 17 de septiembre de 2026: correcciones de exactitud y benchmarks
    Why it matters: Publicó correcciones de exactitud, añadió documentación en chino, y publicó nuevas cifras de benchmark — la etiqueta estable más reciente registrada en la [página oficial de lanzamientos](https://github.com/ddalcu/mlx-serve/releases) al momento de esta reseña.

¿Qué se puede hacer con mlx-serve?

El conjunto de funciones de mlx-serve se centra en servir modelos rápido en Apple Silicon manteniendo la compatibilidad con herramientas ya construidas para otras APIs. Esto es lo que realmente hace cada parte, según el README de GitHub del proyecto.

  • Servicio multi-API — el servidor responde simultáneamente a solicitudes chat/completions y Responses de OpenAI, solicitudes de la Anthropic Messages API, y solicitudes de la API de Ollama en el mismo puerto, por lo que el código cliente existente de OpenAI/Anthropic/Ollama puede apuntar a mlx-serve con solo un cambio de URL base
  • Despacho nativo de modelos MLX — los modelos con soporte nativo de MLX (según el README: Gemma, Qwen, Llama, Mistral y DeepSeek V4 Flash) se ejecutan directamente a través del framework MLX de Apple en Apple Silicon
  • llama.cpp integrado para GGUF — miles de modelos en formato GGUF no compatibles nativamente con MLX se ejecutan en su lugar a través de una copia integrada de llama.cpp, sin instalación aparte
  • Funciones de rendimiento — el README documenta cuatro variantes de decodificación especulativa, batching continuo, cuantización de caché KV y kernels Metal personalizados orientados al rendimiento en Apple Silicon
  • App complementaria MLX Core — una aplicación integrada para la barra de menú de macOS que ofrece chat multi-sesión con adjuntos de PDF/imagen, un modo agente con herramientas integradas e integración con el marketplace del Model Context Protocol (MCP), un Agent Sandbox aislado para ejecutar comandos de shell, un navegador de modelos con descargas reanudables, y paneles de generación para imágenes, video, música, voz (incluyendo clonación de voz con voces Kokoro) y modelos 3D
  • Lanzadores para agentes de codificación — perfiles de lanzamiento preconfigurados para agentes de codificación, incluyendo Claude Code, OpenCode, Pi y Cursor, según las notas de la versión
  • Sin dependencia de Python — el binario del servidor pesa alrededor de 7 MB y no requiere un entorno de ejecución de Python, a diferencia de muchas otras herramientas de inferencia local

Ejemplos de uso: tres formas de usar mlx-serve

Estos son flujos de trabajo concretos construidos a partir de los comandos documentados de mlx-serve anteriores — no casos de uso hipotéticos.

Precio de mlx-serve: ¿es realmente gratis?

Sí — mlx-serve no tiene ningún nivel de pago. El repositorio de GitHub no tiene página de precios, y el archivo LICENSE se aplica a toda la aplicación. El texto de la licencia es la Licencia MIT estándar, con copyright de David Dalcu — permisiva, sin obligaciones de copyleft. Los metadatos del propio repositorio de GitHub clasifican la licencia general como una entrada personalizada ("Other") en lugar de una simple insignia MIT, porque el repositorio también incluye algunos componentes de terceros bajo la Apache License 2.0, documentados en un archivo NOTICE separado.

  • Sin suscripción, sin nivel de pago, sin límites de uso impuestos por mlx-serve en sí
  • No se requiere cuenta ni registro para instalar o usar el servidor o la app complementaria MLX Core
  • El código principal de mlx-serve tiene licencia MIT — permisiva, gratuita para uso comercial y no comercial, con la atribución preservada en el texto de la licencia
  • Algunos componentes de terceros incluidos (según el archivo NOTICE del repositorio) tienen licencia Apache License 2.0 en lugar de MIT — lee el archivo NOTICE directamente si la revisión de cumplimiento de tu organización depende de la mezcla exacta de licencias

mlx-serve vs. Ollama

mlx-serve y Ollama sirven ambos modelos locales a través de una API HTTP en un Mac, y se comparan a menudo porque ambos pueden estar detrás de las mismas herramientas cliente. Las diferencias más claras están en el alcance de plataformas y la elección de motor nativo.

Aspecto
mlx-serve
Ollama
PlataformasSolo macOS (Apple Silicon)macOS, Windows, Linux
Motor nativoMLX (nativo) + llama.cpp integrado para GGUFBasado en llama.cpp
Compatibilidad de APIAPI OpenAI + Anthropic + Ollama, mismo puertoAPI propia, más un endpoint compatible con OpenAI
GUI incluidaApp barra de menú MLX Core (chat, modo agente, gen. medios)GUI integrada mínima; depende de frontends de terceros
Dependencia de runtimeBinario único de ~7 MB, sin PythonBinario único en Go, sin Python
Generación de mediosImagen/video/música/voz/3D vía MLX CoreSolo chat de texto y visión

La compatibilidad de mlx-serve con la API de Ollama significa que las herramientas construidas para Ollama a menudo pueden apuntar directamente a mlx-serve, según la documentación del proyecto. Si el soporte multiplataforma importa — Windows o Linux, no solo macOS —, Ollama es la opción con mayor alcance; verifica los detalles actuales de funciones en el sitio propio de cada proyecto antes de decidir, ya que ambos publican actualizaciones con frecuencia.

¿Quién debería usar mlx-serve?

Que mlx-serve encaje depende de si tienes hardware Apple Silicon y quieres un único servidor que hable varios formatos de API cliente además de una GUI incluida para generación de medios.

mlx-serve vs. otras herramientas de inferencia MLX

mlx-serve es uno de varios servidores de inferencia centrados en Apple Silicon que han surgido en torno al framework MLX de Apple. Así se posiciona frente a otras opciones en este espacio — consulta el Directorio de Software de LLM Local para el catálogo completo, y la comparación dedicada mlx-serve vs. Ollama más arriba para el enfrentamiento multiplataforma más cercano.

  • MLX LM — la propia biblioteca Python y herramientas de línea de comandos de Apple para ejecutar y afinar modelos de lenguaje con MLX; de nivel más bajo y basada en Python, a diferencia del binario Zig independiente de mlx-serve. Consulta la explicación de MLX LM para un análisis más profundo de la biblioteca subyacente sobre la que se construye el despacho nativo de mlx-serve.
  • omlx — otra opción de inferencia local centrada en Apple Silicon; consulta la reseña dedicada para ver cómo se comparan su conjunto de funciones y compatibilidad de API con mlx-serve.
  • rapid-mlx — una herramienta de inferencia basada en MLX orientada al rendimiento; consulta la reseña dedicada para una comparación de rendimiento y funciones frente a mlx-serve.
  • LoRAX — un framework de servicio multi-adaptador LoRA; relevante si tu flujo de trabajo necesita servir muchos adaptadores afinados desde un modelo base en lugar de un solo modelo por servidor, lo cual no es el enfoque de diseño de mlx-serve.
  • Ollama — un servidor de modelos locales multiplataforma; consulta la sección de comparación dedicada anterior para ver cómo difiere de mlx-serve en alcance de plataformas y motor nativo.

Errores comunes al evaluar mlx-serve

La mayor parte de la confusión sobre mlx-serve proviene de su restricción de plataforma, su clasificación de licencia en GitHub, o de asumir que es una herramienta Python como la mayoría de los demás servidores de inferencia local.

Preguntas frecuentes

¿Qué es mlx-serve?

mlx-serve (github.com/ddalcu/mlx-serve) es un servidor de inferencia gratuito y de código abierto escrito en Zig, que ejecuta modelos de IA localmente en Mac con Apple Silicon, ofreciendo APIs compatibles con OpenAI, Anthropic y Ollama desde un único binario.

¿Es gratis mlx-serve?

Sí. El repositorio de GitHub no tiene página de precios, y su archivo LICENSE es la Licencia MIT, que se aplica a toda la aplicación principal, sin nivel de pago.

¿Es mlx-serve de código abierto? ¿Qué licencia usa?

Sí, mlx-serve es de código abierto. Su archivo LICENSE principal es la Licencia MIT estándar, con copyright de David Dalcu. El repositorio también incluye algunos componentes de terceros bajo la Apache License 2.0, listados en un archivo NOTICE separado, razón por la cual los metadatos del repositorio de GitHub muestran la licencia como una entrada personalizada ("Other") en lugar de una simple insignia MIT. Verifica ambos archivos por tu cuenta para una decisión legal.

¿Qué plataformas soporta mlx-serve?

Solo macOS 26.2 o posterior en hardware Apple Silicon (serie M), según el README oficial de GitHub. No hay soporte para Windows, Linux, ni Mac Intel.

¿Requiere Python mlx-serve?

No. mlx-serve está escrito en Zig y se distribuye como un único binario de aproximadamente 7 MB, sin dependencia de un entorno de ejecución de Python, a diferencia de muchas otras herramientas de inferencia local.

¿Qué formatos de modelo soporta mlx-serve?

Los modelos con soporte nativo de MLX (el README nombra a Gemma, Qwen, Llama, Mistral y DeepSeek V4 Flash) se ejecutan directamente a través del framework MLX de Apple. Otros modelos en formato GGUF se ejecutan a través de una copia integrada de llama.cpp, sin instalación aparte.

¿Qué es MLX Core?

MLX Core es la app complementaria para la barra de menú de macOS incluida con mlx-serve, instalada como un cask de Homebrew independiente. Ofrece chat multi-sesión, un modo agente con integración de herramientas MCP, un navegador de modelos, y paneles de generación para imágenes, video, música, voz y modelos 3D.

¿Puede mlx-serve reemplazar a Ollama para herramientas existentes?

A menudo, sí — mlx-serve ofrece una API compatible con Ollama junto a las APIs compatibles con OpenAI y Anthropic en el mismo puerto, por lo que las herramientas construidas para la API de Ollama pueden apuntar con frecuencia a mlx-serve con solo un cambio de URL base. Verifica la compatibilidad para tu cliente específico antes de cambiar en un flujo de trabajo de producción.

¿Cómo instalo mlx-serve?

Mediante Homebrew: brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve seguido de brew install mlx-serve para el servidor, y brew install --cask mlx-core para la app complementaria opcional de la barra de menú. Consulta el README oficial de GitHub para las instrucciones actuales antes de instalar.

¿Cuándo se lanzó mlx-serve por primera vez?

El repositorio de GitHub de mlx-serve se creó en febrero de 2026. Al momento de esta reseña, el proyecto publica lanzamientos etiquetados casi diarios — consulta la página oficial de lanzamientos para el historial completo.

Fuentes

← Volver a LLM locales avanzados