Skip to main content
PromptQuorum
Inicio/LLM locales avanzados/oMLX Review 2026: servidor de inferencia para Apple Silicon con caché en SSD
Overview & Reference

oMLX Review 2026: servidor de inferencia para Apple Silicon con caché en SSD

·11 min de lectura·Por Hans Kuepper · Fundador de PromptQuorum, herramienta de despacho multi-modelo · PromptQuorum

oMLX es un servidor de inferencia local gratuito y de código abierto para Apple Silicon (código fuente en github.com/jundot/omlx) que ejecuta modelos de pesos abiertos en tu propia Mac a través del framework MLX de Apple, con una app nativa de macOS en la barra de menús para gestionarlo y endpoints de API compatibles con OpenAI/Anthropic para otras herramientas. Está licenciado bajo una Apache License 2.0 estándar sin modificar (copyright de oMLX contributors), sin ningún nivel de pago. oMLX requiere macOS 15.0 (Sequoia) o posterior en Apple Silicon (M1 a M5) — no funciona en Mac Intel, Windows ni Linux, porque MLX en sí solo está dirigido a Apple Silicon. Su función principal es una caché clave-valor por niveles que traslada los bloques de contexto inactivos a SSD en lugar de descartarlos, de modo que un agente de codificación que vuelve a una conversación larga puede restaurar ese contexto en segundos en vez de recalcularlo desde cero.

oMLX (github.com/jundot/omlx, también documentado en omlx.ai) es un servidor de inferencia local gratuito y de código abierto, construido sobre el framework MLX de Apple, distribuido tanto como una app nativa de macOS en la barra de menús como un servidor de línea de comandos. Ejecuta modelos de pesos abiertos completamente en tu Mac, expone endpoints de API compatibles con OpenAI y Anthropic, y añade una caché clave-valor por niveles de RAM más SSD diseñada para mantener rápidos los contextos largos de agentes de codificación incluso después de reinicios. Esta review cubre lo que oMLX realmente hace, cómo instalarlo, cómo se compara con el simple mlx-lm, y dónde encaja junto a otras herramientas de inferencia local.

Conclusiones clave

  • oMLX es gratuito y de código abierto; la LICENSE oficial en GitHub es una Apache License 2.0 estándar sin modificar, copyright de oMLX contributors
  • Se ejecuta por completo en local a través del framework MLX de Apple y del BatchGenerator de mlx-lm — no requiere conexión a la nube
  • Requiere macOS 15.0 (Sequoia) o posterior, Apple Silicon (M1–M5) y Python 3.11–3.13; no admite Mac Intel, Windows ni Linux
  • Incluye una app nativa de macOS en la barra de menús (Swift/SwiftUI, no Electron) junto con una herramienta de línea de comandos omlx y un servidor en segundo plano
  • Caché clave-valor por niveles — los bloques activos en RAM, los bloques fríos trasladados a SSD en formato safetensors, persistiendo a través de reinicios del servidor con compartición de prefijos y copy-on-write
  • Expone endpoints compatibles con OpenAI (/v1/chat/completions, /v1/completions, /v1/embeddings, /v1/rerank) y compatibles con Anthropic (/v1/messages) en http://localhost:8000
  • Configuración con un clic para integraciones de agentes de codificación — incluyendo Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot y Pi — desde su panel de administración integrado
  • Creado por un único desarrollador, jundot, anunciado públicamente por primera vez en un hilo de discusión de GitHub de MLX en marzo de 2026; el repositorio canónico es github.com/jundot/omlx — existen varios forks con el mismo nombre bajo otros nombres de usuario de GitHub y no son el proyecto original

📍 En una frase

oMLX es un servidor de inferencia local gratuito y de código abierto para Mac con Apple Silicon que ejecuta modelos a través de MLX, se distribuye como app en la barra de menús más CLI/servidor, y añade una caché SSD paginada para que los contextos de agentes de codificación se recarguen rápido en vez de recalcularse desde cero.

💬 En términos simples

En lugar de que un modelo recargue todo su historial de conversación desde cero cada vez que reabres un agente de codificación, oMLX guarda la versión ya procesada de ese contexto en el SSD de tu Mac y la restaura en segundos. Funciona por completo en tu propia Mac, tiene un ícono en la barra de menús para que no tengas que tocar la terminal, y también habla los mismos formatos de API que OpenAI y Anthropic, así que herramientas como Claude Code o Cursor pueden apuntar directamente a él.

📌Nota: Esta review es el complemento en profundidad de la entrada de oMLX en el directorio de software de LLM local — consulta esa página para ver cómo se compara oMLX de un vistazo con docenas de otras herramientas de IA local.

¿Qué es oMLX?

oMLX es un servidor de inferencia local para Mac con Apple Silicon que convierte el framework de machine learning MLX de Apple en una pila de servicio completa — una API compatible con OpenAI/Anthropic, un gestor multi-modelo, una caché SSD paginada, y una app nativa de macOS en la barra de menús para controlarlo todo, sin requerir una terminal para el uso diario. Su propia descripción en GitHub lo posiciona como "un servidor de inferencia LLM optimizado para Mac con Apple Silicon, con batching continuo, caché KV por niveles, y una interfaz de gestión nativa en la barra de menús de macOS".

  • Función principal: un servidor de inferencia en segundo plano que carga modelos de pesos abiertos y los sirve a través de una API HTTP local, gestionado desde una app en la barra de menús o el CLI omlx
  • Motor de inferencia: construido sobre el framework MLX de Apple y el BatchGenerator de la librería mlx-lm, según la propia documentación de oMLX, con una capa original de batching continuo y caché paginada por encima
  • Base: según el propio anuncio del desarrollador, oMLX se construyó originalmente sobre vllm-mlx como punto de partida, con implementaciones originales añadidas para el tiering de caché en SSD, batching continuo, soporte de modelos de visión y lenguaje, la API compatible con Anthropic, y la interfaz nativa de macOS
  • Desarrollador: jundot (contacto listado como junkim.dot@gmail.com en el repositorio), un mantenedor independiente — esta review no encontró evidencia de una empresa o ronda de financiación detrás de oMLX
  • Repositorio canónico: github.com/jundot/omlx — existen varios forks con nombre idéntico bajo otros nombres de usuario de GitHub (por ejemplo mkmsyk/omlx, dannysl/omlx); esos no son el proyecto original

Origen y crecimiento de oMLX

oMLX fue anunciado públicamente por primera vez por su desarrollador, jundot, en una publicación de marzo de 2026 en el propio foro de discusiones de GitHub de Apple MLX. El anuncio presentaba oMLX como una solución a un problema concreto y específico: los agentes de codificación que reutilizan un contexto largo y creciente podían experimentar en Apple Silicon retrasos de varias decenas de segundos al recargar ese contexto en cada solicitud, porque los servidores basados en MLX de la época solían mantener el estado de la caché clave-valor solo en RAM y lo perdían cada vez que el servidor se reiniciaba o un contexto expiraba. La caché SSD paginada de oMLX persiste ese estado en disco en su lugar, de modo que un prefijo previamente procesado puede restaurarse desde el SSD en lugar de recalcularse a partir del modelo. Según el propio anuncio del desarrollador, oMLX ya había acumulado aproximadamente 110 estrellas en GitHub en su lanzamiento, construido sobre vllm-mlx como punto de partida con código recién escrito para el tiering en SSD, batching continuo, soporte de modelos de visión y lenguaje, una API compatible con Anthropic, y la interfaz nativa de macOS. A la fecha de publicación de esta review, el repositorio de GitHub de oMLX muestra aproximadamente 21,859 estrellas — un crecimiento rápido para un proyecto que tenía seis meses de existencia al momento de escribir esto.

  • Anuncio: 4 de marzo de 2026, en github.com/ml-explore/mlx/discussions/3203, publicado por el propio desarrollador del proyecto, jundot
  • Punto de partida: vllm-mlx, con el tiering en SSD, el batching continuo, el VLM, la API de Anthropic y el código de interfaz nativa propios del desarrollador añadidos encima
  • Crecimiento: de aproximadamente 110 estrellas en GitHub en el anuncio de marzo de 2026 a aproximadamente 21,859 estrellas a la fecha de esta review, según el propio repositorio de GitHub de oMLX
  • Historial de licencia: el archivo LICENSE del repositorio lleva un aviso de copyright de 2025 para "oMLX contributors", anterior al anuncio público del proyecto en marzo de 2026 — consistente con un desarrollo privado antes del lanzamiento público

¿Qué puedes hacer con oMLX?

El conjunto de funciones de oMLX se centra en convertir la inferencia de modelos MLX en un servidor local multi-modelo persistente, en lugar de un script de un solo uso. Esto es lo que hace realmente cada parte, según el propio README de GitHub de oMLX y la documentación de omlx.ai.

  • Caché clave-valor por niveles — los bloques de contexto activos permanecen en un nivel caliente de RAM; los bloques inactivos pasan a un nivel frío de SSD en formato safetensors, con compartición de prefijos y copy-on-write, y la caché sobrevive a los reinicios del servidor en lugar de descartarse
  • Batching continuo — las solicitudes concurrentes se gestionan a través del BatchGenerator de mlx-lm, con una concurrencia máxima configurable, en lugar de procesar una solicitud a la vez
  • Servicio multi-modelo — carga LLM, modelos de visión y lenguaje (VLM), modelos de embeddings y rerankers en paralelo, con desalojo LRU, carga/descarga manual, fijación de modelos y un tiempo de vida configurable por modelo
  • API compatible con OpenAI y Anthropic/v1/chat/completions, /v1/completions, /v1/embeddings y /v1/rerank para clientes con formato OpenAI, más /v1/messages para clientes con formato Anthropic, todo servido desde http://localhost:8000
  • Soporte de visión y lenguaje y OCR — chat multi-imagen con entradas en base64, URL o archivo, llamadas a herramientas con contexto visual, y detección automática de modelos OCR dedicados
  • Llamadas a herramientas y MCP — llamadas a herramientas con esquema JSON y detección automática de plantillas de chat para Llama, Qwen, DeepSeek, Gemma, GLM, MiniMax, Mistral y otras familias de modelos, además de configuración del Model Context Protocol (MCP)
  • App nativa de macOS en la barra de menús — una app Swift/SwiftUI (explícitamente no Electron, según la propia documentación del proyecto) para iniciar, detener y monitorear el servidor sin terminal, con analíticas de uso locales (totales por modelo, mapa de calor de uso por hora) y reinicio automático ante fallos
  • Panel de administración — una interfaz web en /admin, accesible desde un navegador una vez que el servidor está en marcha, para gestión de modelos, una interfaz de chat integrada, benchmarking con un clic, un descargador de modelos, y configuración con un clic para integraciones de agentes de codificación incluyendo Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot y Pi
  • Inferencia distribuida experimental — inferencia multi-Mac a través de rangos de pipeline de MLX mediante red Ring o Thunderbolt RDMA, marcada como experimental en la propia documentación de oMLX

Ejemplos de uso: tres formas de usar oMLX

Estos son flujos de trabajo concretos construidos a partir de las funciones documentadas de oMLX arriba — no casos de uso hipotéticos.

Precios de oMLX: ¿es realmente gratis?

Sí — oMLX no tiene ningún nivel de pago. Ni el repositorio de GitHub ni omlx.ai tienen página de precios, y el archivo LICENSE es una Apache License 2.0 estándar sin modificar con un aviso de copyright de 2025 para "oMLX contributors" — se aplica a toda la aplicación, sin ninguna cláusula que bloquee una función detrás de un pago.

  • Sin suscripción, sin nivel de pago, sin límites de uso impuestos por oMLX mismo
  • No se requiere cuenta ni registro para instalar o ejecutar la app
  • La aplicación, la app de la barra de menús, el CLI y el panel de administración están todos cubiertos por los mismos términos de la Apache License 2.0
  • Como oMLX solo ejecuta modelos locales a través de MLX, tampoco hay ningún coste por token o por solicitud de un proveedor en la nube — el único coste es la electricidad y el hardware que ya tienes

oMLX vs. mlx-lm

mlx-lm es la librería de Python y el CLI simple que el ecosistema MLX de Apple ofrece para ejecutar y servir modelos — y oMLX se construye directamente sobre él, usando su BatchGenerator para el batching continuo. Los dos no son realmente competidores sino capas distintas: mlx-lm es la base, oMLX es un producto de servicio completo construido sobre esa base.

Aspecto
oMLX
mlx-lm
Qué esUn servidor de inferencia empaquetado: app de barra de menús + CLI + panel de administraciónUna librería de Python y un CLI ligero para ejecutar/servir modelos MLX
Caché KVCaché paginada por niveles de RAM + SSD, persiste tras reiniciosSolo caché en memoria, según su propio servidor documentado; sin tiering en SSD
Gestión multi-modeloDesalojo LRU, fijación, TTL por modelo, carga/descarga desde una interfazNo es una función integrada — se gestiona por script o manualmente
Compatibilidad de APIEndpoints compatibles con OpenAI y con AnthropicModo servidor compatible con OpenAI (mlx_lm.server)
InterfazApp nativa de macOS en la barra de menús más panel de administración webSolo línea de comandos, sin GUI
Integraciones con agentes de codificaciónConfiguración con un clic para Claude Code, Cursor, OpenClaw y otrosNo es una función documentada; requiere configuración manual de endpoints

Si quieres la forma más simple posible de ejecutar un solo modelo MLX desde un script o un comando rápido de servidor, mlx-lm solo puede ser todo lo que necesitas. Si quieres un servidor multi-modelo persistente con una interfaz en la barra de menús, caché respaldada por SSD para contextos largos de agentes, e integraciones con agentes de codificación con un clic, oMLX está construido específicamente para añadir esa capa sobre mlx-lm en lugar de reemplazarlo.

¿Quién debería usar oMLX?

Que oMLX te sirva depende casi por completo, primero, de una cosa: si estás en una Mac con Apple Silicon, ya que ese requisito no tiene solución alternativa.

oMLX vs. otras herramientas de inferencia local

oMLX se sitúa en el rincón de Apple Silicon / MLX del panorama de inferencia local. Así es como se compara con otras herramientas en ese mismo segmento — consulta el directorio de software de LLM local para el catálogo completo, y la comparación dedicada oMLX vs. mlx-lm arriba para el enfrentamiento más directo.

  • mlx-lm — la librería de Python y el CLI subyacentes sobre los que oMLX mismo está construido; la elección correcta si quieres la forma más simple posible de ejecutar un solo modelo MLX sin una capa de servidor completa. Consulta la sección de comparación dedicada arriba.
  • exo — una herramienta de código abierto para agrupar en clúster varias Mac con Apple Silicon (y otros dispositivos) y ejecutar modelos más grandes de los que una sola máquina podría alojar; relevante si el modo experimental de clúster único distribuido de oMLX no es suficiente para tu configuración. Consulta la review de exo.
  • LM Studio — una app de escritorio multiplataforma (macOS, Windows, Linux) que también usa MLX como uno de sus motores de inferencia en Apple Silicon, junto con llama.cpp; mejor opción si necesitas que la misma herramienta funcione también en hardware que no sea Mac. Consulta la review de LM Studio.
  • llamafile — un enfoque de inferencia local en un solo ejecutable, construido sobre llama.cpp en lugar de MLX, que ejecuta el mismo archivo en macOS, Windows y Linux sin paso de instalación; un contraste útil si la portabilidad multiplataforma te importa más que el rendimiento específico de Apple Silicon. Consulta el artículo llamafile explicado.

Errores comunes al evaluar oMLX

La mayor parte de la confusión sobre oMLX viene de asumir que funciona como una herramienta multiplataforma, confundirlo con un fork con el mismo nombre, o esperar soporte para Mac Intel.

Preguntas frecuentes

¿Qué es oMLX?

oMLX (github.com/jundot/omlx) es un servidor de inferencia local gratuito y de código abierto para Mac con Apple Silicon. Ejecuta modelos a través del framework MLX de Apple y se distribuye como una app nativa de macOS en la barra de menús más una herramienta de línea de comandos omlx y un servidor en segundo plano, con endpoints de API compatibles con OpenAI y Anthropic.

¿Es gratis oMLX?

Sí. Ni el repositorio de GitHub ni omlx.ai tienen página de precios, y el archivo LICENSE es una Apache License 2.0 estándar sin modificar, sin ningún nivel de pago.

¿oMLX funciona en Windows o Linux?

No. oMLX es exclusivo de macOS, y requiere específicamente Apple Silicon (M1 a M5) y macOS 15.0 (Sequoia) o posterior, porque depende del framework MLX de Apple, que no está dirigido a Windows, Linux ni Mac Intel.

¿oMLX funciona en una Mac Intel?

No. Los requisitos del sistema documentados de oMLX especifican solo Apple Silicon. MLX, el framework sobre el que se construye, no admite Mac basadas en Intel.

¿En qué se diferencia oMLX de mlx-lm?

mlx-lm es la librería de Python y el CLI ligero subyacentes que ofrece el ecosistema MLX de Apple para ejecutar modelos; oMLX se construye sobre el BatchGenerator de mlx-lm y añade un servidor persistente, una app en la barra de menús, una caché por niveles respaldada por SSD, gestión multi-modelo, y endpoints compatibles con OpenAI/Anthropic. Consulta la comparación completa arriba.

¿Para qué sirve la caché SSD paginada en oMLX?

Traslada los bloques de caché clave-valor inactivos de la RAM al SSD de tu Mac, en formato safetensors, en lugar de descartarlos. Cuando un agente de codificación de larga duración revisita un contexto grande, oMLX puede restaurar los bloques previamente procesados desde el SSD en lugar de recalcularlos a partir del modelo, lo que según su propia documentación reduce las esperas de recarga en contextos largos de varias decenas de segundos a solo unos pocos segundos.

¿Puedo usar oMLX con Claude Code o Cursor?

Sí. El panel de administración de oMLX incluye configuración de integración con un clic para Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot y Pi, y su API es compatible tanto con el formato de solicitud de OpenAI como con el de Anthropic que usan esas herramientas.

¿Es oMLX de código abierto? ¿Qué licencia usa?

Sí. El archivo LICENSE de oMLX es una Apache License 2.0 estándar sin modificar, con un aviso de copyright de 2025 para "oMLX contributors".

¿Quién desarrolla oMLX?

oMLX está desarrollado por jundot, un mantenedor independiente (contacto listado como junkim.dot@gmail.com en el repositorio). Esta review no encontró evidencia de una empresa o ronda de financiación detrás del proyecto.

¿Es github.com/jundot/omlx el repositorio real de oMLX?

Sí. Existen varios repositorios "omlx" con nombre idéntico bajo otros nombres de usuario de GitHub, pero github.com/jundot/omlx es el proyecto original, confirmado por el propio anuncio del desarrollador en el foro de discusiones de GitHub de Apple MLX.

Fuentes

← Volver a LLM locales avanzados