Conclusiones clave
- oMLX es gratuito y de código abierto; la LICENSE oficial en GitHub es una Apache License 2.0 estándar sin modificar, copyright de oMLX contributors
- Se ejecuta por completo en local a través del framework MLX de Apple y del
BatchGeneratorde mlx-lm — no requiere conexión a la nube - Requiere macOS 15.0 (Sequoia) o posterior, Apple Silicon (M1–M5) y Python 3.11–3.13; no admite Mac Intel, Windows ni Linux
- Incluye una app nativa de macOS en la barra de menús (Swift/SwiftUI, no Electron) junto con una herramienta de línea de comandos
omlxy un servidor en segundo plano - Caché clave-valor por niveles — los bloques activos en RAM, los bloques fríos trasladados a SSD en formato safetensors, persistiendo a través de reinicios del servidor con compartición de prefijos y copy-on-write
- Expone endpoints compatibles con OpenAI (
/v1/chat/completions,/v1/completions,/v1/embeddings,/v1/rerank) y compatibles con Anthropic (/v1/messages) enhttp://localhost:8000 - Configuración con un clic para integraciones de agentes de codificación — incluyendo Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot y Pi — desde su panel de administración integrado
- Creado por un único desarrollador, jundot, anunciado públicamente por primera vez en un hilo de discusión de GitHub de MLX en marzo de 2026; el repositorio canónico es github.com/jundot/omlx — existen varios forks con el mismo nombre bajo otros nombres de usuario de GitHub y no son el proyecto original
📍 En una frase
oMLX es un servidor de inferencia local gratuito y de código abierto para Mac con Apple Silicon que ejecuta modelos a través de MLX, se distribuye como app en la barra de menús más CLI/servidor, y añade una caché SSD paginada para que los contextos de agentes de codificación se recarguen rápido en vez de recalcularse desde cero.
💬 En términos simples
En lugar de que un modelo recargue todo su historial de conversación desde cero cada vez que reabres un agente de codificación, oMLX guarda la versión ya procesada de ese contexto en el SSD de tu Mac y la restaura en segundos. Funciona por completo en tu propia Mac, tiene un ícono en la barra de menús para que no tengas que tocar la terminal, y también habla los mismos formatos de API que OpenAI y Anthropic, así que herramientas como Claude Code o Cursor pueden apuntar directamente a él.
📌Nota: Esta review es el complemento en profundidad de la entrada de oMLX en el directorio de software de LLM local — consulta esa página para ver cómo se compara oMLX de un vistazo con docenas de otras herramientas de IA local.
¿Qué es oMLX?
oMLX es un servidor de inferencia local para Mac con Apple Silicon que convierte el framework de machine learning MLX de Apple en una pila de servicio completa — una API compatible con OpenAI/Anthropic, un gestor multi-modelo, una caché SSD paginada, y una app nativa de macOS en la barra de menús para controlarlo todo, sin requerir una terminal para el uso diario. Su propia descripción en GitHub lo posiciona como "un servidor de inferencia LLM optimizado para Mac con Apple Silicon, con batching continuo, caché KV por niveles, y una interfaz de gestión nativa en la barra de menús de macOS".
- Función principal: un servidor de inferencia en segundo plano que carga modelos de pesos abiertos y los sirve a través de una API HTTP local, gestionado desde una app en la barra de menús o el CLI
omlx - Motor de inferencia: construido sobre el framework MLX de Apple y el
BatchGeneratorde la librería mlx-lm, según la propia documentación de oMLX, con una capa original de batching continuo y caché paginada por encima - Base: según el propio anuncio del desarrollador, oMLX se construyó originalmente sobre vllm-mlx como punto de partida, con implementaciones originales añadidas para el tiering de caché en SSD, batching continuo, soporte de modelos de visión y lenguaje, la API compatible con Anthropic, y la interfaz nativa de macOS
- Desarrollador: jundot (contacto listado como junkim.dot@gmail.com en el repositorio), un mantenedor independiente — esta review no encontró evidencia de una empresa o ronda de financiación detrás de oMLX
- Repositorio canónico: github.com/jundot/omlx — existen varios forks con nombre idéntico bajo otros nombres de usuario de GitHub (por ejemplo mkmsyk/omlx, dannysl/omlx); esos no son el proyecto original
Origen y crecimiento de oMLX
oMLX fue anunciado públicamente por primera vez por su desarrollador, jundot, en una publicación de marzo de 2026 en el propio foro de discusiones de GitHub de Apple MLX. El anuncio presentaba oMLX como una solución a un problema concreto y específico: los agentes de codificación que reutilizan un contexto largo y creciente podían experimentar en Apple Silicon retrasos de varias decenas de segundos al recargar ese contexto en cada solicitud, porque los servidores basados en MLX de la época solían mantener el estado de la caché clave-valor solo en RAM y lo perdían cada vez que el servidor se reiniciaba o un contexto expiraba. La caché SSD paginada de oMLX persiste ese estado en disco en su lugar, de modo que un prefijo previamente procesado puede restaurarse desde el SSD en lugar de recalcularse a partir del modelo. Según el propio anuncio del desarrollador, oMLX ya había acumulado aproximadamente 110 estrellas en GitHub en su lanzamiento, construido sobre vllm-mlx como punto de partida con código recién escrito para el tiering en SSD, batching continuo, soporte de modelos de visión y lenguaje, una API compatible con Anthropic, y la interfaz nativa de macOS. A la fecha de publicación de esta review, el repositorio de GitHub de oMLX muestra aproximadamente 21,859 estrellas — un crecimiento rápido para un proyecto que tenía seis meses de existencia al momento de escribir esto.
- Anuncio: 4 de marzo de 2026, en github.com/ml-explore/mlx/discussions/3203, publicado por el propio desarrollador del proyecto, jundot
- Punto de partida: vllm-mlx, con el tiering en SSD, el batching continuo, el VLM, la API de Anthropic y el código de interfaz nativa propios del desarrollador añadidos encima
- Crecimiento: de aproximadamente 110 estrellas en GitHub en el anuncio de marzo de 2026 a aproximadamente 21,859 estrellas a la fecha de esta review, según el propio repositorio de GitHub de oMLX
- Historial de licencia: el archivo LICENSE del repositorio lleva un aviso de copyright de 2025 para "oMLX contributors", anterior al anuncio público del proyecto en marzo de 2026 — consistente con un desarrollo privado antes del lanzamiento público
¿Qué puedes hacer con oMLX?
El conjunto de funciones de oMLX se centra en convertir la inferencia de modelos MLX en un servidor local multi-modelo persistente, en lugar de un script de un solo uso. Esto es lo que hace realmente cada parte, según el propio README de GitHub de oMLX y la documentación de omlx.ai.
- Caché clave-valor por niveles — los bloques de contexto activos permanecen en un nivel caliente de RAM; los bloques inactivos pasan a un nivel frío de SSD en formato safetensors, con compartición de prefijos y copy-on-write, y la caché sobrevive a los reinicios del servidor en lugar de descartarse
- Batching continuo — las solicitudes concurrentes se gestionan a través del
BatchGeneratorde mlx-lm, con una concurrencia máxima configurable, en lugar de procesar una solicitud a la vez - Servicio multi-modelo — carga LLM, modelos de visión y lenguaje (VLM), modelos de embeddings y rerankers en paralelo, con desalojo LRU, carga/descarga manual, fijación de modelos y un tiempo de vida configurable por modelo
- API compatible con OpenAI y Anthropic —
/v1/chat/completions,/v1/completions,/v1/embeddingsy/v1/rerankpara clientes con formato OpenAI, más/v1/messagespara clientes con formato Anthropic, todo servido desdehttp://localhost:8000 - Soporte de visión y lenguaje y OCR — chat multi-imagen con entradas en base64, URL o archivo, llamadas a herramientas con contexto visual, y detección automática de modelos OCR dedicados
- Llamadas a herramientas y MCP — llamadas a herramientas con esquema JSON y detección automática de plantillas de chat para Llama, Qwen, DeepSeek, Gemma, GLM, MiniMax, Mistral y otras familias de modelos, además de configuración del Model Context Protocol (MCP)
- App nativa de macOS en la barra de menús — una app Swift/SwiftUI (explícitamente no Electron, según la propia documentación del proyecto) para iniciar, detener y monitorear el servidor sin terminal, con analíticas de uso locales (totales por modelo, mapa de calor de uso por hora) y reinicio automático ante fallos
- Panel de administración — una interfaz web en
/admin, accesible desde un navegador una vez que el servidor está en marcha, para gestión de modelos, una interfaz de chat integrada, benchmarking con un clic, un descargador de modelos, y configuración con un clic para integraciones de agentes de codificación incluyendo Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot y Pi - Inferencia distribuida experimental — inferencia multi-Mac a través de rangos de pipeline de MLX mediante red Ring o Thunderbolt RDMA, marcada como experimental en la propia documentación de oMLX
Ejemplos de uso: tres formas de usar oMLX
Estos son flujos de trabajo concretos construidos a partir de las funciones documentadas de oMLX arriba — no casos de uso hipotéticos.
Instalar oMLX: app de macOS, Homebrew y CLI
oMLX se instala como app de macOS, vía Homebrew, o desde el código fuente — no hay build de Windows ni Linux, porque depende del framework MLX de Apple, que solo está dirigido a Apple Silicon. Los tres métodos instalan la misma herramienta de línea de comandos omlx subyacente. Los enlaces de abajo provienen del README de GitHub oficial — verifica siempre directamente contra esa página, ya que las instrucciones de instalación pueden cambiar entre releases.
App de macOS (.dmg)
- Comando / enlace:
- Descarga desde GitHub Releases, arrastra a Applications. Incluye actualización automática e instala un shim de CLI en
~/.omlx/bin/omlx.
Homebrew
- Comando / enlace:
brew tap jundot/omlx https://github.com/jundot/omlx, luegobrew install jundot/omlx/omlx, luegoomlx start
Desde el código fuente
- Comando / enlace:
git clone https://github.com/jundot/omlx.git, luegocd omlx, luegopip install -e .
Ejecutar el servidor directamente
- Comando / enlace:
omlx serve --model-dir ~/models(primer plano) oomlx start/omlx stop/omlx restart(segundo plano)
Requisitos del sistema según el README oficial: macOS 15.0 (Sequoia) o posterior, Apple Silicon (M1 a M5) y Python 3.11–3.13. No hay build para Mac Intel, Windows ni Linux. Una variante de instalación desde el código fuente añade OMLX_WITH_CUSTOM_KERNEL=1 pip install -e . para familias de modelos específicas (GLM-5.2/MiniMax M3, según el README) que se benefician de un kernel compilado a medida. Los flags de configuración del servidor — --memory-guard {safe|balanced|aggressive}, --memory-guard-gb, --paged-ssd-cache-dir, --hot-cache-max-size, --max-concurrent-requests, --mcp-config, --hf-endpoint, --api-key y --host — persisten en ~/.omlx/settings.json una vez definidos, y pueden sobrescribirse por ejecución con flags de CLI.
Precios de oMLX: ¿es realmente gratis?
Sí — oMLX no tiene ningún nivel de pago. Ni el repositorio de GitHub ni omlx.ai tienen página de precios, y el archivo LICENSE es una Apache License 2.0 estándar sin modificar con un aviso de copyright de 2025 para "oMLX contributors" — se aplica a toda la aplicación, sin ninguna cláusula que bloquee una función detrás de un pago.
- Sin suscripción, sin nivel de pago, sin límites de uso impuestos por oMLX mismo
- No se requiere cuenta ni registro para instalar o ejecutar la app
- La aplicación, la app de la barra de menús, el CLI y el panel de administración están todos cubiertos por los mismos términos de la Apache License 2.0
- Como oMLX solo ejecuta modelos locales a través de MLX, tampoco hay ningún coste por token o por solicitud de un proveedor en la nube — el único coste es la electricidad y el hardware que ya tienes
oMLX vs. mlx-lm
mlx-lm es la librería de Python y el CLI simple que el ecosistema MLX de Apple ofrece para ejecutar y servir modelos — y oMLX se construye directamente sobre él, usando su BatchGenerator para el batching continuo. Los dos no son realmente competidores sino capas distintas: mlx-lm es la base, oMLX es un producto de servicio completo construido sobre esa base.
Aspecto | oMLX | mlx-lm |
|---|---|---|
| Qué es | Un servidor de inferencia empaquetado: app de barra de menús + CLI + panel de administración | Una librería de Python y un CLI ligero para ejecutar/servir modelos MLX |
| Caché KV | Caché paginada por niveles de RAM + SSD, persiste tras reinicios | Solo caché en memoria, según su propio servidor documentado; sin tiering en SSD |
| Gestión multi-modelo | Desalojo LRU, fijación, TTL por modelo, carga/descarga desde una interfaz | No es una función integrada — se gestiona por script o manualmente |
| Compatibilidad de API | Endpoints compatibles con OpenAI y con Anthropic | Modo servidor compatible con OpenAI (mlx_lm.server) |
| Interfaz | App nativa de macOS en la barra de menús más panel de administración web | Solo línea de comandos, sin GUI |
| Integraciones con agentes de codificación | Configuración con un clic para Claude Code, Cursor, OpenClaw y otros | No es una función documentada; requiere configuración manual de endpoints |
Si quieres la forma más simple posible de ejecutar un solo modelo MLX desde un script o un comando rápido de servidor, mlx-lm solo puede ser todo lo que necesitas. Si quieres un servidor multi-modelo persistente con una interfaz en la barra de menús, caché respaldada por SSD para contextos largos de agentes, e integraciones con agentes de codificación con un clic, oMLX está construido específicamente para añadir esa capa sobre mlx-lm en lugar de reemplazarlo.
¿Quién debería usar oMLX?
Que oMLX te sirva depende casi por completo, primero, de una cosa: si estás en una Mac con Apple Silicon, ya que ese requisito no tiene solución alternativa.
oMLX vs. otras herramientas de inferencia local
oMLX se sitúa en el rincón de Apple Silicon / MLX del panorama de inferencia local. Así es como se compara con otras herramientas en ese mismo segmento — consulta el directorio de software de LLM local para el catálogo completo, y la comparación dedicada oMLX vs. mlx-lm arriba para el enfrentamiento más directo.
- mlx-lm — la librería de Python y el CLI subyacentes sobre los que oMLX mismo está construido; la elección correcta si quieres la forma más simple posible de ejecutar un solo modelo MLX sin una capa de servidor completa. Consulta la sección de comparación dedicada arriba.
- exo — una herramienta de código abierto para agrupar en clúster varias Mac con Apple Silicon (y otros dispositivos) y ejecutar modelos más grandes de los que una sola máquina podría alojar; relevante si el modo experimental de clúster único distribuido de oMLX no es suficiente para tu configuración. Consulta la review de exo.
- LM Studio — una app de escritorio multiplataforma (macOS, Windows, Linux) que también usa MLX como uno de sus motores de inferencia en Apple Silicon, junto con llama.cpp; mejor opción si necesitas que la misma herramienta funcione también en hardware que no sea Mac. Consulta la review de LM Studio.
- llamafile — un enfoque de inferencia local en un solo ejecutable, construido sobre llama.cpp en lugar de MLX, que ejecuta el mismo archivo en macOS, Windows y Linux sin paso de instalación; un contraste útil si la portabilidad multiplataforma te importa más que el rendimiento específico de Apple Silicon. Consulta el artículo llamafile explicado.
Errores comunes al evaluar oMLX
La mayor parte de la confusión sobre oMLX viene de asumir que funciona como una herramienta multiplataforma, confundirlo con un fork con el mismo nombre, o esperar soporte para Mac Intel.
Preguntas frecuentes
¿Qué es oMLX?
oMLX (github.com/jundot/omlx) es un servidor de inferencia local gratuito y de código abierto para Mac con Apple Silicon. Ejecuta modelos a través del framework MLX de Apple y se distribuye como una app nativa de macOS en la barra de menús más una herramienta de línea de comandos omlx y un servidor en segundo plano, con endpoints de API compatibles con OpenAI y Anthropic.
¿Es gratis oMLX?
Sí. Ni el repositorio de GitHub ni omlx.ai tienen página de precios, y el archivo LICENSE es una Apache License 2.0 estándar sin modificar, sin ningún nivel de pago.
¿oMLX funciona en Windows o Linux?
No. oMLX es exclusivo de macOS, y requiere específicamente Apple Silicon (M1 a M5) y macOS 15.0 (Sequoia) o posterior, porque depende del framework MLX de Apple, que no está dirigido a Windows, Linux ni Mac Intel.
¿oMLX funciona en una Mac Intel?
No. Los requisitos del sistema documentados de oMLX especifican solo Apple Silicon. MLX, el framework sobre el que se construye, no admite Mac basadas en Intel.
¿En qué se diferencia oMLX de mlx-lm?
mlx-lm es la librería de Python y el CLI ligero subyacentes que ofrece el ecosistema MLX de Apple para ejecutar modelos; oMLX se construye sobre el BatchGenerator de mlx-lm y añade un servidor persistente, una app en la barra de menús, una caché por niveles respaldada por SSD, gestión multi-modelo, y endpoints compatibles con OpenAI/Anthropic. Consulta la comparación completa arriba.
¿Para qué sirve la caché SSD paginada en oMLX?
Traslada los bloques de caché clave-valor inactivos de la RAM al SSD de tu Mac, en formato safetensors, en lugar de descartarlos. Cuando un agente de codificación de larga duración revisita un contexto grande, oMLX puede restaurar los bloques previamente procesados desde el SSD en lugar de recalcularlos a partir del modelo, lo que según su propia documentación reduce las esperas de recarga en contextos largos de varias decenas de segundos a solo unos pocos segundos.
¿Puedo usar oMLX con Claude Code o Cursor?
Sí. El panel de administración de oMLX incluye configuración de integración con un clic para Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot y Pi, y su API es compatible tanto con el formato de solicitud de OpenAI como con el de Anthropic que usan esas herramientas.
¿Es oMLX de código abierto? ¿Qué licencia usa?
Sí. El archivo LICENSE de oMLX es una Apache License 2.0 estándar sin modificar, con un aviso de copyright de 2025 para "oMLX contributors".
¿Quién desarrolla oMLX?
oMLX está desarrollado por jundot, un mantenedor independiente (contacto listado como junkim.dot@gmail.com en el repositorio). Esta review no encontró evidencia de una empresa o ronda de financiación detrás del proyecto.
¿Es github.com/jundot/omlx el repositorio real de oMLX?
Sí. Existen varios repositorios "omlx" con nombre idéntico bajo otros nombres de usuario de GitHub, pero github.com/jundot/omlx es el proyecto original, confirmado por el propio anuncio del desarrollador en el foro de discusiones de GitHub de Apple MLX.