Principais conclusões
- O oMLX é gratuito e de código aberto; a LICENSE oficial no GitHub é uma Apache License 2.0 padrão, sem modificações, copyright dos oMLX contributors
- Roda totalmente localmente por meio do framework MLX da Apple e do
BatchGeneratordo mlx-lm — nenhuma conexão com a nuvem é necessária - Exige macOS 15.0 (Sequoia) ou posterior, Apple Silicon (M1–M5) e Python 3.11–3.13; não é compatível com Mac Intel, Windows ou Linux
- Vem com um app nativo de menu bar do macOS (Swift/SwiftUI, não Electron) além de uma ferramenta de linha de comando
omlxe um servidor em segundo plano - Cache chave-valor em camadas — blocos ativos na RAM, blocos frios descarregados para o SSD em formato safetensors, persistindo através de reinicializações do servidor com compartilhamento de prefixo e copy-on-write
- Expõe endpoints compatíveis com OpenAI (
/v1/chat/completions,/v1/completions,/v1/embeddings,/v1/rerank) e compatíveis com Anthropic (/v1/messages) emhttp://localhost:8000 - Configuração com um clique para integrações de agentes de codificação — incluindo Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot e Pi — direto do painel de administração integrado
- Criado por um único desenvolvedor, jundot, anunciado publicamente pela primeira vez em uma thread de discussão do GitHub do MLX em março de 2026; o repositório canônico é github.com/jundot/omlx — vários forks com o mesmo nome existem sob outros nomes de usuário no GitHub e não são o projeto original
📍 Em uma frase
O oMLX é um servidor de inferência local gratuito e de código aberto para Macs com Apple Silicon que executa modelos por meio do MLX, vem como app de menu bar mais CLI/servidor, e adiciona um cache SSD paginado para que contextos de agentes de codificação recarreguem rápido em vez de serem recalculados do zero.
💬 Em termos simples
Em vez de um modelo recarregar todo o histórico de conversa do zero toda vez que você reabre um agente de codificação, o oMLX salva a versão já processada desse contexto no SSD do seu Mac e a restaura em segundos. Ele roda totalmente no seu próprio Mac, tem um ícone na barra de menus para você não precisar mexer no terminal, e também fala os mesmos formatos de API que OpenAI e Anthropic, permitindo que ferramentas como Claude Code ou Cursor apontem diretamente para ele.
📌Nota: Esta review é o complemento aprofundado da entrada do oMLX no diretório de software de LLM local — veja essa página para comparar rapidamente o oMLX com dezenas de outras ferramentas de IA local.
O que é o oMLX?
O oMLX é um servidor de inferência local para Macs com Apple Silicon que transforma o framework de machine learning MLX da Apple em uma pilha de serviço completa — uma API compatível com OpenAI/Anthropic, um gerenciador multimodelo, um cache SSD paginado, e um app nativo de menu bar do macOS para controlar tudo isso, sem exigir um terminal para o uso do dia a dia. Sua própria descrição no GitHub o posiciona como "um servidor de inferência de LLM otimizado para Macs com Apple Silicon, com batching contínuo, cache KV em camadas e uma interface nativa de gerenciamento na barra de menus do macOS".
- Função principal: um servidor de inferência em segundo plano que carrega modelos de pesos abertos e os serve por uma API HTTP local, gerenciado a partir de um app de menu bar ou da CLI
omlx - Motor de inferência: construído sobre o framework MLX da Apple e o
BatchGeneratorda biblioteca mlx-lm, segundo a própria documentação do oMLX, com uma camada original de batching contínuo e cache paginado por cima - Base: segundo o próprio anúncio do desenvolvedor, o oMLX foi originalmente construído sobre o vllm-mlx como ponto de partida, com implementações originais adicionadas para o escalonamento de cache em SSD, batching contínuo, suporte a modelos de visão e linguagem, a API compatível com Anthropic, e a interface nativa do macOS
- Desenvolvedor: jundot (contato listado como junkim.dot@gmail.com no repositório), um mantenedor independente — esta review não encontrou evidências de uma empresa ou rodada de investimento por trás do oMLX
- Repositório canônico: github.com/jundot/omlx — vários forks com nome idêntico existem sob outros nomes de usuário no GitHub (por exemplo mkmsyk/omlx, dannysl/omlx); esses não são o projeto original
Origem e crescimento do oMLX
O oMLX foi anunciado publicamente pela primeira vez pelo seu desenvolvedor, jundot, em uma postagem de março de 2026 no próprio fórum de discussões do GitHub do Apple MLX. O anúncio apresentava o oMLX como solução para um problema concreto e específico: agentes de codificação que reutilizam um contexto longo e crescente podiam sofrer, no Apple Silicon, atrasos de dezenas de segundos ao recarregar esse contexto a cada requisição, porque os servidores baseados em MLX da época geralmente mantinham o estado do cache chave-valor apenas na RAM e o perdiam sempre que o servidor reiniciava ou um contexto expirava. O cache SSD paginado do oMLX, em vez disso, persiste esse estado em disco, de modo que um prefixo processado anteriormente pode ser restaurado a partir do SSD em vez de recalculado pelo modelo. Segundo o próprio anúncio do desenvolvedor, o oMLX já havia acumulado cerca de 110 estrelas no GitHub no lançamento, construído sobre o vllm-mlx como ponto de partida, com código recém-escrito para escalonamento de SSD, batching contínuo, suporte a modelos de visão e linguagem, uma API compatível com Anthropic, e a interface nativa do macOS. Na data de publicação desta review, o repositório do GitHub do oMLX mostra cerca de 21.859 estrelas — um crescimento rápido para um projeto que tinha seis meses de existência no momento da redação.
- Anúncio: 4 de março de 2026, em github.com/ml-explore/mlx/discussions/3203, publicado pelo próprio desenvolvedor do projeto, jundot
- Ponto de partida: vllm-mlx, com o escalonamento de SSD, o batching contínuo, o VLM, a API Anthropic e o código de interface nativa próprios do desenvolvedor adicionados por cima
- Crescimento: de cerca de 110 estrelas no GitHub no anúncio de março de 2026 para cerca de 21.859 estrelas na data desta review, segundo o próprio repositório do GitHub do oMLX
- Histórico de licença: o arquivo LICENSE do repositório traz um aviso de copyright de 2025 para "oMLX contributors", anterior ao anúncio público do projeto em março de 2026 — consistente com desenvolvimento privado antes do lançamento público
O que você pode fazer com o oMLX?
O conjunto de recursos do oMLX foca em transformar a inferência de modelos MLX em um servidor local multimodelo persistente, em vez de um script pontual. Aqui está o que cada parte realmente faz, segundo o próprio README no GitHub do oMLX e a documentação do omlx.ai.
- Cache chave-valor em camadas — blocos de contexto ativos ficam em uma camada quente na RAM; blocos inativos migram para uma camada fria no SSD em formato safetensors, com compartilhamento de prefixo e copy-on-write, e o cache sobrevive a reinicializações do servidor em vez de ser descartado
- Batching contínuo — requisições simultâneas são tratadas pelo
BatchGeneratordo mlx-lm, com uma concorrência máxima configurável, em vez de processar uma requisição de cada vez - Serviço multimodelo — carregue LLMs, modelos de visão e linguagem (VLMs), modelos de embedding e rerankers lado a lado, com remoção LRU, carregamento/descarregamento manual, fixação de modelo e um tempo de vida configurável por modelo
- API compatível com OpenAI e Anthropic —
/v1/chat/completions,/v1/completions,/v1/embeddingse/v1/rerankpara clientes no formato OpenAI, além de/v1/messagespara clientes no formato Anthropic, tudo servido a partir dehttp://localhost:8000 - Suporte a visão e linguagem e OCR — chat com múltiplas imagens com entradas em base64, URL ou arquivo, chamada de ferramentas com contexto visual, e detecção automática de modelos de OCR dedicados
- Chamada de ferramentas e MCP — chamada de ferramentas com esquema JSON e detecção automática de template de chat para Llama, Qwen, DeepSeek, Gemma, GLM, MiniMax, Mistral e outras famílias de modelos, além de configuração do Model Context Protocol (MCP)
- App nativo de menu bar do macOS — um app Swift/SwiftUI (explicitamente não Electron, segundo a própria documentação do projeto) para iniciar, parar e monitorar o servidor sem terminal, com análise de uso local (totais por modelo, mapa de calor de uso por hora) e reinicialização automática em caso de travamento
- Painel de administração — uma interface web em
/admin, acessível pelo navegador assim que o servidor estiver rodando, para gerenciamento de modelos, uma interface de chat integrada, benchmarking com um clique, um downloader de modelos, e configuração com um clique para integrações de agentes de codificação incluindo Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot e Pi - Inferência distribuída experimental — inferência multi-Mac entre ranks de pipeline do MLX via rede Ring ou Thunderbolt RDMA, marcada como experimental na própria documentação do oMLX
Exemplos de uso: três formas de usar o oMLX
Estes são fluxos de trabalho concretos construídos a partir dos recursos documentados do oMLX acima — não são casos de uso hipotéticos.
Instalar o oMLX: app de macOS, Homebrew e CLI
O oMLX é instalado como app de macOS, via Homebrew, ou a partir do código-fonte — não há build para Windows ou Linux, porque ele depende do framework MLX da Apple, que é voltado apenas para Apple Silicon. Os três métodos instalam a mesma ferramenta de linha de comando omlx subjacente. Os links abaixo vêm do README oficial no GitHub — sempre verifique diretamente nessa página, já que as instruções de instalação podem mudar entre releases.
App de macOS (.dmg)
- Comando / link:
- Baixe do GitHub Releases, arraste para Applications. Inclui atualização automática e instala um shim de CLI em
~/.omlx/bin/omlx.
Homebrew
- Comando / link:
brew tap jundot/omlx https://github.com/jundot/omlx, depoisbrew install jundot/omlx/omlx, depoisomlx start
A partir do código-fonte
- Comando / link:
git clone https://github.com/jundot/omlx.git, depoiscd omlx, depoispip install -e .
Rodar o servidor diretamente
- Comando / link:
omlx serve --model-dir ~/models(primeiro plano) ouomlx start/omlx stop/omlx restart(segundo plano)
Requisitos de sistema segundo o README oficial: macOS 15.0 (Sequoia) ou posterior, Apple Silicon (M1 a M5) e Python 3.11–3.13. Não há build para Mac Intel, Windows ou Linux. Uma variante de instalação a partir do código-fonte adiciona OMLX_WITH_CUSTOM_KERNEL=1 pip install -e . para famílias de modelos específicas (GLM-5.2/MiniMax M3, segundo o README) que se beneficiam de um kernel compilado personalizado. As flags de configuração do servidor — --memory-guard {safe|balanced|aggressive}, --memory-guard-gb, --paged-ssd-cache-dir, --hot-cache-max-size, --max-concurrent-requests, --mcp-config, --hf-endpoint, --api-key e --host — persistem em ~/.omlx/settings.json depois de definidas, e podem ser sobrescritas por execução com flags de CLI.
Preços do oMLX: o oMLX é realmente gratuito?
Sim — o oMLX não tem nenhum plano pago. Nem o repositório do GitHub nem o omlx.ai têm página de preços, e o arquivo LICENSE é uma Apache License 2.0 padrão, sem modificações, com um aviso de copyright de 2025 para "oMLX contributors" — ela se aplica a toda a aplicação, sem nenhuma cláusula que bloqueie um recurso atrás de um pagamento.
- Sem assinatura, sem plano pago, sem limites de uso impostos pelo próprio oMLX
- Nenhuma conta ou cadastro é necessário para instalar ou rodar o app
- A aplicação, o app de menu bar, a CLI e o painel de administração estão todos cobertos pelos mesmos termos da Apache License 2.0
- Como o oMLX só roda modelos locais por meio do MLX, também não há custo por token ou por requisição em um provedor de nuvem — o único custo é a eletricidade e o hardware que você já tem
oMLX vs. mlx-lm
O mlx-lm é a biblioteca Python e a CLI simples que o ecossistema MLX da Apple fornece para executar e servir modelos — e o oMLX é construído diretamente sobre ele, usando seu BatchGenerator para batching contínuo. Os dois não são exatamente concorrentes, e sim camadas diferentes: o mlx-lm é a base, o oMLX é um produto de serviço completo construído sobre essa base.
Aspecto | oMLX | mlx-lm |
|---|---|---|
| O que é | Um servidor de inferência empacotado: app de menu bar + CLI + painel de administração | Uma biblioteca Python e uma CLI leve para executar/servir modelos MLX |
| Cache KV | Cache paginado em camadas de RAM + SSD, persiste após reinicializações | Apenas cache em memória, segundo seu próprio servidor documentado; sem escalonamento em SSD |
| Gerenciamento multimodelo | Remoção LRU, fixação, TTL por modelo, carregamento/descarregamento por interface | Não é um recurso integrado — feito via script ou gerenciado manualmente |
| Compatibilidade de API | Endpoints compatíveis com OpenAI e com Anthropic | Modo servidor compatível com OpenAI (mlx_lm.server) |
| Interface | App nativo de menu bar do macOS mais painel de administração web | Apenas linha de comando, sem GUI |
| Integrações com agentes de codificação | Configuração com um clique para Claude Code, Cursor, OpenClaw e outros | Não é um recurso documentado; exige configuração manual de endpoints |
Se você quer a forma mais simples possível de rodar um único modelo MLX a partir de um script ou de um comando de servidor rápido, o mlx-lm sozinho pode ser tudo o que você precisa. Se você quer um servidor multimodelo persistente com uma interface de menu bar, cache apoiado em SSD para contextos longos de agentes, e integrações com agentes de codificação com um clique, o oMLX foi feito especificamente para adicionar essa camada sobre o mlx-lm em vez de substituí-lo.
Quem deveria usar o oMLX?
Se o oMLX serve para você depende quase inteiramente, primeiro, de uma coisa: se você está em um Mac com Apple Silicon, já que esse requisito não tem contorno possível.
oMLX vs. outras ferramentas de inferência local
O oMLX está no canto Apple Silicon/MLX do cenário de inferência local. Veja como ele se compara a outras ferramentas desse mesmo segmento — veja o diretório de software de LLM local para o catálogo completo, e a comparação dedicada oMLX vs. mlx-lm acima para o confronto mais direto.
- mlx-lm — a biblioteca Python e a CLI subjacentes sobre as quais o próprio oMLX é construído; a escolha certa se você quer a forma mais simples possível de rodar um modelo MLX sem uma camada de servidor completa. Veja a seção de comparação dedicada acima.
- exo — uma ferramenta de código aberto para agrupar vários Macs com Apple Silicon (e outros dispositivos) em cluster para rodar modelos maiores do que uma única máquina conseguiria comportar; relevante se o modo experimental de cluster único distribuído do oMLX não for suficiente para a sua configuração. Veja a review do exo.
- LM Studio — um app de desktop multiplataforma (macOS, Windows, Linux) que também usa MLX como um de seus motores de inferência no Apple Silicon, junto com o llama.cpp; melhor opção se você precisa que a mesma ferramenta funcione também em hardware que não seja Mac. Veja a review do LM Studio.
- llamafile — uma abordagem de inferência local em um único executável, construída sobre o llama.cpp em vez do MLX, que roda o mesmo arquivo em macOS, Windows e Linux sem etapa de instalação; um contraste útil se a portabilidade multiplataforma importa mais para você do que o desempenho específico de Apple Silicon. Veja o artigo llamafile explicado.
Erros comuns ao avaliar o oMLX
A maior parte da confusão em torno do oMLX vem de supor que ele funciona como uma ferramenta multiplataforma, confundi-lo com um fork de mesmo nome, ou esperar suporte a Mac Intel.
Perguntas frequentes
O que é o oMLX?
O oMLX (github.com/jundot/omlx) é um servidor de inferência local gratuito e de código aberto para Macs com Apple Silicon. Ele executa modelos por meio do framework MLX da Apple e vem como um app nativo de menu bar do macOS mais uma ferramenta de linha de comando omlx e um servidor em segundo plano, com endpoints de API compatíveis com OpenAI e Anthropic.
O oMLX é gratuito?
Sim. Nem o repositório do GitHub nem o omlx.ai têm página de preços, e o arquivo LICENSE é uma Apache License 2.0 padrão, sem modificações, sem nenhum plano pago.
O oMLX roda em Windows ou Linux?
Não. O oMLX é exclusivo do macOS, e exige especificamente Apple Silicon (M1 a M5) e macOS 15.0 (Sequoia) ou posterior, porque depende do framework MLX da Apple, que não é voltado para Windows, Linux ou Mac Intel.
O oMLX roda em um Mac Intel?
Não. Os requisitos de sistema documentados do oMLX especificam apenas Apple Silicon. O MLX, o framework sobre o qual ele é construído, não é compatível com Macs baseados em Intel.
Como o oMLX é diferente do mlx-lm?
O mlx-lm é a biblioteca Python e a CLI leve subjacentes que o ecossistema MLX da Apple fornece para executar modelos; o oMLX é construído sobre o BatchGenerator do mlx-lm e adiciona um servidor persistente, um app de menu bar, um cache em camadas apoiado em SSD, gerenciamento multimodelo, e endpoints compatíveis com OpenAI/Anthropic. Veja a comparação completa acima.
Para que serve o cache SSD paginado no oMLX?
Ele descarrega blocos de cache chave-valor inativos da RAM para o SSD do seu Mac, em formato safetensors, em vez de descartá-los. Quando um agente de codificação de longa duração revisita um contexto grande, o oMLX consegue restaurar os blocos processados anteriormente a partir do SSD em vez de recalculá-los pelo modelo, o que sua própria documentação credita por reduzir esperas de recarregamento em contextos longos de dezenas de segundos para apenas alguns segundos.
Posso usar o oMLX com Claude Code ou Cursor?
Sim. O painel de administração do oMLX inclui configuração de integração com um clique para Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot e Pi, e sua API é compatível tanto com o formato de requisição do OpenAI quanto com o do Anthropic que essas ferramentas usam.
O oMLX é de código aberto? Qual licença ele usa?
Sim. O arquivo LICENSE do oMLX é uma Apache License 2.0 padrão, sem modificações, com um aviso de copyright de 2025 para "oMLX contributors".
Quem desenvolve o oMLX?
O oMLX é desenvolvido por jundot, um mantenedor independente (contato listado como junkim.dot@gmail.com no repositório). Esta review não encontrou evidências de uma empresa ou rodada de investimento por trás do projeto.
O github.com/jundot/omlx é o repositório real do oMLX?
Sim. Existem vários repositórios "omlx" com nome idêntico sob outros nomes de usuário no GitHub, mas github.com/jundot/omlx é o projeto original, confirmado pelo próprio anúncio do desenvolvedor no fórum de discussões do GitHub do Apple MLX.