Skip to main content
PromptQuorum
Início/LLMs locais avançados/oMLX Review 2026: servidor de inferência para Apple Silicon com cache em SSD
Overview & Reference

oMLX Review 2026: servidor de inferência para Apple Silicon com cache em SSD

·11 min de leitura·Por Hans Kuepper · Fundador do PromptQuorum, ferramenta de despacho multi-modelo de IA · PromptQuorum

O oMLX é um servidor de inferência local gratuito e de código aberto para Apple Silicon (código-fonte em github.com/jundot/omlx) que executa modelos de pesos abertos no seu próprio Mac por meio do framework MLX da Apple, com um app nativo de menu bar do macOS para gerenciamento e endpoints de API compatíveis com OpenAI/Anthropic para outras ferramentas. Ele é licenciado sob uma Apache License 2.0 padrão, sem modificações (copyright dos oMLX contributors), sem nenhum plano pago. O oMLX exige macOS 15.0 (Sequoia) ou posterior em Apple Silicon (M1 a M5) — ele não roda em Mac Intel, Windows ou Linux, porque o próprio MLX é voltado apenas para Apple Silicon. Seu recurso principal é um cache chave-valor em camadas que descarrega blocos de contexto inativos para o SSD em vez de descartá-los, permitindo que um agente de codificação que retorna a uma conversa longa restaure esse contexto em segundos em vez de recalculá-lo do zero.

O oMLX (github.com/jundot/omlx, também documentado em omlx.ai) é um servidor de inferência local gratuito e de código aberto, construído sobre o framework MLX da Apple, distribuído tanto como um app nativo de menu bar do macOS quanto como um servidor de linha de comando. Ele executa modelos de pesos abertos totalmente no seu Mac, expõe endpoints de API compatíveis com OpenAI e Anthropic, e adiciona um cache chave-valor em camadas de RAM mais SSD, projetado para manter contextos longos de agentes de codificação rápidos mesmo após reinicializações. Esta review cobre o que o oMLX realmente faz, como instalá-lo, como ele se compara ao simples mlx-lm, e onde ele se encaixa entre outras ferramentas de inferência local.

Principais conclusões

  • O oMLX é gratuito e de código aberto; a LICENSE oficial no GitHub é uma Apache License 2.0 padrão, sem modificações, copyright dos oMLX contributors
  • Roda totalmente localmente por meio do framework MLX da Apple e do BatchGenerator do mlx-lm — nenhuma conexão com a nuvem é necessária
  • Exige macOS 15.0 (Sequoia) ou posterior, Apple Silicon (M1–M5) e Python 3.11–3.13; não é compatível com Mac Intel, Windows ou Linux
  • Vem com um app nativo de menu bar do macOS (Swift/SwiftUI, não Electron) além de uma ferramenta de linha de comando omlx e um servidor em segundo plano
  • Cache chave-valor em camadas — blocos ativos na RAM, blocos frios descarregados para o SSD em formato safetensors, persistindo através de reinicializações do servidor com compartilhamento de prefixo e copy-on-write
  • Expõe endpoints compatíveis com OpenAI (/v1/chat/completions, /v1/completions, /v1/embeddings, /v1/rerank) e compatíveis com Anthropic (/v1/messages) em http://localhost:8000
  • Configuração com um clique para integrações de agentes de codificação — incluindo Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot e Pi — direto do painel de administração integrado
  • Criado por um único desenvolvedor, jundot, anunciado publicamente pela primeira vez em uma thread de discussão do GitHub do MLX em março de 2026; o repositório canônico é github.com/jundot/omlx — vários forks com o mesmo nome existem sob outros nomes de usuário no GitHub e não são o projeto original

📍 Em uma frase

O oMLX é um servidor de inferência local gratuito e de código aberto para Macs com Apple Silicon que executa modelos por meio do MLX, vem como app de menu bar mais CLI/servidor, e adiciona um cache SSD paginado para que contextos de agentes de codificação recarreguem rápido em vez de serem recalculados do zero.

💬 Em termos simples

Em vez de um modelo recarregar todo o histórico de conversa do zero toda vez que você reabre um agente de codificação, o oMLX salva a versão já processada desse contexto no SSD do seu Mac e a restaura em segundos. Ele roda totalmente no seu próprio Mac, tem um ícone na barra de menus para você não precisar mexer no terminal, e também fala os mesmos formatos de API que OpenAI e Anthropic, permitindo que ferramentas como Claude Code ou Cursor apontem diretamente para ele.

📌Nota: Esta review é o complemento aprofundado da entrada do oMLX no diretório de software de LLM local — veja essa página para comparar rapidamente o oMLX com dezenas de outras ferramentas de IA local.

O que é o oMLX?

O oMLX é um servidor de inferência local para Macs com Apple Silicon que transforma o framework de machine learning MLX da Apple em uma pilha de serviço completa — uma API compatível com OpenAI/Anthropic, um gerenciador multimodelo, um cache SSD paginado, e um app nativo de menu bar do macOS para controlar tudo isso, sem exigir um terminal para o uso do dia a dia. Sua própria descrição no GitHub o posiciona como "um servidor de inferência de LLM otimizado para Macs com Apple Silicon, com batching contínuo, cache KV em camadas e uma interface nativa de gerenciamento na barra de menus do macOS".

  • Função principal: um servidor de inferência em segundo plano que carrega modelos de pesos abertos e os serve por uma API HTTP local, gerenciado a partir de um app de menu bar ou da CLI omlx
  • Motor de inferência: construído sobre o framework MLX da Apple e o BatchGenerator da biblioteca mlx-lm, segundo a própria documentação do oMLX, com uma camada original de batching contínuo e cache paginado por cima
  • Base: segundo o próprio anúncio do desenvolvedor, o oMLX foi originalmente construído sobre o vllm-mlx como ponto de partida, com implementações originais adicionadas para o escalonamento de cache em SSD, batching contínuo, suporte a modelos de visão e linguagem, a API compatível com Anthropic, e a interface nativa do macOS
  • Desenvolvedor: jundot (contato listado como junkim.dot@gmail.com no repositório), um mantenedor independente — esta review não encontrou evidências de uma empresa ou rodada de investimento por trás do oMLX
  • Repositório canônico: github.com/jundot/omlx — vários forks com nome idêntico existem sob outros nomes de usuário no GitHub (por exemplo mkmsyk/omlx, dannysl/omlx); esses não são o projeto original

Origem e crescimento do oMLX

O oMLX foi anunciado publicamente pela primeira vez pelo seu desenvolvedor, jundot, em uma postagem de março de 2026 no próprio fórum de discussões do GitHub do Apple MLX. O anúncio apresentava o oMLX como solução para um problema concreto e específico: agentes de codificação que reutilizam um contexto longo e crescente podiam sofrer, no Apple Silicon, atrasos de dezenas de segundos ao recarregar esse contexto a cada requisição, porque os servidores baseados em MLX da época geralmente mantinham o estado do cache chave-valor apenas na RAM e o perdiam sempre que o servidor reiniciava ou um contexto expirava. O cache SSD paginado do oMLX, em vez disso, persiste esse estado em disco, de modo que um prefixo processado anteriormente pode ser restaurado a partir do SSD em vez de recalculado pelo modelo. Segundo o próprio anúncio do desenvolvedor, o oMLX já havia acumulado cerca de 110 estrelas no GitHub no lançamento, construído sobre o vllm-mlx como ponto de partida, com código recém-escrito para escalonamento de SSD, batching contínuo, suporte a modelos de visão e linguagem, uma API compatível com Anthropic, e a interface nativa do macOS. Na data de publicação desta review, o repositório do GitHub do oMLX mostra cerca de 21.859 estrelas — um crescimento rápido para um projeto que tinha seis meses de existência no momento da redação.

  • Anúncio: 4 de março de 2026, em github.com/ml-explore/mlx/discussions/3203, publicado pelo próprio desenvolvedor do projeto, jundot
  • Ponto de partida: vllm-mlx, com o escalonamento de SSD, o batching contínuo, o VLM, a API Anthropic e o código de interface nativa próprios do desenvolvedor adicionados por cima
  • Crescimento: de cerca de 110 estrelas no GitHub no anúncio de março de 2026 para cerca de 21.859 estrelas na data desta review, segundo o próprio repositório do GitHub do oMLX
  • Histórico de licença: o arquivo LICENSE do repositório traz um aviso de copyright de 2025 para "oMLX contributors", anterior ao anúncio público do projeto em março de 2026 — consistente com desenvolvimento privado antes do lançamento público

O que você pode fazer com o oMLX?

O conjunto de recursos do oMLX foca em transformar a inferência de modelos MLX em um servidor local multimodelo persistente, em vez de um script pontual. Aqui está o que cada parte realmente faz, segundo o próprio README no GitHub do oMLX e a documentação do omlx.ai.

  • Cache chave-valor em camadas — blocos de contexto ativos ficam em uma camada quente na RAM; blocos inativos migram para uma camada fria no SSD em formato safetensors, com compartilhamento de prefixo e copy-on-write, e o cache sobrevive a reinicializações do servidor em vez de ser descartado
  • Batching contínuo — requisições simultâneas são tratadas pelo BatchGenerator do mlx-lm, com uma concorrência máxima configurável, em vez de processar uma requisição de cada vez
  • Serviço multimodelo — carregue LLMs, modelos de visão e linguagem (VLMs), modelos de embedding e rerankers lado a lado, com remoção LRU, carregamento/descarregamento manual, fixação de modelo e um tempo de vida configurável por modelo
  • API compatível com OpenAI e Anthropic/v1/chat/completions, /v1/completions, /v1/embeddings e /v1/rerank para clientes no formato OpenAI, além de /v1/messages para clientes no formato Anthropic, tudo servido a partir de http://localhost:8000
  • Suporte a visão e linguagem e OCR — chat com múltiplas imagens com entradas em base64, URL ou arquivo, chamada de ferramentas com contexto visual, e detecção automática de modelos de OCR dedicados
  • Chamada de ferramentas e MCP — chamada de ferramentas com esquema JSON e detecção automática de template de chat para Llama, Qwen, DeepSeek, Gemma, GLM, MiniMax, Mistral e outras famílias de modelos, além de configuração do Model Context Protocol (MCP)
  • App nativo de menu bar do macOS — um app Swift/SwiftUI (explicitamente não Electron, segundo a própria documentação do projeto) para iniciar, parar e monitorar o servidor sem terminal, com análise de uso local (totais por modelo, mapa de calor de uso por hora) e reinicialização automática em caso de travamento
  • Painel de administração — uma interface web em /admin, acessível pelo navegador assim que o servidor estiver rodando, para gerenciamento de modelos, uma interface de chat integrada, benchmarking com um clique, um downloader de modelos, e configuração com um clique para integrações de agentes de codificação incluindo Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot e Pi
  • Inferência distribuída experimental — inferência multi-Mac entre ranks de pipeline do MLX via rede Ring ou Thunderbolt RDMA, marcada como experimental na própria documentação do oMLX

Exemplos de uso: três formas de usar o oMLX

Estes são fluxos de trabalho concretos construídos a partir dos recursos documentados do oMLX acima — não são casos de uso hipotéticos.

Preços do oMLX: o oMLX é realmente gratuito?

Sim — o oMLX não tem nenhum plano pago. Nem o repositório do GitHub nem o omlx.ai têm página de preços, e o arquivo LICENSE é uma Apache License 2.0 padrão, sem modificações, com um aviso de copyright de 2025 para "oMLX contributors" — ela se aplica a toda a aplicação, sem nenhuma cláusula que bloqueie um recurso atrás de um pagamento.

  • Sem assinatura, sem plano pago, sem limites de uso impostos pelo próprio oMLX
  • Nenhuma conta ou cadastro é necessário para instalar ou rodar o app
  • A aplicação, o app de menu bar, a CLI e o painel de administração estão todos cobertos pelos mesmos termos da Apache License 2.0
  • Como o oMLX só roda modelos locais por meio do MLX, também não há custo por token ou por requisição em um provedor de nuvem — o único custo é a eletricidade e o hardware que você já tem

oMLX vs. mlx-lm

O mlx-lm é a biblioteca Python e a CLI simples que o ecossistema MLX da Apple fornece para executar e servir modelos — e o oMLX é construído diretamente sobre ele, usando seu BatchGenerator para batching contínuo. Os dois não são exatamente concorrentes, e sim camadas diferentes: o mlx-lm é a base, o oMLX é um produto de serviço completo construído sobre essa base.

Aspecto
oMLX
mlx-lm
O que éUm servidor de inferência empacotado: app de menu bar + CLI + painel de administraçãoUma biblioteca Python e uma CLI leve para executar/servir modelos MLX
Cache KVCache paginado em camadas de RAM + SSD, persiste após reinicializaçõesApenas cache em memória, segundo seu próprio servidor documentado; sem escalonamento em SSD
Gerenciamento multimodeloRemoção LRU, fixação, TTL por modelo, carregamento/descarregamento por interfaceNão é um recurso integrado — feito via script ou gerenciado manualmente
Compatibilidade de APIEndpoints compatíveis com OpenAI e com AnthropicModo servidor compatível com OpenAI (mlx_lm.server)
InterfaceApp nativo de menu bar do macOS mais painel de administração webApenas linha de comando, sem GUI
Integrações com agentes de codificaçãoConfiguração com um clique para Claude Code, Cursor, OpenClaw e outrosNão é um recurso documentado; exige configuração manual de endpoints

Se você quer a forma mais simples possível de rodar um único modelo MLX a partir de um script ou de um comando de servidor rápido, o mlx-lm sozinho pode ser tudo o que você precisa. Se você quer um servidor multimodelo persistente com uma interface de menu bar, cache apoiado em SSD para contextos longos de agentes, e integrações com agentes de codificação com um clique, o oMLX foi feito especificamente para adicionar essa camada sobre o mlx-lm em vez de substituí-lo.

Quem deveria usar o oMLX?

Se o oMLX serve para você depende quase inteiramente, primeiro, de uma coisa: se você está em um Mac com Apple Silicon, já que esse requisito não tem contorno possível.

oMLX vs. outras ferramentas de inferência local

O oMLX está no canto Apple Silicon/MLX do cenário de inferência local. Veja como ele se compara a outras ferramentas desse mesmo segmento — veja o diretório de software de LLM local para o catálogo completo, e a comparação dedicada oMLX vs. mlx-lm acima para o confronto mais direto.

  • mlx-lm — a biblioteca Python e a CLI subjacentes sobre as quais o próprio oMLX é construído; a escolha certa se você quer a forma mais simples possível de rodar um modelo MLX sem uma camada de servidor completa. Veja a seção de comparação dedicada acima.
  • exo — uma ferramenta de código aberto para agrupar vários Macs com Apple Silicon (e outros dispositivos) em cluster para rodar modelos maiores do que uma única máquina conseguiria comportar; relevante se o modo experimental de cluster único distribuído do oMLX não for suficiente para a sua configuração. Veja a review do exo.
  • LM Studio — um app de desktop multiplataforma (macOS, Windows, Linux) que também usa MLX como um de seus motores de inferência no Apple Silicon, junto com o llama.cpp; melhor opção se você precisa que a mesma ferramenta funcione também em hardware que não seja Mac. Veja a review do LM Studio.
  • llamafile — uma abordagem de inferência local em um único executável, construída sobre o llama.cpp em vez do MLX, que roda o mesmo arquivo em macOS, Windows e Linux sem etapa de instalação; um contraste útil se a portabilidade multiplataforma importa mais para você do que o desempenho específico de Apple Silicon. Veja o artigo llamafile explicado.

Erros comuns ao avaliar o oMLX

A maior parte da confusão em torno do oMLX vem de supor que ele funciona como uma ferramenta multiplataforma, confundi-lo com um fork de mesmo nome, ou esperar suporte a Mac Intel.

Perguntas frequentes

O que é o oMLX?

O oMLX (github.com/jundot/omlx) é um servidor de inferência local gratuito e de código aberto para Macs com Apple Silicon. Ele executa modelos por meio do framework MLX da Apple e vem como um app nativo de menu bar do macOS mais uma ferramenta de linha de comando omlx e um servidor em segundo plano, com endpoints de API compatíveis com OpenAI e Anthropic.

O oMLX é gratuito?

Sim. Nem o repositório do GitHub nem o omlx.ai têm página de preços, e o arquivo LICENSE é uma Apache License 2.0 padrão, sem modificações, sem nenhum plano pago.

O oMLX roda em Windows ou Linux?

Não. O oMLX é exclusivo do macOS, e exige especificamente Apple Silicon (M1 a M5) e macOS 15.0 (Sequoia) ou posterior, porque depende do framework MLX da Apple, que não é voltado para Windows, Linux ou Mac Intel.

O oMLX roda em um Mac Intel?

Não. Os requisitos de sistema documentados do oMLX especificam apenas Apple Silicon. O MLX, o framework sobre o qual ele é construído, não é compatível com Macs baseados em Intel.

Como o oMLX é diferente do mlx-lm?

O mlx-lm é a biblioteca Python e a CLI leve subjacentes que o ecossistema MLX da Apple fornece para executar modelos; o oMLX é construído sobre o BatchGenerator do mlx-lm e adiciona um servidor persistente, um app de menu bar, um cache em camadas apoiado em SSD, gerenciamento multimodelo, e endpoints compatíveis com OpenAI/Anthropic. Veja a comparação completa acima.

Para que serve o cache SSD paginado no oMLX?

Ele descarrega blocos de cache chave-valor inativos da RAM para o SSD do seu Mac, em formato safetensors, em vez de descartá-los. Quando um agente de codificação de longa duração revisita um contexto grande, o oMLX consegue restaurar os blocos processados anteriormente a partir do SSD em vez de recalculá-los pelo modelo, o que sua própria documentação credita por reduzir esperas de recarregamento em contextos longos de dezenas de segundos para apenas alguns segundos.

Posso usar o oMLX com Claude Code ou Cursor?

Sim. O painel de administração do oMLX inclui configuração de integração com um clique para Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot e Pi, e sua API é compatível tanto com o formato de requisição do OpenAI quanto com o do Anthropic que essas ferramentas usam.

O oMLX é de código aberto? Qual licença ele usa?

Sim. O arquivo LICENSE do oMLX é uma Apache License 2.0 padrão, sem modificações, com um aviso de copyright de 2025 para "oMLX contributors".

Quem desenvolve o oMLX?

O oMLX é desenvolvido por jundot, um mantenedor independente (contato listado como junkim.dot@gmail.com no repositório). Esta review não encontrou evidências de uma empresa ou rodada de investimento por trás do projeto.

O github.com/jundot/omlx é o repositório real do oMLX?

Sim. Existem vários repositórios "omlx" com nome idêntico sob outros nomes de usuário no GitHub, mas github.com/jundot/omlx é o projeto original, confirmado pelo próprio anúncio do desenvolvedor no fórum de discussões do GitHub do Apple MLX.

Fontes

← Voltar para LLMs locais avançados