Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/oMLX Review 2026 : serveur d'inférence Apple Silicon avec cache SSD
Overview & Reference

oMLX Review 2026 : serveur d'inférence Apple Silicon avec cache SSD

·11 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

oMLX est un serveur d'inférence locale gratuit et open source pour Apple Silicon (code source sur github.com/jundot/omlx) qui exécute des modèles à poids ouverts sur votre propre Mac via le framework MLX d'Apple, avec une application native macOS dans la barre de menus pour la gestion et des points de terminaison API compatibles OpenAI/Anthropic pour d'autres outils. Il est distribué sous une licence Apache License 2.0 standard, non modifiée (copyright oMLX contributors), sans palier payant. oMLX nécessite macOS 15.0 (Sequoia) ou ultérieur sur Apple Silicon (M1 à M5) — il ne fonctionne pas sur Mac Intel, Windows ou Linux, car MLX lui-même ne cible que l'Apple Silicon. Sa fonctionnalité phare est un cache clé-valeur à plusieurs niveaux qui décharge les blocs de contexte inactifs vers le SSD au lieu de les abandonner, permettant à un agent de codage revenant sur une longue conversation de restaurer ce contexte en quelques secondes au lieu de le recalculer entièrement.

oMLX (github.com/jundot/omlx, également documenté sur omlx.ai) est un serveur d'inférence locale gratuit et open source, construit sur le framework MLX d'Apple, distribué à la fois comme application native macOS dans la barre de menus et comme serveur en ligne de commande. Il exécute des modèles à poids ouverts entièrement sur votre Mac, expose des points de terminaison API compatibles OpenAI et Anthropic, et ajoute un cache clé-valeur RAM-plus-SSD à plusieurs niveaux conçu pour garder les longs contextes des agents de codage rapides à travers les redémarrages. Cette review couvre ce que fait réellement oMLX, comment l'installer, comment il se compare au simple mlx-lm, et où il se situe parmi les autres outils d'inférence locale.

Points clés

  • oMLX est gratuit et open source ; la LICENSE officielle sur GitHub est une Apache License 2.0 standard non modifiée, copyright oMLX contributors
  • Fonctionne entièrement en local via le framework MLX d'Apple et le BatchGenerator de mlx-lm — aucune connexion cloud requise
  • Nécessite macOS 15.0 (Sequoia) ou ultérieur, Apple Silicon (M1–M5) et Python 3.11–3.13 ; ne prend pas en charge Mac Intel, Windows ou Linux
  • Fournit une application native macOS dans la barre de menus (Swift/SwiftUI, pas Electron) accompagnée d'un outil en ligne de commande omlx et d'un serveur en arrière-plan
  • Cache clé-valeur à plusieurs niveaux — blocs chauds en RAM, blocs froids déchargés sur SSD au format safetensors, persistant à travers les redémarrages avec partage de préfixe et copy-on-write
  • Expose des points de terminaison compatibles OpenAI (/v1/chat/completions, /v1/completions, /v1/embeddings, /v1/rerank) et compatibles Anthropic (/v1/messages) sur http://localhost:8000
  • Configuration en un clic pour les intégrations d'agents de codage — dont Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot et Pi — depuis son tableau de bord d'administration intégré
  • Développé par un développeur unique, jundot, annoncé publiquement pour la première fois sur un fil de discussion GitHub de MLX en mars 2026 ; le dépôt canonique est github.com/jundot/omlx — plusieurs forks du même nom existent sous d'autres identifiants GitHub et ne sont pas le projet original

📍 En une phrase

oMLX est un serveur d'inférence locale gratuit et open source pour Mac Apple Silicon qui exécute des modèles via MLX, se présente comme une application barre de menus plus un CLI/serveur, et ajoute un cache SSD paginé pour que les contextes des agents de codage se rechargent vite au lieu d'être recalculés depuis zéro.

💬 En termes simples

Au lieu qu'un modèle recharge tout son historique de conversation depuis zéro chaque fois que vous rouvrez un agent de codage, oMLX enregistre la version traitée de ce contexte sur le SSD de votre Mac et la restaure en quelques secondes. Il fonctionne entièrement sur votre propre Mac, dispose d'une icône dans la barre de menus pour éviter de toucher au terminal, et parle aussi les mêmes formats d'API qu'OpenAI et Anthropic, permettant à des outils comme Claude Code ou Cursor de pointer directement vers lui.

📌Remarque: Cette review est le complément approfondi de l'entrée d'oMLX dans le répertoire de logiciels IA locale — consultez cette page pour voir comment oMLX se compare en un coup d'œil à des dizaines d'autres outils d'IA locale.

Qu'est-ce qu'oMLX ?

oMLX est un serveur d'inférence locale pour Mac Apple Silicon qui transforme le framework de machine learning MLX d'Apple en une pile de service complète — une API compatible OpenAI/Anthropic, un gestionnaire multi-modèles, un cache SSD paginé, et une application native macOS dans la barre de menus pour tout contrôler, sans nécessiter de terminal pour un usage quotidien. Sa propre description GitHub le présente comme « un serveur d'inférence LLM optimisé pour les Mac Apple Silicon, avec batching continu, cache KV à plusieurs niveaux, et une interface de gestion native dans la barre de menus macOS ».

  • Fonction principale : un serveur d'inférence en arrière-plan qui charge des modèles à poids ouverts et les sert via une API HTTP locale, géré depuis une application barre de menus ou le CLI omlx
  • Moteur d'inférence : construit sur le framework MLX d'Apple et le BatchGenerator de la bibliothèque mlx-lm, selon la documentation d'oMLX, avec une couche originale de batching continu et de cache paginé par-dessus
  • Fondation : selon l'annonce du développeur, oMLX a été initialement construit sur vllm-mlx comme point de départ, avec des implémentations originales ajoutées pour le tiering du cache SSD, le batching continu, le support des modèles vision-langage, l'API compatible Anthropic, et l'interface macOS native
  • Développeur : jundot (contact listé comme junkim.dot@gmail.com dans le dépôt), un mainteneur indépendant — cette review n'a trouvé aucune preuve d'une entreprise ou d'un tour de financement derrière oMLX
  • Dépôt canonique : github.com/jundot/omlx — plusieurs forks portant le même nom existent sous d'autres identifiants GitHub (par exemple mkmsyk/omlx, dannysl/omlx) ; ce ne sont pas le projet original

Origine et croissance d'oMLX

oMLX a été annoncé publiquement pour la première fois par son développeur, jundot, dans un message de mars 2026 sur le forum de discussions GitHub d'Apple MLX. L'annonce présentait oMLX comme une solution à un problème concret et spécifique : les agents de codage réutilisant un contexte long et croissant pouvaient subir sur Apple Silicon des délais de plusieurs dizaines de secondes pour recharger ce contexte à chaque requête, car les serveurs basés sur MLX de l'époque ne conservaient généralement l'état du cache clé-valeur qu'en RAM et le perdaient à chaque redémarrage du serveur ou expiration d'un contexte. Le cache SSD paginé d'oMLX persiste cet état sur disque à la place, permettant de restaurer un préfixe précédemment traité depuis le SSD plutôt que de le recalculer à partir du modèle. Selon l'annonce du développeur, oMLX avait déjà accumulé environ 110 étoiles GitHub au lancement, construit sur vllm-mlx comme point de départ avec du code nouvellement écrit pour le tiering SSD, le batching continu, le support des modèles vision-langage, une API compatible Anthropic, et l'interface macOS native. À la date de publication de cette review, le dépôt GitHub d'oMLX affiche environ 21 859 étoiles — une croissance rapide pour un projet vieux de six mois au moment de la rédaction.

  • Annonce : 4 mars 2026, sur github.com/ml-explore/mlx/discussions/3203, publiée par le développeur du projet lui-même, jundot
  • Point de départ : vllm-mlx, avec le tiering SSD, le batching continu, le VLM, l'API Anthropic et le code d'interface native ajoutés par le développeur
  • Croissance : d'environ 110 étoiles GitHub à l'annonce de mars 2026 à environ 21 859 étoiles à la date de cette review, selon le dépôt GitHub d'oMLX
  • Historique de licence : le fichier LICENSE du dépôt porte une mention de copyright 2025 pour « oMLX contributors », antérieure à l'annonce publique du projet en mars 2026 — cohérent avec un développement privé avant le lancement public

Que pouvez-vous faire avec oMLX ?

L'ensemble de fonctionnalités d'oMLX vise à transformer l'inférence de modèles MLX en un serveur local multi-modèles persistant, plutôt qu'un script ponctuel. Voici ce que fait réellement chaque partie, selon le README GitHub et la documentation omlx.ai d'oMLX.

  • Cache clé-valeur à plusieurs niveaux — les blocs de contexte actifs restent dans un niveau RAM chaud ; les blocs inactifs passent dans un niveau SSD froid au format safetensors, avec partage de préfixe et copy-on-write, et le cache survit aux redémarrages du serveur au lieu d'être abandonné
  • Batching continu — les requêtes concurrentes sont traitées via le BatchGenerator de mlx-lm, avec une concurrence maximale configurable, plutôt que de traiter les requêtes une par une
  • Service multi-modèles — chargez côte à côte des LLM, des modèles vision-langage (VLM), des modèles d'embedding et des reranker, avec éviction LRU, chargement/déchargement manuel, épinglage de modèle et une durée de vie configurable par modèle
  • API compatible OpenAI et Anthropic/v1/chat/completions, /v1/completions, /v1/embeddings et /v1/rerank pour les clients au format OpenAI, plus /v1/messages pour les clients au format Anthropic, tous servis depuis http://localhost:8000
  • Support vision-langage et OCR — chat multi-image avec entrées en base64, URL ou fichier, appel d'outils avec contexte visuel, et détection automatique des modèles OCR dédiés
  • Appel d'outils et MCP — appel d'outils par schéma JSON avec détection automatique du chat-template pour Llama, Qwen, DeepSeek, Gemma, GLM, MiniMax, Mistral et d'autres familles de modèles, plus configuration du Model Context Protocol (MCP)
  • Application native macOS dans la barre de menus — une application Swift/SwiftUI (explicitement pas Electron, selon la documentation propre du projet) pour démarrer, arrêter et surveiller le serveur sans terminal, avec des statistiques d'usage locales (totaux par modèle, carte de chaleur horaire d'utilisation) et redémarrage automatique en cas de plantage
  • Tableau de bord d'administration — une interface web sur /admin, accessible depuis un navigateur une fois le serveur lancé, pour la gestion des modèles, une interface de chat intégrée, un benchmarking en un clic, un téléchargeur de modèles, et une configuration en un clic pour les intégrations d'agents de codage incluant Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot et Pi
  • Inférence distribuée expérimentale — inférence multi-Mac à travers des rangs de pipeline MLX via un réseau Ring ou Thunderbolt RDMA, marquée expérimentale dans la propre documentation d'oMLX

Exemples d'usage : trois façons d'utiliser oMLX

Voici des workflows concrets construits à partir des fonctionnalités documentées d'oMLX ci-dessus — pas des cas d'usage hypothétiques.

Tarifs oMLX : oMLX est-il vraiment gratuit ?

Oui — oMLX n'a pas de palier payant. Ni le dépôt GitHub ni omlx.ai n'a de page tarifaire, et le fichier LICENSE est une Apache License 2.0 standard non modifiée avec une mention de copyright 2025 pour « oMLX contributors » — elle s'applique à l'ensemble de l'application, sans clause bloquant une fonctionnalité derrière un paiement.

  • Aucun abonnement, aucun palier payant, aucune limite d'usage imposée par oMLX lui-même
  • Aucun compte ni inscription requis pour installer ou exécuter l'application
  • L'application, l'application barre de menus, le CLI et le tableau de bord d'administration sont tous couverts par les mêmes conditions de l'Apache License 2.0
  • Comme oMLX n'exécute que des modèles locaux via MLX, il n'y a pas non plus de coût par token ou par requête auprès d'un fournisseur cloud — le seul coût est l'électricité et le matériel que vous possédez déjà

oMLX vs. mlx-lm

mlx-lm est la bibliothèque Python et le CLI simple que l'écosystème MLX d'Apple fournit pour exécuter et servir des modèles — et oMLX est construit directement par-dessus, en utilisant son BatchGenerator pour le batching continu. Les deux ne sont pas vraiment des concurrents mais plutôt des couches différentes : mlx-lm est la fondation, oMLX est un produit de service complet construit sur cette fondation.

Aspect
oMLX
mlx-lm
Ce que c'estUn serveur d'inférence packagé : app barre de menus + CLI + tableau de bord d'administrationUne bibliothèque Python et un CLI léger pour exécuter/servir des modèles MLX
Cache KVCache paginé RAM + SSD à plusieurs niveaux, persiste à travers les redémarragesCache en mémoire uniquement, selon son propre serveur documenté ; pas de tiering SSD
Gestion multi-modèlesÉviction LRU, épinglage, TTL par modèle, chargement/déchargement depuis une interfacePas une fonctionnalité intégrée — scriptée ou gérée manuellement
Compatibilité APIPoints de terminaison compatibles OpenAI et AnthropicMode serveur compatible OpenAI (mlx_lm.server)
InterfaceApplication native macOS barre de menus plus tableau de bord web d'administrationLigne de commande uniquement, aucune interface graphique
Intégrations agents de codageConfiguration en un clic pour Claude Code, Cursor, OpenClaw et autresPas une fonctionnalité documentée ; nécessite une configuration manuelle des points de terminaison

Si vous voulez le moyen le plus simple possible d'exécuter un seul modèle MLX depuis un script ou une commande serveur rapide, mlx-lm seul peut suffire. Si vous voulez un serveur multi-modèles persistant avec une interface barre de menus, un cache adossé au SSD pour les longs contextes d'agent, et des intégrations d'agents de codage en un clic, oMLX est spécifiquement conçu pour ajouter cette couche par-dessus mlx-lm plutôt que de le remplacer.

À qui s'adresse oMLX ?

Le fait qu'oMLX vous convienne dépend presque entièrement d'abord d'une chose : êtes-vous sur un Mac Apple Silicon, car cette exigence n'a pas de contournement.

oMLX vs. autres outils d'inférence locale

oMLX se situe dans le segment Apple Silicon / MLX du paysage de l'inférence locale. Voici comment il se compare à d'autres outils de ce même segment — consultez le répertoire de logiciels IA locale pour le catalogue complet, et le comparatif dédié oMLX vs. mlx-lm ci-dessus pour la confrontation la plus directe.

  • mlx-lm — la bibliothèque Python et le CLI sous-jacents sur lesquels oMLX lui-même est construit ; le bon choix si vous voulez le moyen le plus simple possible d'exécuter un modèle MLX sans couche serveur complète. Voir le comparatif dédié ci-dessus.
  • exo — un outil open source pour mettre en cluster plusieurs Mac Apple Silicon (et d'autres appareils) afin d'exécuter des modèles plus grands qu'une seule machine ne pourrait contenir ; pertinent si le mode expérimental de cluster unique distribué d'oMLX ne suffit pas à votre configuration. Voir la review exo.
  • LM Studio — une application de bureau multiplateforme (macOS, Windows, Linux) qui utilise aussi MLX comme l'un de ses moteurs d'inférence sur Apple Silicon, aux côtés de llama.cpp ; mieux adaptée si vous avez besoin que le même outil fonctionne aussi sur du matériel non-Mac. Voir la review LM Studio.
  • llamafile — une approche d'inférence locale en exécutable unique, construite sur llama.cpp plutôt que MLX, qui exécute le même fichier sous macOS, Windows et Linux sans étape d'installation ; un contraste utile si la portabilité multiplateforme compte plus pour vous que la performance spécifique à l'Apple Silicon. Voir l'article llamafile expliqué.

Erreurs courantes en évaluant oMLX

La plupart des confusions autour d'oMLX viennent du fait de supposer qu'il fonctionne comme un outil multiplateforme, de le confondre avec un fork du même nom, ou de s'attendre à un support Mac Intel.

Questions fréquentes

Qu'est-ce qu'oMLX ?

oMLX (github.com/jundot/omlx) est un serveur d'inférence locale gratuit et open source pour Mac Apple Silicon. Il exécute des modèles via le framework MLX d'Apple et se présente comme une application native macOS dans la barre de menus plus un outil en ligne de commande omlx et un serveur en arrière-plan, avec des points de terminaison API compatibles OpenAI et Anthropic.

oMLX est-il gratuit ?

Oui. Ni le dépôt GitHub ni omlx.ai n'a de page tarifaire, et le fichier LICENSE est une Apache License 2.0 standard non modifiée, sans aucun palier payant.

oMLX fonctionne-t-il sous Windows ou Linux ?

Non. oMLX est exclusif à macOS, et nécessite spécifiquement l'Apple Silicon (M1 à M5) et macOS 15.0 (Sequoia) ou ultérieur, car il dépend du framework MLX d'Apple, qui ne cible ni Windows, ni Linux, ni les Mac Intel.

oMLX fonctionne-t-il sur un Mac Intel ?

Non. Les prérequis système documentés d'oMLX spécifient exclusivement l'Apple Silicon. MLX, le framework sur lequel il est construit, ne prend pas en charge les Mac à base Intel.

En quoi oMLX diffère-t-il de mlx-lm ?

mlx-lm est la bibliothèque Python et le CLI léger sous-jacents que fournit l'écosystème MLX d'Apple pour exécuter des modèles ; oMLX est construit par-dessus le BatchGenerator de mlx-lm et ajoute un serveur persistant, une application barre de menus, un cache à plusieurs niveaux adossé au SSD, une gestion multi-modèles, et des points de terminaison compatibles OpenAI/Anthropic. Voir le comparatif complet ci-dessus.

À quoi sert le cache SSD paginé dans oMLX ?

Il décharge les blocs de cache clé-valeur inactifs de la RAM vers le SSD de votre Mac, au format safetensors, au lieu de les abandonner. Lorsqu'un agent de codage de longue durée revisite un contexte volumineux, oMLX peut restaurer les blocs précédemment traités depuis le SSD plutôt que de les recalculer à partir du modèle, ce que sa propre documentation crédite d'une réduction des temps de rechargement sur les longs contextes, de plusieurs dizaines de secondes à quelques secondes.

Puis-je utiliser oMLX avec Claude Code ou Cursor ?

Oui. Le tableau de bord d'administration d'oMLX inclut une configuration d'intégration en un clic pour Claude Code, Cursor, OpenClaw, OpenCode, Codex, Hermes Agent, Copilot et Pi, et son API est compatible avec les formats de requête OpenAI et Anthropic que ces outils utilisent.

oMLX est-il open source ? Quelle licence utilise-t-il ?

Oui. Le fichier LICENSE d'oMLX est une Apache License 2.0 standard non modifiée, avec une mention de copyright 2025 pour « oMLX contributors ».

Qui développe oMLX ?

oMLX est développé par jundot, un mainteneur indépendant (contact listé comme junkim.dot@gmail.com dans le dépôt). Cette review n'a trouvé aucune preuve d'entreprise ou de tour de financement derrière le projet.

github.com/jundot/omlx est-il le vrai dépôt oMLX ?

Oui. Plusieurs dépôts « omlx » portant le nom identique existent sous d'autres identifiants GitHub, mais github.com/jundot/omlx est le projet original, confirmé par l'annonce propre du développeur sur le forum de discussions GitHub d'Apple MLX.

Sources

← Retour aux LLM locaux avancés