Points clés
- mlx-serve est gratuit et open source ; le fichier LICENSE officiel sur GitHub est la licence MIT, avec certains composants tiers intégrés sous licence Apache License 2.0
- Fonctionne nativement sur Apple Silicon via MLX pour les familles de modèles prises en charge, et via un llama.cpp intégré pour les modèles GGUF
- Expose simultanément les API compatibles chat/completions et Responses d'OpenAI, l'API Messages d'Anthropic et l'API Ollama sur un seul port
- Fournit une application compagne pour la barre de menus macOS, MLX Core, avec chat multi-sessions, mode agent avec prise en charge d'outils MCP, et panneaux de génération d'images/vidéo/musique/voix/3D
- Un seul binaire d'environ 7 Mo, sans dépendance à un environnement d'exécution Python
- Des lanceurs préconfigurés pour les agents de codage, notamment Claude Code, OpenCode et Cursor
- Nécessite macOS 26.2 ou ultérieur sur du matériel Apple Silicon (série M) — aucune prise en charge de Windows, Linux ou des Mac Intel
- Développé par David Dalcu ; publie des versions taguées quasi quotidiennes au moment de cette revue
📍 En une phrase
mlx-serve est un serveur d'inférence Zig gratuit et open source pour les Mac Apple Silicon qui expose des API compatibles OpenAI, Anthropic et Ollama depuis un seul binaire, sans offre payante.
💬 En termes simples
Au lieu d'installer Python et plusieurs paquets séparés pour faire tourner un serveur de modèle local, mlx-serve est un petit programme unique installé avec Homebrew. Il exécute les modèles directement via le framework MLX d'Apple ou, pour les modèles GGUF, via une copie intégrée de llama.cpp, et répond aux requêtes dans le même format que celui utilisé par OpenAI, Anthropic et Ollama, si bien que les outils déjà conçus pour ces API fonctionnent sans modification.
📌Remarque: Cette revue est le complément détaillé de la fiche de mlx-serve dans le Répertoire des logiciels d'IA locale — consultez cette page pour voir en un coup d'œil comment mlx-serve se compare à des dizaines d'autres outils d'IA locale.
Qu'est-ce que mlx-serve ?
mlx-serve est un serveur d'inférence natif pour les Mac Apple Silicon qui exécute des modèles d'IA sur l'appareil et les expose via des API compatibles OpenAI, Anthropic et Ollama. Sa propre description GitHub indique : « Native LLM inference server for Apple Silicon. OpenAI + Anthropic API compatible. No Python. Includes MLX Core macOS app with chat, agent mode, and tool calling. » Le serveur lui-même est écrit en Zig, un langage de programmation système, ce qui explique qu'il soit livré sous forme d'un seul petit binaire plutôt que d'une application Python avec des dépendances à installer.
- Fonction principale : un serveur d'inférence local qui charge un modèle une fois et l'expose via HTTP dans trois formats d'API différents simultanément
- Répartition native des modèles : MLX — le framework de calcul matriciel propre à Apple pour Apple Silicon — pour les familles de modèles prises en charge, et un llama.cpp intégré pour les modèles au format GGUF
- Compatibilité API : les points de terminaison chat/completions et Responses d'OpenAI, l'API Messages d'Anthropic, et l'API Ollama, tous sur le port 11234 par défaut
- Application compagne : MLX Core, une application pour la barre de menus macOS intégrée pour le chat, les workflows d'agents et la génération de médias, installée comme un cask Homebrew séparé aux côtés du serveur
- Développeur : David Dalcu, un développeur individuel selon la mention de copyright dans le fichier LICENSE du dépôt GitHub
- Dépôt canonique : github.com/ddalcu/mlx-serve — le projet original ; plusieurs forks et au moins un projet indépendant, écrit par un autre auteur, partagent un nom similaire, donc vérifiez que vous pointez précisément vers ce dépôt
Historique des versions de mlx-serve
Le dépôt GitHub de mlx-serve a été créé en février 2026, et le projet publie depuis des versions taguées quasi quotidiennes, ajoutant du décodage spéculatif, des lanceurs pour agents de codage et une génération de médias élargie. Il s'agit d'un projet jeune et évoluant rapidement, et non d'un projet mature avec un long historique — un élément à prendre en compte dans toute évaluation.
- 1v26.8.9 — 18 août 2026 : lanceurs pour agents de codage
Why it matters: Ajout de lanceurs préconfigurés pour les agents de codage (selon les notes de version : « launch your coding agent »), accompagné d'un chat enrichi et d'un décodage plus rapide, selon la [page officielle des versions](https://github.com/ddalcu/mlx-serve/releases). - 2v26.8.10 — 26 août 2026 : délestage du préremplissage vers le Neural Engine
Why it matters: Ajout du délestage du préremplissage vers le Neural Engine et du décodage par lots, une optimisation visant à utiliser le matériel Neural Engine dédié d'Apple pour une partie du pipeline d'inférence. - 3v26.8.11 — 29 août 2026 : MLX 0.32.2 et Qwen 3.8 Flash Next
Why it matters: Mise à jour de la version du framework MLX intégré et ajout de la prise en charge d'une nouvelle variante du modèle Qwen. - 4v26.9.1 — 3 septembre 2026 : contexte de 1 million de tokens et décodage Flash plus rapide
Why it matters: Ajout de terminaux dans la barre latérale de l'application compagne MLX Core, ainsi que la prise en charge d'une fenêtre de contexte d'un million de tokens sur les modèles compatibles. - 5v26.9.2 — 9 septembre 2026 : paramètres par modèle et fournisseurs de chat
Why it matters: Ajout d'une configuration par modèle et d'options supplémentaires de fournisseurs de chat, ainsi que de nouvelles améliorations de la vitesse de décodage. - 6v26.9.3 — 16 septembre 2026 : décodage spéculatif pour tous les modèles
Why it matters: Extension de la prise en charge du décodage spéculatif au-delà d'un ensemble restreint de modèles, selon les notes de version, aux côtés d'un travail de performance Flash sur les Mac 64 Go. - 7v26.9.4 — 17 septembre 2026 : correctifs et benchmarks
Why it matters: Publication de correctifs, ajout d'une documentation en chinois, et publication de nouveaux chiffres de benchmark — la version stable la plus récente notée sur la [page officielle des versions](https://github.com/ddalcu/mlx-serve/releases) au moment de cette revue.
Que peut-on faire avec mlx-serve ?
L'ensemble de fonctionnalités de mlx-serve se concentre sur l'exécution rapide de modèles sur Apple Silicon tout en restant compatible avec les outils déjà conçus pour d'autres API. Voici ce que fait réellement chaque partie, selon le README GitHub du projet.
- Service multi-API — le serveur répond simultanément aux requêtes chat/completions et Responses d'OpenAI, aux requêtes de l'API Messages d'Anthropic et aux requêtes de l'API Ollama sur le même port, si bien que le code client OpenAI/Anthropic/Ollama existant peut pointer vers mlx-serve avec un simple changement d'URL de base
- Répartition native des modèles MLX — les modèles disposant d'une prise en charge native de MLX (selon le README : Gemma, Qwen, Llama, Mistral et DeepSeek V4 Flash) s'exécutent directement via le framework MLX d'Apple sur Apple Silicon
- llama.cpp intégré pour GGUF — des milliers de modèles au format GGUF non pris en charge nativement par MLX s'exécutent à la place via une copie intégrée de llama.cpp, sans installation séparée
- Fonctionnalités de performance — le README documente quatre variantes de décodage spéculatif, le batching continu, la quantification du cache KV et des kernels Metal personnalisés visant le débit sur Apple Silicon
- Application compagne MLX Core — une application pour la barre de menus macOS intégrée proposant un chat multi-sessions avec pièces jointes PDF/image, un mode agent avec outils intégrés et une intégration au marketplace du Model Context Protocol (MCP), un Agent Sandbox isolé pour exécuter des commandes shell, un navigateur de modèles avec téléchargements reprenables, et des panneaux de génération pour images, vidéo, musique, voix (y compris le clonage vocal avec les voix Kokoro) et modèles 3D
- Lanceurs pour agents de codage — des profils de lancement préconfigurés pour des agents de codage, notamment Claude Code, OpenCode, Pi et Cursor, selon les notes de version
- Aucune dépendance à Python — le binaire du serveur pèse environ 7 Mo et ne nécessite aucun environnement d'exécution Python, contrairement à de nombreux autres outils d'inférence locale
Exemples d'utilisation : trois façons d'utiliser mlx-serve
Il s'agit de workflows concrets construits à partir des commandes documentées de mlx-serve ci-dessus — pas de cas d'usage hypothétiques.
Installer mlx-serve
mlx-serve s'installe via Homebrew, et son code source est sur GitHub. Les liens ci-dessous proviennent du README GitHub officiel — vérifiez toujours directement sur cette page, car les instructions d'installation peuvent changer d'une version à l'autre.
Serveur (Homebrew)
- Lien:
brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-servepuisbrew install mlx-serve
App compagne MLX Core (cask Homebrew)
- Lien:
brew install --cask mlx-core
Dépôt GitHub (code source, licence MIT)
Page d'accueil du projet
- Lien:
- mlxserve.com
Compiler depuis les sources
- Lien:
- Nécessite Xcode 26.2+ avec le composant Metal Toolchain, selon le README GitHub
L'application compagne MLX Core pour la barre de menus est un complément, pas la voie d'installation principale — mlx-serve est fondamentalement un serveur en ligne de commande, et MLX Core en est un frontend graphique optionnel. mlx-serve nécessite macOS 26.2 ou ultérieur sur Apple Silicon ; il ne fonctionne pas sur les Mac Intel, Windows ou Linux, et il n'existe aucune version officielle pour ces plateformes.
Tarifs de mlx-serve : vraiment gratuit ?
Oui — mlx-serve n'a aucune offre payante. Le dépôt GitHub n'a pas de page tarifaire, et le fichier LICENSE s'applique à l'ensemble de l'application. Le texte de la licence est la licence MIT standard, copyright David Dalcu — permissive, sans obligation de copyleft. Les métadonnées propres du dépôt GitHub classent la licence globale comme une entrée personnalisée (« Other ») plutôt que comme un simple badge MIT, car le dépôt intègre aussi certains composants tiers sous licence Apache License 2.0, documentés dans un fichier NOTICE séparé.
- Aucun abonnement, aucune offre payante, aucune limite d'utilisation imposée par mlx-serve lui-même
- Aucun compte ni inscription requis pour installer ou utiliser le serveur ou l'application compagne MLX Core
- Le code principal de mlx-serve est sous licence MIT — permissive, gratuite pour un usage commercial et non commercial, avec attribution préservée dans le texte de la licence
- Certains composants tiers intégrés (selon le fichier NOTICE du dépôt) sont sous licence Apache License 2.0 plutôt que MIT — lisez directement le fichier NOTICE si l'examen de conformité de votre organisation dépend du mélange exact de licences
mlx-serve vs. Ollama
mlx-serve et Ollama exposent tous deux des modèles locaux via une API HTTP sur un Mac, et ils sont souvent comparés car les deux peuvent se trouver derrière les mêmes outils clients. Les différences les plus nettes concernent la portée des plateformes et le choix du moteur natif.
Aspect | mlx-serve | Ollama |
|---|---|---|
| Plateformes | macOS (Apple Silicon) uniquement | macOS, Windows, Linux |
| Moteur natif | MLX (natif) + llama.cpp intégré pour GGUF | Basé sur llama.cpp |
| Compatibilité API | API OpenAI + Anthropic + Ollama, même port | API propre, plus un point de terminaison compatible OpenAI |
| Interface fournie | App barre de menus MLX Core (chat, mode agent, gén. médias) | Interface intégrée minimale ; dépend de frontends tiers |
| Dépendance runtime | Un seul binaire d'env. 7 Mo, sans Python | Un seul binaire Go, sans Python |
| Génération de médias | Image/vidéo/musique/voix/3D via MLX Core | Chat texte et vision uniquement |
La compatibilité de mlx-serve avec l'API Ollama signifie que les outils conçus pour Ollama peuvent souvent pointer directement vers mlx-serve, selon la documentation du projet. Si la prise en charge multiplateforme compte — Windows ou Linux, pas seulement macOS —, Ollama est l'option avec la portée la plus large ; vérifiez les détails de fonctionnalités actuels sur le site propre à chaque projet avant de trancher, les deux publiant des mises à jour fréquentes.
À qui s'adresse mlx-serve ?
La pertinence de mlx-serve dépend du fait que vous possédiez du matériel Apple Silicon et que vous vouliez un seul serveur parlant plusieurs formats d'API client, plus une interface graphique intégrée pour la génération de médias.
mlx-serve vs. autres outils d'inférence MLX
mlx-serve est l'un de plusieurs serveurs d'inférence axés sur Apple Silicon apparus autour du framework MLX d'Apple. Voici comment il se positionne face à d'autres options dans ce domaine — consultez le Répertoire des logiciels d'IA locale pour le catalogue complet, et la comparaison dédiée mlx-serve vs. Ollama ci-dessus pour le face-à-face multiplateforme le plus proche.
- MLX LM — la bibliothèque Python et les outils en ligne de commande propres à Apple pour exécuter et affiner des modèles de langage avec MLX ; de plus bas niveau et basée sur Python, contrairement au binaire Zig autonome de mlx-serve. Voir l'explication de MLX LM pour un aperçu plus approfondi de la bibliothèque sous-jacente sur laquelle s'appuie la répartition native de mlx-serve.
- omlx — une autre option d'inférence locale axée sur Apple Silicon ; voir la revue dédiée pour comparer son ensemble de fonctionnalités et sa compatibilité API à ceux de mlx-serve.
- rapid-mlx — un outil d'inférence basé sur MLX orienté performance ; voir la revue dédiée pour une comparaison de débit et de fonctionnalités face à mlx-serve.
- LoRAX — un framework de service multi-adaptateurs LoRA ; pertinent si votre workflow doit servir de nombreux adaptateurs affinés depuis un modèle de base plutôt qu'un seul modèle par serveur, ce qui n'est pas l'axe de conception de mlx-serve.
- Ollama — un serveur de modèles locaux multiplateforme ; voir la section de comparaison dédiée ci-dessus pour ses différences avec mlx-serve en matière de portée de plateformes et de moteur natif.
Erreurs courantes lors de l'évaluation de mlx-serve
La plupart des confusions autour de mlx-serve proviennent de sa restriction de plateforme, de la classification de sa licence sur GitHub, ou du fait de le supposer être un outil Python comme la plupart des autres serveurs d'inférence locale.
Questions fréquentes
Qu'est-ce que mlx-serve ?
mlx-serve (github.com/ddalcu/mlx-serve) est un serveur d'inférence gratuit et open source écrit en Zig, qui exécute des modèles d'IA localement sur les Mac Apple Silicon, exposant des API compatibles OpenAI, Anthropic et Ollama depuis un seul binaire.
mlx-serve est-il gratuit ?
Oui. Le dépôt GitHub n'a pas de page tarifaire, et son fichier LICENSE est la licence MIT, s'appliquant à l'ensemble de l'application principale, sans offre payante.
mlx-serve est-il open source ? Quelle licence utilise-t-il ?
Oui, mlx-serve est open source. Son fichier LICENSE principal est la licence MIT standard, copyright David Dalcu. Le dépôt intègre aussi certains composants tiers sous licence Apache License 2.0, listés dans un fichier NOTICE séparé, ce qui explique pourquoi les métadonnées du dépôt GitHub affichent la licence comme une entrée personnalisée (« Other ») plutôt que comme un simple badge MIT. Vérifiez les deux fichiers vous-même pour une décision juridique.
Quelles plateformes mlx-serve prend-il en charge ?
macOS 26.2 ou ultérieur sur du matériel Apple Silicon (série M) uniquement, selon le README GitHub officiel. Il n'y a aucune prise en charge de Windows, Linux ou des Mac Intel.
mlx-serve nécessite-t-il Python ?
Non. mlx-serve est écrit en Zig et livré sous forme d'un seul binaire d'environ 7 Mo, sans dépendance à un environnement d'exécution Python, contrairement à de nombreux autres outils d'inférence locale.
Quels formats de modèles mlx-serve prend-il en charge ?
Les modèles disposant d'une prise en charge native de MLX (le README nomme Gemma, Qwen, Llama, Mistral et DeepSeek V4 Flash) s'exécutent directement via le framework MLX d'Apple. Les autres modèles au format GGUF s'exécutent plutôt via une copie intégrée de llama.cpp, sans installation séparée.
Qu'est-ce que MLX Core ?
MLX Core est l'application compagne pour la barre de menus macOS intégrée à mlx-serve, installée comme un cask Homebrew séparé. Elle offre un chat multi-sessions, un mode agent avec intégration d'outils MCP, un navigateur de modèles et des panneaux de génération pour images, vidéo, musique, voix et modèles 3D.
mlx-serve peut-il remplacer Ollama pour des outils existants ?
Souvent, oui — mlx-serve expose une API compatible Ollama aux côtés des API compatibles OpenAI et Anthropic sur le même port, si bien que les outils conçus pour l'API d'Ollama peuvent fréquemment pointer vers mlx-serve avec un simple changement d'URL de base. Vérifiez la compatibilité pour votre client spécifique avant de basculer dans un workflow de production.
Comment installer mlx-serve ?
Via Homebrew : brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve suivi de brew install mlx-serve pour le serveur, et brew install --cask mlx-core pour l'application compagne optionnelle de la barre de menus. Consultez le README GitHub officiel pour les instructions actuelles avant d'installer.
Quand mlx-serve a-t-il été publié pour la première fois ?
Le dépôt GitHub de mlx-serve a été créé en février 2026. Au moment de cette revue, le projet publie des versions taguées quasi quotidiennes — voir la page officielle des versions pour l'historique complet.