Points clés
- vllm-mlx (github.com/waybarrios/vllm-mlx) est un serveur d'inférence gratuit et open source, installé via
pip install vllm-mlx - Développé par le développeur indépendant Way Barrios ; pas le projet vLLM officiel (github.com/vllm-project/vllm) et non affilié à l'équipe vLLM
- Sous licence Apache 2.0, confirmée via le fichier LICENSE du dépôt GitHub
- Expose des points de terminaison compatibles OpenAI (
/v1/chat/completions,/v1/embeddings,/v1/rerank,/v1/responses) et Anthropic (/v1/messages) depuis un seul processus serveur - Fonctionnalités de serving adaptées de vLLM : batching continu, cache KV paginé, prefix caching, et cache optionnel sur SSD pour les workloads à long contexte
- Gère des modèles texte, vision (image/vidéo), audio (TTS/STT) et d'embedding/reranking, le tout via MLX natif sur Apple Silicon
- Nécessite un Mac Apple Silicon (M1 à M5) — aucun support Windows, Linux ou Mac Intel
- Plus de 1 580 étoiles GitHub au moment de cet avis
📍 En une phrase
vllm-mlx est un serveur d'inférence Python gratuit et open source (Apache 2.0) qui apporte le batching continu et le cache KV paginé façon vLLM aux Mac Apple Silicon via MLX natif, en exposant des points de terminaison API compatibles OpenAI et Anthropic.
💬 En termes simples
vllm-mlx permet d'exécuter des modèles d'IA sur son propre Mac et de leur parler exactement comme aux API cloud d'OpenAI ou d'Anthropic — il suffit de pointer le code existant vers localhost au lieu du cloud. Il est conçu pour traiter efficacement plusieurs requêtes à la fois, d'où le « façon vLLM » dans son nom, mais reste un projet distinct et non officiel plutôt que vLLM lui-même tournant sur un Mac.
📌Remarque: Cet avis s'appuie sur le dépôt GitHub de vllm-mlx, son README, son site de documentation et sa fiche PyPI. Il ne reprend pas les benchmarks de débit publiés par vllm-mlx comme des faits vérifiés indépendamment — ces chiffres proviennent du README du projet et doivent être considérés comme déclarés par l'éditeur, non testés par PromptQuorum. Cet avis complète l'entrée de vllm-mlx dans le Local LLM Software Directory.
Qu'est-ce que vllm-mlx ?
vllm-mlx est un serveur d'inférence en ligne de commande pour Mac Apple Silicon qui expose des modèles d'IA exécutés localement via les mêmes formats d'API que les services cloud d'OpenAI et d'Anthropic. Son propre README GitHub le décrit comme apportant « continuous batching + APIs OpenAI + Anthropic dans un seul serveur » avec une « inférence native Apple Silicon ». Ce n'est pas une application de bureau graphique — c'est un paquet Python exécuté depuis le terminal, qui écoute ensuite sur un port local les requêtes API.
- Type de produit : un serveur d'inférence CLI basé sur Python, installé comme paquet pip/uv, et non une application graphique téléchargeable
- Créateur : le développeur indépendant Way Barrios (identifiant GitHub
waybarrios) ; cet avis n'a trouvé aucune preuve d'entreprise, de levée de fonds ou d'entité commerciale derrière le projet - Dépôt : github.com/waybarrios/vllm-mlx, le plus ancien et le plus étoilé de plusieurs dépôts GitHub portant le même nom — d'autres dépôts homonymes (sous d'autres noms d'utilisateur) décrivent celui-ci comme le projet qu'ils reflètent
- Licence : Apache 2.0, confirmée via le fichier LICENSE du dépôt
- Nom : « vllm-mlx » signale que le projet suit la conception d'API de serving et la terminologie de vLLM (batching continu, cache KV paginé) tout en s'exécutant sur MLX plutôt que sur le moteur CUDA/ROCm propre à vLLM — il ne contient pas le code source original de vLLM
Historique du projet
vllm-mlx est un projet relativement jeune. Sa fiche PyPI et son dépôt GitHub montrent un développement actif et continu plutôt qu'un long historique de versions pluriannuel, et son README documente déjà un large ensemble de fonctionnalités — compatibilité API OpenAI et Anthropic, batching continu, support multimodal et appel d'outils MCP — comme état actuel plutôt que comme déploiement progressif.
- Distribué sur PyPI sous le paquet
vllm-mlx, avec des tags de version publiés visibles viapip index versions vllm-mlxou la page du projet PyPI - Maintenu activement : le dépôt GitHub montre des commits continus et un site de documentation à l'adresse vllm-mlx.is-a.dev
- Le README est traduit en plusieurs langues (anglais, espagnol, français, chinois) par le projet lui-même, ce qui est inhabituel pour un projet de cette taille et signale une base d'utilisateurs répartie à l'international
- L'ensemble de fonctionnalités inclut déjà, au moment de cet avis, le support des modèles de raisonnement (extraction de raisonnement façon Qwen3, DeepSeek-R1), le décodage spéculatif et des optimisations de type Mixture-of-Experts
Que peut-on faire avec vllm-mlx ?
L'ensemble de fonctionnalités de vllm-mlx se concentre sur le service efficace de plusieurs requêtes simultanées sur un seul Mac, tout en couvrant plus que la simple génération de texte. Voici ce que fait réellement chaque élément, selon le README et le site de documentation du projet.
- Double compatibilité API — sert des points de terminaison de type OpenAI (
/v1/chat/completions,/v1/completions,/v1/embeddings,/v1/rerank,/v1/responses) et de type Anthropic (/v1/messages, avec streaming, usage d'outils et prompts système) depuis un seul serveur en fonctionnement - Batching continu — traite plusieurs requêtes simultanées ensemble plutôt qu'une par une, la même technique popularisée par vLLM pour le serving GPU, adaptée ici pour MLX/Metal
- Cache KV paginé et par préfixe — un cache basé sur un trie, économe en mémoire, qui partage les préfixes de prompt répétés entre requêtes, avec un flag optionnel
--ssd-cache-dirpour déporter le cache sur disque pour les workloads d'agents à long contexte - Support multimodal — entrées texte, image, vidéo et audio depuis un seul serveur ; les familles de modèles vision compatibles documentées incluent Gemma, Qwen3-VL, Pixtral et les variantes vision de Llama
- Audio intégré — synthèse vocale (plusieurs voix et langues selon son README) et reconnaissance vocale via les modèles de la famille Whisper, exécutées dans le même processus serveur
- Appel d'outils MCP — support du Model Context Protocol avec des parseurs pour plusieurs familles de modèles (le README cite entre autres les formats d'appel d'outils OpenAI, Anthropic, Gemini, Qwen, DeepSeek et Gemma), plus une compatibilité explicite avec Claude Code via le point de terminaison compatible Anthropic
- Fonctions de raisonnement et MoE — extraction des jetons de raisonnement pour des modèles comme Qwen3 et DeepSeek-R1, plus des options de routage Mixture-of-Experts et de décodage spéculatif pour les familles de modèles prises en charge
- Observabilité et benchmarking — un point de terminaison Prometheus
/metricsoptionnel et une commande intégréevllm-mlx bench-servepour exécuter et journaliser des mesures de débit
Exemples d'usage : trois façons d'utiliser vllm-mlx
Voici des workflows concrets bâtis à partir des fonctionnalités documentées de vllm-mlx ci-dessus, avec des commandes issues du README du projet.
Installer vllm-mlx
vllm-mlx s'installe gratuitement via pip ou uv, et son code source est sur GitHub. En tant qu'outil CLI pour développeurs, il n'existe pas d'installateur téléchargeable par OS — l'installation passe toujours par l'outillage de paquets de Python.
Source | Lien |
|---|---|
| Documentation officielle | vllm-mlx.is-a.dev |
| Dépôt GitHub (code source, Apache 2.0) | github.com/waybarrios/vllm-mlx |
| Paquet PyPI | pypi.org/project/vllm-mlx |
| Installation rapide (uv) | uv tool install vllm-mlx |
| Installation rapide (pip) | pip install vllm-mlx |
vllm-mlx nécessite un Mac Apple Silicon (M1, M2, M3, M4 ou M5) sous macOS avec le framework MLX — il ne fonctionne pas sur Mac Intel, Windows ou Linux. Les fonctions audio nécessitent une étape supplémentaire `pip install vllm-mlx[audio] ainsi que brew install espeak-ng` pour la synthèse vocale non anglophone, selon le README du projet.
Tarifs de vllm-mlx : vllm-mlx est-il vraiment gratuit ?
Oui — vllm-mlx n'a aucune offre payante. Il est distribué comme un paquet PyPI gratuit sous licence Apache 2.0, sans compte, clé de licence ni plafond d'usage. Le dépôt GitHub n'a pas de page tarifaire, et ni le README ni la documentation ne décrivent d'édition commerciale ou entreprise.
- Aucun coût pour installer ou exécuter vllm-mlx lui-même —
pip install vllm-mlxconstitue toute la transaction - La licence Apache 2.0 autorise l'usage commercial, la modification et la redistribution, sous réserve des conditions standard de la licence (attribution et conservation de la mention de licence)
- Le seul coût réel est le matériel Mac Apple Silicon nécessaire pour le faire tourner, et l'espace disque pour les modèles téléchargés séparément depuis Hugging Face ou l'organisation
mlx-community - Aucune version cloud hébergée par le développeur, API hébergée ou offre managée n'a été trouvée pour cet avis — vllm-mlx ne fonctionne que sur du matériel que l'on contrôle soi-même
vllm-mlx vs. mlx-lm
vllm-mlx et mlx-lm exécutent tous deux des modèles via le framework MLX d'Apple, mais résolvent des problèmes différents. mlx-lm est la bibliothèque et le CLI Python de plus bas niveau propres à Apple pour exécuter et affiner des modèles MLX une requête à la fois ; vllm-mlx est un serveur de plus haut niveau construit au-dessus de bibliothèques comme mlx-lm, mlx-vlm et mlx-audio (selon son propre schéma d'architecture), qui ajoute les fonctionnalités de serving concurrent pour lesquelles vLLM est connu.
Mainteneur
- vllm-mlx:
- Développeur indépendant (Way Barrios)
- mlx-lm:
- Équipe MLX d'Apple
Cas d'usage principal
- vllm-mlx:
- Serveur API pour requêtes concurrentes
- mlx-lm:
- Bibliothèque de génération et de fine-tuning mono-requête
Batching concurrent
- vllm-mlx:
- Batching continu, cache KV paginé
- mlx-lm:
- Pas un axe central ; généralement une requête à la fois
Surface API
- vllm-mlx:
- Points de terminaison compatibles OpenAI + Anthropic
- mlx-lm:
- API et CLI Python, pas de serveur intégré au format Anthropic
Relation
- vllm-mlx:
- S'appuie en interne sur mlx-lm, mlx-vlm, mlx-audio
- mlx-lm:
- Une dépendance fondamentale sur laquelle d'autres outils MLX s'appuient
Il s'agit d'une comparaison factuelle de fonctionnalités basée sur la documentation propre à chaque projet, et non d'un benchmark réalisé par PromptQuorum. Les deux ne sont pas des concurrents stricts — vllm-mlx dépend de mlx-lm plutôt que de le remplacer.
À qui s'adresse vllm-mlx ?
vllm-mlx convient aux développeurs sur Apple Silicon qui recherchent un serving concurrent de type production plutôt qu'une application de chat mono-utilisateur.
Erreurs courantes en évaluant vllm-mlx
La plupart des confusions autour de vllm-mlx viennent de son nom, qui invite à des suppositions que le projet lui-même ne fait pas.
Concurrents et alternatives
vllm-mlx se situe dans le même segment de serveurs d'inférence Apple Silicon qu'oMLX, Rapid-MLX et mlxcel — tous des projets indépendants qui exécutent des modèles locaux via MLX avec une surface API compatible OpenAI ou similaire, différant surtout par le langage (Python vs. Rust), l'accent mis sur certaines fonctionnalités et la stratégie de cache.
Outil | Connu pour | Lien |
|---|---|---|
| oMLX | Serveur d'inférence Apple Silicon avec cache de prompts sur SSD | Avis oMLX |
| Rapid-MLX | Serveur d'inférence MLX natif axé sur la vitesse de serving | Avis Rapid-MLX |
| mlxcel | Runtime MLX natif Rust pour LLM, VLM, embeddings et audio | Avis mlxcel |
| LoRAX | Serving de milliers d'adaptateurs LoRA depuis un modèle de base sur un seul GPU | Avis LoRAX |
Cette liste reflète des outils couramment comparés dans l'espace des moteurs d'inférence Apple Silicon et de serving d'adaptateurs, et non un classement indépendant de PromptQuorum — vérifiez l'ensemble de fonctionnalités actuel de chaque outil avant de choisir.
Foire aux questions
Qu'est-ce que vllm-mlx ?
vllm-mlx (github.com/waybarrios/vllm-mlx) est un serveur d'inférence gratuit et open source (Apache 2.0) qui exécute des modèles d'IA sur Mac Apple Silicon via MLX natif, en exposant des points de terminaison API compatibles OpenAI et Anthropic.
vllm-mlx est-il identique à vLLM ?
Non. vllm-mlx est un projet indépendant et non officiel qui adapte les concepts de serving de vLLM (batching continu, cache KV paginé) au framework MLX d'Apple. Il n'est affilié ni au projet ni à l'équipe vLLM officiels, et ne contient pas le code source original de vLLM.
vllm-mlx est-il gratuit ?
Oui. Il s'installe gratuitement via pip install vllm-mlx, est sous licence Apache 2.0, et n'a ni offre payante, ni compte, ni plafond d'usage.
Comment installer vllm-mlx ?
Exécutez pip install vllm-mlx ou uv tool install vllm-mlx, selon le README du projet. Un Mac Apple Silicon est requis ; aucun support Windows, Linux ou Mac Intel n'existe.
vllm-mlx fonctionne-t-il avec Claude Code ?
Oui. Le projet documente un support explicite de Claude Code en définissant ANTHROPIC_BASE_URL pour pointer vers le point de terminaison vllm-mlx servi localement, puisqu'il expose un point de terminaison compatible Anthropic /v1/messages.
Quel matériel vllm-mlx nécessite-t-il ?
Un Mac Apple Silicon (M1, M2, M3, M4 ou M5). Il utilise les kernels Metal via MLX et n'a pas de repli CPU seul ni de support GPU non Apple.
Qui a créé vllm-mlx ?
Le développeur indépendant Way Barrios, identifiant GitHub waybarrios. Cet avis n'a trouvé aucune preuve d'entreprise ou de levée de fonds derrière le projet.
vllm-mlx prend-il en charge les modèles vision et audio, ou seulement le texte ?
Il prend en charge les modèles texte, vision (image/vidéo) et audio (synthèse et reconnaissance vocale), plus les embeddings et le reranking, le tout servi depuis le même processus, selon le README du projet.
Qu'est-ce que le batching continu ?
Une technique de serving, popularisée par vLLM, qui traite plusieurs requêtes simultanées ensemble plutôt qu'une par une, améliorant le débit quand un serveur gère plusieurs requêtes à la fois. vllm-mlx adapte ce concept pour MLX sur Apple Silicon.
PromptQuorum a-t-il testé indépendamment les affirmations de benchmark de vllm-mlx ?
Non. Cet avis s'appuie sur le dépôt GitHub, le README et le site de documentation de vllm-mlx, et non sur un benchmarking pratique réalisé par PromptQuorum. Les chiffres de débit dans le README du projet sont auto-déclarés.