Points clés
- Gratuit, open source, licence Apache-2.0, copyright Exo Technologies Ltd, selon le fichier LICENSE du dépôt — vérifié le 12/09/2026
- Découverte automatique des appareils — les appareils exécutant exo sur le même réseau se trouvent sans configuration manuelle, selon le README d'exo
- Mode auto-parallèle tenant compte de la topologie : exo répartit le modèle sur les appareils en fonction d'une vue en temps réel des ressources de chaque appareil et de la latence/bande passante des liaisons réseau
- Parallélisme tensoriel en plus du sharding — jusqu'à 1,8x d'accélération sur 2 appareils et 3,2x sur 4 appareils, selon le README d'exo
- Support du RDMA sur Thunderbolt 5 (macOS 26.2+), décrit par exo comme une réduction de 99 % de la latence entre appareils, selon sa propre documentation
- Utilise MLX, le framework de calcul matriciel d'Apple, comme backend d'inférence et MLX distributed pour la communication entre appareils
- Compatible avec les API OpenAI Chat Completions, OpenAI Responses, Claude Messages et Ollama, si bien que les clients existants peuvent pointer vers un cluster exo sans modification majeure
- 47 375 étoiles GitHub, 3 508 forks, vérifiés via l'API GitHub le 12/09/2026
- macOS (Apple Silicon) est la plateforme principale et testée ; Linux fonctionne aujourd'hui uniquement sur CPU (le support GPU est listé comme « en développement » dans le PLATFORMS.md d'exo) ; Windows n'est actuellement pas pris en charge
📍 En une phrase
exo est un framework gratuit et open source (Apache-2.0) qui regroupe plusieurs Mac Apple Silicon — et, avec un support limité au CPU, des machines Linux — en un cluster d'inférence distribué unique, en utilisant la découverte automatique des appareils et un sharding tenant compte de la topologie pour exécuter des modèles trop volumineux pour un seul appareil.
💬 En termes simples
Plutôt que d'acheter une machine très coûteuse avec assez de mémoire pour charger un énorme modèle, ou de louer du temps de GPU dans le cloud, exo permet de connecter sur le réseau plusieurs Mac (ou machines Linux) déjà possédés pour qu'ils agissent comme un ordinateur plus puissant, en répartissant automatiquement les couches du modèle sur l'ensemble.
📌Remarque: Cette review est le complément de l'entrée d'exo dans l'annuaire des logiciels d'IA locale — consultez cette page pour voir en un coup d'œil comment exo se compare à des dizaines d'autres outils d'IA locale.
Qu'est-ce qu'exo ?
exo est un framework qui connecte plusieurs appareils déjà possédés en un cluster d'inférence IA, afin que des modèles trop volumineux pour la mémoire d'un seul appareil puissent tout de même s'exécuter, en répartissant le modèle sur le groupe. Il est maintenu par exo labs et sa propre description de dépôt tient en une phrase : « Run frontier AI locally. »
- Fonction principale : découverte automatique des appareils plus sharding de modèle tenant compte de la topologie — pointez plusieurs appareils vers le même cluster, exo détermine comment répartir le modèle
- Backend d'inférence : MLX, le framework de calcul matriciel open source d'Apple, utilisé à la fois pour l'exécution du modèle et pour la couche de communication MLX distributed entre appareils
- Modèle de déploiement : depuis les sources (macOS ou Linux), via le gestionnaire de paquets Nix, ou — macOS uniquement — comme application d'arrière-plan installable via Homebrew ou un fichier
.dmgtéléchargeable - Développeur : exo-explore / exo labs sur GitHub ; le fichier LICENSE du dépôt indique Exo Technologies Ltd comme détenteur du copyright
- Dépôt canonique : github.com/exo-explore/exo, créé en juin 2024 selon les métadonnées propres de GitHub, avec un push enregistré le 25/08/2026 au moment de cette review
Installer exo : options de configuration
Le README d'exo documente trois façons de l'exécuter : compiler depuis les sources sous macOS ou Linux, l'exécuter via le gestionnaire de paquets Nix, ou — macOS uniquement — installer une application d'arrière-plan prête à l'emploi. Il n'existe pas de paquet pip install exo ; les installations depuis les sources utilisent uv pour les dépendances Python.
- Cela démarre le tableau de bord exo et l'API compatible OpenAI sur
http://localhost:52415, selon le README d'exo - Sous Linux, les commandes équivalentes utilisent
uv sync --extra mlx-cpu(ou--extra mlx-cuda13/--extra mlx-cuda12le cas échéant) ; le README d'exo indique que sous Linux, exo fonctionne aujourd'hui uniquement sur CPU, le support GPU étant « en développement » - Si Nix est déjà installé,
nix run .#exoévite la plupart des étapes manuelles de configuration des dépendances sous macOS - Sous macOS, exo fournit aussi une application d'arrière-plan prête à l'emploi nécessitant macOS Tahoe 26.2 ou ultérieur — installez-la via
brew install --cask exoou téléchargez directement EXO-latest.dmg, selon la documentation d'exo - Deux options de configuration existent pour les installations depuis les sources, selon le README :
--no-worker(exécuter un nœud coordinateur uniquement, sans inférence locale — utile pour une machine avec une bonne connectivité réseau mais un GPU/mémoire limités) et--legacy-daemon(exécuter en démon d'arrière-plan pour les systèmes d'init plus anciens)
git clone https://github.com/exo-explore/exo
cd exo/dashboard && npm install && npm run build && cd ..
uv sync --extra mlx
uv run exoComment fonctionne réellement le clustering d'exo
Le README d'exo documente quatre mécanismes qui, ensemble, permettent à un groupe d'appareils distincts de se comporter comme un cluster d'inférence unique, sans que vous ayez à décider manuellement quelles couches s'exécutent où.
- Mises en garde d'exo pour le RDMA : chaque appareil du cluster doit être directement relié à tous les autres par des câbles certifiés Thunderbolt 5, et tous les appareils doivent exécuter exactement la même version de macOS, y compris les numéros de build bêta
- Un indicateur
--no-workerpermet à un appareil de rejoindre un cluster en tant que coordinateur uniquement, sans exécuter d'inférence localement — utile pour une machine avec une forte connectivité réseau mais une puissance de calcul limitée - La variable d'environnement
EXO_OFFLINEfait fonctionner un cluster sans connexion Internet, en utilisant uniquement les modèles déjà mis en cache localement
Modèles et plateformes pris en charge
exo charge les modèles depuis le Hugging Face Hub via son backend d'inférence MLX, et le README d'exo ne documente pas de support pour les modèles au format GGUF — ce qui le distingue des outils basés sur llama.cpp comme Ollama ou LM Studio, qui privilégient GGUF.
Performance : ce que montrent les benchmarks
Le README d'exo renvoie vers des benchmarks tiers plutôt que de publier des chiffres propres pour chaque configuration ; PromptQuorum n'a pas reproduit ces tests de manière indépendante et les rapporte ici comme les sources citées par exo lui-même, pas comme des mesures propres à PromptQuorum.
- Le README d'exo montre une capture d'écran du tableau de bord de 4 Mac Studio M3 Ultra de 512 Go exécutant simultanément DeepSeek V3.1 (8 bits) et Kimi-K2-Thinking (4 bits), en illustration de la mutualisation de mémoire permise par exo
- Un benchmark cité du blog de Jeff Geerling couvre Qwen3-235B (8 bits) exécuté sur 4 Mac Studio M3 Ultra avec RDMA en parallélisme tensoriel
- La même source citée couvre aussi DeepSeek V3.1 671B (8 bits) et Kimi K2 Thinking (natif 4 bits) sur la même configuration de cluster à 4 appareils
- Le README d'exo indique les multiplicateurs généraux allant jusqu'à 1,8x (2 appareils) et 3,2x (4 appareils) spécifiquement issus du parallélisme tensoriel, séparément des benchmarks tiers pour grands modèles ci-dessus
Exemples d'usage
Ce sont des workflows construits à partir des fonctionnalités documentées d'exo ci-dessus, pas des cas d'usage hypothétiques.
Pour qui exo est-il fait ?
Le fait qu'exo convienne dépend fortement du matériel déjà possédé et de son appartenance ou non à l'écosystème macOS — le clustering d'exo est d'abord conçu et testé pour Apple Silicon.
exo face aux autres outils d'inférence distribuée
exo se situe dans le segment de l'inférence locale distribuée/en cluster, aux côtés d'autres projets qui répartissent un modèle sur plusieurs machines plutôt que de le servir depuis une seule. Voici comment il se compare — voir l'annuaire des logiciels d'IA locale pour le catalogue complet.
- GPUStack — un gestionnaire de cluster GPU open source (Apache-2.0) qui regroupe des GPU sur Linux, Windows et macOS et peut servir des modèles via Ollama, vLLM ou llama.cpp comme backends ; un gestionnaire de cluster plus large et indépendant du backend, comparé à la conception spécifique MLX et centrée Apple Silicon d'exo. GPUStack a sa propre entrée dans l'annuaire des logiciels d'IA locale de PromptQuorum.
- Le backend RPC de llama.cpp — llama.cpp propose un
ggml-rpc-serverexpérimental qui décharge le calcul vers des hôtes distants pour l'inférence distribuée ; ses propres mainteneurs le qualifient de « proof-of-concept » « fragile and insecure » et déconseillent formellement de l'exposer sur un réseau ouvert, une posture de maturité et de sécurité nettement différente de celle du clustering documenté d'exo. - Petals — un projet de recherche de l'atelier BigScience qui exécute de grands modèles « à la BitTorrent » sur un essaim public de GPU grand public géré par des volontaires, plutôt que sur un cluster privé d'appareils vous appartenant ; un modèle de confiance différent du clustering en réseau local d'exo, orienté vers l'inférence collaborative sur du matériel inconnu plutôt que sur votre propre réseau local.
Erreurs courantes lors de l'évaluation d'exo
La plupart des confusions autour d'exo viennent du fait de le traiter comme une application de chat mono-appareil, ou d'attendre que Linux/Windows égalent les fonctionnalités de macOS.
Questions fréquemment posées
Qu'est-ce qu'exo ?
exo (exolabs.net, code source sur github.com/exo-explore/exo) est un framework open source, sous licence Apache-2.0, qui connecte plusieurs appareils — principalement des Mac Apple Silicon — en un cluster d'inférence IA distribué unique, afin que des modèles trop volumineux pour un seul appareil puissent tout de même s'exécuter en étant répartis sur le groupe.
exo est-il gratuit ?
Oui. exo est open source sous licence Apache-2.0, vérifiée par rapport au fichier LICENSE du dépôt — il n'y a pas de palier payant séparé ni de restriction d'usage au-delà des conditions standard Apache-2.0.
Quelle licence exo utilise-t-il ? A-t-elle changé ?
exo est sous licence Apache License 2.0, copyright Exo Technologies Ltd, selon le fichier LICENSE actuel du dépôt, vérifié directement le 12/09/2026. PromptQuorum n'a trouvé aucune restriction d'usage supplémentaire au-delà du texte standard Apache-2.0 dans le dépôt actuel.
Comment fonctionne réellement le clustering d'exo ?
Selon le README d'exo, les appareils exécutant exo se découvrent automatiquement sur le même réseau, exo construit une vue en temps réel de la mémoire de chaque appareil et des liaisons réseau entre eux, et répartit les couches d'un modèle sur le cluster en conséquence, en ajoutant du parallélisme tensoriel pour une accélération supplémentaire. Sur du matériel macOS pris en charge, il peut en plus utiliser le RDMA sur Thunderbolt 5 pour des liaisons à latence réduite entre appareils.
Quels formats de modèles exo prend-il en charge ?
Le README d'exo documente le chargement de modèles depuis le Hugging Face Hub via son backend d'inférence MLX ; il ne documente pas de support pour les modèles au format GGUF, ce qui le distingue des outils GGUF-first comme llama.cpp ou Ollama.
exo fonctionne-t-il sous Windows ?
Pas actuellement. Le PLATFORMS.md d'exo ne liste le support Windows CUDA et Windows CPU que sous un intitulé de feuille de route « Longer term », séparé de ses plans à court terme.
exo fonctionne-t-il sous Linux ?
Oui, mais uniquement sur CPU aujourd'hui. Le README et le PLATFORMS.md d'exo précisent explicitement que le support GPU pour Linux (CUDA et Vulkan) est en développement et non encore livré, au moment de cette review.
Comment installer exo ?
Compilez depuis les sources avec git clone https://github.com/exo-explore/exo, construisez le tableau de bord, exécutez uv sync --extra mlx (macOS) ou uv sync --extra mlx-cpu (Linux), puis uv run exo. Sous macOS, vous pouvez aussi installer une application d'arrière-plan prête à l'emploi via brew install --cask exo ou en téléchargeant EXO-latest.dmg — nécessite macOS Tahoe 26.2 ou ultérieur.
Combien d'étoiles GitHub exo a-t-il ?
exo comptait 47 375 étoiles et 3 508 forks sur GitHub, vérifiés via l'API GitHub le 12/09/2026. Consultez le dépôt en direct pour le chiffre actuel, car le nombre d'étoiles change continuellement.
Qui développe exo ?
exo est développé par exo-explore / exo labs sur GitHub ; le fichier LICENSE du dépôt indique Exo Technologies Ltd comme détenteur du copyright. Le dépôt a été créé en juin 2024, selon les métadonnées propres de GitHub.
