Points clés
- SwiftLM (github.com/SharpAI/SwiftLM) est un serveur d'inférence gratuit, open source et natif en Swift pour les modèles MLX — ni un IDE, ni un paquet Python
- Sous licence MIT, confirmé via les métadonnées de licence du dépôt GitHub
- macOS 14.0+ sur Apple Silicon (M1 à M5) uniquement, selon la section Requirements du dépôt lui-même — aucune prise en charge de Windows, Linux ou Mac Intel
- Développé par SharpAI, une organisation de la Silicon Valley dont la bio GitHub décrit l'activité principale comme l'application du machine learning aux caméras de vidéosurveillance CCTV/NVR traditionnelles
- Sert une API strictement compatible OpenAI (
/v1/chat/completions,/v1/models,/health), de sorte que le code client OpenAI existant peut s'y connecter directement - Prend en charge les modèles vision-langage (via
--vision) et, pour certaines variantes de Gemma-4, l'entrée audio-langage (via--audio) - Inclut le streaming d'experts depuis SSD pour les modèles Mixture-of-Experts surdimensionnés et la compression du cache KV TurboQuant pour l'inférence à contexte long
- Inclut SwiftBuddy, une application compagnon iOS/iPadOS gratuite et open source qui télécharge des modèles MLX depuis HuggingFace et les exécute sur l'appareil
- 768 étoiles GitHub et 53 forks au moment de cette revue (18/09/2026) ; dépôt créé le 21 mars 2026, avec des versions publiées environ tous les 1 à 2 jours dans les semaines précédant cette revue
📍 En une phrase
SwiftLM est un serveur d'inférence natif en Swift, gratuit et open source (MIT), pour Apple Silicon, qui sert des modèles MLX via une API strictement compatible OpenAI sans runtime Python, et fournit une application compagnon iOS/iPadOS nommée SwiftBuddy.
💬 En termes simples
SwiftLM est un programme en ligne de commande que l'on exécute sur un Mac Apple Silicon, qui charge un modèle d'IA et permet à d'autres applications de lui parler comme elles parleraient aux serveurs d'OpenAI — sauf que tout tourne sur votre propre machine, compilé directement en code Metal natif au lieu de passer par Python. Une application compagnon pour iPhone/iPad, SwiftBuddy, fait quelque chose de similaire directement sur votre téléphone.
📌Remarque: Cette revue est le complément détaillé de l'entrée de SwiftLM dans l'Annuaire des logiciels LLM locaux — voir cette page pour comparer SwiftLM en un coup d'œil à des dizaines d'autres outils d'IA locale. Elle s'appuie sur le dépôt GitHub, le README et l'historique des versions de SwiftLM lui-même, pas sur un benchmark indépendant de PromptQuorum des chiffres de performance publiés par SharpAI.
Qu'est-ce que SwiftLM ?
SwiftLM est un serveur d'inférence, écrit entièrement en Swift, qui charge des modèles d'IA au format MLX et les sert via une API HTTP strictement compatible OpenAI — une alternative native aux serveurs basés sur Python comme mlx-lm. Sa propre description GitHub le résume comme « Native MLX Swift LLM inference server for Apple Silicon », et il se compile en un seul binaire autonome plutôt que de nécessiter un environnement Python, un gestionnaire d'environnement virtuel ou un installateur de paquets.
- Fonction principale : un serveur HTTP local qui charge un modèle MLX à la fois et l'expose via des points de terminaison de complétion de chat compatibles OpenAI
- Langage d'implémentation : Swift, compilé avec des noyaux Metal pour le calcul GPU — pas de Python, et pas de Global Interpreter Lock (GIL) pour freiner les requêtes concurrentes
- Développeur : SharpAI, une organisation basée dans la Silicon Valley, présente sur GitHub depuis février 2018, dont la propre bio décrit son activité principale comme l'apport du machine learning aux caméras de vidéosurveillance CCTV/NVR traditionnelles
- Framework sous-jacent : le framework de tableaux MLX d'Apple, via des forks personnalisés (
SharpAI/mlx,SharpAI/mlx-c) qui ajoutent une exécution hors mémoire vive (out-of-core), mappée en mémoire, que SharpAI indique ne pas encore être disponible dans les dépôts officielsml-explore - Licence : MIT, confirmée via les métadonnées de licence du dépôt
- Échelle : 768 étoiles GitHub, 53 forks et 12 contributeurs au moment de cette revue
Qui développe SwiftLM, et à quelle vitesse évolue-t-il ?
SwiftLM est un projet jeune et évoluant rapidement : son dépôt GitHub a été créé le 21 mars 2026, et à la date de publication de cette revue, il avait publié des versions taguées environ tous les un à deux jours au cours des semaines précédentes.
- Dépôt créé : 21 mars 2026 — environ six mois au moment de cette revue
- Cadence de publication récente : les versions taguées b703 à b711 sont sorties entre le 27 août 2026 et le 5 septembre 2026, soit en moyenne environ une version tous les 1,4 jours sur cette période
- Organisation : SharpAI, créée sur GitHub en février 2018, basée dans la Silicon Valley selon son profil GitHub
- Activité principale : selon la propre bio GitHub de SharpAI, l'organisation se concentre principalement sur « l'apport de technologies de machine learning aux caméras CCTV/NVR et de vidéosurveillance traditionnelles » — SwiftLM lui-même n'est pas un produit de vidéosurveillance, mais un serveur d'inférence généraliste que SharpAI a mis en open source
- Contributeurs : 12 au moment de cette revue, incluant un travail d'ingénierie crédité sur le streaming d'experts depuis SSD et la compression du cache KV TurboQuant
- Forks MLX personnalisés : SharpAI maintient
SharpAI/mlxetSharpAI/mlx-c, des forks du framework MLX officiel d'Apple, pour prendre en charge une exécution hors mémoire vive mappée en mémoire que le README indique ne pas encore être disponible en amont
Que peut-on faire avec SwiftLM ?
L'ensemble de fonctionnalités de SwiftLM est centré sur le service de modèles MLX aussi rapidement et efficacement en mémoire que possible sur Apple Silicon, avec plusieurs fonctionnalités visant spécifiquement à exécuter des modèles trop volumineux pour tenir confortablement dans la mémoire unifiée. Voici ce que fait chaque partie, selon le propre README GitHub de SwiftLM.
- Service compatible OpenAI — expose les points de terminaison
/v1/chat/completions,/v1/modelset/health, de sorte que les SDK et outils clients OpenAI existants peuvent pointer vers SwiftLM comme backend local de substitution - Large prise en charge des familles de modèles — le README répertorie une prise en charge native de plus de 30 familles de modèles, dont Gemma 4/3, Qwen 3.5/3/2.5, Llama 3.x, Mistral/Mixtral, Phi 4/3, DeepSeek V3, GLM 4, Falcon H1, et plusieurs familles de recherche plus petites
- Modèles vision-langage (VLM) — exécutés avec le drapeau
--vision, prenant en charge l'analyse d'images en base64 en temps réel pour des modèles tels que Qwen2-VL, Qwen2.5-VL et PaliGemma - Modèles audio-langage (ALM) — exécutés avec le drapeau
--audiopour certaines variantes « Omni » de Gemma-4, décodant les charges utilesinput_audioau format OpenAI via l'extraction WAV d'AVFoundation - Compression du cache KV TurboQuant — un schéma de quantification personnalisé, non linéaire (codebook Lloyd-Max), de classe 3 bits, pour le cache KV d'attention, que les propres benchmarks de SharpAI annoncent environ 3,5 fois plus compact que le FP16 avec une perte de précision quasi nulle, activé avec
--turbo-kv - Streaming d'experts depuis SSD — pour les modèles Mixture-of-Experts, diffuse les couches d'experts inactives depuis un SSD NVMe au lieu de nécessiter le modèle complet en RAM, activé avec
--stream-experts; les propres tests de SharpAI couvrent des modèles aussi volumineux que 69,6 Go (Qwen3.5-122B-A10B) et 209 Go (Qwen3.5-397B-A22B) sur un Mac de 64 Go - Décodage spéculatif et prédiction multi-jetons (MTP) — accélère l'inférence en RAM soit via un petit modèle brouillon séparé (
--draft-model), soit, pour les modèles disposant de têtes MTP natives comme la famille Qwen3, sans en avoir besoin du tout - Contrôle mémoire granulaire — des drapeaux comme
--gpu-layerset--prefill-sizepermettent d'ajuster la part d'un modèle placée sur le GPU et la manière dont les prompts sont découpés pendant le préremplissage
Exemples d'utilisation : trois façons d'utiliser SwiftLM
Voici des flux de travail concrets construits à partir des drapeaux et points de terminaison documentés de SwiftLM ci-dessus — pas des cas d'usage hypothétiques.
Installer SwiftLM
SwiftLM s'installe gratuitement, soit sous forme de binaire macOS précompilé, soit compilé depuis les sources, et son code source — ainsi que celui de l'application iOS SwiftBuddy — est sur GitHub.
Source | Lien |
|---|---|
| Dépôt GitHub (code source, licence MIT) | github.com/SharpAI/SwiftLM |
| Binaire macOS arm64 précompilé | Page Releases |
Compilation depuis les sources (./build.sh) | Instructions Build from Source |
| Code source de l'app SwiftBuddy iOS/iPadOS (compilation dans Xcode) | Répertoire SwiftBuddy |
| Modèles au format MLX | huggingface.co/mlx-community |
Selon la propre section Requirements du dépôt, SwiftLM nécessite macOS 14.0+ sur Apple Silicon (M1–M5), les outils en ligne de commande Xcode, et le Metal Toolchain (installable via xcodebuild -downloadComponent MetalToolchain). SwiftBuddy n'est pas distribué via l'App Store au moment de cette revue — le compiler nécessite Xcode et votre propre compte Apple Developer, car son fichier .xcodeproj est exclu de git et régénéré localement via generate_xcodeproj.py.
Tarifs et licence de SwiftLM
SwiftLM est gratuit, sans aucune offre payante. SwiftLM et son application compagnon SwiftBuddy sont tous deux sous licence MIT, confirmée via les métadonnées de licence du dépôt GitHub — une licence open source permissive sans obligation d'attribution au-delà du maintien de la mention de copyright, et sans obligation de copyleft.
- Aucun abonnement, aucune offre payante, aucune limite d'usage imposée par SwiftLM lui-même
- Aucun compte ni inscription requis pour exécuter le serveur ou l'application SwiftBuddy
- La licence MIT s'applique à l'ensemble du dépôt, y compris SwiftBuddy, selon les métadonnées de licence du dépôt GitHub
- Le seul coût réel est le matériel : SwiftLM nécessite un Mac Apple Silicon exécutant macOS 14.0 ou ultérieur — il ne fonctionne ni sur Mac Intel, ni sur Windows, ni sur Linux
SwiftLM contre Ollama
SwiftLM et Ollama exécutent tous deux des modèles à poids ouverts localement derrière une API compatible OpenAI, mais ils visent des priorités différentes — Ollama optimise pour une large compatibilité matérielle et un vaste écosystème existant, tandis que SwiftLM optimise étroitement pour des performances maximales sur Apple Silicon et l'efficacité en contexte long.
Aspect | SwiftLM | Ollama |
|---|---|---|
| Moteur | Swift natif, compilé en Metal via MLX | Wrapper Go autour d'un cœur C++ llama.cpp/GGML |
| Plateformes | macOS 14+, Apple Silicon uniquement, plus une app iOS | macOS, Windows, Linux, Docker ; Intel et Apple Silicon |
| Dépendance runtime | Aucune — un seul binaire natif, pas de Python | Aucune — également un seul binaire natif, pas de Python |
| Format de modèle | HuggingFace safetensors via MLX (builds mlx-community) | GGUF via sa propre bibliothèque de modèles et système Modelfile |
| Compression KV contexte long | TurboQuant, ~3,5x plus compact que FP16 (--turbo-kv) | Aucun drapeau de compression KV dédié au moment de cette revue |
| Modèles MoE surdimensionnés | Le streaming SSD exécute des MoE de 100 Md+ au-delà de la RAM | S'appuie sur le mappage mémoire standard de l'OS, sans mode de streaming dédié |
| Maturité | 768 étoiles GitHub, dépôt créé en mars 2026 | Projet établi avec une base d'installation et un écosystème bien plus vastes |
Cette comparaison reflète des fonctionnalités documentées publiquement sur le propre dépôt GitHub de chaque projet, pas un benchmark indépendant de PromptQuorum du débit réel de l'un ou l'autre outil. Si vous avez besoin d'une prise en charge multiplateforme (Windows ou Linux) ou du plus vaste écosystème d'intégrations existant, Ollama est le choix le plus établi ; si vous êtes exclusivement sur Apple Silicon et voulez tirer parti de performances natives en Swift et d'économies de mémoire en contexte long, SwiftLM mérite d'être évalué directement.
À qui SwiftLM convient-il ?
Que SwiftLM vous convienne dépend fortement de votre matériel — il est exclusif à Apple Silicon — et de l'importance que vous accordez aux performances natives en Swift et à l'efficacité mémoire en contexte long par rapport à la maturité de l'écosystème.
Concurrents et alternatives
SwiftLM se situe dans un petit champ, mais en croissance, de serveurs d'inférence MLX natifs et sans Python pour Apple Silicon — voici comment il se compare à d'autres outils du même segment, ainsi qu'à l'implémentation de référence en Python à laquelle il se positionne face.
Outil | Connu pour | Lien |
|---|---|---|
| — | — | — |
| — | — | — |
| — | — | — |
| — | — | — |
Ceci n'est pas une liste exhaustive des outils d'inférence pour Apple Silicon — consultez l'Annuaire des logiciels LLM locaux pour le catalogue complet et régulièrement mis à jour, incluant l'entrée propre à SwiftLM dans l'annuaire.
Erreurs courantes en évaluant SwiftLM
La plupart des confusions autour de SwiftLM viennent du fait de le confondre avec des projets sans rapport portant un nom similaire, ou de supposer qu'il fonctionne sur du matériel qu'il ne prend explicitement pas en charge.
Questions fréquemment posées
Qu'est-ce que SwiftLM ?
SwiftLM (github.com/SharpAI/SwiftLM) est un serveur d'inférence gratuit, open source (MIT) et natif en Swift qui exécute des modèles d'IA au format MLX sur des Mac Apple Silicon via une API strictement compatible OpenAI, sans runtime Python requis.
SwiftLM est-il gratuit ?
Oui. SwiftLM et son application compagnon SwiftBuddy sont tous deux gratuits et sous licence MIT, confirmée via les métadonnées de licence du dépôt GitHub. Il n'y a ni page tarifaire, ni compte, ni offre payante.
Quelles sont les exigences système pour SwiftLM ?
Selon la propre section Requirements du dépôt : macOS 14.0 ou ultérieur, un Mac Apple Silicon (M1 à M5), les outils en ligne de commande Xcode, et le Metal Toolchain. Il n'existe aucune version Windows, Linux ou Mac Intel.
Comment installer SwiftLM ?
Téléchargez un binaire macOS arm64 précompilé depuis la page GitHub Releases du projet et exécutez-le directement, ou clonez le dépôt et exécutez ./build.sh pour compiler depuis les sources, selon le README officiel.
Qu'est-ce que SwiftBuddy ?
SwiftBuddy est l'application compagnon gratuite et open source de SwiftLM pour iPhone et iPad, qui télécharge des modèles MLX depuis HuggingFace et les exécute directement sur l'appareil via MLX Swift. Son code source vit à l'intérieur du dépôt SwiftLM ; elle se compile et s'exécute via Xcode plutôt que d'être distribuée sur l'App Store, au moment de cette revue.
SwiftLM prend-il en charge l'entrée visuelle ou audio ?
Oui. Lancer SwiftLM avec le drapeau --vision active les modèles vision-langage tels que Qwen2-VL et PaliGemma, et le drapeau --audio active l'entrée audio pour certaines variantes « Omni » de Gemma-4, selon le README officiel.
Qu'est-ce que TurboQuant ?
TurboQuant est le schéma de compression du cache KV personnalisé de SwiftLM, combinant des codebooks non linéaires Lloyd-Max avec une implémentation Metal accélérée matériellement. Les propres benchmarks de SharpAI indiquent qu'il compresse le cache KV à environ 3,5 fois plus compact que le FP16, avec une perte de précision quasi nulle, activé avec le drapeau --turbo-kv.
Qu'est-ce que le streaming d'experts depuis SSD ?
C'est une fonctionnalité qui diffuse les couches Mixture-of-Experts inactives directement depuis un SSD NVMe vers le GPU au lieu de nécessiter le modèle complet en mémoire unifiée, activée avec --stream-experts. Les propres tests de SharpAI couvrent des modèles aussi volumineux que 209 Go s'exécutant sur un Mac de 64 Go.
Qui développe SwiftLM ?
SwiftLM est développé par SharpAI, une organisation basée dans la Silicon Valley, présente sur GitHub depuis 2018, dont l'activité principale déclarée est l'application du machine learning aux systèmes de vidéosurveillance CCTV/NVR. SwiftLM est un serveur d'inférence généraliste que l'organisation a mis en open source séparément de cette activité principale.
Comment SwiftLM se compare-t-il à Ollama ?
Les deux servent des modèles locaux derrière une API compatible OpenAI, mais Ollama prend en charge macOS, Windows et Linux avec un écosystème bien plus vaste, tandis que SwiftLM est exclusif à Apple Silicon et ajoute des fonctionnalités natives MLX comme la compression KV TurboQuant et le streaming d'experts depuis SSD pour les modèles MoE surdimensionnés. Voir la comparaison dédiée SwiftLM contre Ollama ci-dessus.
PromptQuorum a-t-il testé indépendamment les affirmations de performance de SwiftLM ?
Cette revue s'appuie sur le dépôt GitHub, le README et l'historique des versions de SwiftLM lui-même, pas sur un benchmark indépendant de PromptQuorum des chiffres de performance publiés par SharpAI.