Points clés
- Shimmy (github.com/Michael-A-Kuykendall/shimmy) est un serveur d'inférence gratuit, open source, en un seul binaire, pas un IDE ni une app de chat
- Créé et maintenu par Michael A. Kuykendall en tant que projet géré de façon indépendante — son propre README indique « free forever » (gratuit pour toujours), sans preuve d'une entreprise ou d'un tour de financement derrière
- Sous licence Apache-2.0, selon le fichier LICENSE du dépôt lui-même
- Fonctionne sur Airframe, son propre moteur transformer WebGPU (WGSL) 100 % Rust, évitant ainsi entièrement une chaîne d'outils C++ ou une dépendance à llama.cpp
- Sert des modèles GGUF et SafeTensors via une API compatible OpenAI ; la version v2.6.2 a ajouté des routes compatibles Ollama et Anthropic
- 5 890 étoiles GitHub au moment de cette review (github.com/Michael-A-Kuykendall/shimmy, vérifié via l'API GitHub)
📍 En une phrase
Shimmy est un serveur d'inférence local gratuit, open source, en un seul binaire, entièrement écrit en Rust — une alternative légère et sans dépendances à Ollama — qui sert des modèles GGUF et SafeTensors via une API compatible OpenAI, sans runtime Python, sans chaîne d'outils C++ et sans dépendance à llama.cpp, selon le propre README du projet.
💬 En termes simples
Plutôt que d'installer le paquet de plusieurs centaines de mégaoctets d'Ollama, Shimmy est un seul petit fichier exécutable (quelques mégaoctets) que vous téléchargez ou compilez avec Cargo, que vous pointez vers un fichier de modèle GGUF sur votre disque, puis exécutez. Tout outil qui parle déjà le format de l'API OpenAI peut communiquer avec Shimmy à la place, sans modification de code.
📌Remarque: Cette review est le complément approfondi de l'entrée de Shimmy dans le Local LLM Software Directory — consultez cette page pour comparer Shimmy en un coup d'œil à des dizaines d'autres outils d'IA locale. Elle s'appuie sur le README, le changelog et les notes de version de Shimmy, pas sur un benchmark pratique réalisé par PromptQuorum.
Qu'est-ce que Shimmy ?
Shimmy est un serveur d'inférence en ligne de commande : un binaire unique qui charge un fichier de modèle GGUF ou SafeTensors local et l'expose via une API HTTP compatible OpenAI. Sa propre description GitHub le qualifie de « pure-Rust WebGPU inference engine — OpenAI-API compatible, GGUF native, runs on any GPU. No Python. No llama.cpp. Single binary. »
- Type de produit : un serveur en ligne de commande, en un seul binaire — ni application graphique, ni extension IDE
- Créateur : Michael A. Kuykendall, développeur indépendant ; cette review n'a trouvé aucune preuve d'une entreprise, d'un investisseur ou d'un tour de financement derrière le projet
- Dépôt : github.com/Michael-A-Kuykendall/shimmy
- Licence : Apache-2.0, confirmée via le fichier LICENSE du dépôt lui-même
- Ampleur : 5 890 étoiles GitHub au moment de cette review, selon l'API GitHub
- Moteur : Airframe, un moteur transformer WebGPU (WGSL) 100 % Rust, auquel le propre README de Shimmy attribue le fait d'éviter entièrement une chaîne d'outils C++
Historique du projet et jalons de versions
Shimmy publie des versions fréquentes et incrémentales, son propre CHANGELOG documentant près de 200 commits et un rythme régulier de versions mineures tout au long de 2026, centrées sur son pipeline de certification de modèles auto-publié et son moteur d'inférence Airframe.
- 1v2.5.0 — 6 août 2026 : moteur Airframe mis à jour vers 0.3.0
Why it matters: Mise à jour du moteur transformer WebGPU 100 % Rust sous-jacent sur lequel Shimmy fonctionne. - 2v2.6.0 — 27 août 2026 : pipeline de certification consolidé
Why it matters: Consolidation de la certification de modèles auto-publiée de Shimmy en un protocole « 3-box » MATH + INFERENCE + DETERMINISM, certifiant 26 combinaisons modèle/quantification à travers 12 familles de modèles, et suppression d'environ 1 600 lignes de code moteur hérité. - 3v2.6.1 — 28 août 2026 : templating de chat unifié
Why it matters: Regroupement de tout le formatage des prompts via un module partagé prompt_render utilisant de vrais templates de chat GGUF via Jinja, et retrait d'un chemin de code de serveur GPU hérité (environ 1 847 lignes supprimées). - 4v2.6.2 — 28 août 2026 : documentation OpenAPI et routes compatibles supplémentaires
Why it matters: Ajout d'un contrat d'API lisible par machine (`GET /openapi.json`) et d'une interface Swagger interactive (`GET /docs`), ainsi que de routes compatibles Ollama et Anthropic en plus de l'API compatible OpenAI existante. - 5v2.6.3 — 29 août 2026 : correctif de chargement de modèle sur GPU intégré
Why it matters: Correction du chargement de modèle sur les GPU intégrés, y compris un correctif spécifique pour les GPU Intel Arc, en mettant à jour la dépendance au moteur Airframe vers la version 0.4.2. - 6v2.6.4 — 30 août 2026 : dernière version mineure au moment de cette review
Why it matters: La version taguée la plus récente trouvée sur la page des releases GitHub du projet au moment de cette review — consultez directement [github.com/Michael-A-Kuykendall/shimmy/releases](https://github.com/Michael-A-Kuykendall/shimmy/releases) pour tout ce qui a été publié après la date de publication de cette review.
Que fait réellement Shimmy ?
L'ensemble des fonctionnalités de Shimmy se concentre sur le service de modèles locaux via une surface d'API familière, tout en gardant le binaire lui-même minimal et sans dépendances, selon le propre README de Shimmy.
- Chargement de modèle natif GGUF — charge directement les fichiers de modèle GGUF, sans recompilation ni constantes codées en dur par modèle, selon la propre documentation du projet ; le format SafeTensors est également pris en charge
- API compatible OpenAI — chat completions, text completions, réponses en streaming et endpoints de listing des modèles correspondant au format de l'API OpenAI, afin que le code client OpenAI existant et les outils puissent pointer vers Shimmy sans modification
- Routes compatibles supplémentaires — depuis la v2.6.2, Shimmy expose aussi des routes compatibles Ollama et Anthropic en plus de son API compatible OpenAI
- Certification de modèles auto-publiée — un protocole de test « 3-box » (MATH, INFERENCE, DETERMINISM) que Shimmy exécute sur les modèles pris en charge ; le projet indique que 26 combinaisons modèle/quantification à travers 12 familles de modèles réussissent ce protocole au moment de cette review
- Compression du cache KV INT4 TurboShimmy — la propre documentation de Shimmy décrit une utilisation mémoire du cache KV environ 7 fois plus faible dans les configurations testées, destinée à permettre des fenêtres de contexte plus larges ou des GPU plus modestes pour un modèle donné
- Contexte étendu via le scaling YaRN RoPE — configurable via des variables d'environnement, selon la documentation du projet
- Aucune dépendance d'inférence externe — Shimmy fonctionne sur Airframe, son propre moteur WebGPU 100 % Rust, plutôt que d'encapsuler llama.cpp ou de nécessiter une chaîne d'outils Python/CUDA
Exemples d'utilisation : trois façons d'utiliser Shimmy
Il s'agit de workflows concrets construits à partir des fonctionnalités documentées de Shimmy ci-dessus — pas de cas d'usage hypothétiques.
Installer Shimmy
Shimmy s'installe comme un binaire Rust — via Cargo, un téléchargement de version précompilée, ou Docker.
Source | Lien |
|---|---|
| Commande d'installation Cargo | cargo install shimmy |
| Dépôt GitHub (code source, Apache-2.0) | github.com/Michael-A-Kuykendall/shimmy |
| Binaires de version précompilés | github.com/Michael-A-Kuykendall/shimmy/releases |
| Fiche du paquet crates.io | lib.rs/crates/shimmy |
Après l'installation, exécutez shimmy serve --model-path /absolute/path/to/model.gguf --bind 127.0.0.1:11435 (selon le propre README du projet) pour commencer à servir un modèle local. Un Dockerfile et une configuration Docker Compose sont également disponibles dans le dépôt pour un déploiement basé sur des conteneurs. Vérifiez les instructions d'installation actuelles sur le dépôt GitHub avant d'exécuter une commande, car les étapes d'installation peuvent changer d'une version à l'autre.
Plateforme, tarification et licence
Plateforme
- Ce que Shimmy indique:
- Un serveur en ligne de commande, en un seul binaire — fonctionne sur macOS, Windows et Linux ; aucun installeur graphique.
Coût
- Ce que Shimmy indique:
- Gratuit et open source. Le propre README du projet indique « Shimmy will be free forever » (gratuit pour toujours). Aucun palier payant n'existe.
Licence
- Ce que Shimmy indique:
- Apache-2.0, confirmée via le fichier LICENSE du dépôt lui-même.
Financement
- Ce que Shimmy indique:
- Maintenu de façon indépendante par Michael A. Kuykendall ; le dépôt liste un programme de sponsoring volontaire (d'un palier à 5 $/mois jusqu'à un palier partenaire infrastructure à 500 $/mois), pas un tour de financement ni une entreprise.
Vérifiez le statut actuel de licence et de financement directement sur github.com/Michael-A-Kuykendall/shimmy avant de vous appuyer sur ce tableau pour une décision de conformité ou de risque fournisseur.
Shimmy vs. Ollama
Shimmy se positionne directement face à Ollama, son propre README se qualifiant de « the 5MB alternative to Ollama ». Les deux servent des modèles locaux via des API HTTP similaires ; la différence tient principalement à la taille du binaire, à l'empreinte des dépendances et au moteur d'inférence de chaque projet.
Taille du binaire
- Shimmy:
- Quelques Mo, selon la revendication du propre README de Shimmy
- Ollama:
- Plusieurs centaines de Mo, selon des comparatifs tiers
Moteur d'inférence
- Shimmy:
- Airframe — son propre moteur WebGPU (WGSL) 100 % Rust
- Ollama:
- Construit sur llama.cpp
Dépendances runtime
- Shimmy:
- Aucune — ni Python, ni chaîne d'outils C++, selon son README
- Ollama:
- Embarque son propre runtime ; aucun Python séparé requis non plus
Compatibilité API
- Shimmy:
- Compatible OpenAI, plus des routes compatibles Ollama et Anthropic (v2.6.2+)
- Ollama:
- Dispose de sa propre API native plus une couche compatible OpenAI
Format de modèle
- Shimmy:
- GGUF et SafeTensors
- Ollama:
- Basé sur GGUF, via sa propre bibliothèque de modèles et le format Modelfile
Mainteneur
- Shimmy:
- Développeur indépendant solo
- Ollama:
- Ollama Inc., une entreprise financée
Si la taille du binaire, le temps de démarrage à froid, ou le fait d'éviter spécifiquement llama.cpp sont les facteurs décisifs, Shimmy est conçu pour gagner précisément sur ces axes, selon son propre positionnement. Si vous voulez la plus grande bibliothèque de modèles existante, de l'outillage communautaire, et une entreprise financée derrière la maintenance à long terme, le parcours d'Ollama est plus établi — voir la Ollama Review pour une analyse complète. Vérifiez vous-même les benchmarks actuels plutôt que de vous fier au marketing de l'un ou l'autre projet.
À qui s'adresse Shimmy ?
Shimmy convient aux développeurs qui veulent spécifiquement un serveur d'inférence à empreinte minimale et sans dépendances, et qui sont à l'aise avec un projet encore jeune, géré par une seule personne.
Concurrents et alternatives
Parmi les serveurs d'inférence locale légers, Shimmy est le plus directement comparable à Ollama et llama.cpp — le moteur sur lequel s'appuient la plupart des outils locaux, y compris Ollama — ainsi qu'à LMDeploy pour les équipes évaluant des options de serving à plus haut débit.
Ollama
- Connu pour:
- Le runtime LLM local en une commande le plus largement adopté, soutenu par une entreprise financée
- Lien:
- Ollama Review
Articles sur Ollama (10)
- Ollama Review 2026: The One-Command Local LLM RuntimeMis à jour 12 septembre 2026
- Cherry Studio 2.0 in 2026: The Free Agent-Based AI Desktop AppMis à jour 20 septembre 2026
- AutoGPT Review 2026: Classic Agent vs. Hosted PlatformMis à jour 20 septembre 2026
- KoboldCpp Review 2026: One File, No Install, Built for RoleplayMis à jour 20 septembre 2026
- llama.cpp Explained: The Engine Powering Ollama (2026)Mis à jour 20 septembre 2026
- Nanobot Review: A Self-Hosted AI Agent Framework in 2026Mis à jour 20 septembre 2026
- Baserow Review 2026: A No-Code Database With a Local-AI FieldMis à jour 19 septembre 2026
- Farfalle Review: A Self-Hosted, Open-Source AI Search EngineMis à jour 19 septembre 2026
- little-coder Review: A Coding Agent CLI Built for Small Local ModelsMis à jour 19 septembre 2026
- Local Deep Research Review 2026: Self-Hosted, Cited AI Research AgentMis à jour 19 septembre 2026
+273 autres non affichés
llama.cpp
- Connu pour:
- Le moteur d'inférence C/C++ sur lequel Ollama et de nombreux autres outils sont construits
- Lien:
- llama.cpp Explained
Articles sur llama.cpp (10)
- llama.cpp Explained: The Engine Powering Ollama (2026)Mis à jour 20 septembre 2026
- KoboldCpp Review 2026: One File, No Install, Built for RoleplayMis à jour 20 septembre 2026
- little-coder Review: A Coding Agent CLI Built for Small Local ModelsMis à jour 19 septembre 2026
- Local Deep Research Review 2026: Self-Hosted, Cited AI Research AgentMis à jour 19 septembre 2026
- mlx-serve Review 2026: Native Zig Inference Server for Apple SiliconMis à jour 19 septembre 2026
- mlxcel Review: Rust-Native MLX Inference RuntimeMis à jour 19 septembre 2026
- Parlor Review: On-Device Real-Time Voice and Vision AIMis à jour 19 septembre 2026
- Rapid-MLX Review: Native MLX Inference Server for Apple SiliconMis à jour 19 septembre 2026
- Shimmy Review 2026: A 5MB Rust Alternative to OllamaMis à jour 19 septembre 2026
- Sidekick Review 2026: A Free, Native macOS Local AI Chat AppMis à jour 19 septembre 2026
+140 autres non affichés
LMDeploy
- Connu pour:
- Serving LLM à haut débit et quantification, destiné aux charges de production
- Lien:
- LMDeploy Review
Articles sur LMDeploy (1)
- LMDeploy Review: High-Throughput LLM Serving and QuantizationMis à jour 19 septembre 2026
Également mentionné dans :
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingMis à jour 19 septembre 2026
- LoRAX Review: Serving Thousands of LoRA Adapters on One GPUMis à jour 19 septembre 2026
- Shimmy Review 2026: A 5MB Rust Alternative to OllamaMis à jour 19 septembre 2026
- TurboFieldfare Review: Running Gemma 4 26B-A4B in 2 GB of RAMMis à jour 19 septembre 2026
Ceci n'est pas une liste exhaustive des serveurs d'inférence locale — consultez le Local LLM Software Directory pour le catalogue complet, régulièrement mis à jour, incluant la propre fiche de Shimmy dans ce répertoire.
Erreurs courantes lors de l'évaluation de Shimmy
La plupart des confusions autour de Shimmy viennent du fait de le confondre avec des projets homonymes sans rapport, ou de supposer qu'il a l'ampleur de la bibliothèque de modèles d'Ollama.
Questions fréquemment posées
Qu'est-ce que Shimmy ?
Shimmy (github.com/Michael-A-Kuykendall/shimmy) est un serveur d'inférence gratuit, open source, en un seul binaire, entièrement écrit en Rust, qui sert des modèles GGUF et SafeTensors locaux via une API compatible OpenAI.
Shimmy est-il gratuit ?
Oui. Shimmy est gratuit et open source sous licence Apache-2.0. Son propre README indique « Shimmy will be free forever » (gratuit pour toujours), sans palier payant.
Comment installer Shimmy ?
La méthode la plus simple, selon le propre README du projet, est cargo install shimmy. Des binaires de version précompilés et une configuration Docker sont également disponibles sur le dépôt GitHub.
En quoi Shimmy diffère-t-il d'Ollama ?
Le propre README de Shimmy le décrit comme « the 5MB alternative to Ollama » — un binaire beaucoup plus petit, sans runtime Python ni chaîne d'outils C++, fonctionnant sur son propre moteur Airframe plutôt que sur llama.cpp. Ollama dispose d'une bibliothèque de modèles plus grande et plus établie et est soutenu par une entreprise financée ; Shimmy est maintenu par un seul développeur indépendant.
Shimmy utilise-t-il llama.cpp ?
Non. Shimmy fonctionne sur Airframe, son propre moteur transformer WebGPU (WGSL) 100 % Rust, ce qui, selon le projet, lui permet d'éviter entièrement une dépendance à llama.cpp ou à une chaîne d'outils C++.
Quels formats de modèle Shimmy prend-il en charge ?
GGUF et SafeTensors, selon la propre documentation du projet. Shimmy charge les fichiers GGUF directement, sans recompilation ni constantes codées en dur par modèle.
L'API de Shimmy est-elle compatible avec les outils OpenAI ?
Oui. Shimmy expose une API compatible OpenAI (chat completions, text completions, streaming, listing des modèles). Depuis la version v2.6.2, des routes compatibles Ollama et Anthropic ont également été ajoutées.
Qui a créé Shimmy ?
Michael A. Kuykendall a créé et maintient Shimmy en tant que projet open source indépendant, géré par une seule personne. Cette review n'a trouvé aucune preuve d'une entreprise ou d'un tour de financement derrière.
Combien de modèles Shimmy prend-il en charge ?
Au moment de cette review, Shimmy certifie 26 combinaisons modèle/quantification spécifiques à travers 12 familles de modèles via son propre protocole de test « MATH + INFERENCE + DETERMINISM » — consultez le dépôt GitHub du projet pour la liste actuelle, tenue à jour.
PromptQuorum a-t-il testé de manière indépendante les revendications de performance de Shimmy ?
Cette review s'appuie sur le propre README, CHANGELOG et notes de version de Shimmy, plutôt que sur un benchmark pratique du temps de démarrage, de l'empreinte mémoire ou de la compression du cache KV réalisé par PromptQuorum.