Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/Shimmy Review 2026 : une alternative Rust de 5 Mo à Ollama
Overview & Reference

Shimmy Review 2026 : une alternative Rust de 5 Mo à Ollama

·10 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Shimmy est un serveur d'inférence gratuit, open source, en un seul binaire, entièrement écrit en Rust, qui sert des modèles GGUF et SafeTensors locaux via une API compatible OpenAI, sans runtime Python, sans chaîne d'outils C++ et sans dépendance à llama.cpp. Créé et maintenu par Michael A. Kuykendall en tant que projet open source indépendant, géré par une seule personne, sous licence Apache-2.0, Shimmy se positionne spécifiquement contre le binaire bien plus volumineux et le démarrage à froid plus lent d'Ollama — son propre README revendique un binaire de quelques mégaoctets contre une installation de plusieurs centaines de mégaoctets pour Ollama.

Shimmy (github.com/Michael-A-Kuykendall/shimmy) est un serveur d'inférence gratuit, open source, en un seul binaire, entièrement écrit en Rust, positionné comme une alternative légère et sans dépendances à Ollama pour servir des modèles GGUF et SafeTensors locaux via une API compatible OpenAI. Il ne nécessite ni runtime Python, ni chaîne d'outils C++, ni dépendance à llama.cpp — le binaire lui-même ne fait que quelques mégaoctets, contre plusieurs centaines pour Ollama. Cette review couvre ce que Shimmy fait réellement, comment il se compare à Ollama et llama.cpp, comment l'installer, et à qui il convient.

Points clés

  • Shimmy (github.com/Michael-A-Kuykendall/shimmy) est un serveur d'inférence gratuit, open source, en un seul binaire, pas un IDE ni une app de chat
  • Créé et maintenu par Michael A. Kuykendall en tant que projet géré de façon indépendante — son propre README indique « free forever » (gratuit pour toujours), sans preuve d'une entreprise ou d'un tour de financement derrière
  • Sous licence Apache-2.0, selon le fichier LICENSE du dépôt lui-même
  • Fonctionne sur Airframe, son propre moteur transformer WebGPU (WGSL) 100 % Rust, évitant ainsi entièrement une chaîne d'outils C++ ou une dépendance à llama.cpp
  • Sert des modèles GGUF et SafeTensors via une API compatible OpenAI ; la version v2.6.2 a ajouté des routes compatibles Ollama et Anthropic
  • 5 890 étoiles GitHub au moment de cette review (github.com/Michael-A-Kuykendall/shimmy, vérifié via l'API GitHub)

📍 En une phrase

Shimmy est un serveur d'inférence local gratuit, open source, en un seul binaire, entièrement écrit en Rust — une alternative légère et sans dépendances à Ollama — qui sert des modèles GGUF et SafeTensors via une API compatible OpenAI, sans runtime Python, sans chaîne d'outils C++ et sans dépendance à llama.cpp, selon le propre README du projet.

💬 En termes simples

Plutôt que d'installer le paquet de plusieurs centaines de mégaoctets d'Ollama, Shimmy est un seul petit fichier exécutable (quelques mégaoctets) que vous téléchargez ou compilez avec Cargo, que vous pointez vers un fichier de modèle GGUF sur votre disque, puis exécutez. Tout outil qui parle déjà le format de l'API OpenAI peut communiquer avec Shimmy à la place, sans modification de code.

📌Remarque: Cette review est le complément approfondi de l'entrée de Shimmy dans le Local LLM Software Directory — consultez cette page pour comparer Shimmy en un coup d'œil à des dizaines d'autres outils d'IA locale. Elle s'appuie sur le README, le changelog et les notes de version de Shimmy, pas sur un benchmark pratique réalisé par PromptQuorum.

Qu'est-ce que Shimmy ?

Shimmy est un serveur d'inférence en ligne de commande : un binaire unique qui charge un fichier de modèle GGUF ou SafeTensors local et l'expose via une API HTTP compatible OpenAI. Sa propre description GitHub le qualifie de « pure-Rust WebGPU inference engine — OpenAI-API compatible, GGUF native, runs on any GPU. No Python. No llama.cpp. Single binary. »

  • Type de produit : un serveur en ligne de commande, en un seul binaire — ni application graphique, ni extension IDE
  • Créateur : Michael A. Kuykendall, développeur indépendant ; cette review n'a trouvé aucune preuve d'une entreprise, d'un investisseur ou d'un tour de financement derrière le projet
  • Dépôt : github.com/Michael-A-Kuykendall/shimmy
  • Licence : Apache-2.0, confirmée via le fichier LICENSE du dépôt lui-même
  • Ampleur : 5 890 étoiles GitHub au moment de cette review, selon l'API GitHub
  • Moteur : Airframe, un moteur transformer WebGPU (WGSL) 100 % Rust, auquel le propre README de Shimmy attribue le fait d'éviter entièrement une chaîne d'outils C++

Historique du projet et jalons de versions

Shimmy publie des versions fréquentes et incrémentales, son propre CHANGELOG documentant près de 200 commits et un rythme régulier de versions mineures tout au long de 2026, centrées sur son pipeline de certification de modèles auto-publié et son moteur d'inférence Airframe.

  1. 1
    v2.5.0 — 6 août 2026 : moteur Airframe mis à jour vers 0.3.0
    Why it matters: Mise à jour du moteur transformer WebGPU 100 % Rust sous-jacent sur lequel Shimmy fonctionne.
  2. 2
    v2.6.0 — 27 août 2026 : pipeline de certification consolidé
    Why it matters: Consolidation de la certification de modèles auto-publiée de Shimmy en un protocole « 3-box » MATH + INFERENCE + DETERMINISM, certifiant 26 combinaisons modèle/quantification à travers 12 familles de modèles, et suppression d'environ 1 600 lignes de code moteur hérité.
  3. 3
    v2.6.1 — 28 août 2026 : templating de chat unifié
    Why it matters: Regroupement de tout le formatage des prompts via un module partagé prompt_render utilisant de vrais templates de chat GGUF via Jinja, et retrait d'un chemin de code de serveur GPU hérité (environ 1 847 lignes supprimées).
  4. 4
    v2.6.2 — 28 août 2026 : documentation OpenAPI et routes compatibles supplémentaires
    Why it matters: Ajout d'un contrat d'API lisible par machine (`GET /openapi.json`) et d'une interface Swagger interactive (`GET /docs`), ainsi que de routes compatibles Ollama et Anthropic en plus de l'API compatible OpenAI existante.
  5. 5
    v2.6.3 — 29 août 2026 : correctif de chargement de modèle sur GPU intégré
    Why it matters: Correction du chargement de modèle sur les GPU intégrés, y compris un correctif spécifique pour les GPU Intel Arc, en mettant à jour la dépendance au moteur Airframe vers la version 0.4.2.
  6. 6
    v2.6.4 — 30 août 2026 : dernière version mineure au moment de cette review
    Why it matters: La version taguée la plus récente trouvée sur la page des releases GitHub du projet au moment de cette review — consultez directement [github.com/Michael-A-Kuykendall/shimmy/releases](https://github.com/Michael-A-Kuykendall/shimmy/releases) pour tout ce qui a été publié après la date de publication de cette review.

Que fait réellement Shimmy ?

L'ensemble des fonctionnalités de Shimmy se concentre sur le service de modèles locaux via une surface d'API familière, tout en gardant le binaire lui-même minimal et sans dépendances, selon le propre README de Shimmy.

  • Chargement de modèle natif GGUF — charge directement les fichiers de modèle GGUF, sans recompilation ni constantes codées en dur par modèle, selon la propre documentation du projet ; le format SafeTensors est également pris en charge
  • API compatible OpenAI — chat completions, text completions, réponses en streaming et endpoints de listing des modèles correspondant au format de l'API OpenAI, afin que le code client OpenAI existant et les outils puissent pointer vers Shimmy sans modification
  • Routes compatibles supplémentaires — depuis la v2.6.2, Shimmy expose aussi des routes compatibles Ollama et Anthropic en plus de son API compatible OpenAI
  • Certification de modèles auto-publiée — un protocole de test « 3-box » (MATH, INFERENCE, DETERMINISM) que Shimmy exécute sur les modèles pris en charge ; le projet indique que 26 combinaisons modèle/quantification à travers 12 familles de modèles réussissent ce protocole au moment de cette review
  • Compression du cache KV INT4 TurboShimmy — la propre documentation de Shimmy décrit une utilisation mémoire du cache KV environ 7 fois plus faible dans les configurations testées, destinée à permettre des fenêtres de contexte plus larges ou des GPU plus modestes pour un modèle donné
  • Contexte étendu via le scaling YaRN RoPE — configurable via des variables d'environnement, selon la documentation du projet
  • Aucune dépendance d'inférence externe — Shimmy fonctionne sur Airframe, son propre moteur WebGPU 100 % Rust, plutôt que d'encapsuler llama.cpp ou de nécessiter une chaîne d'outils Python/CUDA

Exemples d'utilisation : trois façons d'utiliser Shimmy

Il s'agit de workflows concrets construits à partir des fonctionnalités documentées de Shimmy ci-dessus — pas de cas d'usage hypothétiques.

Plateforme, tarification et licence

Plateforme

Ce que Shimmy indique:
Un serveur en ligne de commande, en un seul binaire — fonctionne sur macOS, Windows et Linux ; aucun installeur graphique.

Coût

Ce que Shimmy indique:
Gratuit et open source. Le propre README du projet indique « Shimmy will be free forever » (gratuit pour toujours). Aucun palier payant n'existe.

Licence

Ce que Shimmy indique:
Apache-2.0, confirmée via le fichier LICENSE du dépôt lui-même.

Financement

Ce que Shimmy indique:
Maintenu de façon indépendante par Michael A. Kuykendall ; le dépôt liste un programme de sponsoring volontaire (d'un palier à 5 $/mois jusqu'à un palier partenaire infrastructure à 500 $/mois), pas un tour de financement ni une entreprise.

Vérifiez le statut actuel de licence et de financement directement sur github.com/Michael-A-Kuykendall/shimmy avant de vous appuyer sur ce tableau pour une décision de conformité ou de risque fournisseur.

Shimmy vs. Ollama

Shimmy se positionne directement face à Ollama, son propre README se qualifiant de « the 5MB alternative to Ollama ». Les deux servent des modèles locaux via des API HTTP similaires ; la différence tient principalement à la taille du binaire, à l'empreinte des dépendances et au moteur d'inférence de chaque projet.

Taille du binaire

Shimmy:
Quelques Mo, selon la revendication du propre README de Shimmy
Ollama:
Plusieurs centaines de Mo, selon des comparatifs tiers

Moteur d'inférence

Shimmy:
Airframe — son propre moteur WebGPU (WGSL) 100 % Rust
Ollama:
Construit sur llama.cpp

Dépendances runtime

Shimmy:
Aucune — ni Python, ni chaîne d'outils C++, selon son README
Ollama:
Embarque son propre runtime ; aucun Python séparé requis non plus

Compatibilité API

Shimmy:
Compatible OpenAI, plus des routes compatibles Ollama et Anthropic (v2.6.2+)
Ollama:
Dispose de sa propre API native plus une couche compatible OpenAI

Format de modèle

Shimmy:
GGUF et SafeTensors
Ollama:
Basé sur GGUF, via sa propre bibliothèque de modèles et le format Modelfile

Mainteneur

Shimmy:
Développeur indépendant solo
Ollama:
Ollama Inc., une entreprise financée

Si la taille du binaire, le temps de démarrage à froid, ou le fait d'éviter spécifiquement llama.cpp sont les facteurs décisifs, Shimmy est conçu pour gagner précisément sur ces axes, selon son propre positionnement. Si vous voulez la plus grande bibliothèque de modèles existante, de l'outillage communautaire, et une entreprise financée derrière la maintenance à long terme, le parcours d'Ollama est plus établi — voir la Ollama Review pour une analyse complète. Vérifiez vous-même les benchmarks actuels plutôt que de vous fier au marketing de l'un ou l'autre projet.

À qui s'adresse Shimmy ?

Shimmy convient aux développeurs qui veulent spécifiquement un serveur d'inférence à empreinte minimale et sans dépendances, et qui sont à l'aise avec un projet encore jeune, géré par une seule personne.

Concurrents et alternatives

Parmi les serveurs d'inférence locale légers, Shimmy est le plus directement comparable à Ollama et llama.cpp — le moteur sur lequel s'appuient la plupart des outils locaux, y compris Ollama — ainsi qu'à LMDeploy pour les équipes évaluant des options de serving à plus haut débit.

Ollama

Connu pour:
Le runtime LLM local en une commande le plus largement adopté, soutenu par une entreprise financée
Articles sur Ollama (10)

+273 autres non affichés

llama.cpp

Connu pour:
Le moteur d'inférence C/C++ sur lequel Ollama et de nombreux autres outils sont construits
Articles sur llama.cpp (10)

+140 autres non affichés

LMDeploy

Connu pour:
Serving LLM à haut débit et quantification, destiné aux charges de production
Articles sur LMDeploy (1)

Également mentionné dans :

Ceci n'est pas une liste exhaustive des serveurs d'inférence locale — consultez le Local LLM Software Directory pour le catalogue complet, régulièrement mis à jour, incluant la propre fiche de Shimmy dans ce répertoire.

Erreurs courantes lors de l'évaluation de Shimmy

La plupart des confusions autour de Shimmy viennent du fait de le confondre avec des projets homonymes sans rapport, ou de supposer qu'il a l'ampleur de la bibliothèque de modèles d'Ollama.

Questions fréquemment posées

Qu'est-ce que Shimmy ?

Shimmy (github.com/Michael-A-Kuykendall/shimmy) est un serveur d'inférence gratuit, open source, en un seul binaire, entièrement écrit en Rust, qui sert des modèles GGUF et SafeTensors locaux via une API compatible OpenAI.

Shimmy est-il gratuit ?

Oui. Shimmy est gratuit et open source sous licence Apache-2.0. Son propre README indique « Shimmy will be free forever » (gratuit pour toujours), sans palier payant.

Comment installer Shimmy ?

La méthode la plus simple, selon le propre README du projet, est cargo install shimmy. Des binaires de version précompilés et une configuration Docker sont également disponibles sur le dépôt GitHub.

En quoi Shimmy diffère-t-il d'Ollama ?

Le propre README de Shimmy le décrit comme « the 5MB alternative to Ollama » — un binaire beaucoup plus petit, sans runtime Python ni chaîne d'outils C++, fonctionnant sur son propre moteur Airframe plutôt que sur llama.cpp. Ollama dispose d'une bibliothèque de modèles plus grande et plus établie et est soutenu par une entreprise financée ; Shimmy est maintenu par un seul développeur indépendant.

Shimmy utilise-t-il llama.cpp ?

Non. Shimmy fonctionne sur Airframe, son propre moteur transformer WebGPU (WGSL) 100 % Rust, ce qui, selon le projet, lui permet d'éviter entièrement une dépendance à llama.cpp ou à une chaîne d'outils C++.

Quels formats de modèle Shimmy prend-il en charge ?

GGUF et SafeTensors, selon la propre documentation du projet. Shimmy charge les fichiers GGUF directement, sans recompilation ni constantes codées en dur par modèle.

L'API de Shimmy est-elle compatible avec les outils OpenAI ?

Oui. Shimmy expose une API compatible OpenAI (chat completions, text completions, streaming, listing des modèles). Depuis la version v2.6.2, des routes compatibles Ollama et Anthropic ont également été ajoutées.

Qui a créé Shimmy ?

Michael A. Kuykendall a créé et maintient Shimmy en tant que projet open source indépendant, géré par une seule personne. Cette review n'a trouvé aucune preuve d'une entreprise ou d'un tour de financement derrière.

Combien de modèles Shimmy prend-il en charge ?

Au moment de cette review, Shimmy certifie 26 combinaisons modèle/quantification spécifiques à travers 12 familles de modèles via son propre protocole de test « MATH + INFERENCE + DETERMINISM » — consultez le dépôt GitHub du projet pour la liste actuelle, tenue à jour.

PromptQuorum a-t-il testé de manière indépendante les revendications de performance de Shimmy ?

Cette review s'appuie sur le propre README, CHANGELOG et notes de version de Shimmy, plutôt que sur un benchmark pratique du temps de démarrage, de l'empreinte mémoire ou de la compression du cache KV réalisé par PromptQuorum.

Sources

← Retour aux LLM locaux avancés