Wichtigste Erkenntnisse
- Shimmy (github.com/Michael-A-Kuykendall/shimmy) ist ein kostenloser, quelloffener Inferenzserver in einer einzigen Binary, keine IDE und keine Chat-App
- Entwickelt und gepflegt von Michael A. Kuykendall als unabhängig betreutes Projekt — das eigene README erklärt "free forever" ("für immer kostenlos"), ohne Hinweise auf ein Unternehmen oder eine Finanzierungsrunde dahinter
- Apache-2.0-lizenziert, laut der eigenen LICENSE-Datei des Repositorys
- Läuft auf Airframe, der projekteigenen, reinen Rust-WebGPU-Transformer-Engine (WGSL), wodurch eine C++-Toolchain oder eine llama.cpp-Abhängigkeit vollständig vermieden wird
- Stellt GGUF- und SafeTensors-Modelle über eine OpenAI-kompatible API bereit; das v2.6.2-Release ergänzte zusätzlich Ollama-kompatible und Anthropic-kompatible Routen
- 5.890 GitHub-Stars zum Zeitpunkt dieser Review (github.com/Michael-A-Kuykendall/shimmy, verifiziert über die GitHub-API)
📍 In einem Satz
Shimmy ist ein kostenloser, quelloffener Inferenzserver in einer einzigen Binary, komplett in Rust geschrieben — eine schlanke, abhängigkeitsfreie Alternative zu Ollama —, der GGUF- und SafeTensors-Modelle über eine OpenAI-kompatible API bereitstellt, ohne Python-Laufzeitumgebung, ohne C++-Toolchain und ohne llama.cpp-Abhängigkeit, laut dem eigenen README des Projekts.
💬 In einfachen Worten
Statt Ollamas mehrere hundert Megabyte großes Paket zu installieren, ist Shimmy eine einzelne kleine ausführbare Datei (wenige Megabyte), die Sie herunterladen oder mit Cargo bauen, auf eine GGUF-Modelldatei auf Ihrer Festplatte verweisen lassen und ausführen. Jedes Tool, das bereits das OpenAI-API-Format spricht, kann stattdessen ohne Codeänderungen mit Shimmy sprechen.
📌Hinweis: Diese Review ist der ausführliche Begleitartikel zu Shimmys Eintrag im Local LLM Software Directory — dort finden Sie einen schnellen Vergleich von Shimmy mit Dutzenden anderer lokaler KI-Tools. Sie basiert auf Shimmys eigenem README, Changelog und Release Notes, nicht auf praktischen Benchmarks von PromptQuorum.
Was ist Shimmy?
Shimmy ist ein Kommandozeilen-Inferenzserver: eine einzelne Binary, die eine lokale GGUF- oder SafeTensors-Modelldatei lädt und über eine OpenAI-kompatible HTTP-API bereitstellt. Die eigene GitHub-Beschreibung bezeichnet es als "pure-Rust WebGPU inference engine — OpenAI-API compatible, GGUF native, runs on any GPU. No Python. No llama.cpp. Single binary."
- Produkttyp: ein Kommandozeilen-Server in einer einzigen Binary — keine GUI-App und keine IDE-Erweiterung
- Entwickler: Michael A. Kuykendall, ein unabhängiger Entwickler; diese Review fand keine Hinweise auf ein Unternehmen, einen Investor oder eine Finanzierungsrunde hinter dem Projekt
- Repository: github.com/Michael-A-Kuykendall/shimmy
- Lizenz: Apache-2.0, bestätigt über die eigene LICENSE-Datei des Repositorys
- Umfang: 5.890 GitHub-Stars zum Zeitpunkt dieser Review, laut GitHub-API
- Engine: Airframe, eine reine Rust-WebGPU-Transformer-Engine (WGSL), der Shimmys eigenes README zuschreibt, eine C++-Toolchain vollständig zu vermeiden
Shimmys Projektgeschichte und Versions-Meilensteine
Shimmy hat häufige, inkrementelle Releases veröffentlicht, das eigene CHANGELOG dokumentiert knapp 200 Commits und einen stetigen Takt an Punkt-Releases im Jahr 2026, zentriert um die selbst veröffentlichte Modell-Zertifizierungs-Pipeline und die Airframe-Inferenz-Engine.
- 1v2.5.0 — 6. August 2026: Airframe-Engine auf 0.3.0 aktualisiert
Why it matters: Aktualisierte die zugrunde liegende reine Rust-WebGPU-Transformer-Engine, auf der Shimmy läuft. - 2v2.6.0 — 27. August 2026: Zertifizierungs-Pipeline konsolidiert
Why it matters: Konsolidierte Shimmys selbst veröffentlichte Modell-Zertifizierung in ein "3-Box"-Regime aus MATH + INFERENCE + DETERMINISM, das 26 Modell-/Quantisierungs-Kombinationen über 12 Modellfamilien hinweg zertifiziert, und entfernte rund 1.600 Zeilen Legacy-Engine-Code. - 3v2.6.1 — 28. August 2026: Vereinheitlichtes Chat-Templating
Why it matters: Führte die gesamte Prompt-Formatierung über ein gemeinsames Modul prompt_render zusammen, das echte GGUF-Chat-Templates via Jinja verwendet, und entfernte einen veralteten GPU-Server-Codepfad (rund 1.847 Zeilen entfernt). - 4v2.6.2 — 28. August 2026: OpenAPI-Dokumentation und zusätzliche kompatible Routen
Why it matters: Ergänzte einen maschinenlesbaren API-Vertrag (`GET /openapi.json`) und eine interaktive Swagger-UI (`GET /docs`), sowie Ollama-kompatible und Anthropic-kompatible Routen neben der bestehenden OpenAI-kompatiblen API. - 5v2.6.3 — 29. August 2026: Fix für das Laden von Modellen auf integrierten GPUs
Why it matters: Behob das Laden von Modellen auf integrierten GPUs, einschließlich eines spezifischen Fixes für Intel-Arc-GPUs, durch Aktualisierung der Airframe-Engine-Abhängigkeit auf 0.4.2. - 6v2.6.4 — 30. August 2026: Aktuellstes Punkt-Release zum Zeitpunkt dieser Review
Why it matters: Das aktuellste getaggte Release, das zum Zeitpunkt dieser Review auf der GitHub-Releases-Seite des Projekts gefunden wurde — prüfen Sie [github.com/Michael-A-Kuykendall/shimmy/releases](https://github.com/Michael-A-Kuykendall/shimmy/releases) direkt für alles, was nach dem Veröffentlichungsdatum dieser Review erschienen ist.
Was macht Shimmy tatsächlich?
Shimmys Funktionsumfang konzentriert sich darauf, lokale Modelle über eine vertraute API-Oberfläche bereitzustellen und dabei die Binary selbst minimal und abhängigkeitsfrei zu halten, laut Shimmys eigenem README.
- GGUF-natives Modell-Laden — lädt GGUF-Modelldateien direkt, ohne Neukompilierung oder fest codierte Konstanten pro Modell, laut der eigenen Dokumentation des Projekts; das SafeTensors-Format wird ebenfalls unterstützt
- OpenAI-kompatible API — Chat Completions, Text Completions, Streaming-Antworten und Endpunkte zur Modell-Auflistung, die dem OpenAI-API-Format entsprechen, sodass bestehender OpenAI-Client-Code und Tools ohne Änderung auf Shimmy verweisen können
- Zusätzliche kompatible Routen — seit v2.6.2 stellt Shimmy neben seiner OpenAI-kompatiblen API auch Ollama-kompatible und Anthropic-kompatible Routen bereit
- Selbst veröffentlichte Modell-Zertifizierung — ein "3-Box"-Testregime (MATH, INFERENCE, DETERMINISM), das Shimmy gegen unterstützte Modelle ausführt; das Projekt gibt an, dass 26 Modell-/Quantisierungs-Kombinationen über 12 Modellfamilien hinweg dieses Regime zum Zeitpunkt dieser Review bestehen
- TurboShimmy INT4-KV-Cache-Komprimierung — Shimmys eigene Dokumentation beschreibt einen rund 7-fach niedrigeren KV-Cache-Speicherverbrauch in getesteten Konfigurationen, gedacht, um größere Kontextfenster oder kleinere GPUs für ein gegebenes Modell nutzbar zu machen
- Erweiterter Kontext über YaRN-RoPE-Skalierung — über Umgebungsvariablen konfigurierbar, laut der Dokumentation des Projekts
- Keine externe Inferenz-Abhängigkeit — Shimmy läuft auf Airframe, der eigenen reinen Rust-WebGPU-Engine, statt llama.cpp zu umwickeln oder eine Python-/CUDA-Toolchain zu benötigen
Anwendungsbeispiele: Drei Wege, Shimmy zu nutzen
Dies sind konkrete Workflows, aufgebaut aus Shimmys oben dokumentierten Funktionen — keine hypothetischen Anwendungsfälle.
Shimmy installieren
Shimmy installiert sich als Rust-Binary — über Cargo, einen vorgebauten Release-Download oder Docker.
Quelle | Link |
|---|---|
| Cargo-Installationsbefehl | cargo install shimmy |
| GitHub-Repository (Quellcode, Apache-2.0) | github.com/Michael-A-Kuykendall/shimmy |
| Vorgebaute Release-Binaries | github.com/Michael-A-Kuykendall/shimmy/releases |
| crates.io-Paketeintrag | lib.rs/crates/shimmy |
Führen Sie nach der Installation shimmy serve --model-path /absolute/path/to/model.gguf --bind 127.0.0.1:11435 (laut dem eigenen README des Projekts) aus, um ein lokales Modell bereitzustellen. Ein Dockerfile und eine Docker-Compose-Konfiguration stehen ebenfalls im Repository für containerbasierte Bereitstellungen zur Verfügung. Prüfen Sie die aktuellen Installationsanweisungen auf dem GitHub-Repository, bevor Sie einen Befehl ausführen, da sich Installationsschritte zwischen Releases ändern können.
Plattform, Preise und Lizenzierung
Plattform
- Was Shimmy angibt:
- Ein Kommandozeilen-Server in einer einzigen Binary — läuft auf macOS, Windows und Linux; kein GUI-Installer.
Kosten
- Was Shimmy angibt:
- Kostenlos und quelloffen. Das eigene README des Projekts erklärt "Shimmy will be free forever" ("für immer kostenlos"). Es gibt keine kostenpflichtige Stufe.
Lizenzierung
- Was Shimmy angibt:
- Apache-2.0, bestätigt über die eigene LICENSE-Datei des Repositorys.
Finanzierung
- Was Shimmy angibt:
- Unabhängig betreut von Michael A. Kuykendall; das Repository listet ein freiwilliges Sponsoring-Programm (von einer 5-$-pro-Monat-Stufe bis zu einer 500-$-pro-Monat-Infrastruktur-Partner-Stufe), keine Finanzierungsrunde oder ein Unternehmen.
Prüfen Sie den aktuellen Lizenzierungs- und Finanzierungsstatus direkt auf github.com/Michael-A-Kuykendall/shimmy, bevor Sie sich für eine Compliance- oder Anbieterrisiko-Entscheidung auf diese Tabelle verlassen.
Shimmy vs. Ollama
Shimmy positioniert sich direkt gegen Ollama, das eigene README bezeichnet sich selbst als "the 5MB alternative to Ollama". Beide stellen lokale Modelle über ähnliche HTTP-APIs bereit; der Unterschied liegt hauptsächlich in Binary-Größe, Abhängigkeits-Fußabdruck und der jeweiligen Inferenz-Engine.
Binary-Größe
- Shimmy:
- Wenige MB, laut Shimmys eigener README-Angabe
- Ollama:
- Mehrere hundert MB, laut Vergleichen von Dritten
Inferenz-Engine
- Shimmy:
- Airframe — eine eigene, reine Rust-WebGPU-Engine (WGSL)
- Ollama:
- Baut auf llama.cpp auf
Laufzeit-Abhängigkeiten
- Shimmy:
- Keine — kein Python, keine C++-Toolchain, laut eigenem README
- Ollama:
- Bündelt eine eigene Laufzeitumgebung; ebenfalls kein separates Python nötig
API-Kompatibilität
- Shimmy:
- OpenAI-kompatibel, plus Ollama- und Anthropic-kompatible Routen (ab v2.6.2)
- Ollama:
- Hat eine eigene native API plus eine OpenAI-kompatible Schicht
Modellformat
- Shimmy:
- GGUF und SafeTensors
- Ollama:
- GGUF-basiert, über eine eigene Modellbibliothek und das Modelfile-Format
Betreuer
- Shimmy:
- Unabhängiger Einzelentwickler
- Ollama:
- Ollama Inc., ein finanziertes Unternehmen
Wenn Binary-Größe, Kaltstartzeit oder das gezielte Vermeiden von llama.cpp die entscheidenden Faktoren sind, ist Shimmy laut eigener Positionierung genau auf diese Achsen hin gebaut, um zu gewinnen. Wenn Sie die größte bestehende Modellbibliothek, Community-Tooling und ein finanziertes Unternehmen hinter der langfristigen Pflege möchten, ist Ollamas Erfolgsbilanz etablierter — siehe die Ollama Review für eine vollständige Übersicht. Prüfen Sie aktuelle Benchmarks selbst, statt sich auf das Marketing eines der beiden Projekte zu verlassen.
Für wen eignet sich Shimmy?
Shimmy passt zu Entwicklern, die gezielt einen minimalen, abhängigkeitsfreien Inferenzserver möchten und damit einverstanden sind, ein noch junges, allein betreutes Projekt einzusetzen.
Wettbewerber und Alternativen
Innerhalb schlanker lokaler Inferenzserver ist Shimmy am direktesten mit Ollama und llama.cpp vergleichbar — der Engine, auf der die meisten lokalen Tools, einschließlich Ollama, aufbauen — sowie LMDeploy für Teams, die Serving-Optionen mit höherem Durchsatz bewerten.
Ollama
- Bekannt für:
- Die am weitesten verbreitete Ein-Befehl-Laufzeitumgebung für lokale LLMs, unterstützt von einem finanzierten Unternehmen
- Link:
- Ollama Review
Artikel über Ollama (10)
- Ollama Review 2026: The One-Command Local LLM RuntimeAktualisiert 12. September 2026
- Cherry Studio 2.0 in 2026: The Free Agent-Based AI Desktop AppAktualisiert 20. September 2026
- AutoGPT Review 2026: Classic Agent vs. Hosted PlatformAktualisiert 20. September 2026
- KoboldCpp Review 2026: One File, No Install, Built for RoleplayAktualisiert 20. September 2026
- llama.cpp Explained: The Engine Powering Ollama (2026)Aktualisiert 20. September 2026
- Nanobot Review: A Self-Hosted AI Agent Framework in 2026Aktualisiert 20. September 2026
- Baserow Review 2026: A No-Code Database With a Local-AI FieldAktualisiert 19. September 2026
- Farfalle Review: A Self-Hosted, Open-Source AI Search EngineAktualisiert 19. September 2026
- little-coder Review: A Coding Agent CLI Built for Small Local ModelsAktualisiert 19. September 2026
- Local Deep Research Review 2026: Self-Hosted, Cited AI Research AgentAktualisiert 19. September 2026
+273 weitere nicht angezeigt
llama.cpp
- Bekannt für:
- Die C/C++-Inferenz-Engine, auf der Ollama und viele andere Tools aufbauen
- Link:
- llama.cpp Explained
Artikel über llama.cpp (10)
- llama.cpp Explained: The Engine Powering Ollama (2026)Aktualisiert 20. September 2026
- KoboldCpp Review 2026: One File, No Install, Built for RoleplayAktualisiert 20. September 2026
- little-coder Review: A Coding Agent CLI Built for Small Local ModelsAktualisiert 19. September 2026
- Local Deep Research Review 2026: Self-Hosted, Cited AI Research AgentAktualisiert 19. September 2026
- mlx-serve Review 2026: Native Zig Inference Server for Apple SiliconAktualisiert 19. September 2026
- mlxcel Review: Rust-Native MLX Inference RuntimeAktualisiert 19. September 2026
- Parlor Review: On-Device Real-Time Voice and Vision AIAktualisiert 19. September 2026
- Rapid-MLX Review: Native MLX Inference Server for Apple SiliconAktualisiert 19. September 2026
- Shimmy Review 2026: A 5MB Rust Alternative to OllamaAktualisiert 19. September 2026
- Sidekick Review 2026: A Free, Native macOS Local AI Chat AppAktualisiert 19. September 2026
+140 weitere nicht angezeigt
LMDeploy
- Bekannt für:
- Hochdurchsatz-LLM-Serving und Quantisierung, ausgerichtet auf Produktions-Workloads
- Link:
- LMDeploy Review
Artikel über LMDeploy (1)
- LMDeploy Review: High-Throughput LLM Serving and QuantizationAktualisiert 19. September 2026
Auch erwähnt in:
- NVIDIA Dynamo Review: Datacenter-Scale Inference ServingAktualisiert 19. September 2026
- LoRAX Review: Serving Thousands of LoRA Adapters on One GPUAktualisiert 19. September 2026
- Shimmy Review 2026: A 5MB Rust Alternative to OllamaAktualisiert 19. September 2026
- TurboFieldfare Review: Running Gemma 4 26B-A4B in 2 GB of RAMAktualisiert 19. September 2026
Dies ist keine erschöpfende Liste lokaler Inferenzserver — siehe das Local LLM Software Directory für den vollständigen, regelmäßig aktualisierten Katalog, einschließlich Shimmys eigenem Verzeichniseintrag.
Häufige Fehler bei der Bewertung von Shimmy
Die meiste Verwirrung um Shimmy entsteht durch die Vermischung mit nicht verwandten, gleichnamigen Projekten, oder durch die Annahme, es habe Ollamas Modellbibliothek-Umfang.
Häufig gestellte Fragen
Was ist Shimmy?
Shimmy (github.com/Michael-A-Kuykendall/shimmy) ist ein kostenloser, quelloffener Inferenzserver in einer einzigen Binary, komplett in Rust geschrieben, der lokale GGUF- und SafeTensors-Modelle über eine OpenAI-kompatible API bereitstellt.
Ist Shimmy kostenlos?
Ja. Shimmy ist kostenlos und quelloffen unter der Apache-2.0-Lizenz. Das eigene README erklärt "Shimmy will be free forever" ("für immer kostenlos"), ohne kostenpflichtige Stufe.
Wie installiere ich Shimmy?
Die einfachste Methode ist laut dem eigenen README des Projekts cargo install shimmy. Vorgebaute Release-Binaries und eine Docker-Konfiguration stehen ebenfalls im GitHub-Repository zur Verfügung.
Wie unterscheidet sich Shimmy von Ollama?
Shimmys eigenes README beschreibt es als "the 5MB alternative to Ollama" — eine deutlich kleinere Binary ohne Python-Laufzeitumgebung oder C++-Toolchain, die auf der eigenen Airframe-Engine statt llama.cpp läuft. Ollama hat eine größere, etabliertere Modellbibliothek und wird von einem finanzierten Unternehmen unterstützt; Shimmy wird von einem einzelnen unabhängigen Entwickler betreut.
Verwendet Shimmy llama.cpp?
Nein. Shimmy läuft auf Airframe, der eigenen reinen Rust-WebGPU-Transformer-Engine (WGSL), die laut Projektangabe eine llama.cpp- oder C++-Toolchain-Abhängigkeit vollständig vermeidet.
Welche Modellformate unterstützt Shimmy?
GGUF und SafeTensors, laut der eigenen Dokumentation des Projekts. Shimmy lädt GGUF-Dateien direkt, ohne Neukompilierung oder fest codierte Konstanten pro Modell.
Ist Shimmys API mit OpenAI-Tools kompatibel?
Ja. Shimmy stellt eine OpenAI-kompatible API bereit (Chat Completions, Text Completions, Streaming, Modell-Auflistung). Seit dem v2.6.2-Release wurden zusätzlich Ollama-kompatible und Anthropic-kompatible Routen ergänzt.
Wer hat Shimmy entwickelt?
Michael A. Kuykendall hat Shimmy als unabhängiges, allein betreutes Open-Source-Projekt entwickelt und pflegt es. Diese Review fand keine Hinweise auf ein Unternehmen oder eine Finanzierungsrunde dahinter.
Wie viele Modelle unterstützt Shimmy?
Zum Zeitpunkt dieser Review zertifiziert Shimmy 26 spezifische Modell-/Quantisierungs-Kombinationen über 12 Modellfamilien hinweg durch das eigene "MATH + INFERENCE + DETERMINISM"-Testregime — prüfen Sie das GitHub-Repository des Projekts für die aktuelle, stets aktualisierte Liste.
Hat PromptQuorum Shimmys Leistungsangaben eigenständig getestet?
Diese Review basiert auf Shimmys eigenem README, CHANGELOG und Release Notes, nicht auf praktischem Benchmarking von Startzeit, Speicherverbrauch oder KV-Cache-Komprimierung durch PromptQuorum.
Muss ich bei der Verwendung von Shimmy die DSGVO beachten?
Shimmy läuft vollständig lokal auf Ihrer eigenen Hardware und sendet standardmäßig keine Prompt- oder Modelldaten an einen externen Server, sodass Verarbeitungsvorgänge im Rahmen der DSGVO grundsätzlich bei Ihnen als Betreiber verbleiben. Für Unternehmen bedeutet das: Die DSGVO-Artikel-28-Auftragsverarbeitungspflichten entfallen typischerweise, da kein externer Auftragsverarbeiter im Spiel ist, solange Sie Shimmy selbst hosten und keine Daten an Dritte weiterleiten. Beachten Sie dennoch die BSI-Grundschutz-Kataloge für die Absicherung des Servers selbst, etwa Netzwerkzugriff und Zugriffskontrolle auf die API. Dies ist keine Rechtsberatung — prüfen Sie Ihren konkreten Anwendungsfall mit einem Datenschutzbeauftragten.
Ist Shimmy für den deutschen Mittelstand geeignet?
Für IT-Teams im deutschen Mittelstand, die bereits Erfahrung mit Kommandozeilen-Tools und Git-Workflows haben, kann Shimmys minimaler Ressourcenbedarf attraktiv sein, etwa für den Einsatz auf bestehender Hardware ohne dedizierte GPU-Server. Da Shimmy von einem einzelnen unabhängigen Entwickler ohne Unternehmen dahinter gepflegt wird, sollten Mittelstandsunternehmen mit hohen Anforderungen an garantierten Support oder SLAs dies gegen Ollamas etablierteres, unternehmensgestütztes Modell abwägen und eigene BSI-konforme Absicherungsmaßnahmen für den produktiven Einsatz treffen.