Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Shimmy Review 2026: Eine 5-MB-Rust-Alternative zu Ollama
Overview & Reference

Shimmy Review 2026: Eine 5-MB-Rust-Alternative zu Ollama

·10 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Shimmy ist ein kostenloser, quelloffener Inferenzserver in einer einzigen Binary, komplett in Rust geschrieben, der lokale GGUF- und SafeTensors-Modelle über eine OpenAI-kompatible API bereitstellt, ohne Python-Laufzeitumgebung, ohne C++-Toolchain und ohne llama.cpp-Abhängigkeit. Entwickelt und gepflegt von Michael A. Kuykendall als unabhängiges, allein betreutes Open-Source-Projekt unter der Apache-2.0-Lizenz, positioniert sich Shimmy gezielt gegen Ollamas deutlich größere Binary und langsamere Kaltstartzeit — das eigene README behauptet eine Binary-Größe von wenigen Megabyte gegenüber Ollamas mehreren hundert Megabyte umfassender Installation.

Shimmy (github.com/Michael-A-Kuykendall/shimmy) ist ein kostenloser, quelloffener Inferenzserver in einer einzigen Binary, komplett in Rust geschrieben, positioniert als schlanke, abhängigkeitsfreie Alternative zu Ollama zum Servieren lokaler GGUF- und SafeTensors-Modelle über eine OpenAI-kompatible API. Es benötigt keine Python-Laufzeitumgebung, keine C++-Toolchain und keine llama.cpp-Abhängigkeit — die Binary selbst ist nur wenige Megabyte groß statt mehrerer hundert. Diese Review beschreibt, was Shimmy tatsächlich leistet, wie es sich mit Ollama und llama.cpp vergleicht, wie man es installiert und für wen es geeignet ist.

Wichtigste Erkenntnisse

  • Shimmy (github.com/Michael-A-Kuykendall/shimmy) ist ein kostenloser, quelloffener Inferenzserver in einer einzigen Binary, keine IDE und keine Chat-App
  • Entwickelt und gepflegt von Michael A. Kuykendall als unabhängig betreutes Projekt — das eigene README erklärt "free forever" ("für immer kostenlos"), ohne Hinweise auf ein Unternehmen oder eine Finanzierungsrunde dahinter
  • Apache-2.0-lizenziert, laut der eigenen LICENSE-Datei des Repositorys
  • Läuft auf Airframe, der projekteigenen, reinen Rust-WebGPU-Transformer-Engine (WGSL), wodurch eine C++-Toolchain oder eine llama.cpp-Abhängigkeit vollständig vermieden wird
  • Stellt GGUF- und SafeTensors-Modelle über eine OpenAI-kompatible API bereit; das v2.6.2-Release ergänzte zusätzlich Ollama-kompatible und Anthropic-kompatible Routen
  • 5.890 GitHub-Stars zum Zeitpunkt dieser Review (github.com/Michael-A-Kuykendall/shimmy, verifiziert über die GitHub-API)

📍 In einem Satz

Shimmy ist ein kostenloser, quelloffener Inferenzserver in einer einzigen Binary, komplett in Rust geschrieben — eine schlanke, abhängigkeitsfreie Alternative zu Ollama —, der GGUF- und SafeTensors-Modelle über eine OpenAI-kompatible API bereitstellt, ohne Python-Laufzeitumgebung, ohne C++-Toolchain und ohne llama.cpp-Abhängigkeit, laut dem eigenen README des Projekts.

💬 In einfachen Worten

Statt Ollamas mehrere hundert Megabyte großes Paket zu installieren, ist Shimmy eine einzelne kleine ausführbare Datei (wenige Megabyte), die Sie herunterladen oder mit Cargo bauen, auf eine GGUF-Modelldatei auf Ihrer Festplatte verweisen lassen und ausführen. Jedes Tool, das bereits das OpenAI-API-Format spricht, kann stattdessen ohne Codeänderungen mit Shimmy sprechen.

📌Hinweis: Diese Review ist der ausführliche Begleitartikel zu Shimmys Eintrag im Local LLM Software Directory — dort finden Sie einen schnellen Vergleich von Shimmy mit Dutzenden anderer lokaler KI-Tools. Sie basiert auf Shimmys eigenem README, Changelog und Release Notes, nicht auf praktischen Benchmarks von PromptQuorum.

Was ist Shimmy?

Shimmy ist ein Kommandozeilen-Inferenzserver: eine einzelne Binary, die eine lokale GGUF- oder SafeTensors-Modelldatei lädt und über eine OpenAI-kompatible HTTP-API bereitstellt. Die eigene GitHub-Beschreibung bezeichnet es als "pure-Rust WebGPU inference engine — OpenAI-API compatible, GGUF native, runs on any GPU. No Python. No llama.cpp. Single binary."

  • Produkttyp: ein Kommandozeilen-Server in einer einzigen Binary — keine GUI-App und keine IDE-Erweiterung
  • Entwickler: Michael A. Kuykendall, ein unabhängiger Entwickler; diese Review fand keine Hinweise auf ein Unternehmen, einen Investor oder eine Finanzierungsrunde hinter dem Projekt
  • Repository: github.com/Michael-A-Kuykendall/shimmy
  • Lizenz: Apache-2.0, bestätigt über die eigene LICENSE-Datei des Repositorys
  • Umfang: 5.890 GitHub-Stars zum Zeitpunkt dieser Review, laut GitHub-API
  • Engine: Airframe, eine reine Rust-WebGPU-Transformer-Engine (WGSL), der Shimmys eigenes README zuschreibt, eine C++-Toolchain vollständig zu vermeiden

Shimmys Projektgeschichte und Versions-Meilensteine

Shimmy hat häufige, inkrementelle Releases veröffentlicht, das eigene CHANGELOG dokumentiert knapp 200 Commits und einen stetigen Takt an Punkt-Releases im Jahr 2026, zentriert um die selbst veröffentlichte Modell-Zertifizierungs-Pipeline und die Airframe-Inferenz-Engine.

  1. 1
    v2.5.0 — 6. August 2026: Airframe-Engine auf 0.3.0 aktualisiert
    Why it matters: Aktualisierte die zugrunde liegende reine Rust-WebGPU-Transformer-Engine, auf der Shimmy läuft.
  2. 2
    v2.6.0 — 27. August 2026: Zertifizierungs-Pipeline konsolidiert
    Why it matters: Konsolidierte Shimmys selbst veröffentlichte Modell-Zertifizierung in ein "3-Box"-Regime aus MATH + INFERENCE + DETERMINISM, das 26 Modell-/Quantisierungs-Kombinationen über 12 Modellfamilien hinweg zertifiziert, und entfernte rund 1.600 Zeilen Legacy-Engine-Code.
  3. 3
    v2.6.1 — 28. August 2026: Vereinheitlichtes Chat-Templating
    Why it matters: Führte die gesamte Prompt-Formatierung über ein gemeinsames Modul prompt_render zusammen, das echte GGUF-Chat-Templates via Jinja verwendet, und entfernte einen veralteten GPU-Server-Codepfad (rund 1.847 Zeilen entfernt).
  4. 4
    v2.6.2 — 28. August 2026: OpenAPI-Dokumentation und zusätzliche kompatible Routen
    Why it matters: Ergänzte einen maschinenlesbaren API-Vertrag (`GET /openapi.json`) und eine interaktive Swagger-UI (`GET /docs`), sowie Ollama-kompatible und Anthropic-kompatible Routen neben der bestehenden OpenAI-kompatiblen API.
  5. 5
    v2.6.3 — 29. August 2026: Fix für das Laden von Modellen auf integrierten GPUs
    Why it matters: Behob das Laden von Modellen auf integrierten GPUs, einschließlich eines spezifischen Fixes für Intel-Arc-GPUs, durch Aktualisierung der Airframe-Engine-Abhängigkeit auf 0.4.2.
  6. 6
    v2.6.4 — 30. August 2026: Aktuellstes Punkt-Release zum Zeitpunkt dieser Review
    Why it matters: Das aktuellste getaggte Release, das zum Zeitpunkt dieser Review auf der GitHub-Releases-Seite des Projekts gefunden wurde — prüfen Sie [github.com/Michael-A-Kuykendall/shimmy/releases](https://github.com/Michael-A-Kuykendall/shimmy/releases) direkt für alles, was nach dem Veröffentlichungsdatum dieser Review erschienen ist.

Was macht Shimmy tatsächlich?

Shimmys Funktionsumfang konzentriert sich darauf, lokale Modelle über eine vertraute API-Oberfläche bereitzustellen und dabei die Binary selbst minimal und abhängigkeitsfrei zu halten, laut Shimmys eigenem README.

  • GGUF-natives Modell-Laden — lädt GGUF-Modelldateien direkt, ohne Neukompilierung oder fest codierte Konstanten pro Modell, laut der eigenen Dokumentation des Projekts; das SafeTensors-Format wird ebenfalls unterstützt
  • OpenAI-kompatible API — Chat Completions, Text Completions, Streaming-Antworten und Endpunkte zur Modell-Auflistung, die dem OpenAI-API-Format entsprechen, sodass bestehender OpenAI-Client-Code und Tools ohne Änderung auf Shimmy verweisen können
  • Zusätzliche kompatible Routen — seit v2.6.2 stellt Shimmy neben seiner OpenAI-kompatiblen API auch Ollama-kompatible und Anthropic-kompatible Routen bereit
  • Selbst veröffentlichte Modell-Zertifizierung — ein "3-Box"-Testregime (MATH, INFERENCE, DETERMINISM), das Shimmy gegen unterstützte Modelle ausführt; das Projekt gibt an, dass 26 Modell-/Quantisierungs-Kombinationen über 12 Modellfamilien hinweg dieses Regime zum Zeitpunkt dieser Review bestehen
  • TurboShimmy INT4-KV-Cache-Komprimierung — Shimmys eigene Dokumentation beschreibt einen rund 7-fach niedrigeren KV-Cache-Speicherverbrauch in getesteten Konfigurationen, gedacht, um größere Kontextfenster oder kleinere GPUs für ein gegebenes Modell nutzbar zu machen
  • Erweiterter Kontext über YaRN-RoPE-Skalierung — über Umgebungsvariablen konfigurierbar, laut der Dokumentation des Projekts
  • Keine externe Inferenz-Abhängigkeit — Shimmy läuft auf Airframe, der eigenen reinen Rust-WebGPU-Engine, statt llama.cpp zu umwickeln oder eine Python-/CUDA-Toolchain zu benötigen

Anwendungsbeispiele: Drei Wege, Shimmy zu nutzen

Dies sind konkrete Workflows, aufgebaut aus Shimmys oben dokumentierten Funktionen — keine hypothetischen Anwendungsfälle.

Plattform, Preise und Lizenzierung

Plattform

Was Shimmy angibt:
Ein Kommandozeilen-Server in einer einzigen Binary — läuft auf macOS, Windows und Linux; kein GUI-Installer.

Kosten

Was Shimmy angibt:
Kostenlos und quelloffen. Das eigene README des Projekts erklärt "Shimmy will be free forever" ("für immer kostenlos"). Es gibt keine kostenpflichtige Stufe.

Lizenzierung

Was Shimmy angibt:
Apache-2.0, bestätigt über die eigene LICENSE-Datei des Repositorys.

Finanzierung

Was Shimmy angibt:
Unabhängig betreut von Michael A. Kuykendall; das Repository listet ein freiwilliges Sponsoring-Programm (von einer 5-$-pro-Monat-Stufe bis zu einer 500-$-pro-Monat-Infrastruktur-Partner-Stufe), keine Finanzierungsrunde oder ein Unternehmen.

Prüfen Sie den aktuellen Lizenzierungs- und Finanzierungsstatus direkt auf github.com/Michael-A-Kuykendall/shimmy, bevor Sie sich für eine Compliance- oder Anbieterrisiko-Entscheidung auf diese Tabelle verlassen.

Shimmy vs. Ollama

Shimmy positioniert sich direkt gegen Ollama, das eigene README bezeichnet sich selbst als "the 5MB alternative to Ollama". Beide stellen lokale Modelle über ähnliche HTTP-APIs bereit; der Unterschied liegt hauptsächlich in Binary-Größe, Abhängigkeits-Fußabdruck und der jeweiligen Inferenz-Engine.

Binary-Größe

Shimmy:
Wenige MB, laut Shimmys eigener README-Angabe
Ollama:
Mehrere hundert MB, laut Vergleichen von Dritten

Inferenz-Engine

Shimmy:
Airframe — eine eigene, reine Rust-WebGPU-Engine (WGSL)
Ollama:
Baut auf llama.cpp auf

Laufzeit-Abhängigkeiten

Shimmy:
Keine — kein Python, keine C++-Toolchain, laut eigenem README
Ollama:
Bündelt eine eigene Laufzeitumgebung; ebenfalls kein separates Python nötig

API-Kompatibilität

Shimmy:
OpenAI-kompatibel, plus Ollama- und Anthropic-kompatible Routen (ab v2.6.2)
Ollama:
Hat eine eigene native API plus eine OpenAI-kompatible Schicht

Modellformat

Shimmy:
GGUF und SafeTensors
Ollama:
GGUF-basiert, über eine eigene Modellbibliothek und das Modelfile-Format

Betreuer

Shimmy:
Unabhängiger Einzelentwickler
Ollama:
Ollama Inc., ein finanziertes Unternehmen

Wenn Binary-Größe, Kaltstartzeit oder das gezielte Vermeiden von llama.cpp die entscheidenden Faktoren sind, ist Shimmy laut eigener Positionierung genau auf diese Achsen hin gebaut, um zu gewinnen. Wenn Sie die größte bestehende Modellbibliothek, Community-Tooling und ein finanziertes Unternehmen hinter der langfristigen Pflege möchten, ist Ollamas Erfolgsbilanz etablierter — siehe die Ollama Review für eine vollständige Übersicht. Prüfen Sie aktuelle Benchmarks selbst, statt sich auf das Marketing eines der beiden Projekte zu verlassen.

Für wen eignet sich Shimmy?

Shimmy passt zu Entwicklern, die gezielt einen minimalen, abhängigkeitsfreien Inferenzserver möchten und damit einverstanden sind, ein noch junges, allein betreutes Projekt einzusetzen.

Wettbewerber und Alternativen

Innerhalb schlanker lokaler Inferenzserver ist Shimmy am direktesten mit Ollama und llama.cpp vergleichbar — der Engine, auf der die meisten lokalen Tools, einschließlich Ollama, aufbauen — sowie LMDeploy für Teams, die Serving-Optionen mit höherem Durchsatz bewerten.

Ollama

Bekannt für:
Die am weitesten verbreitete Ein-Befehl-Laufzeitumgebung für lokale LLMs, unterstützt von einem finanzierten Unternehmen
Artikel über Ollama (10)

+273 weitere nicht angezeigt

llama.cpp

Bekannt für:
Die C/C++-Inferenz-Engine, auf der Ollama und viele andere Tools aufbauen
Artikel über llama.cpp (10)

+140 weitere nicht angezeigt

LMDeploy

Bekannt für:
Hochdurchsatz-LLM-Serving und Quantisierung, ausgerichtet auf Produktions-Workloads
Artikel über LMDeploy (1)

Auch erwähnt in:

Dies ist keine erschöpfende Liste lokaler Inferenzserver — siehe das Local LLM Software Directory für den vollständigen, regelmäßig aktualisierten Katalog, einschließlich Shimmys eigenem Verzeichniseintrag.

Häufige Fehler bei der Bewertung von Shimmy

Die meiste Verwirrung um Shimmy entsteht durch die Vermischung mit nicht verwandten, gleichnamigen Projekten, oder durch die Annahme, es habe Ollamas Modellbibliothek-Umfang.

Häufig gestellte Fragen

Was ist Shimmy?

Shimmy (github.com/Michael-A-Kuykendall/shimmy) ist ein kostenloser, quelloffener Inferenzserver in einer einzigen Binary, komplett in Rust geschrieben, der lokale GGUF- und SafeTensors-Modelle über eine OpenAI-kompatible API bereitstellt.

Ist Shimmy kostenlos?

Ja. Shimmy ist kostenlos und quelloffen unter der Apache-2.0-Lizenz. Das eigene README erklärt "Shimmy will be free forever" ("für immer kostenlos"), ohne kostenpflichtige Stufe.

Wie installiere ich Shimmy?

Die einfachste Methode ist laut dem eigenen README des Projekts cargo install shimmy. Vorgebaute Release-Binaries und eine Docker-Konfiguration stehen ebenfalls im GitHub-Repository zur Verfügung.

Wie unterscheidet sich Shimmy von Ollama?

Shimmys eigenes README beschreibt es als "the 5MB alternative to Ollama" — eine deutlich kleinere Binary ohne Python-Laufzeitumgebung oder C++-Toolchain, die auf der eigenen Airframe-Engine statt llama.cpp läuft. Ollama hat eine größere, etabliertere Modellbibliothek und wird von einem finanzierten Unternehmen unterstützt; Shimmy wird von einem einzelnen unabhängigen Entwickler betreut.

Verwendet Shimmy llama.cpp?

Nein. Shimmy läuft auf Airframe, der eigenen reinen Rust-WebGPU-Transformer-Engine (WGSL), die laut Projektangabe eine llama.cpp- oder C++-Toolchain-Abhängigkeit vollständig vermeidet.

Welche Modellformate unterstützt Shimmy?

GGUF und SafeTensors, laut der eigenen Dokumentation des Projekts. Shimmy lädt GGUF-Dateien direkt, ohne Neukompilierung oder fest codierte Konstanten pro Modell.

Ist Shimmys API mit OpenAI-Tools kompatibel?

Ja. Shimmy stellt eine OpenAI-kompatible API bereit (Chat Completions, Text Completions, Streaming, Modell-Auflistung). Seit dem v2.6.2-Release wurden zusätzlich Ollama-kompatible und Anthropic-kompatible Routen ergänzt.

Wer hat Shimmy entwickelt?

Michael A. Kuykendall hat Shimmy als unabhängiges, allein betreutes Open-Source-Projekt entwickelt und pflegt es. Diese Review fand keine Hinweise auf ein Unternehmen oder eine Finanzierungsrunde dahinter.

Wie viele Modelle unterstützt Shimmy?

Zum Zeitpunkt dieser Review zertifiziert Shimmy 26 spezifische Modell-/Quantisierungs-Kombinationen über 12 Modellfamilien hinweg durch das eigene "MATH + INFERENCE + DETERMINISM"-Testregime — prüfen Sie das GitHub-Repository des Projekts für die aktuelle, stets aktualisierte Liste.

Hat PromptQuorum Shimmys Leistungsangaben eigenständig getestet?

Diese Review basiert auf Shimmys eigenem README, CHANGELOG und Release Notes, nicht auf praktischem Benchmarking von Startzeit, Speicherverbrauch oder KV-Cache-Komprimierung durch PromptQuorum.

Muss ich bei der Verwendung von Shimmy die DSGVO beachten?

Shimmy läuft vollständig lokal auf Ihrer eigenen Hardware und sendet standardmäßig keine Prompt- oder Modelldaten an einen externen Server, sodass Verarbeitungsvorgänge im Rahmen der DSGVO grundsätzlich bei Ihnen als Betreiber verbleiben. Für Unternehmen bedeutet das: Die DSGVO-Artikel-28-Auftragsverarbeitungspflichten entfallen typischerweise, da kein externer Auftragsverarbeiter im Spiel ist, solange Sie Shimmy selbst hosten und keine Daten an Dritte weiterleiten. Beachten Sie dennoch die BSI-Grundschutz-Kataloge für die Absicherung des Servers selbst, etwa Netzwerkzugriff und Zugriffskontrolle auf die API. Dies ist keine Rechtsberatung — prüfen Sie Ihren konkreten Anwendungsfall mit einem Datenschutzbeauftragten.

Ist Shimmy für den deutschen Mittelstand geeignet?

Für IT-Teams im deutschen Mittelstand, die bereits Erfahrung mit Kommandozeilen-Tools und Git-Workflows haben, kann Shimmys minimaler Ressourcenbedarf attraktiv sein, etwa für den Einsatz auf bestehender Hardware ohne dedizierte GPU-Server. Da Shimmy von einem einzelnen unabhängigen Entwickler ohne Unternehmen dahinter gepflegt wird, sollten Mittelstandsunternehmen mit hohen Anforderungen an garantierten Support oder SLAs dies gegen Ollamas etablierteres, unternehmensgestütztes Modell abwägen und eigene BSI-konforme Absicherungsmaßnahmen für den produktiven Einsatz treffen.

Sources

← Zurück zu Lokale LLMs Pro