Wichtigste Erkenntnisse
- AGPL-3.0-Lizenz — kostenlos nutzbar, mit Copyleft-Pflicht, wenn modifiziert und als Netzwerkdienst weiterverbreitet
- Baut im Hintergrund auf llama.cpp (MIT-lizenziert) auf, mit eigener Oberfläche und zusätzlichen Funktionen obendrauf
- Eine ausführbare Datei je Plattform: Windows, Linux x64, macOS ARM64 — kein Installer
- KoboldAI Lite, die integrierte Weboberfläche, ist für Story-Schreiben und Rollenspiel gebaut: editierbare Ausgabe, Memory-/World-Info-Felder und mehrere Chat-/Adventure-Modi
- GPU-Beschleunigung über CUDA (NVIDIA) oder Vulkan (herstellerübergreifend, empfohlener Weg für AMD); ein rollierender ROCm-Build existiert für Linux; reiner CPU-Betrieb ebenfalls vollständig unterstützt
- Enthält zudem Stable-Diffusion-Bildgenerierung und Whisper-Sprache-zu-Text in derselben ausführbaren Datei
📍 In einem Satz
KoboldCpp ist eine kostenlose, AGPL-3.0-lizenzierte lokale LLM-Anwendung in einer einzigen Datei, aufgebaut auf llama.cpp, die GGUF-Modelle ohne Installation ausführt und die KoboldAI-Lite-Weboberfläche für Story-Schreiben und Rollenspiel mitbringt.
💬 In einfachen Worten
Eine Datei herunterladen, doppelklicken, und ein Browser-Tab öffnet sich mit bereits integrierter Chat- und Story-Editier-Oberfläche — kein separater Installer, kein Kommandozeilen-Setup, keine zusätzliche Wrapper-App nötig.
📌Hinweis: Die einzige offizielle Download-Quelle ist die GitHub-Releases-Seite. Dateien mit demselben Namen auf anderen Seiten lassen sich nicht als echter Build verifizieren.
Was ist KoboldCpp?
KoboldCpp ist ein kostenloses Ein-Datei-Programm, das GGUF-Sprachmodelle lokal ausführt, aufgebaut auf der llama.cpp-Inferenz-Engine und gepflegt von einem pseudonymen Entwickler namens LostRuins. Es stammt von den Oberflächen-Konventionen des ursprünglichen KoboldAI-Projekts ab, angepasst für den Betrieb auf llama.cpps Backend statt eines Python-basierten Inferenz-Stacks.
Das Projekt liegt unter github.com/LostRuins/koboldcpp und steht unter der GNU Affero General Public License Version 3 (AGPL 3.0) — einer Copyleft-Lizenz, die sich von der freizügigen MIT-Lizenz unterscheidet, die llama.cpp selbst im Hintergrund verwendet. Releases erscheinen häufig; die zum Testzeitpunkt aktuelle Version (Ende August 2026) war v1.120.
- Als eine ausführbare Datei je Plattform verteilt — koboldcpp.exe (Windows), koboldcpp-linux-x64 (Linux), koboldcpp-mac-arm64 (macOS Apple Silicon)
- Kein Installer, keine Python-Umgebung und kein Docker zum Betrieb nötig
- Nutzt llama.cpp für die eigentliche Modell-Inferenz und baut eigenen Server, Weboberfläche und API-Schicht obendrauf
- Bietet einen nocuda-Build (CUDA-frei, Vulkan-fähig) und einen oldpc-Build (CUDA11 + AVX1) für ältere Hardware, neben dem CUDA-fähigen Hauptbuild
Was ist KoboldAI Lite, und was bringt es zusätzlich?
KoboldAI Lite ist die Weboberfläche, die direkt in der KoboldCpp-Datei mitgeliefert wird — sie öffnet sich automatisch in einem Browser-Tab, sobald der Server startet, ohne separaten Installationsschritt. Sie ist speziell auf Langform-Schreiben und Rollenspiel ausgelegt, nicht nur auf Chat im Frage-Antwort-Takt.
- Editierbare Ausgabe: generierter Text lässt sich direkt bearbeiten, nicht nur neu generieren — wichtig für gemeinsames Story-Schreiben
- Memory- und World-Info-Felder: dauerhafte Kontextblöcke, die das Modell immer sieht, um Charakterdetails oder Story-Fakten über eine lange Sitzung hinweg konsistent zu halten
- Mehrere Modi: normaler Chat, ein „Story"-Modus für gemeinsames Schreiben und ein „Adventure"-Modus im Stil von Textadventures
- Author's-Note- und Instruct-Formatierungs-Kontrollen zur Steuerung von Ton und Stil, ohne die zugrunde liegende Prompt-Vorlage von Hand zu bearbeiten
- Läuft vollständig aus derselben ausführbaren Datei und demselben lokalen Server — keine separate Frontend-App oder Browser-Erweiterung nötig
Wie lädt man KoboldCpp herunter und startet es?
Die richtige Datei für die eigene Plattform von der offiziellen GitHub-Releases-Seite herunterladen und direkt ausführen — ein Installationsschritt entfällt. Die passende Version für die eigene Hardware zu wählen ist die einzige wirkliche Entscheidung dabei.
- 1Die KoboldCpp-Releases-Seite auf GitHub aufrufen — die einzige offizielle Download-Quelle.
- 2Die passende Plattform-Version wählen: koboldcpp.exe für Windows, koboldcpp-linux-x64 für Linux oder koboldcpp-mac-arm64 für macOS auf Apple Silicon.
- 3Den passenden GPU-Weg wählen: Der Hauptbuild enthält NVIDIA-CUDA-Unterstützung; AMD-Nutzern empfiehlt das Projekt zunächst die Vulkan-Option im nocuda-Build; ein separater rollierender ROCm-Build existiert für Linux; ältere Hardware ohne moderne Befehlssätze sollte den oldpc-Build (CUDA11 + AVX1) nutzen.
- 4Eine GGUF-Modelldatei (z. B. von Hugging Face) herunterladen, falls noch keine vorhanden ist.
- 5Die ausführbare Datei starten, im Launcher-Fenster die GGUF-Datei und einen GPU-Layer-Offload-Wert wählen und den Server starten.
- 6Ein Browser-Tab öffnet sich automatisch mit der KoboldAI-Lite-Oberfläche, bereits mit dem laufenden lokalen Server verbunden.
Erfordert KoboldCpp eine Installation?
Nein. Es handelt sich um eine einzelne ausführbare Datei — herunterladen und direkt starten. Es gibt keinen Installer, keine separate Python-Umgebung und keinen Docker-Container.
Kann KoboldCpp ohne GPU laufen?
Ja. Reiner CPU-Betrieb wird vollständig unterstützt; eine GPU (über CUDA, Vulkan oder ROCm) beschleunigt lediglich die Generierung, ist aber nie zwingend erforderlich.
Welche GPUs und Hardware unterstützt KoboldCpp?
KoboldCpp unterstützt NVIDIA-, AMD- und reine CPU-Setups über separate Build-Varianten statt eines einzigen, alles automatisch erkennenden Universal-Binarys. Die passende Version für die eigene Hardware zu wählen ist nötig, damit GPU-Beschleunigung funktioniert.
- NVIDIA — CUDA-Beschleunigung ist in den Haupt-Release-Binaries fest eingebaut
- AMD — das Projekt selbst empfiehlt, zunächst das Vulkan-Backend im nocuda-Build zu probieren, da es die breiteste Kompatibilität bietet; ein separates rollierendes ROCm-Binary wird zudem für Linux gepflegt
- Herstellerübergreifend — das Vulkan-Backend läuft auch auf Intel-Grafik und älteren NVIDIA-/AMD-Karten ohne herstellerspezifische Treiber
- Ältere Hardware — der oldpc-Build richtet sich an CUDA 11 und reine AVX1-CPUs für Rechner, die den modernen Standard-Build nicht ausführen können
- Nur CPU — der nocuda-Build läuft komplett ohne GPU, mit reduzierter Geschwindigkeit gegenüber GPU-beschleunigter Inferenz
Für wen eignet sich KoboldCpp?
Nutzen Sie KoboldCpp, wenn Story-Schreiben, Rollenspiel oder eine installationsfreie Einzeldatei wichtiger sind als reiner Durchsatz oder minimaler Speicherbedarf; nutzen Sie etwas anderes, wenn Sie Multi-User-Produktions-Serving oder den kleinstmöglichen Download brauchen.
Wie schneidet KoboldCpp im Vergleich zu Ollama und anderen lokalen Tools ab?
Die engsten Vergleiche zu KoboldCpp sind andere auf llama.cpp aufgebaute Tools sowie Produktions-Serving-Engines für eine ganz andere Aufgabe.
Tool | Lizenz | Am besten für |
|---|---|---|
| KoboldCpp | AGPL 3.0 | Installationsfrei, Rollenspiel/Story-UI eingebaut |
| llama.cpp | MIT | Breiteste Hardware-Unterstützung, direkte Kontrolle |
| Ollama | MIT | Einfache CLI/API, Modellverwaltung |
| LM Studio | Proprietär (kostenlos) | Terminalfreie Desktop-GUI |
| vLLM | Apache 2.0 | Multi-User-Serving mit hohem Durchsatz |
| text-generation-webui | AGPL 3.0 | Tiefe UI-Anpassung, viele Backends |
Häufige Fehler bei der Bewertung von KoboldCpp
Die meiste Verwirrung entsteht, wenn KoboldCpp wie eine gewöhnlich installierte App behandelt wird, oder beim Download aus inoffiziellen Quellen.
Häufig gestellte Fragen
Was ist KoboldCpp?
KoboldCpp ist eine kostenlose, auf llama.cpp aufgebaute lokale LLM-Anwendung in einer einzigen Datei. Sie führt GGUF-Modelle ohne Installationsschritt aus und bringt die KoboldAI-Lite-Weboberfläche für Story-Schreiben und Rollenspiel mit.
Wer pflegt KoboldCpp?
KoboldCpp wird von einem pseudonymen Entwickler namens LostRuins im Repository github.com/LostRuins/koboldcpp gepflegt. Releases erscheinen häufig, mit v1.120 als aktueller Version Stand Ende August 2026.
Ist KoboldCpp kostenlos?
Ja. KoboldCpp ist kostenlos und quelloffen unter der AGPL-3.0-Lizenz. Es gibt keine kostenpflichtige Stufe und kein gehostetes Produkt — jede KoboldCpp-Installation läuft auf selbst kontrollierter Hardware.
Unter welcher Lizenz steht KoboldCpp?
AGPL 3.0 (GNU Affero General Public License Version 3), eine Copyleft-Lizenz. Das unterscheidet sich von der MIT-Lizenz, die llama.cpp, die Engine im Hintergrund, verwendet.
Erfordert KoboldCpp eine Installation?
Nein. Es wird als einzelne ausführbare Datei je Plattform (Windows, Linux, macOS ARM64) verteilt — herunterladen und direkt starten, ohne Installer, Python-Umgebung oder Docker-Container.
Unterstützt KoboldCpp AMD-GPUs?
Ja, allerdings nicht über den Haupt-CUDA-Build. Das Projekt empfiehlt die Vulkan-Option im nocuda-Build als ersten Weg für AMD, ergänzt durch einen separat gepflegten rollierenden ROCm-Build für Linux.
Was ist KoboldAI Lite?
KoboldAI Lite ist die in der KoboldCpp-Datei mitgelieferte Weboberfläche. Sie öffnet sich automatisch im Browser, sobald der Server startet, und bietet editierbare Ausgabe, Memory-/World-Info-Felder sowie eigene Chat-, Story- und Adventure-Modi für Rollenspiel und gemeinsames Schreiben.
Kann KoboldCpp Bilder generieren oder Sprache transkribieren?
Ja. Dieselbe ausführbare Datei bündelt Stable-Diffusion-Bildgenerierung und Whisper-Sprache-zu-Text neben der primären Textgenerierung.
Eignet sich KoboldCpp für Produktion oder Multi-User-Betrieb?
Nein, das ist nicht das Designziel. KoboldCpp ist für Einzelnutzer-Betrieb mit reichhaltiger Schreiboberfläche gebaut; für Multi-User-Produktions-Serving mit hoher Nebenläufigkeit sind vLLM oder NVIDIA TensorRT-LLM die passenden Werkzeuge.
Worin unterscheidet sich KoboldCpp von Ollama?
Beide bauen auf llama.cpp auf, aber Ollama setzt auf eine minimale CLI und Modell-Registry ohne integrierte Oberfläche, während KoboldCpp eine vollständige browserbasierte Schreib- und Rollenspiel-Oberfläche (KoboldAI Lite) in derselben ausführbaren Datei mitbringt.
