Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/llamafile im Überblick 2026: Eine Datei, sechs Betriebssysteme
Overview & Reference

llamafile im Überblick 2026: Eine Datei, sechs Betriebssysteme

·8 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

llamafile ist ein kostenloses, Apache-2.0-lizenziertes Projekt, ursprünglich von Mozillas Innovationsgruppe veröffentlicht und von Justine Tunney erstellt, das ein LLM und die llama.cpp-Inferenz-Engine in eine einzige ausführbare Datei verpackt, die unverändert auf macOS, Linux, Windows und BSD läuft. Möglich macht das Cosmopolitan Libc, eine C-Standardbibliothek, die eine Binärdatei erzeugt, die nativ auf mehreren Betriebssystemen und CPU-Architekturen läuft, mit GPU-Beschleunigung über Metal (Apple Silicon), CUDA (NVIDIA), ROCm (AMD) und Vulkan.

llamafile verpackt eine Modelldatei und die llama.cpp-Engine in eine einzige ausführbare Datei, die unverändert auf macOS, Linux, Windows und BSD läuft — aufgebaut auf Cosmopolitan Libc, der Technologie, die es einer einzigen Binärdatei erlaubt, nativ auf mehreren Betriebssystemen und CPU-Architekturen zugleich zu laufen.

llamafile im Überblick 2026: Eine Datei, sechs Betriebssysteme

Wichtigste Erkenntnisse

  • Apache-2.0-Lizenz; die eigenen Änderungen des Projekts an llama.cpp und whisper.cpp bleiben MIT-lizenziert, um upstreamfähig zu bleiben
  • Rund 25.900+ GitHub-Sterne, Stand September 2026, Repository unter github.com/mozilla-ai/llamafile
  • Erstellt von Justine Tunney, Schöpferin von Cosmopolitan Libc, erstmals von Mozillas Innovationsgruppe im November 2023 veröffentlicht
  • Eine ausführbare Datei läuft auf macOS, Linux, BSD und Windows — Windows begrenzt ausführbare Dateien speziell auf 4 GB
  • GPU-Beschleunigung verfügbar über Metal (Apple Silicon), CUDA (NVIDIA), ROCm (AMD) und Vulkan
  • Direkt auf llama.cpp für die eigentliche Modell-Inferenz aufgebaut, wobei Cosmopolitan Libc die plattformübergreifende Verpackung löst

📍 In einem Satz

llamafile ist ein kostenloses, Apache-2.0-lizenziertes Projekt von Justine Tunney, ursprünglich von Mozilla veröffentlicht, das ein Modell und die llama.cpp-Engine in eine einzige ausführbare Datei verpackt, die unverändert auf macOS, Linux, Windows und BSD läuft — dank Cosmopolitan Libc.

💬 In einfachen Worten

Eine Datei herunterladen und doppelklicken — kein Installer, keine plattformspezifische Build-Auswahl —, weil die Datei selbst auf mehreren Betriebssystemen zugleich gültig ist, ein Kunststück, das Cosmopolitan Libc ermöglicht und nicht das Bündeln mehrerer separater Builds durch llamafile.

📌Hinweis: Version 0.10.0 führte ein überarbeitetes Build-System ein, um llamafile mit aktuellen llama.cpp-Versionen im Einklang zu halten, und die CUDA-Unterstützung für Linux wurde im Februar 2026 wieder eingeführt, nachdem sie eine Zeit lang nicht synchron war — die Release-Notes zeigen den genauen Funktionsumfang der heruntergeladenen Version.

Was ist llamafile?

llamafile ist ein kostenloses, quelloffenes Projekt, das ein Sprachmodell zusammen mit der llama.cpp-Inferenz-Engine in eine einzige ausführbare Datei verpackt, die ohne Installation auf mehreren Betriebssystemen verteilt und ausgeführt werden kann. Es wurde von Justine Tunney erstellt und erstmals von Mozillas Innovationsgruppe im November 2023 veröffentlicht.

Das Projekt liegt unter github.com/mozilla-ai/llamafile (zuvor unter der Organisation Mozilla-Ocho) und hat rund 25.900 GitHub-Sterne überschritten. Es steht unter der Apache-2.0-Lizenz, wobei die eigenen Änderungen des Projekts an llama.cpp und whisper.cpp unter MIT bleiben, um mit diesen Projekten kompatibel und upstreamfähig zu bleiben.

  • Kombiniert eine Modelldatei und die llama.cpp-Engine zu einer verteilbaren ausführbaren Datei, statt eine separate Engine-Installation plus separaten Modell-Download zu erfordern
  • Baut für die eigentliche Inferenzarbeit auf llama.cpp auf — llamafiles eigener Beitrag ist die Verpackungs- und plattformübergreifende Ausführungsschicht
  • Startet standardmäßig eine Chat-Web-Oberfläche beim Ausführen, zusätzlich zu einem OpenAI-API-kompatiblen Server-Modus
  • Vorgefertigte Beispiel-llamafiles für populäre offene Modelle werden vom Projekt und der Community auf Hugging Face veröffentlicht

Was ist Cosmopolitan Libc, und wie macht es das möglich?

Cosmopolitan Libc ist eine C-Standardbibliothek, ebenfalls von Justine Tunney erstellt, entwickelt, um „fette" Binärdateien zu kompilieren, die gleichzeitig auf mehreren Betriebssystemen und CPU-Architekturen gültige ausführbare Dateien sind. Das ist die zugrunde liegende Technologie, die llamafiles plattformübergreifende Ein-Datei-Verteilung ermöglicht.

  • Eine mit Cosmopolitan Libc gebaute Binärdatei kann unverändert auf macOS, Linux, BSD und Windows laufen, statt einen separaten kompilierten Build pro Betriebssystem zu erfordern
  • Das unterscheidet sich vom Bündeln mehrerer plattformspezifischer Binärdateien in einem Archiv — es ist wirklich eine Binärdatei, die über Systeme hinweg gültig ist
  • Windows setzt Ausführbaren-Dateien eine Größenbegrenzung von 4 GB, was speziell auf dieser Plattform begrenzt, wie groß eine einzelne llamafile sein kann
  • Cosmopolitan Libc ist ein eigenständiges, universelles Projekt; llamafile ist eine prominente Anwendung davon, nicht die einzige

Wie lädt man eine llamafile herunter und startet sie?

Eine vorgefertigte llamafile für das gewünschte Modell herunterladen, ausführbar machen und direkt starten — ein separater Installationsschritt entfällt. Auch das Erstellen einer eigenen llamafile aus einer eigenen GGUF-Modelldatei wird unterstützt.

  1. 1
    Eine vorgefertigte llamafile (ein mit der Engine gebündeltes Modell) von der Hugging-Face-Seite des Projekts oder der GitHub-Releases-Seite herunterladen.
  2. 2
    Unter macOS und Linux die Datei ausführbar machen (chmod +x yourmodel.llamafile), falls noch nicht geschehen, und dann direkt starten (./yourmodel.llamafile).
  3. 3
    Unter Windows die Datei um die Endung .exe erweitern, falls sie diese noch nicht hat, da Windows ausführbare Dateien so erkennt.
  4. 4
    Standardmäßig öffnet das Ausführen der Datei eine lokale Chat-Weboberfläche im Browser, zusätzlich zu einem OpenAI-API-kompatiblen Server-Endpunkt.
  5. 5
    Um GPU-Beschleunigung zu aktivieren, -ngl 999 übergeben, um möglichst viele Schichten auf eine erkannte GPU (Metal, CUDA, ROCm oder Vulkan) auszulagern.
  6. 6
    Um eine eigene llamafile aus einem eigenen GGUF-Modell zu erstellen, die Verpackungstools des Projekts nutzen, um das Modell mit dem llamafile-Engine-Binary zu kombinieren.

Erfordert llamafile eine Installation?

Nein. Die Datei herunterladen, bei Bedarf ausführbar machen und direkt starten — ein separater Installer ist nicht nötig.

Kann llamafile ohne GPU laufen?

Ja. Reiner CPU-Betrieb funktioniert sofort; GPU-Beschleunigung (Metal, CUDA, ROCm, Vulkan) ist eine optionale Leistungsverbesserung, kein Erfordernis.

Welche Hardware und GPU-Beschleunigung unterstützt llamafile?

llamafile unterstützt reinen CPU-Betrieb sofort, mit optionaler GPU-Beschleunigung über die meisten großen Hersteller hinweg. Die GPU-Unterstützung hat sich im Laufe der Zeit weiterentwickelt, daher hängt die genaue Fähigkeit von der heruntergeladenen Version ab.

  • Apple Silicon — Metal-Beschleunigung, standardmäßig aktiviert, wenn eine Metal-GPU erkannt wird (implementiert im Dezember 2025)
  • NVIDIA — CUDA-Beschleunigung unter Linux, im Februar 2026 wieder eingeführt, nachdem sie eine Zeit lang nicht mit dem vorgelagerten llama.cpp synchron war
  • AMD — ROCm-Beschleunigung
  • Herstellerübergreifend — Vulkan-Backend-Unterstützung
  • GPU-Bibliotheken (CUDA, ROCm, Vulkan) werden dynamisch aus vorgefertigten Dateien neben der ausführbaren Datei geladen, statt fest hineinkompiliert zu sein

Für wen eignet sich llamafile?

Nutzen Sie llamafile, wenn die Verteilung oder Ausführung eines Modells als einzelne, abhängigkeitsfreie, plattformübergreifende Datei wichtiger ist als die neuesten llama.cpp-Funktionen sofort zu haben; nutzen Sie llama.cpp direkt oder eine Wrapper-App, wenn diese Ein-Datei-Portabilität nicht Priorität hat.

Wie schneidet llamafile im Vergleich zu KoboldCpp und anderen installationsfreien Tools ab?

Der engste Vergleich zu llamafile ist KoboldCpp — beide werden als einzelne, auf llama.cpp aufgebaute Datei verteilt —, aber sie lösen unterschiedliche Probleme: plattformübergreifende Portabilität gegenüber einer gebündelten, rollenspielorientierten Oberfläche.

Tool
Lizenz
Am besten für
llamafileApache 2.0Eine Datei läuft unverändert auf 4 Systemen
KoboldCppAGPL 3.0Installationsfrei, Rollenspiel/Story-UI eingebaut
llama.cppMITBreiteste Hardware-Unterstützung, direkte Kontrolle
OllamaMITEinfache CLI/API, Modellverwaltung
LM StudioProprietär (kostenlos)Terminalfreie Desktop-GUI

Häufige Fehler bei der Bewertung von llamafile

Die meiste Verwirrung entsteht durch Missverständnisse darüber, wie der plattformübergreifende Ein-Datei-Trick funktioniert, oder durch Erwarten der neuesten llama.cpp-Funktionen sofort.

Häufig gestellte Fragen

Was ist llamafile?

llamafile ist ein kostenloses, Apache-2.0-lizenziertes Projekt, das ein Modell und die llama.cpp-Engine in eine einzige ausführbare Datei verpackt, die unverändert auf macOS, Linux, Windows und BSD läuft, mithilfe von Cosmopolitan Libc.

Wer hat llamafile erstellt?

Justine Tunney, Schöpferin von Cosmopolitan Libc, hat llamafile erstellt, erstmals von Mozillas Innovationsgruppe im November 2023 veröffentlicht. Es wird jetzt unter github.com/mozilla-ai/llamafile gepflegt.

Wie kann eine Datei auf macOS, Linux und Windows laufen?

llamafile wird mit Cosmopolitan Libc gebaut, einer C-Standardbibliothek, die eine einzelne Binärdatei erzeugt, die gleichzeitig auf mehreren Betriebssystemen und CPU-Architekturen gültig ist, statt separate Builds pro Plattform zu erfordern.

Ist llamafile kostenlos für kommerzielle Nutzung?

Ja. llamafile ist Apache-2.0-lizenziert, kostenlos für private und kommerzielle Nutzung. Die eigenen Änderungen an llama.cpp und whisper.cpp bleiben MIT-lizenziert.

Benötigt llamafile eine GPU?

Nein. Reiner CPU-Betrieb funktioniert standardmäßig; GPU-Beschleunigung über Metal, CUDA, ROCm oder Vulkan ist optional und verbessert die Geschwindigkeit.

Gibt es eine Dateigrößenbegrenzung für eine llamafile?

Ja, speziell unter Windows — Windows begrenzt ausführbare Dateien auf 4 GB, was einschränken kann, wie groß ein Modell als einzelne llamafile für Windows-Nutzer verpackt werden kann.

Bleibt llamafile mit llama.cpp auf dem aktuellen Stand?

Es synchronisiert sich periodisch statt fortlaufend — Version 0.10.0 führte ein überarbeitetes Build-System speziell ein, um mit aktuellen llama.cpp-Versionen Schritt zu halten, und die CUDA-Unterstützung für Linux wurde im Februar 2026 wieder eingeführt, nachdem sie eine Zeit lang hinterherhinkte.

Was ist der Unterschied zwischen llamafile und KoboldCpp?

Beide werden als einzelne, auf llama.cpp aufgebaute Datei ohne separaten Installer verteilt, aber llamafiles Unterscheidungsmerkmal ist echte plattformübergreifende Portabilität (eine Datei läuft auf 4 verschiedenen Betriebssystemen), während KoboldCpps Unterscheidungsmerkmal eine gebündelte, auf Rollenspiel und Story-Schreiben ausgerichtete Web-Oberfläche ist.

Kann ich eine llamafile aus meinem eigenen Modell erstellen?

Ja. Das Projekt stellt Verpackungstools bereit, um eine GGUF-Modelldatei mit dem llamafile-Engine-Binary zu einer eigenen, einzelnen ausführbaren Datei zu kombinieren.

Eignet sich llamafile für Produktions-Multi-User-Serving?

Nicht sein Fokus. llamafile ist für einfache, portable Ein-Datei-Verteilung und Einzelnutzer- oder kleinmaßstäbliche Nutzung gebaut; für Hochdurchsatz-Produktions-Serving für viele Nutzer sind vLLM oder SGLang die geeigneteren Werkzeuge.

Quellen

← Zurück zu Lokale LLMs Pro