Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/ExLlamaV2 erklärt 2026: Archiviert, abgelöst durch ExLlamaV3
Overview & Reference

ExLlamaV2 erklärt 2026: Archiviert, abgelöst durch ExLlamaV3

·8 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

ExLlamaV2 ist eine kostenlose, MIT-lizenzierte Inferenz-Bibliothek von turboderp's, gebaut für maximale Inferenzgeschwindigkeit auf Consumer-NVIDIA-GPUs mit dem eigenen EXL2-Quantisierungsformat, das eine Mischung von 2- bis 8-Bit-Präzision pro Layer erlaubt, um eine durchschnittliche Ziel-Bitrate zu erreichen. Zum Zeitpunkt dieses Artikels ist das Repository turboderp-org/exllamav2 als archiviert markiert, mit der Begründung, dass die Entwicklung zum Nachfolger ExLlamaV3 gewechselt ist, der ein neues EXL3-Quantisierungsformat einführt.

ExLlamaV2 war eine schnelle, auf Consumer-GPUs ausgerichtete Inferenz-Bibliothek, bekannt für ihr flexibles EXL2-Quantisierungsformat — doch zum Zeitpunkt dieses Artikels ist das eigene Repository archiviert, und die Entwicklung wird beim Nachfolger ExLlamaV3 fortgesetzt.

ExLlamaV2 erklärt 2026: Archiviert, abgelöst durch ExLlamaV3

Wichtigste Erkenntnisse

  • MIT-Lizenz, erstellt von einem Entwickler, der als turboderp bekannt ist
  • Rund 4.600 GitHub-Stars; das Repository unter github.com/turboderp-org/exllamav2 ist als archiviert markiert
  • EXL2-Quantisierungsformat: mischt 2-, 3-, 4-, 5-, 6- und 8-Bit-Präzision pro Layer, um eine durchschnittliche Ziel-Bitrate zu erreichen, z. B. ein 70B-Modell in 24 GB VRAM bei rund 2,55 Bit pro Gewicht
  • Das Nachfolgeprojekt ExLlamaV3 (rund 1.300 GitHub-Stars) führt das EXL3-Format ein, eine gestraffte Variante des QTIP-Quantisierungsansatzes von Cornell RelaxML
  • TabbyAPI, ein FastAPI-basierter Server, ist die empfohlene OpenAI-kompatible API-Schicht für beide Versionen
  • Auch integriert in text-generation-webui, lollms-webui und die eigenständige ExUI-Weboberfläche

📍 In einem Satz

ExLlamaV2 ist eine kostenlose, MIT-lizenzierte Inferenz-Bibliothek von turboderp's für schnelle LLM-Inferenz auf Consumer-NVIDIA-GPUs, bekannt für ihr flexibles EXL2-Quantisierungsformat, doch das Repository ist inzwischen zugunsten des aktiv entwickelten Nachfolgers ExLlamaV3 archiviert.

💬 In einfachen Worten

ExLlamaV2 wurde gezielt gebaut, um mit einem ungewöhnlich flexiblen Quantisierungsschema maximale Geschwindigkeit aus einer einzelnen Consumer-GPU herauszuholen; der eigene Maintainer hat die Entwicklung inzwischen auf ein neues Projekt, ExLlamaV3, verlagert, statt V2 weiter zu aktualisieren.

📌Hinweis: Die GitHub-README von ExLlamaV2 selbst besagt, dass das Projekt archiviert ist und die Entwicklung bei ExLlamaV3 fortgesetzt wird — wer heute ein neues Projekt startet, sollte ExLlamaV3 bewerten, statt auf der archivierten V2-Codebasis aufzubauen.

Was war ExLlamaV2?

ExLlamaV2 war eine kostenlose Open-Source-Inferenz-Bibliothek, veröffentlicht unter der MIT-Lizenz von einem Entwickler, der als turboderp bekannt ist, und speziell darauf ausgelegt, die Inferenzgeschwindigkeit auf Consumer-NVIDIA-GPUs zu maximieren. Es folgte auf ein früheres Projekt, ExLlama, und war selbst eine speichereffizientere Neufassung mit Fokus darauf, quantisierte Modelle schnell auf einer einzelnen GPU auszuführen.

Das Repository, github.com/turboderp-org/exllamav2, erreichte rund 4.600 GitHub-Stars, bevor es als archiviert markiert wurde; die README verweist auf ExLlamaV3 als das Projekt, in dem die Entwicklung nun fortgesetzt wird.

  • Fokussiert eng auf NVIDIA-Consumer-GPUs statt auf die breite Hardware-Abdeckung von Engines wie llama.cpp
  • Führte das EXL2-Quantisierungsformat als Hauptbeitrag ein, das gemischte Präzisionsquantisierung innerhalb eines einzelnen Modells erlaubt
  • Unterstützte dieselben 4-Bit-GPTQ-Modelle wie das ursprüngliche ExLlama, zusätzlich zum eigenen EXL2-Format
  • Installierbar über pip (pip install exllamav2), vorgefertigte Wheels oder Build aus dem Quellcode gegen das CUDA Toolkit

Was ist EXL2-Quantisierung?

EXL2 ist das Quantisierungsformat von ExLlamaV2 und erlaubt es, dass verschiedene lineare Layer innerhalb desselben Modells unterschiedliche Bit-Breiten verwenden — von 2-Bit bis 8-Bit —, die automatisch anhand von Kalibrierungsdaten gewählt werden, um eine durchschnittliche Ziel-Bitrate zu erreichen. Das ist flexibler als eine einzige feste Bit-Breite, die einheitlich auf ein gesamtes Modell angewendet wird.

  • Unterstützt 2-, 3-, 4-, 5-, 6- und 8-Bit-Quantisierungsstufen, gemischt pro Layer innerhalb eines Modells
  • Wichtigere Gewichtsspalten können mit höherer Präzision quantisiert werden, während weniger wichtige weniger Bits nutzen, ähnlich im Prinzip zur sparsamen Quantisierung
  • Ermöglicht extreme Komprimierung großer Modelle bei begrenztem VRAM — dokumentierte Tests zeigen ein 70B-Parameter-Modell, das in 24 GB VRAM bei rund 2,55 Bit pro Gewicht mit 2048-Token-Kontext läuft
  • Quantisierungsparameter werden automatisch anhand von Kalibrierungsdaten gewählt, statt manuelle Pro-Layer-Konfiguration zu erfordern

Warum ist ExLlamaV2 archiviert, und was ändert ExLlamaV3?

Das Repository turboderp-org/exllamav2 ist als archiviert markiert, mit der eigenen README, die besagt, dass die Entwicklung bei ExLlamaV3 fortgesetzt wird. Dies ist die wichtigste Tatsache, die man vor der Bewertung von ExLlamaV2 für ein neues Projekt kennen sollte.

ExLlamaV3 führt ein eigenes Format ein, EXL3, beschrieben als gestraffte Variante des QTIP-Quantisierungsansatzes von Cornell RelaxML. Anders als EXL2 erhält EXL3 ursprüngliche Tensorstrukturen, statt sie umzubenennen, was die künftige Unterstützung durch andere Frameworks erleichtern soll. ExLlamaV3 dokumentiert CUDA 12.4 oder neuer als Voraussetzung und wird von den eigenen Maintainern ausdrücklich als noch reifend gekennzeichnet — es sind also noch Unebenheiten zu erwarten.

  • ExLlamaV2: archiviert, MIT-Lizenz, EXL2-Format, weiterhin installierbar, erhält aber keine weitere Entwicklung
  • ExLlamaV3: aktiv, MIT-Lizenz, EXL3-Format (basierend auf QTIP-Forschung), Beta-Stabilität laut eigener Dokumentation
  • Beide werden vom selben Entwickler, turboderp, unter der GitHub-Organisation turboderp-org gepflegt

📌Hinweis: Für jedes neue Deployment sollte zuerst ExLlamaV3 bewertet werden — dort findet die aktive Pflege und Weiterentwicklung statt. ExLlamaV2 bleibt vor allem für bestehende Setups relevant, die bereits darauf aufbauen, oder für bereits im Umlauf befindliche EXL2-quantisierte Modelldateien.

Wie installiert und betreibt man ExLlamaV2 (oder V3)?

ExLlamaV2 wird über pip, vorgefertigte Wheels oder aus dem Quellcode gegen das CUDA Toolkit installiert; ExLlamaV3 folgt einem ähnlichen Muster. TabbyAPI ist der empfohlene Weg, um einen OpenAI-kompatiblen Server auf beiden aufzusetzen.

  1. 1
    Für ExLlamaV2: Installation über pip install exllamav2, oder Download eines vorgefertigten Wheels passend zu Python- und CUDA-Version von der GitHub-Releases-Seite, oder Klonen und Build aus dem Quellcode mit installiertem CUDA Toolkit.
  2. 2
    Für ExLlamaV3 (empfohlen für neue Setups): den entsprechenden Installationswegen unter github.com/turboderp-org/exllamav3 folgen, wobei CUDA 12.4 oder neuer erforderlich ist.
  3. 3
    Ein vorquantisiertes EXL2- (oder EXL3-)Modell herunterladen, üblicherweise von Community-Quantisierern auf Hugging Face veröffentlicht.
  4. 4
    TabbyAPI installieren und ausführen, den empfohlenen FastAPI-basierten Server, um einen OpenAI-kompatiblen API-Endpunkt mit HF-Modell-Download und Jinja2-Chat-Template-Unterstützung bereitzustellen.
  5. 5
    Alternativ ExLlamaV2/V3 über eine bestehende Integration nutzen — text-generation-webui, lollms-webui oder die eigenständige ExUI-Weboberfläche — statt TabbyAPI direkt auszuführen.

Kann ich ExLlamaV2 heute noch nutzen?

Ja, es bleibt installierbar und funktionsfähig, aber das Repository ist archiviert und erhält keine weiteren Updates, Fehlerbehebungen oder neuen Funktionen.

Funktionieren EXL2-Modelldateien mit ExLlamaV3?

Nein, nicht direkt — ExLlamaV3 verwendet sein eigenes EXL3-Quantisierungsformat. Bestehende EXL2-Modelldateien sind für ExLlamaV2/TabbyAPI-Setups gedacht, nicht für V3.

Welche Hardware benötigt ExLlamaV2?

ExLlamaV2 zielt speziell auf Consumer-NVIDIA-GPUs ab — es gibt keinen Unterstützungspfad für AMD, Intel oder reinen CPU-Betrieb. Dieser enge Hardware-Fokus ist Teil des Grunds, warum es so stark auf Single-GPU-Geschwindigkeit optimiert werden konnte.

  • Nur NVIDIA-GPUs, CUDA erforderlich — keine dokumentierte Unterstützung für AMD, Intel oder Apple Silicon
  • Ausgelegt auf Consumer-Karten statt auf Rechenzentrums-GPUs, läuft aber auch auf diesen
  • Der VRAM-Bedarf skaliert mit Modellgröße und gewählter EXL2-Bitrate — genau die flexible Quantisierung erlaubt es, große Modelle in vergleichsweise wenig VRAM unterzubringen
  • ExLlamaV3 dokumentiert CUDA 12.4 oder neuer als Voraussetzung, eine neuere Basis als bei ExLlamaV2 angenommen

Wer sollte ExLlamaV2 (oder ExLlamaV3) nutzen?

Nutzen Sie ExLlamaV3 für ein neues Projekt, wenn maximale Geschwindigkeit und VRAM-Effizienz auf einer einzelnen NVIDIA-Consumer-GPU wichtiger sind als breite Hardware-Unterstützung oder langfristige Stabilitätsgarantien; es gibt heute wenig Grund, ein brandneues Projekt auf dem archivierten ExLlamaV2 zu starten.

Wie schneidet ExLlamaV2 im Vergleich zu Alternativen ab?

Die nächstliegenden Vergleiche für ExLlamaV2 sind der eigene Nachfolger sowie andere Engines mit starkem Fokus auf Quantisierung oder Single-GPU-Geschwindigkeit.

Tool
Lizenz
Am besten für
ExLlamaV2 (archiviert)MITNur bestehende EXL2-Setups
ExLlamaV3MITMax. Single-GPU-Quantisierungseffizienz (Beta)
llama.cppMITBreiteste Hardware-Unterstützung, direkte Kontrolle
OllamaMITEinfachstes lokales Setup
KoboldCppAGPL 3.0Zero-Install, Rollenspiel/Story-UI

Häufige Fehler bei der Bewertung von ExLlamaV2

Die meiste Verwirrung entsteht dadurch, dass der archivierte Status nicht erkannt wird, oder durch die Annahme, EXL2- und EXL3-Modelldateien seien untereinander kompatibel.

Häufig gestellte Fragen

Wird ExLlamaV2 noch gepflegt?

Nein. Das GitHub-Repository turboderp-org/exllamav2 ist als archiviert markiert, wobei die README besagt, dass die Entwicklung stattdessen bei ExLlamaV3 fortgesetzt wird.

Was ist EXL2?

EXL2 ist das Quantisierungsformat von ExLlamaV2 und unterstützt gemischte 2- bis 8-Bit-Präzision pro Layer innerhalb eines einzelnen Modells, um eine durchschnittliche Ziel-Bitrate zu erreichen, sodass große Modelle in weniger VRAM passen.

Was ist ExLlamaV3, und wie unterscheidet es sich?

ExLlamaV3 ist der aktiv entwickelte Nachfolger von ExLlamaV2, der ein neues EXL3-Quantisierungsformat basierend auf dem QTIP-Ansatz von Cornell RelaxML verwendet. Es wird von den eigenen Maintainern als Beta-Software dokumentiert.

Wer hat ExLlamaV2 und ExLlamaV3 entwickelt?

Beide wurden von einem Entwickler erstellt, der als turboderp bekannt ist, unter der GitHub-Organisation turboderp-org.

Ist ExLlamaV2 kostenlos nutzbar?

Ja. Sowohl ExLlamaV2 als auch ExLlamaV3 werden unter der MIT-Lizenz veröffentlicht, kostenlos für private und kommerzielle Nutzung.

Unterstützt ExLlamaV2 AMD-GPUs?

Nein. Sowohl ExLlamaV2 als auch ExLlamaV3 benötigen eine NVIDIA-GPU mit CUDA — es gibt keine Unterstützung für AMD, Intel oder Apple Silicon.

Was ist TabbyAPI?

TabbyAPI ist ein FastAPI-basierter Server und der empfohlene Weg, eine OpenAI-kompatible API auf ExLlamaV2 oder ExLlamaV3 bereitzustellen, mit zusätzlichen Funktionen wie Hugging-Face-Modell-Download und Jinja2-Chat-Template-Unterstützung.

Können EXL2- und EXL3-Modelldateien austauschbar verwendet werden?

Nein. EXL2-Dateien sind für ExLlamaV2 quantisiert und nicht direkt mit ExLlamaV3 kompatibel, das das separate EXL3-Format verwendet.

Sollte ich ExLlamaV2 oder ExLlamaV3 für ein neues Projekt verwenden?

ExLlamaV3, da ExLlamaV2 archiviert ist und keine weitere Entwicklung erhält. ExLlamaV3 ist noch im Beta-Stadium, also sind im Vergleich zu einem ausgereiften, aktiv stabilisierten Projekt einige Unebenheiten zu erwarten.

Wie schneidet ExLlamaV2 im Vergleich zu llama.cpp ab?

llama.cpp unterstützt ein deutlich breiteres Spektrum an Hardware (NVIDIA, AMD, Apple Silicon, Intel, reine CPU) und wird aktiv gepflegt; ExLlamaV2 war eng auf NVIDIA-Consumer-GPUs fokussiert und ist inzwischen archiviert, mit ExLlamaV3 als aktivem Nachfolger.

Quellen

← Zurück zu Lokale LLMs Pro