Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/ExLlamaV2 expliqué 2026 : archivé, remplacé par ExLlamaV3
Overview & Reference

ExLlamaV2 expliqué 2026 : archivé, remplacé par ExLlamaV3

·8 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

ExLlamaV2 est une bibliothèque d'inférence gratuite sous licence MIT créée par turboderp's, conçue pour une vitesse d'inférence maximale sur les GPU NVIDIA grand public via son propre format de quantification EXL2, qui permet de mélanger une précision de 2 à 8 bits par couche pour atteindre un débit binaire moyen cible. Au moment de la rédaction, le dépôt turboderp-org/exllamav2 est marqué comme archivé, la raison indiquée étant que le développement s'est déplacé vers son successeur, ExLlamaV3, qui introduit un nouveau format de quantification EXL3.

ExLlamaV2 était une bibliothèque d'inférence rapide, axée sur les GPU grand public, connue pour son format de quantification EXL2 flexible — mais au moment de la rédaction, son propre dépôt est archivé, le développement se poursuivant sur son successeur, ExLlamaV3.

ExLlamaV2 expliqué 2026 : archivé, remplacé par ExLlamaV3

Points clés

  • Licence MIT, créé par un développeur connu sous le nom de turboderp
  • Environ 4 600 étoiles GitHub ; le dépôt sur github.com/turboderp-org/exllamav2 est marqué comme archivé
  • Format de quantification EXL2 : mélange une précision de 2, 3, 4, 5, 6 et 8 bits par couche pour atteindre un débit binaire moyen cible, par exemple un modèle de 70B en 24 Go de VRAM à environ 2,55 bits par poids
  • Le projet successeur ExLlamaV3 (environ 1 300 étoiles GitHub) introduit le format EXL3, une variante allégée de l'approche de quantification QTIP de Cornell RelaxML
  • TabbyAPI, un serveur basé sur FastAPI, est la couche API compatible OpenAI recommandée pour les deux versions
  • Également intégré dans text-generation-webui, lollms-webui et l'interface web autonome ExUI

📍 En une phrase

ExLlamaV2 est une bibliothèque d'inférence gratuite sous licence MIT créée par turboderp's pour une inférence LLM rapide sur GPU NVIDIA grand public, connue pour son format de quantification EXL2 flexible, mais son dépôt est désormais archivé au profit du successeur activement développé, ExLlamaV3.

💬 En termes simples

ExLlamaV2 a été conçu spécifiquement pour tirer une vitesse maximale d'un seul GPU grand public grâce à un schéma de quantification inhabituellement flexible ; son propre mainteneur a depuis déplacé le développement vers un nouveau projet, ExLlamaV3, plutôt que de continuer à mettre à jour V2.

📌Remarque: Le README GitHub d'ExLlamaV2 lui-même indique que le projet est archivé et que le développement se poursuit sur ExLlamaV3 — toute personne démarrant un nouveau projet aujourd'hui devrait évaluer ExLlamaV3 plutôt que de construire sur la base de code archivée de V2.

Qu'était ExLlamaV2 ?

ExLlamaV2 était une bibliothèque d'inférence gratuite et open source, publiée sous licence MIT par un développeur connu sous le nom de turboderp, conçue spécifiquement pour maximiser la vitesse d'inférence sur les GPU NVIDIA grand public. Il faisait suite à un projet antérieur, ExLlama, et était lui-même une réécriture plus économe en mémoire axée sur l'exécution rapide de modèles quantifiés sur un seul GPU.

Le dépôt, github.com/turboderp-org/exllamav2, a atteint environ 4 600 étoiles GitHub avant d'être marqué comme archivé, son README pointant vers ExLlamaV3 comme projet où le développement se poursuit désormais.

  • Ciblait étroitement les GPU NVIDIA grand public plutôt que la large couverture matérielle de moteurs comme llama.cpp
  • A introduit le format de quantification EXL2 comme principale contribution technique, permettant une quantification à précision mixte au sein d'un même modèle
  • Prenait en charge les mêmes modèles GPTQ 4 bits que l'ExLlama original, en plus de son propre format EXL2
  • Installable via pip (pip install exllamav2), des wheels précompilés, ou une compilation depuis les sources avec le CUDA Toolkit

Qu'est-ce que la quantification EXL2 ?

EXL2 est le format de quantification d'ExLlamaV2, permettant à différentes couches linéaires d'un même modèle d'utiliser des largeurs de bits différentes — de 2 à 8 bits — choisies automatiquement à partir de données de calibration pour atteindre un débit binaire moyen cible. C'est plus flexible qu'une largeur de bits fixe unique appliquée uniformément à un modèle entier.

  • Prend en charge des niveaux de quantification de 2, 3, 4, 5, 6 et 8 bits, mélangés par couche au sein d'un même modèle
  • Les colonnes de poids les plus importantes peuvent être quantifiées à une précision plus élevée tandis que les moins importantes utilisent moins de bits, un principe proche de la quantification parcimonieuse
  • Permet une compression extrême pour les grands modèles avec un VRAM limité — des tests documentés montrent un modèle de 70 milliards de paramètres fonctionnant en 24 Go de VRAM à environ 2,55 bits par poids avec un contexte de 2048 tokens
  • Les paramètres de quantification sont choisis automatiquement à partir de données de calibration plutôt que d'exiger une configuration manuelle par couche

Pourquoi ExLlamaV2 est-il archivé, et que change ExLlamaV3 ?

Le dépôt turboderp-org/exllamav2 est marqué comme archivé, son propre README indiquant que le développement se poursuit sur ExLlamaV3. C'est le fait le plus important à connaître avant d'évaluer ExLlamaV2 pour un nouveau projet.

ExLlamaV3 introduit son propre format, EXL3, décrit comme une variante allégée de l'approche de quantification QTIP de Cornell RelaxML. Contrairement à EXL2, EXL3 préserve les structures de tenseurs d'origine au lieu de les renommer, dans le but de faciliter le futur support par d'autres frameworks. ExLlamaV3 documente CUDA 12.4 ou une version ultérieure comme prérequis et est explicitement signalé par ses propres mainteneurs comme encore en maturation — attendez-vous à quelques aspérités.

  • ExLlamaV2 : archivé, licence MIT, format EXL2, toujours installable mais ne recevant plus de développement
  • ExLlamaV3 : actif, licence MIT, format EXL3 (basé sur la recherche QTIP), stabilité bêta selon sa propre documentation
  • Les deux sont maintenus par le même développeur, turboderp, sous l'organisation GitHub turboderp-org

📌Remarque: Pour tout nouveau déploiement, évaluez d'abord ExLlamaV3 — c'est là que se déroulent la maintenance active et les améliorations. ExLlamaV2 reste pertinent principalement pour les installations existantes déjà construites dessus, ou pour les fichiers de modèles quantifiés EXL2 déjà en circulation.

Comment installer et exécuter ExLlamaV2 (ou V3) ?

ExLlamaV2 s'installe via pip, des wheels précompilés, ou depuis les sources avec le CUDA Toolkit ; ExLlamaV3 suit un schéma similaire. TabbyAPI est le moyen recommandé d'obtenir un serveur compatible OpenAI fonctionnant sur l'un ou l'autre.

  1. 1
    Pour ExLlamaV2 : installer via pip install exllamav2, ou télécharger un wheel précompilé correspondant à votre version de Python et de CUDA depuis la page GitHub Releases, ou cloner et compiler depuis les sources avec le CUDA Toolkit installé.
  2. 2
    Pour ExLlamaV3 (recommandé pour les nouvelles installations) : suivre les chemins d'installation équivalents documentés sur github.com/turboderp-org/exllamav3, en notant que CUDA 12.4 ou une version ultérieure est requise.
  3. 3
    Télécharger un modèle EXL2 (ou EXL3) pré-quantifié, généralement publié sur Hugging Face par des quantificateurs communautaires.
  4. 4
    Installer et exécuter TabbyAPI, le serveur basé sur FastAPI recommandé, pour exposer un point de terminaison API compatible OpenAI avec téléchargement de modèles HF et prise en charge des modèles de chat Jinja2.
  5. 5
    Autrement, utiliser ExLlamaV2/V3 via une intégration existante — text-generation-webui, lollms-webui, ou l'interface web autonome ExUI — plutôt que d'exécuter TabbyAPI directement.

Puis-je encore utiliser ExLlamaV2 aujourd'hui ?

Oui, il reste installable et fonctionnel, mais le dépôt est archivé et ne recevra plus de mises à jour, de corrections de bugs ou de nouvelles fonctionnalités.

Les fichiers de modèles EXL2 fonctionnent-ils avec ExLlamaV3 ?

Non, pas directement — ExLlamaV3 utilise son propre format de quantification EXL3. Les fichiers de modèles EXL2 existants sont conçus pour les installations ExLlamaV2/TabbyAPI, pas pour V3.

Quel matériel ExLlamaV2 nécessite-t-il ?

ExLlamaV2 cible spécifiquement les GPU NVIDIA grand public — il n'existe aucun chemin de support AMD, Intel, ou CPU uniquement. Ce focus matériel étroit fait partie de ce qui lui a permis d'optimiser aussi fortement la vitesse sur un seul GPU.

  • GPU NVIDIA uniquement, CUDA requis — aucun support documenté pour AMD, Intel, ou Apple Silicon
  • Conçu autour des cartes grand public plutôt que des GPU de centre de données, bien qu'il fonctionne aussi sur ceux-ci
  • Les besoins en VRAM évoluent avec la taille du modèle et le débit binaire EXL2 choisi — c'est précisément la quantification flexible qui permet à de grands modèles de tenir dans relativement peu de VRAM
  • ExLlamaV3 documente CUDA 12.4 ou une version ultérieure comme prérequis, une base plus récente que celle supposée par ExLlamaV2

Qui devrait utiliser ExLlamaV2 (ou ExLlamaV3) ?

Utilisez ExLlamaV3 pour un nouveau projet si tirer une vitesse et une efficacité VRAM maximales d'un seul GPU NVIDIA grand public compte plus qu'un large support matériel ou des garanties de stabilité à long terme ; il y a aujourd'hui peu de raisons de démarrer un tout nouveau projet sur l'ExLlamaV2 archivé.

Comment ExLlamaV2 se compare-t-il aux alternatives ?

Les comparaisons les plus proches d'ExLlamaV2 sont son propre successeur et d'autres moteurs axés sur la quantification ou la vitesse sur un seul GPU.

Outil
Licence
Idéal pour
ExLlamaV2 (archivé)MITInstallations EXL2 existantes uniquement
ExLlamaV3MITEfficacité max de quantification sur un GPU (bêta)
llama.cppMITSupport matériel le plus large, contrôle direct
OllamaMITInstallation locale la plus simple
KoboldCppAGPL 3.0Zéro installation, UI roleplay/récit

Erreurs courantes lors de l'évaluation d'ExLlamaV2

La plupart des confusions viennent du fait de ne pas réaliser que le projet est archivé, ou de s'attendre à une compatibilité croisée entre les fichiers de modèles EXL2 et EXL3.

Foire aux questions

ExLlamaV2 est-il encore maintenu ?

Non. Le dépôt GitHub turboderp-org/exllamav2 est marqué comme archivé, son README indiquant que le développement se poursuit sur ExLlamaV3 à la place.

Qu'est-ce qu'EXL2 ?

EXL2 est le format de quantification d'ExLlamaV2, prenant en charge une précision mixte de 2 à 8 bits par couche au sein d'un même modèle pour atteindre un débit binaire moyen cible, permettant à de grands modèles de tenir dans moins de VRAM.

Qu'est-ce qu'ExLlamaV3, et en quoi est-il différent ?

ExLlamaV3 est le successeur activement développé d'ExLlamaV2, utilisant un nouveau format de quantification EXL3 basé sur l'approche QTIP de Cornell RelaxML. Il est documenté comme logiciel bêta par ses propres mainteneurs.

Qui a créé ExLlamaV2 et ExLlamaV3 ?

Les deux ont été créés par un développeur connu sous le nom de turboderp, sous l'organisation GitHub turboderp-org.

ExLlamaV2 est-il gratuit ?

Oui. ExLlamaV2 et ExLlamaV3 sont tous deux publiés sous licence MIT, gratuits pour un usage personnel et commercial.

ExLlamaV2 prend-il en charge les GPU AMD ?

Non. ExLlamaV2 et ExLlamaV3 nécessitent tous deux un GPU NVIDIA avec CUDA — il n'y a aucun support pour AMD, Intel, ou Apple Silicon.

Qu'est-ce que TabbyAPI ?

TabbyAPI est un serveur basé sur FastAPI et le moyen recommandé d'exposer une API compatible OpenAI sur ExLlamaV2 ou ExLlamaV3, avec des fonctionnalités supplémentaires comme le téléchargement de modèles Hugging Face et la prise en charge des modèles de chat Jinja2.

Les fichiers de modèles EXL2 et EXL3 sont-ils interchangeables ?

Non. Les fichiers EXL2 sont quantifiés pour ExLlamaV2 et ne sont pas directement compatibles avec ExLlamaV3, qui utilise le format EXL3 distinct.

Devrais-je utiliser ExLlamaV2 ou ExLlamaV3 pour un nouveau projet ?

ExLlamaV3, puisqu'ExLlamaV2 est archivé et ne reçoit plus de développement. ExLlamaV3 est encore en bêta, donc attendez-vous à quelques aspérités par rapport à un projet mature et activement stabilisé.

Comment ExLlamaV2 se compare-t-il à llama.cpp ?

llama.cpp prend en charge une gamme de matériel bien plus large (NVIDIA, AMD, Apple Silicon, Intel, CPU uniquement) et est activement maintenu ; ExLlamaV2 était étroitement axé sur les GPU NVIDIA grand public et est désormais archivé, avec ExLlamaV3 comme successeur actif.

Sources

← Retour aux LLM locaux avancés