Points clés
- Gratuit et open source ; le dépôt GitHub affiche une licence Apache-2.0, et cette review n'a trouvé aucune page tarifaire distincte pour le framework lui-même
- Deux façons de l'utiliser : LLaMA Board (une interface web Gradio pour l'entraînement, l'évaluation et l'inférence sans code) et
llamafactory-cli(un outil en ligne de commande pour des workflows train/chat/export scriptés) - Affine des LLM et des modèles vision-langage sur plus de 100 familles de modèles — LLaMA, Qwen3, Mistral, Mixtral-MoE, DeepSeek, Gemma, GLM, Phi, LLaVA, Qwen3-VL et d'autres, de 270M à 671B de paramètres selon le README
- Prend en charge le fine-tuning complet, LoRA, QLoRA, Freeze, GaLore, BAdam, DoRA, PiSSA et OFT/OFTv2, sur le pré-entraînement, le fine-tuning supervisé, le reward modeling, PPO et DPO
- Support matériel multi-backend : NVIDIA CUDA, AMD ROCm et Ascend NPU, chacun avec une image Docker dédiée, plus une installation native sous Linux, Windows et macOS
- Déploie les modèles entraînés via une API locale de type OpenAI ou un worker vLLM, et peut accélérer optionnellement l'entraînement en utilisant les kernels d'Unsloth comme l'une de ses options de backend
- Maintenu par hiyouga (un mainteneur individuel sur GitHub, selon l'API GitHub) ; dépôt créé le 28 mai 2023, avec des commits poussés à quelques jours de la date de recherche de cette review, 9 153 forks et 1 152 issues ouvertes
📍 En une phrase
LLaMA-Factory est un framework open source gratuit (Apache-2.0) qui affine plus de 100 LLM et modèles vision-langage ouverts via une interface web sans code (LLaMA Board) ou une ligne de commande Python, sur matériel NVIDIA, AMD ou Ascend NPU.
💬 En termes simples
Si vous voulez enseigner vos propres données à un modèle d'IA ouvert existant — sans écrire de script d'entraînement depuis zéro — LLaMA-Factory vous donne une page web avec des menus déroulants et des curseurs pour choisir le modèle, le jeu de données et la méthode d'entraînement, puis lance la tâche sur votre propre GPU. Une version en ligne de commande existe aussi pour automatiser les mêmes étapes.
📌Remarque: Cette review est le complément approfondi de la fiche de LLaMA-Factory dans le Local LLM Software Directory — consultez cette page pour voir en un coup d'œil comment LLaMA-Factory se compare à des dizaines d'autres outils d'IA locale.
Qu'est-ce que LLaMA-Factory ?
LLaMA-Factory est un framework pour affiner des LLM et modèles vision-langage à poids ouverts sur du matériel que vous contrôlez, via une interface web plutôt qu'un script d'entraînement écrit à la main. Sa propre description GitHub indique « Unified Efficient Fine-Tuning of 100+ LLMs & VLMs (ACL 2024) », en référence à un article académique accepté à la conférence ACL 2024 (Association for Computational Linguistics). La page du projet sur llamafactory.readthedocs.io le décrit comme « une plateforme facile à utiliser et efficace pour entraîner et affiner de grands modèles de langage », conçue pour permettre aux utilisateurs de « fine-tuner des centaines de modèles pré-entraînés localement sans écrire de code ».
- Fonction principale : choisir un modèle de base, un jeu de données et une méthode de fine-tuning (LoRA, QLoRA ou complet) via l'interface web de LLaMA Board ou un fichier de configuration YAML, puis exécuter ou exporter le résultat
- Pas seulement du texte : en plus des LLM textuels, le README mentionne le support du fine-tuning de modèles vision-langage (VLM), incluant des modèles comme LLaVA et Qwen3-VL
- Deux produits, un seul moteur : LLaMA Board (l'interface web Gradio, lancée avec
llamafactory-cli webui) etllamafactory-cli(l'outil en ligne de commande sur lequel reposent à la fois l'interface et les workflows scriptés) - Nom du dépôt : le dépôt GitHub a été renommé de
LLaMA-FactoryàLlamaFactory— un simple changement de casse ; l'ancienne URL (github.com/hiyouga/LLaMA-Factory) redirige vers le même dépôt, avec les mêmes étoiles et le même historique de commits - Mainteneur : hiyouga, listé comme un utilisateur individuel (et non une organisation) via l'API GitHub, bien que le README affirme que le projet est « utilisé par Amazon, NVIDIA, Aliyun » entre autres — une affirmation du propre README du projet, non vérifiée indépendamment par cette review
Historique des versions de LLaMA-Factory
La chronologie vérifiable de LLaMA-Factory provient de deux sources officielles : les métadonnées propres du dépôt GitHub, et les versions taguées du projet sur GitHub.
- Le dépôt GitHub a été créé le 28 mai 2023, selon les métadonnées du dépôt GitHub — initialement sous le nom
LLaMA-Factory - L'article académique associé au projet, « LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models », a été accepté à l'ACL 2024, selon la propre ligne de description du dépôt
- Le dépôt a ensuite été renommé en
LlamaFactory(changement de casse uniquement) ; GitHub redirige automatiquement l'ancienne URLLLaMA-Factoryvers l'actuelle, en conservant les mêmes étoiles, forks et historique de commits - La dernière version taguée, v0.9.5 (« Qwen3.5/3.6, Gemma 4, Transformers v5 »), a été publiée le 30 mai 2026, selon l'API des releases de GitHub
- Les commits sur la branche
mainse sont poursuivis après ce tag — les métadonnées GitHub montrent un push à quelques jours de la date de recherche de cette review, signe d'un développement quotidien actif au-delà de la dernière version formelle
Que pouvez-vous faire avec LLaMA-Factory ?
Les fonctionnalités de LLaMA-Factory couvrent les méthodes d'entraînement, l'étendue des modèles, les backends matériels et le déploiement. Voici ce que fait réellement chaque partie, selon le README GitHub et la documentation du projet.
- Méthodes d'entraînement — fine-tuning complet, LoRA, QLoRA, Freeze, GaLore, BAdam, DoRA, PiSSA et OFT/OFTv2, sur le pré-entraînement, le fine-tuning supervisé (SFT), le reward modeling, PPO et DPO
- Étendue des modèles — plus de 100 familles de modèles dont LLaMA, Qwen3, Mistral, Mixtral-MoE, DeepSeek, Gemma, GLM et Phi, de 270M à 671B de paramètres, plus des modèles vision-langage comme LLaVA et Qwen3-VL, selon le README
- Interface web sans code — LLaMA Board, une interface Gradio, couvre l'entraînement, l'évaluation et l'inférence sans écrire de script d'entraînement
- Outil en ligne de commande —
llamafactory-cliexpose les sous-commandestrain,chat,export,webuietversionpour scripter les mêmes workflows que LLaMA Board couvre de façon interactive - Support de la quantification — les formats AQLM, AWQ, GPTQ, LLM.int8, HQQ et EETQ sont pris en charge, avec une accélération via FlashAttention-2 et une intégration optionnelle des kernels d'Unsloth
- Déploiement — les modèles entraînés peuvent être servis via une API locale de type OpenAI ou un worker vLLM pour un débit d'inférence plus élevé
- Entraînement distribué — la section Advanced de la documentation couvre l'entraînement multi-GPU et multi-nœud, avec une intégration DeepSpeed pour des tâches distribuées économes en mémoire
- Suivi des expériences — s'intègre avec Wandb et TensorBoard pour surveiller les entraînements, selon la documentation
Exemples d'utilisation : deux façons d'affiner avec LLaMA-Factory
Voici des workflows concrets construits à partir des commandes documentées de LLaMA-Factory ci-dessus — pas des cas d'usage hypothétiques.
Installer LLaMA-Factory : Pip, Git et Docker
LLaMA-Factory n'est pas une application téléchargeable pour utilisateur final — il s'installe comme un paquet Python, selon son propre README GitHub et sa documentation d'installation. Les liens ci-dessous sont les commandes officielles documentées du projet ; vérifiez-les toujours directement dans la documentation, car les extras et les chemins Docker peuvent changer entre versions.
Méthode d'installation | Commande ou lien |
|---|---|
| Depuis les sources (recommandé par la doc) | git clone --depth 1 https://github.com/hiyouga/LlamaFactory.git && cd LlamaFactory && pip install -e . |
| Extras metrics optionnels | pip install -r requirements/metrics.txt |
| Depuis PyPI | pip install llamafactory — voir llamafactory sur PyPI |
| Docker — NVIDIA CUDA | cd docker/docker-cuda/ && docker compose up -d |
| Docker — AMD ROCm | cd docker/docker-rocm/ && docker compose up -d (selon la section « Multi-device Backends » de la doc) |
| Docker — Ascend NPU | cd docker/docker-npu/ && docker compose up -d — voir le guide NPU |
| Lancer l'interface web (LLaMA Board) | llamafactory-cli webui |
| Vérifier l'installation | llamafactory-cli version |
Les extras optionnels s'installent via `pip install -e ".[extra_name]", avec extra_name incluant notamment torch, metrics, deepspeed, bitsandbytes, hqq, eetq, gptq, awq, aqlm, vllm, galore, badam, qwen, modelscope et swanlab`, selon la doc d'installation. L'image Docker Ascend NPU existe en plusieurs variantes Ubuntu et openEuler — liste à jour dans le guide NPU. Le support QLoRA sous Windows et FlashAttention-2 nécessitent des wheels spécifiques à la plateforme en plus — consultez directement le guide d'installation plutôt que de deviner les URL de wheels, car elles sont liées à une version précise.
Tarifs de LLaMA-Factory : vraiment gratuit ?
Oui — le framework LLaMA-Factory n'a aucun palier payant. Le dépôt GitHub affiche une licence Apache-2.0 via l'API GitHub, qui s'applique au code de LLaMA-Factory lui-même, et ni le README ni le site de documentation ne renvoient vers une page tarifaire ni ne décrivent de fonctionnalité payante.
- Aucun abonnement, frais de licence ou palier payant documenté pour le framework dans le dépôt GitHub, son README ou son site de documentation
- Aucun compte ni inscription requis pour installer
llamafactory-cli, exécuter LLaMA Board localement, ou utiliser l'une des images Docker - Apache-2.0 couvre le code propre de LLaMA-Factory ; cela ne s'étend pas aux modèles de base que vous affinez avec — des modèles comme la famille Llama de Meta ou Qwen ont leurs propres licences distinctes, qui continuent de s'appliquer aux poids entraînés et redistribués
- Les coûts de GPU cloud (si vous louez du matériel au lieu d'utiliser le vôtre) sont un coût réel séparé que cette review n'estime pas — ils dépendent entièrement du fournisseur et du type d'instance choisis
LLaMA-Factory vs. Unsloth
LLaMA-Factory et Unsloth sont tous deux des outils gratuits Apache-2.0 pour le fine-tuning local, mais ils couvrent un terrain différent. LLaMA-Factory mise sur l'étendue des modèles et des méthodes d'entraînement pour le texte et les modèles vision-langage, avec un chemin documenté vers l'entraînement multi-GPU et multi-nœud ; Unsloth couvre une plus large gamme de modalités (LLM, diffusion, TTS et modèles d'embedding) plus une application de bureau native, au prix de ne pas documenter l'entraînement multi-nœud dans son propre README.
Aspect | LLaMA-Factory | Unsloth |
|---|---|---|
| Licence | Apache-2.0 | Apache-2.0 |
| Interface | Interface web (LLaMA Board) + CLI, pas d'app de bureau | App de bureau, interface web ou bibliothèque Python |
| Types de modèles | LLM + vision-langage (VLM) | LLM, diffusion, TTS, embedding |
| Matériel | NVIDIA CUDA, AMD ROCm, Ascend NPU | NVIDIA, AMD, Intel, CPU via Vulkan |
| Entraînement multi-nœud | Documenté dans la doc Advanced (multi-GPU/multi-nœud + DeepSpeed) | Non documenté dans son README |
| Idéal pour | Couverture modèles/méthodes la plus large pour texte + VLM, y compris au-delà d'une seule machine | Couverture de modalités la plus large (y compris non-texte) dans une app de bureau |
Les deux outils ne sont pas de purs rivaux — la propre documentation de LLaMA-Factory mentionne un backend d'accélération optionnel via les kernels d'Unsloth, ce qui signifie qu'une tâche d'entraînement LLaMA-Factory peut utiliser les kernels optimisés d'Unsloth en coulisses tout en s'exécutant via l'interface web et le format de configuration de LLaMA-Factory. Si votre tâche doit dépasser une seule machine, le chemin multi-nœud documenté de LLaMA-Factory est le choix le plus direct ; si vous avez besoin de fine-tuning pour la diffusion, le TTS ou les modèles d'embedding plutôt que seulement des LLM et VLM, consultez plutôt la review d'Unsloth.
Pour qui est fait LLaMA-Factory ?
LLaMA-Factory convient si vous voulez la couverture de modèles et de méthodes la plus large pour le fine-tuning texte et vision-langage, avec un chemin vers une montée en charge multi-GPU ou multi-nœud.
LLaMA-Factory vs. autres outils de fine-tuning
LLaMA-Factory est l'un des nombreux outils pour affiner des modèles sur votre propre matériel. Voici comment il se positionne face à d'autres options dans ce domaine — voir le Local LLM Software Directory pour le catalogue complet, et la comparaison dédiée LLaMA-Factory vs. Unsloth ci-dessus pour le duel le plus direct.
- Unsloth — un outil gratuit Apache-2.0 couvrant le fine-tuning de LLM, diffusion, TTS et embedding via une app de bureau, une interface web ou une bibliothèque Python ; voir la section de comparaison dédiée ci-dessus pour les différences.
- Second Me — un outil Apache-2.0 d'entraînement autodirigé d'un modèle personnel, avec un périmètre plus étroit (entraîner un modèle personnalisé sur vos propres données) que la portée généraliste de fine-tuning de LLaMA-Factory pour plus de 100 modèles.
- Axolotl — un framework de fine-tuning Apache-2.0 piloté par configuration YAML, avec entraînement multi-nœud documenté et une large couverture de méthodes d'alignement (DPO, ORPO, KTO, et plus) ; il n'existe pas encore de review PromptQuorum dédiée, mais c'est une alternative directe pour les lecteurs comparant des frameworks de fine-tuning pilotés par configuration, sans interface.
- Ollama et LM Studio — des outils d'inférence locale pour *exécuter* des modèles plutôt que les entraîner ; un schéma courant consiste à affiner avec LLaMA-Factory, exporter le résultat, puis l'exécuter dans Ollama ou LM Studio pour un usage quotidien. Voir la review Ollama et la review LM Studio.
Erreurs fréquentes lors de l'évaluation de LLaMA-Factory
La plupart des confusions autour de LLaMA-Factory viennent de son ancien nom de dépôt, de l'absence d'un installateur téléchargeable, ou de l'idée que son tableau matériel est un résultat garanti plutôt qu'un point de départ documenté.
Questions fréquemment posées
Qu'est-ce que LLaMA-Factory ?
LLaMA-Factory (github.com/hiyouga/LlamaFactory, documentation sur llamafactory.readthedocs.io) est un framework open source gratuit (Apache-2.0) pour affiner plus de 100 LLM et modèles vision-langage ouverts, via une interface web Gradio (LLaMA Board) ou un outil en ligne de commande (llamafactory-cli).
LLaMA-Factory est-il gratuit ?
Oui, selon les métadonnées du dépôt GitHub et la propre documentation du projet — le framework porte une licence Apache-2.0 et aucun palier payant documenté. La licence Apache-2.0 couvre le code de LLaMA-Factory, pas la licence du modèle de base que vous affinez avec.
Pourquoi l'URL indique-t-elle « LLaMA-Factory » alors que le dépôt s'appelle « LlamaFactory » ?
L'organisation GitHub a renommé le dépôt de LLaMA-Factory à LlamaFactory — un simple changement de casse. L'ancienne URL (github.com/hiyouga/LLaMA-Factory) redirige (301) vers l'actuelle, en conservant les mêmes étoiles, forks et historique de commits.
LLaMA-Factory nécessite-t-il un GPU ?
Un GPU est fortement recommandé, sans être strictement obligatoire. Selon la documentation du projet, l'entraînement CPU seul est techniquement pris en charge mais peu pratique pour de vraies tâches de fine-tuning ; le fine-tuning LoRA d'un modèle 7B est documenté à environ 16 Go de VRAM, jusqu'à ~4 Go avec QLoRA 2 bits.
Combien de VRAM faut-il pour un fine-tuning complet ?
Selon la propre documentation de LLaMA-Factory, le fine-tuning complet (bf16/fp16) d'un modèle 7B nécessite environ 60 Go de VRAM, et le fine-tuning complet en fp32 du même modèle environ 120 Go — ce sont les chiffres documentés du projet, pas des nombres mesurés indépendamment par cette review.
Quels modèles LLaMA-Factory prend-il en charge ?
Selon son README GitHub, plus de 100 familles de modèles ouverts de 270M à 671B de paramètres, dont LLaMA, Qwen3, Mistral, Mixtral-MoE, DeepSeek, Gemma, GLM, Phi, et des modèles vision-langage comme LLaVA et Qwen3-VL.
LLaMA-Factory a-t-il une application de bureau ?
Non. Il a une interface web (LLaMA Board) qui s'exécute dans votre navigateur après installation du paquet Python et lancement de llamafactory-cli webui, mais pas d'application de bureau packagée et installable. Voir la review d'Unsloth pour un outil de fine-tuning doté d'une véritable app de bureau native.
Comment LLaMA-Factory se compare-t-il à Unsloth ?
LLaMA-Factory couvre une plus grande étendue de modèles pour le texte et le vision-langage, plus un entraînement multi-nœud documenté ; Unsloth couvre plus de modalités (dont la diffusion, le TTS et les modèles d'embedding) plus une app de bureau native. LLaMA-Factory peut optionnellement utiliser les kernels d'Unsloth comme backend d'accélération. Voir la section de comparaison dédiée ci-dessus.
LLaMA-Factory fonctionne-t-il sur du matériel AMD ou Ascend NPU ?
Oui — des images Docker distinctes existent pour AMD ROCm et Ascend NPU, en plus de l'image NVIDIA CUDA par défaut, selon la documentation Multi-device Backends du projet.
Qui maintient LLaMA-Factory ?
hiyouga, listé comme un utilisateur GitHub individuel (et non une organisation) via l'API GitHub. Le README du projet indique qu'il est utilisé par des organisations dont Amazon, NVIDIA et Aliyun — une affirmation du propre README du projet, que cette review n'a pas vérifiée indépendamment.
