Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/LLaMA-Factory Review 2026: 100+ LLMs per Web-UI Fine-Tunen
Productivity & Knowledge Tools

LLaMA-Factory Review 2026: 100+ LLMs per Web-UI Fine-Tunen

·12 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

LLaMA-Factory (github.com/hiyouga/LlamaFactory, Doku unter llamafactory.readthedocs.io) ist ein kostenloses Open-Source-Framework (Apache-2.0) zum Fine-Tuning von über 100 offenen LLMs und Vision-Language-Modellen auf eigener Hardware. Es wird als per pip/git installiertes Python-Paket mit zwei Zugangswegen ausgeliefert: LLaMA Board, eine Gradio-basierte Weboberfläche für codefreies Training, und llamafactory-cli, ein Kommandozeilen-Tool für skriptbasiertes Training, Chat und Export. Laut GitHubs eigenen Repository-Metadaten verzeichnet es Stand dieser Review 74.751 Sterne, 9.153 Forks und 1.152 offene Issues, mit Commits innerhalb weniger Tage vor dem Recherchedatum. Das GitHub-Repository wurde von LLaMA-Factory zu LlamaFactory umbenannt (nur die Schreibweise) — die alte URL leitet per 301-Redirect auf dasselbe Projekt und dieselbe Commit-Historie weiter, beide Schreibweisen bezeichnen also dasselbe Projekt.

LLaMA-Factory (GitHub: github.com/hiyouga/LlamaFactory, Doku unter llamafactory.readthedocs.io) ist ein kostenloses Open-Source-Framework (Apache-2.0) zum Fine-Tuning von über 100 offenen Large Language Models und Vision-Language-Modellen auf eigener Hardware — per LoRA, QLoRA oder vollständigem Fine-Tuning. Es bringt eine Gradio-basierte Weboberfläche namens LLaMA Board für Training ohne Code mit, plus eine llamafactory-cli-Kommandozeile für skriptbasierte Workflows. Diese Review zeigt, was LLaMA-Factory tatsächlich kann, wie man es installiert, welche Hardware-Anforderungen dokumentiert sind und wie es sich zu Unsloth und anderen lokalen Fine-Tuning-Tools verhält.

LLaMA-Factory Review 2026: 100+ LLMs per Web-UI Fine-Tunen

Wichtigste Erkenntnisse

  • Kostenlos und Open Source; das GitHub-Repository weist eine Apache-2.0-Lizenz aus, und diese Review fand keine separate Preisseite für das Framework selbst
  • Zwei Nutzungswege: LLaMA Board (eine Gradio-basierte Weboberfläche für Training, Evaluierung und Inferenz ohne Code) und llamafactory-cli (ein Kommandozeilen-Tool für skriptbasierte Train-/Chat-/Export-Workflows)
  • Fine-Tuning von LLMs und Vision-Language-Modellen über mehr als 100 Modellfamilien hinweg — LLaMA, Qwen3, Mistral, Mixtral-MoE, DeepSeek, Gemma, GLM, Phi, LLaVA, Qwen3-VL und weitere, laut README von 270M bis 671B Parametern
  • Unterstützt vollständiges Fine-Tuning, LoRA, QLoRA, Freeze, GaLore, BAdam, DoRA, PiSSA und OFT/OFTv2, über Pretraining, überwachtes Fine-Tuning, Reward Modeling, PPO und DPO
  • Multi-Backend-Hardware-Unterstützung: NVIDIA CUDA, AMD ROCm und Ascend NPU, jeweils mit eigenem Docker-Image, plus native Installation unter Linux, Windows und macOS
  • Stellt trainierte Modelle über einen OpenAI-artigen lokalen API-Server oder einen vLLM-Worker bereit und kann Training optional über Unsloths Kernel als einen von mehreren Backend-Optionen beschleunigen
  • Gepflegt von hiyouga (laut GitHub-API ein einzelner Maintainer, kein Unternehmen); Repository erstellt am 28. Mai 2023, mit Commits innerhalb weniger Tage vor dem Recherchedatum dieser Review, 9.153 Forks und 1.152 offenen Issues

📍 In einem Satz

LLaMA-Factory ist ein kostenloses Open-Source-Framework (Apache-2.0), das über 100 offene LLMs und Vision-Language-Modelle per codefreier Weboberfläche (LLaMA Board) oder Python-Kommandozeile fine-tunt — auf NVIDIA-, AMD- oder Ascend-NPU-Hardware.

💬 In einfachen Worten

Wenn Sie einem vorhandenen offenen KI-Modell Ihre eigenen Daten beibringen möchten, ohne ein Trainingsskript von Grund auf zu schreiben, gibt Ihnen LLaMA-Factory eine Webseite mit Dropdown-Menüs und Reglern zur Auswahl von Modell, Datensatz und Trainingsmethode und startet den Job dann auf Ihrer eigenen GPU. Eine Kommandozeilen-Variante existiert ebenfalls, um dieselben Schritte zu automatisieren.

📌Hinweis: Diese Review ist der vertiefende Begleittext zu LLaMA-Factorys Eintrag im Local LLM Software Directory — dort sehen Sie auf einen Blick, wie es im Vergleich zu Dutzenden anderer lokaler KI-Tools abschneidet.

Was ist LLaMA-Factory?

LLaMA-Factory ist ein Framework zum Fine-Tuning offener LLMs und Vision-Language-Modelle auf Hardware, die Sie selbst kontrollieren — über eine Weboberfläche statt ein handgeschriebenes Trainingsskript. Die eigene GitHub-Beschreibung lautet „Unified Efficient Fine-Tuning of 100+ LLMs & VLMs (ACL 2024)" und verweist auf ein wissenschaftliches Paper, das auf der ACL-2024-Konferenz (Association for Computational Linguistics) angenommen wurde. Die Projektseite unter llamafactory.readthedocs.io beschreibt es als „eine einfach zu bedienende und effiziente Plattform zum Trainieren und Fine-Tunen von Large Language Models", mit der Nutzer „Hunderte vortrainierter Modelle lokal fine-tunen können, ohne Code zu schreiben".

  • Kernfunktion: Basismodell, Datensatz und Fine-Tuning-Methode (LoRA, QLoRA oder vollständig) über die Weboberfläche von LLaMA Board oder eine YAML-Konfigurationsdatei auswählen, dann das Ergebnis ausführen oder exportieren
  • Nicht nur Text: Neben Text-LLMs listet das README Unterstützung für Vision-Language-Modelle (VLM), einschließlich Modellen wie LLaVA und Qwen3-VL
  • Zwei Produkte, eine Engine: LLaMA Board (die Gradio-Weboberfläche, gestartet mit llamafactory-cli webui) und llamafactory-cli (das Kommandozeilen-Tool, auf dem sowohl die Oberfläche als auch skriptbasierte Workflows aufbauen)
  • Namensgebung des Repositorys: Das GitHub-Repository wurde von LLaMA-Factory zu LlamaFactory umbenannt — nur die Schreibweise ändert sich; die alte URL (github.com/hiyouga/LLaMA-Factory) leitet per Redirect auf dasselbe Repository mit denselben Sternen und derselben Commit-Historie weiter
  • Maintainer: hiyouga, laut GitHub-API als einzelner Nutzer (kein Unternehmen) gelistet, obwohl das README angibt, das Projekt werde unter anderem „von Amazon, NVIDIA, Aliyun" genutzt — eine Angabe aus dem eigenen README des Projekts, die diese Review nicht unabhängig überprüft hat

Release-Historie von LLaMA-Factory

Die überprüfbare Zeitachse von LLaMA-Factory stammt aus zwei offiziellen Quellen: den eigenen Repository-Metadaten von GitHub und den mit Tags versehenen Releases des Projekts auf GitHub.

  • Das GitHub-Repository wurde laut Repository-Metadaten von GitHub am 28. Mai 2023 erstellt — ursprünglich unter dem Namen LLaMA-Factory
  • Das zugehörige wissenschaftliche Paper des Projekts, „LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models", wurde laut der eigenen Beschreibungszeile des Repositorys auf der ACL 2024 angenommen
  • Das Repository wurde später zu LlamaFactory umbenannt (nur die Schreibweise); GitHub leitet die alte LLaMA-Factory-URL automatisch weiter und erhält dabei dieselben Sterne, Forks und die Commit-Historie
  • Das jüngste getaggte Release, v0.9.5 („Qwen3.5/3.6, Gemma 4, Transformers v5"), wurde laut GitHubs Releases-API am 30. Mai 2026 veröffentlicht
  • Commits im main-Branch gingen danach weiter — GitHubs Metadaten zeigen einen Push innerhalb weniger Tage vor dem Recherchedatum dieser Review, was auf aktive tägliche Weiterentwicklung über das letzte formale Release hinaus hindeutet

Was können Sie mit LLaMA-Factory tun?

Der Funktionsumfang von LLaMA-Factory erstreckt sich über Trainingsmethoden, Modellbreite, Hardware-Backends und Deployment. Hier, was jeder Teil laut eigenem GitHub-README und eigener Dokumentation tatsächlich leistet.

  • Trainingsmethoden — vollständiges Fine-Tuning, LoRA, QLoRA, Freeze, GaLore, BAdam, DoRA, PiSSA und OFT/OFTv2, über Pretraining, überwachtes Fine-Tuning (SFT), Reward Modeling, PPO und DPO hinweg
  • Modellbreite — über 100 Modellfamilien, darunter LLaMA, Qwen3, Mistral, Mixtral-MoE, DeepSeek, Gemma, GLM und Phi, von 270M bis 671B Parametern, plus Vision-Language-Modelle wie LLaVA und Qwen3-VL, laut README
  • Codefreie Weboberfläche — LLaMA Board, eine Gradio-Oberfläche, deckt Training, Evaluierung und Inferenz ab, ohne ein Trainingsskript zu schreiben
  • Kommandozeilen-Toolllamafactory-cli bietet die Unterbefehle train, chat, export, webui und version, um dieselben Workflows, die LLaMA Board interaktiv abdeckt, zu skripten
  • Quantisierungsunterstützung — die Formate AQLM, AWQ, GPTQ, LLM.int8, HQQ und EETQ werden unterstützt, ebenso Beschleunigung über FlashAttention-2 und eine optionale Unsloth-Kernel-Integration
  • Deployment — trainierte Modelle lassen sich über eine OpenAI-artige lokale API oder einen vLLM-Worker für höheren Durchsatz bereitstellen
  • Verteiltes Training — der Advanced-Bereich der Dokumentation behandelt Multi-GPU- und Multi-Node-Training sowie DeepSpeed-Integration für speichereffiziente verteilte Jobs
  • Experiment-Tracking — laut Dokumentation Integration mit Wandb und TensorBoard zur Überwachung von Trainingsläufen

Anwendungsbeispiele: Zwei Wege, mit LLaMA-Factory zu fine-tunen

Dies sind konkrete Arbeitsabläufe, aufgebaut auf den oben dokumentierten Befehlen von LLaMA-Factory — keine hypothetischen Anwendungsfälle.

LLaMA-Factory installieren: Pip, Git und Docker

LLaMA-Factory ist keine herunterladbare Endnutzer-App — es wird laut eigenem GitHub-README und eigener Installationsdokumentation als Python-Paket installiert. Die untenstehenden Links sind die eigenen dokumentierten Befehle des Projekts; prüfen Sie diese stets direkt anhand der Dokumentation, da sich Extras und Docker-Pfade zwischen Versionen ändern können.

Installationsweg
Befehl oder Link
Aus dem Quellcode (von der Doku empfohlen)git clone --depth 1 https://github.com/hiyouga/LlamaFactory.git && cd LlamaFactory && pip install -e .
Optionale Metrics-Extraspip install -r requirements/metrics.txt
Über PyPIpip install llamafactory — siehe llamafactory auf PyPI
Docker — NVIDIA CUDAcd docker/docker-cuda/ && docker compose up -d
Docker — AMD ROCmcd docker/docker-rocm/ && docker compose up -d (laut Abschnitt „Multi-device Backends" der Doku)
Docker — Ascend NPUcd docker/docker-npu/ && docker compose up -d — siehe NPU-Guide
Weboberfläche starten (LLaMA Board)llamafactory-cli webui
Installation prüfenllamafactory-cli version

Optionale Extras werden über `pip install -e ".[extra_name]" installiert, wobei extra_name laut Installationsdoku unter anderem torch, metrics, deepspeed, bitsandbytes, hqq, eetq, gptq, awq, aqlm, vllm, galore, badam, qwen, modelscope und swanlab` umfasst. Das Ascend-NPU-Docker-Image gibt es in mehreren Ubuntu- und openEuler-Varianten — aktuelle Liste im NPU-Guide. Windows-QLoRA und FlashAttention-2 benötigen zusätzliche plattformspezifische Wheels — siehe direkt die Installationsanleitung, statt Wheel-URLs zu raten, da diese versionsgebunden sind.

LLaMA-Factory-Preise: Wirklich kostenlos?

Ja — das Framework LLaMA-Factory hat keine bezahlte Stufe. Das GitHub-Repository weist laut GitHub-API eine Apache-2.0-Lizenz aus, die für die Codebasis von LLaMA-Factory selbst gilt, und weder das README noch die Dokumentationsseite verlinken eine Preisseite oder beschreiben eine bezahlte Funktion.

  • Kein Abonnement, keine Lizenzgebühr und keine bezahlte Stufe für das Framework in GitHub-Repository, README oder Dokumentationsseite dokumentiert
  • Kein Konto oder Anmeldung nötig, um llamafactory-cli zu installieren, LLaMA Board lokal auszuführen oder eines der Docker-Images zu nutzen
  • Apache-2.0 deckt LLaMA-Factorys eigenen Code ab; es erstreckt sich nicht auf die Basismodelle, die Sie damit fine-tunen — Modelle wie Metas Llama-Familie oder Qwen haben eigene, separate Lizenzen, die weiterhin für die trainierten und weiterverteilten Gewichte gelten
  • Cloud-GPU-Kosten (falls Sie statt eigener Hardware Rechenleistung mieten) sind ein separater, realer Kostenfaktor, den diese Review nicht schätzt — sie hängen vollständig vom gewählten Anbieter und Instanztyp ab

LLaMA-Factory vs. Unsloth

LLaMA-Factory und Unsloth sind beide kostenlose Apache-2.0-Tools für lokales Fine-Tuning, decken aber unterschiedliches Terrain ab. LLaMA-Factory setzt auf Breite bei Modellen und Trainingsmethoden für Text- und Vision-Language-Modelle, mit dokumentiertem Pfad zu Multi-GPU- und Multi-Node-Training; Unsloth deckt mehr Modalitäten ab (LLMs, Diffusionsmodelle, TTS und Embedding-Modelle) plus eine native Desktop-App, dafür ohne dokumentiertes Multi-Node-Training im eigenen README.

Aspekt
LLaMA-Factory
Unsloth
LizenzApache-2.0Apache-2.0
OberflächeWeboberfläche (LLaMA Board) + CLI, keine Desktop-AppDesktop-App, Weboberfläche oder Python-Bibliothek
ModelltypenLLM + Vision-Language (VLM)LLM, Diffusion, TTS, Embedding
HardwareNVIDIA CUDA, AMD ROCm, Ascend NPUNVIDIA, AMD, Intel, CPU via Vulkan
Multi-Node-TrainingIn der Advanced-Doku dokumentiert (Multi-GPU/Multi-Node + DeepSpeed)Nicht im eigenen README dokumentiert
Am besten fürBreiteste Modell-/Methodenabdeckung für Text + VLM, inklusive Skalierung über eine Maschine hinausBreiteste Modalitätsabdeckung (auch Nicht-Text) in einer Desktop-App

Die beiden Tools sind keine reinen Rivalen — LLaMA-Factorys eigene Dokumentation listet ein optionales Unsloth-Kernel-Beschleunigungs-Backend, sodass ein LLaMA-Factory-Trainingslauf unter der Haube Unsloths optimierte Kernel nutzen kann, während er weiterhin über LLaMA-Factorys Weboberfläche und Konfigurationsformat läuft. Muss Ihr Job über eine Maschine hinaus skalieren, ist LLaMA-Factorys dokumentierter Multi-Node-Pfad die direktere Wahl; brauchen Sie Fine-Tuning für Diffusion, TTS oder Embedding-Modelle statt nur LLMs und VLMs, sehen Sie stattdessen die Unsloth-Review.

Für wen ist LLaMA-Factory geeignet?

Ob LLaMA-Factory passt, hängt davon ab, ob Sie die breiteste dokumentierte Modell- und Methodenabdeckung für Text- und Vision-Language-Fine-Tuning wollen, inklusive Pfad zu Multi-GPU- oder Multi-Node-Skalierung.

LLaMA-Factory vs. andere Fine-Tuning-Tools

LLaMA-Factory ist eines von mehreren Tools zum Fine-Tuning von Modellen auf eigener Hardware. Hier, wie es sich neben anderen Optionen in diesem Bereich einordnet — siehe das Local LLM Software Directory für den vollständigen Katalog, und den dedizierten LLaMA-Factory-vs.-Unsloth-Vergleich oben für das direkteste Duell.

  • Unsloth — ein kostenloses Apache-2.0-Tool, das LLM-, Diffusions-, TTS- und Embedding-Fine-Tuning über Desktop-App, Weboberfläche oder Python-Bibliothek abdeckt; siehe den dedizierten Vergleichsabschnitt oben für die Unterschiede.
  • Second Me — ein Apache-2.0-Tool zum selbstgesteuerten Training eines persönlichen Modells, mit engerem Fokus (Training eines personalisierten Modells auf eigenen Daten) als LLaMA-Factorys allgemeinem Fine-Tuning-Umfang für über 100 Modelle.
  • Axolotl — ein YAML-konfigurationsgesteuertes, Apache-2.0-lizenziertes Fine-Tuning-Framework mit dokumentiertem Multi-Node-Training und breiter Abdeckung von Alignment-Methoden (DPO, ORPO, KTO u. a.); es gibt noch keine dedizierte PromptQuorum-Review, aber es ist eine direkte Alternative für Leser, die konfigurationsgesteuerte Fine-Tuning-Frameworks ohne UI vergleichen.
  • Ollama und LM Studio — lokale Inferenz-Tools zum *Ausführen* von Modellen statt sie zu trainieren; ein gängiges Muster ist Fine-Tuning mit LLaMA-Factory, Export des Ergebnisses und anschließendes Ausführen in Ollama oder LM Studio für den täglichen Gebrauch. Siehe die Ollama-Review und die LM-Studio-Review.

Häufige Fehler bei der Bewertung von LLaMA-Factory

Die meiste Verwirrung um LLaMA-Factory kommt vom alten Repository-Namen, dem Fehlen eines herunterladbaren Installationsprogramms oder der Annahme, die Hardware-Tabelle sei ein garantiertes Ergebnis statt eines dokumentierten Ausgangspunkts.

Häufig gestellte Fragen

Was ist LLaMA-Factory?

LLaMA-Factory (github.com/hiyouga/LlamaFactory, Doku unter llamafactory.readthedocs.io) ist ein kostenloses Open-Source-Framework (Apache-2.0) zum Fine-Tuning von über 100 offenen LLMs und Vision-Language-Modellen, per Gradio-Weboberfläche (LLaMA Board) oder Kommandozeilen-Tool (llamafactory-cli).

Ist LLaMA-Factory kostenlos?

Ja, laut GitHubs Repository-Metadaten und der eigenen Dokumentation des Projekts — das Framework trägt eine Apache-2.0-Lizenz und keine dokumentierte bezahlte Stufe. Die Apache-2.0-Lizenz deckt LLaMA-Factorys Code ab, nicht die Lizenz des jeweils damit fine-getunten Basismodells.

Warum steht in der URL „LLaMA-Factory", das Repository heißt aber „LlamaFactory"?

Die GitHub-Organisation hat das Repository von LLaMA-Factory zu LlamaFactory umbenannt — nur die Schreibweise ändert sich. Die alte URL (github.com/hiyouga/LLaMA-Factory) leitet per 301-Redirect auf die aktuelle weiter, mit denselben Sternen, Forks und der Commit-Historie.

Braucht LLaMA-Factory eine GPU?

Eine GPU wird dringend empfohlen, ist aber nicht zwingend erforderlich. Laut Dokumentation des Projekts ist reines CPU-Training technisch unterstützt, aber für reale Fine-Tuning-Jobs unpraktikabel; LoRA-Fine-Tuning eines 7B-Modells ist mit rund 16 GB VRAM dokumentiert, mit 2-Bit-QLoRA bis zu ~4 GB.

Wie viel VRAM braucht vollständiges Fine-Tuning?

Laut LLaMA-Factorys eigener Dokumentation benötigt vollständiges (bf16/fp16) Fine-Tuning eines 7B-Modells rund 60 GB VRAM, und vollständiges fp32-Fine-Tuning desselben Modells rund 120 GB — dies sind die dokumentierten Werte des Projekts, keine von dieser Review unabhängig gemessenen Zahlen.

Welche Modelle unterstützt LLaMA-Factory?

Laut eigenem GitHub-README über 100 offene Modellfamilien von 270M bis 671B Parametern, darunter LLaMA, Qwen3, Mistral, Mixtral-MoE, DeepSeek, Gemma, GLM, Phi sowie Vision-Language-Modelle wie LLaVA und Qwen3-VL.

Hat LLaMA-Factory eine Desktop-App?

Nein. Es gibt eine Weboberfläche (LLaMA Board), die im Browser läuft, nachdem das Python-Paket installiert und llamafactory-cli webui ausgeführt wurde, aber kein paketiertes, installierbares Desktop-Programm. Siehe die Unsloth-Review für ein Fine-Tuning-Tool mit nativer Desktop-App.

Wie schneidet LLaMA-Factory im Vergleich zu Unsloth ab?

LLaMA-Factory deckt mehr Modellbreite für Text- und Vision-Language-Modelle plus dokumentiertes Multi-Node-Training ab; Unsloth deckt mehr Modalitäten ab (einschließlich Diffusion, TTS und Embedding-Modelle) plus eine native Desktop-App. LLaMA-Factory kann optional Unsloths Kernel als Beschleunigungs-Backend nutzen. Siehe den dedizierten Vergleichsabschnitt oben.

Läuft LLaMA-Factory auf AMD- oder Ascend-NPU-Hardware?

Ja — neben dem Standard-NVIDIA-CUDA-Image existieren laut der Multi-device-Backends-Dokumentation des Projekts separate Docker-Images für AMD ROCm und Ascend NPU.

Wer pflegt LLaMA-Factory?

hiyouga, laut GitHub-API als einzelner Nutzer (kein Unternehmen) gelistet. Das README des Projekts gibt an, es werde unter anderem von Amazon, NVIDIA und Aliyun genutzt — eine Angabe aus dem eigenen README des Projekts, die diese Review nicht unabhängig überprüft hat.

Quellen

← Zurück zu Lokale LLMs Pro