Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Lokale Tools für Modelltraining und Betrieb im Vergleich (2026): Fine-Tuning und Observability
Overview & Reference

Lokale Tools für Modelltraining und Betrieb im Vergleich (2026): Fine-Tuning und Observability

·7 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Die 7 lokalen Tools für Training und Betrieb im PromptQuorum-Verzeichnis lassen sich in zwei Arten teilen, die getrennt verglichen werden sollten: Fine-Tuning-Tools (4) sowie Observability- und Evaluierungs-Tools (3). Unter den Fine-Tuning-Tools dokumentieren LLaMA-Factory und Unsloth LoRA- oder QLoRA-Training; unter den Observability-Tools dokumentieren Langfuse und Plano das Tracing von LLM-Aufrufen. Nutzen Sie die Vergleichstabelle unten und lesen Sie den jeweiligen Test des Tools, bevor Sie es installieren.

Tools für das Training und den Betrieb lokaler Sprachmodelle sind zwei verschiedene Produktarten — Fine-Tuning-Tools, die ein Modell anpassen, sowie Observability- und Evaluierungs-Tools, die zeigen, wie es sich im Einsatz verhält — und keine einzelne Funktionsliste vergleicht sie fair. Dieser Leitfaden vergleicht 7 kostenlose und Freemium-Tools, jeweils innerhalb einer Art, anhand einer Vergleichstabelle, die aus denselben Daten erzeugt wird wie der jeweilige PromptQuorum-Test des Tools, sodass Tabelle und Tests einander nicht widersprechen können.

Diese Seite enthält Verweislinks zu Produkten von Drittanbietern. PromptQuorum ist an keinem Partnerprogramm beteiligt — es sind reine Referenzlinks, die keine Provision erzielen. Das Anklicken von Links und Ihre nächsten Schritte liegen in Ihrer eigenen Verantwortung. Diese Links stellen keine Billigung oder Verifizierung durch PromptQuorum dar.

Wichtigste Erkenntnisse

  • 7 Tools, zwei Arten: Fine-Tuning (4) sowie Observability und Evaluierung (3). Ein Tool, das mehr als eine Aufgabe erfüllt, erscheint in jeder Art, zu der es gehört.
  • Die Tabelle wird aus dem Datensatz jedes Tools erzeugt und mit dessen offizieller README oder Website abgeglichen; ein Strich bedeutet „in der Dokumentation nicht angegeben“, niemals „nein“.
  • Das ist eine kleine Gruppe: Für die Unterkategorien Datensätze und Modell-Hubs gibt es im Verzeichnis noch keine getesteten Tools, daher werden sie hier nicht verglichen.
  • Jeder Toolname in der Tabelle verlinkt auf den eigenen PromptQuorum-Test, in dem Installationsschritte und Grenzen behandelt werden.

📍 In einem Satz

Lokale Tools für Training und Betrieb sind zwei verschiedene Produktarten — Fine-Tuning-Tools sowie Observability- und Evaluierungs-Tools —, daher werden die 7 Tools im PromptQuorum-Verzeichnis innerhalb der jeweiligen Art verglichen, anhand einer Tabelle, die aus denselben Tooldaten erzeugt wird wie der jeweilige Test des Tools.

💬 In einfachen Worten

Manche Tools bringen einem Modell durch Fine-Tuning mit Ihren Daten neues Verhalten bei, andere beobachten, wie eine Modellanwendung arbeitet, und bewerten ihre Antworten. Einen Trainer und ein Monitoring-Dashboard anhand derselben Funktionen zu vergleichen, ergibt keinen Sinn, daher vergleicht dieser Leitfaden Gleiches mit Gleichem.

So haben wir verglichen

Die Fakten jedes Tools — Preis, Lizenz, Plattformen, Hardwareanforderungen und kategoriespezifische Merkmale — werden einmalig im Verzeichniseintrag des Tools gespeichert. Die Vergleichstabelle unten wird aus diesen Einträgen erzeugt, und der Test des Tools stützt sich auf denselben Eintrag, sodass beide keine unterschiedlichen Werte nennen können.

Kategoriespezifische Merkmale (zum Beispiel LoRA- und QLoRA-Unterstützung oder Tracing) wurden der offiziellen README oder Website des jeweiligen Projekts entnommen und am genauen Wortlaut dort geprüft. Wo die Dokumentation schweigt, zeigt die Tabelle einen Strich, statt zu raten; wo eine Aussage eingeschränkt ist (nur Roadmap, eine Enterprise-Edition oder ein separates Paket), wird das Merkmal aus der Tabelle weggelassen und stattdessen im Test des Tools behandelt.

Nur Tools mit eigenem PromptQuorum-Test stehen in der Tabelle. Der Vergleich erstellt keine Rangfolge der Tools, denn welches das richtige ist, hängt von Ihrer Rahmenbedingung ab.

Vergleichstabelle

Wählen Sie unten eine Art von Tool und lesen Sie dann quer durch eine Zeile. Klicken Sie auf einen Toolnamen, um den vollständigen PromptQuorum-Test zu öffnen.

WerkzeugPreisLizenzPlattformenAusführungHardwareVersionLoRA / QLoRAWeb-UIMulti-GPU-TrainingLow-VRAM-ModusExport nach GGUF / OllamaTestProduktlink · offengelegt
LLaMA-FactoryKostenlosApache-2.0macOS, Windows, LinuxLokal16 GB VRAMv0.9.5JaJaJaJaJaTest lesenLLaMA-Factory
LoRAXKostenlosApache-2.0LinuxLokalJe nach Modell unterschiedlichv0.12.1Test lesenLoRAX
Second MeKostenlosApache-2.0macOS, Windows, LinuxLokalJe nach Modell unterschiedlichTest lesenSecond Me
UnslothKostenlosApache-2.0macOS, Windows, LinuxLokalJe nach Modell unterschiedlichJaJaJaJaJaTest lesenUnsloth

„—“ bedeutet, dass die eigene Dokumentation des Projekts es nicht angibt, nicht dass die Funktion fehlt. Die Werte stammen aus der offiziellen README oder Website des jeweiligen Projekts und werden erneut geprüft, wenn der Test eines Werkzeugs aktualisiert wird.

Fine-Tuning-Tools: Was sie unterscheidet

  • LoRA und QLoRA. LLaMA-Factory und Unsloth dokumentieren LoRA- oder QLoRA-Fine-Tuning.
  • Web-Oberfläche. LLaMA-Factory und Unsloth dokumentieren eine Web-Oberfläche für das Training.
  • Multi-GPU-Training. LLaMA-Factory und Unsloth dokumentieren Multi-GPU-Training.
  • Training mit wenig VRAM. LLaMA-Factory und Unsloth dokumentieren einen Modus für wenig VRAM bzw. zum Speichersparen.
  • Export nach GGUF oder Ollama. LLaMA-Factory und Unsloth dokumentieren den Export von Modellen nach GGUF oder Ollama.
  • Dünn besetzte Zeilen. LoRAX und Second Me erscheinen hier wegen ihrer Fine-Tuning-bezogenen Funktionen, doch ihre Dokumentation nennt keines der verglichenen Merkmale, daher zeigen ihre Zellen Striche; siehe ihre Tests.

Observability und Evaluierung: Was sie unterscheidet

  • Tracing. Langfuse und Plano dokumentieren das Tracing von LLM-Aufrufen.
  • Evaluierungen. Langfuse dokumentiert Evaluierungen bzw. Bewertungen.
  • Prompt-Verwaltung. Langfuse dokumentiert Prompt-Verwaltung.
  • OpenTelemetry. Plano dokumentiert OpenTelemetry-Unterstützung.
  • Docker und Self-Hosting. Langfuse und Mission Control dokumentieren Docker- bzw. selbst gehostete Bereitstellung.
  • Lokale LLMs. Langfuse dokumentiert die Arbeit mit lokalen oder selbst gehosteten LLMs.

Was dieser Vergleich nicht aussagen kann

  • Er vergleicht dokumentierte Fähigkeiten, keine Ergebnisse. Er sagt nichts darüber aus, wie gut ein feinabgestimmtes Modell ist, wie schnell das Training auf Ihrer Hardware läuft oder wie genau ein Evaluierungswert ist — PromptQuorum hat das für die aufgeführten Tools nicht gemessen.
  • Striche sind Lücken in der von uns geprüften Dokumentation, keine negativen Befunde. Manche Tools unterstützen möglicherweise eine Funktion, die ihre README nicht erwähnt.
  • Die Hardwareanforderungen für Fine-Tuning hängen stark vom Modell und den Einstellungen ab; lesen Sie den Test des Tools für realistische Anforderungen, bevor Sie einen Trainingslauf starten.
  • Tools ändern sich schnell. Der Test jedes Tools nennt die Version, gegen die er geprüft wurde, und dieser Leitfaden wird aktualisiert, wenn ein Test aktualisiert wird.

Häufig gestellte Fragen

Was ist der Unterschied zwischen einem Fine-Tuning-Tool und einem Observability-Tool?

Ein Fine-Tuning-Tool passt ein Modell an, indem es mit Ihren Daten trainiert wird, oft mit parametereffizienten Methoden wie LoRA oder QLoRA. Ein Observability- oder Evaluierungs-Tool zeichnet auf und bewertet, wie sich eine LLM-Anwendung im Einsatz verhält, zum Beispiel durch das Tracing jeder Anfrage. Sie erfüllen unterschiedliche Aufgaben und werden daher getrennt verglichen.

Was bedeutet ein Strich in der Vergleichstabelle?

Er bedeutet, dass die eigene Dokumentation des Projekts dieses Merkmal nicht angibt. Er bedeutet nicht, dass die Funktion fehlt; prüfen Sie den Test des Tools oder sein Repository.

Warum gibt es hier so wenige Tools?

Das Verzeichnis enthält in diesem Bereich bisher nur wenige getestete Tools und noch keine für Datensätze oder Modell-Hubs. Der Vergleich deckt ab, was getestet ist; weitere Tools werden hinzugefügt, sobald ihre Tests geschrieben sind.

Hat eines dieser Tools einen Affiliate-Link?

Nein. PromptQuorum hat zum Zeitpunkt der Erstellung keine Affiliate-Beziehung zu einem Tool in diesem Vergleich, und kein Link hier bringt eine Provision.

Wie oft wird dieser Vergleich aktualisiert?

Er wird zweimal im Jahr aktualisiert sowie immer dann, wenn der Test eines der aufgeführten Tools aktualisiert wird, da die Tabelle aus denselben Daten wie diese Tests erzeugt wird.

Quellen

  • Die offizielle README oder Website jedes Tools, aufgeführt im PromptQuorum-Test des Tools (verlinkt aus der Vergleichstabelle).
  • PromptQuorum-Verzeichnis für lokale KI-Apps — der Datensatz, aus dem jede Zeile der Tabelle erzeugt wird.

← Zurück zu Lokale LLMs Pro