Wichtigste Erkenntnisse
- 7 Tools, zwei Arten: Fine-Tuning (4) sowie Observability und Evaluierung (3). Ein Tool, das mehr als eine Aufgabe erfüllt, erscheint in jeder Art, zu der es gehört.
- Die Tabelle wird aus dem Datensatz jedes Tools erzeugt und mit dessen offizieller README oder Website abgeglichen; ein Strich bedeutet „in der Dokumentation nicht angegeben“, niemals „nein“.
- Das ist eine kleine Gruppe: Für die Unterkategorien Datensätze und Modell-Hubs gibt es im Verzeichnis noch keine getesteten Tools, daher werden sie hier nicht verglichen.
- Jeder Toolname in der Tabelle verlinkt auf den eigenen PromptQuorum-Test, in dem Installationsschritte und Grenzen behandelt werden.
📍 In einem Satz
Lokale Tools für Training und Betrieb sind zwei verschiedene Produktarten — Fine-Tuning-Tools sowie Observability- und Evaluierungs-Tools —, daher werden die 7 Tools im PromptQuorum-Verzeichnis innerhalb der jeweiligen Art verglichen, anhand einer Tabelle, die aus denselben Tooldaten erzeugt wird wie der jeweilige Test des Tools.
💬 In einfachen Worten
Manche Tools bringen einem Modell durch Fine-Tuning mit Ihren Daten neues Verhalten bei, andere beobachten, wie eine Modellanwendung arbeitet, und bewerten ihre Antworten. Einen Trainer und ein Monitoring-Dashboard anhand derselben Funktionen zu vergleichen, ergibt keinen Sinn, daher vergleicht dieser Leitfaden Gleiches mit Gleichem.
So haben wir verglichen
Die Fakten jedes Tools — Preis, Lizenz, Plattformen, Hardwareanforderungen und kategoriespezifische Merkmale — werden einmalig im Verzeichniseintrag des Tools gespeichert. Die Vergleichstabelle unten wird aus diesen Einträgen erzeugt, und der Test des Tools stützt sich auf denselben Eintrag, sodass beide keine unterschiedlichen Werte nennen können.
Kategoriespezifische Merkmale (zum Beispiel LoRA- und QLoRA-Unterstützung oder Tracing) wurden der offiziellen README oder Website des jeweiligen Projekts entnommen und am genauen Wortlaut dort geprüft. Wo die Dokumentation schweigt, zeigt die Tabelle einen Strich, statt zu raten; wo eine Aussage eingeschränkt ist (nur Roadmap, eine Enterprise-Edition oder ein separates Paket), wird das Merkmal aus der Tabelle weggelassen und stattdessen im Test des Tools behandelt.
Nur Tools mit eigenem PromptQuorum-Test stehen in der Tabelle. Der Vergleich erstellt keine Rangfolge der Tools, denn welches das richtige ist, hängt von Ihrer Rahmenbedingung ab.
Vergleichstabelle
Wählen Sie unten eine Art von Tool und lesen Sie dann quer durch eine Zeile. Klicken Sie auf einen Toolnamen, um den vollständigen PromptQuorum-Test zu öffnen.
| Werkzeug | Preis | Lizenz | Plattformen | Ausführung | Hardware | Version | LoRA / QLoRA | Web-UI | Multi-GPU-Training | Low-VRAM-Modus | Export nach GGUF / Ollama | Test | Produktlink · offengelegt |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| LLaMA-Factory | Kostenlos | Apache-2.0 | macOS, Windows, Linux | Lokal | 16 GB VRAM | v0.9.5 | Ja | Ja | Ja | Ja | Ja | Test lesen → | LLaMA-Factory |
| LoRAX | Kostenlos | Apache-2.0 | Linux | Lokal | Je nach Modell unterschiedlich | v0.12.1 | — | — | — | — | — | Test lesen → | LoRAX |
| Second Me | Kostenlos | Apache-2.0 | macOS, Windows, Linux | Lokal | Je nach Modell unterschiedlich | — | — | — | — | — | — | Test lesen → | Second Me |
| Unsloth | Kostenlos | Apache-2.0 | macOS, Windows, Linux | Lokal | Je nach Modell unterschiedlich | — | Ja | Ja | Ja | Ja | Ja | Test lesen → | Unsloth |
„—“ bedeutet, dass die eigene Dokumentation des Projekts es nicht angibt, nicht dass die Funktion fehlt. Die Werte stammen aus der offiziellen README oder Website des jeweiligen Projekts und werden erneut geprüft, wenn der Test eines Werkzeugs aktualisiert wird.
Fine-Tuning-Tools: Was sie unterscheidet
- LoRA und QLoRA. LLaMA-Factory und Unsloth dokumentieren LoRA- oder QLoRA-Fine-Tuning.
- Web-Oberfläche. LLaMA-Factory und Unsloth dokumentieren eine Web-Oberfläche für das Training.
- Multi-GPU-Training. LLaMA-Factory und Unsloth dokumentieren Multi-GPU-Training.
- Training mit wenig VRAM. LLaMA-Factory und Unsloth dokumentieren einen Modus für wenig VRAM bzw. zum Speichersparen.
- Export nach GGUF oder Ollama. LLaMA-Factory und Unsloth dokumentieren den Export von Modellen nach GGUF oder Ollama.
- Dünn besetzte Zeilen. LoRAX und Second Me erscheinen hier wegen ihrer Fine-Tuning-bezogenen Funktionen, doch ihre Dokumentation nennt keines der verglichenen Merkmale, daher zeigen ihre Zellen Striche; siehe ihre Tests.
Observability und Evaluierung: Was sie unterscheidet
- Tracing. Langfuse und Plano dokumentieren das Tracing von LLM-Aufrufen.
- Evaluierungen. Langfuse dokumentiert Evaluierungen bzw. Bewertungen.
- Prompt-Verwaltung. Langfuse dokumentiert Prompt-Verwaltung.
- OpenTelemetry. Plano dokumentiert OpenTelemetry-Unterstützung.
- Docker und Self-Hosting. Langfuse und Mission Control dokumentieren Docker- bzw. selbst gehostete Bereitstellung.
- Lokale LLMs. Langfuse dokumentiert die Arbeit mit lokalen oder selbst gehosteten LLMs.
Was dieser Vergleich nicht aussagen kann
- Er vergleicht dokumentierte Fähigkeiten, keine Ergebnisse. Er sagt nichts darüber aus, wie gut ein feinabgestimmtes Modell ist, wie schnell das Training auf Ihrer Hardware läuft oder wie genau ein Evaluierungswert ist — PromptQuorum hat das für die aufgeführten Tools nicht gemessen.
- Striche sind Lücken in der von uns geprüften Dokumentation, keine negativen Befunde. Manche Tools unterstützen möglicherweise eine Funktion, die ihre README nicht erwähnt.
- Die Hardwareanforderungen für Fine-Tuning hängen stark vom Modell und den Einstellungen ab; lesen Sie den Test des Tools für realistische Anforderungen, bevor Sie einen Trainingslauf starten.
- Tools ändern sich schnell. Der Test jedes Tools nennt die Version, gegen die er geprüft wurde, und dieser Leitfaden wird aktualisiert, wenn ein Test aktualisiert wird.
Häufig gestellte Fragen
Was ist der Unterschied zwischen einem Fine-Tuning-Tool und einem Observability-Tool?
Ein Fine-Tuning-Tool passt ein Modell an, indem es mit Ihren Daten trainiert wird, oft mit parametereffizienten Methoden wie LoRA oder QLoRA. Ein Observability- oder Evaluierungs-Tool zeichnet auf und bewertet, wie sich eine LLM-Anwendung im Einsatz verhält, zum Beispiel durch das Tracing jeder Anfrage. Sie erfüllen unterschiedliche Aufgaben und werden daher getrennt verglichen.
Was bedeutet ein Strich in der Vergleichstabelle?
Er bedeutet, dass die eigene Dokumentation des Projekts dieses Merkmal nicht angibt. Er bedeutet nicht, dass die Funktion fehlt; prüfen Sie den Test des Tools oder sein Repository.
Warum gibt es hier so wenige Tools?
Das Verzeichnis enthält in diesem Bereich bisher nur wenige getestete Tools und noch keine für Datensätze oder Modell-Hubs. Der Vergleich deckt ab, was getestet ist; weitere Tools werden hinzugefügt, sobald ihre Tests geschrieben sind.
Hat eines dieser Tools einen Affiliate-Link?
Nein. PromptQuorum hat zum Zeitpunkt der Erstellung keine Affiliate-Beziehung zu einem Tool in diesem Vergleich, und kein Link hier bringt eine Provision.
Wie oft wird dieser Vergleich aktualisiert?
Er wird zweimal im Jahr aktualisiert sowie immer dann, wenn der Test eines der aufgeführten Tools aktualisiert wird, da die Tabelle aus denselben Daten wie diese Tests erzeugt wird.
Quellen
- Die offizielle README oder Website jedes Tools, aufgeführt im PromptQuorum-Test des Tools (verlinkt aus der Vergleichstabelle).
- PromptQuorum-Verzeichnis für lokale KI-Apps — der Datensatz, aus dem jede Zeile der Tabelle erzeugt wird.