Wichtigste Erkenntnisse
- 16 Tools, zwei Aufgaben: Bild- und Videogenerierung (13) sowie Vision und OCR (3).
- Die Tabelle wird aus dem Datensatz jedes Tools erzeugt und mit dessen offizieller README oder Website abgeglichen; ein Strich bedeutet „in der Dokumentation nicht angegeben“, nie „nein“.
- Lizenzen unterscheiden sich in relevanter Weise: Zum Beispiel stehen AUTOMATIC1111, DiffusionBee, Stable Diffusion WebUI Forge und Locally Uncensored unter AGPL-3.0, ComfyUI und Fooocus unter GPL-3.0, AnimateDiff, ControlNet und InvokeAI unter Apache-2.0, StableSwarmUI und ToolNeuron unter MIT, und Stable Diffusion verwendet eine OpenRAIL-Lizenz.
- Jeder Toolname in der Tabelle verlinkt auf den eigenen PromptQuorum-Test, in dem Installationsschritte und Grenzen behandelt werden.
📍 In einem Satz
Lokale Bild-Tools sind zwei verschiedene Aufgaben — Bilder und Videos erzeugen sowie Bilder verstehen — daher werden die 16 Tools im PromptQuorum-Verzeichnis innerhalb jeder Aufgabe verglichen, anhand einer Tabelle, die aus denselben Tooldaten erzeugt wird wie der jeweilige Test des Tools.
💬 In einfachen Worten
Manche Tools zeichnen Bilder aus einem Text-Prompt, andere betrachten ein Bild und beantworten Fragen dazu. Ein Zeichen-Tool und ein bildlesendes Modell beim „Inpainting“ zu vergleichen, ergibt keinen Sinn, deshalb vergleicht dieser Leitfaden Gleiches mit Gleichem.
So haben wir verglichen
Die Fakten jedes Tools — Preis, Lizenz, Plattformen, Hardwareanforderungen und aufgabenspezifische Merkmale — werden einmal im Verzeichniseintrag des Tools gespeichert. Die Vergleichstabelle unten wird aus diesen Einträgen erzeugt, und der Test des Tools stützt sich auf denselben Eintrag, sodass beide keine unterschiedlichen Werte nennen können.
Aufgabenspezifische Merkmale (zum Beispiel Inpainting oder Erweiterungsunterstützung) wurden der offiziellen README oder Website des jeweiligen Projekts entnommen und am genauen Wortlaut dort überprüft. Wo die Dokumentation schweigt, zeigt die Tabelle einen Strich, statt zu raten; wo eine Aussage eingeschränkt ist (experimentell, abhängig von einem Fork oder ein gehosteter Dienst statt einer lokalen Funktion), wird das Merkmal aus der Tabelle weggelassen und stattdessen im Test des Tools behandelt.
Nur Tools mit eigenem PromptQuorum-Test stehen in der Tabelle. Der Vergleich listet Tools, die auf der eigenen Hardware laufen; er ordnet sie nicht in eine Rangfolge, weil das passende Tool von Ihrer Einschränkung abhängt.
Vergleichstabelle
Wählen Sie unten eine Aufgabe und lesen Sie dann quer durch eine Zeile. Klicken Sie auf einen Toolnamen, um den vollständigen PromptQuorum-Test zu öffnen.
| Werkzeug | Preis | Lizenz | Plattformen | Ausführung | Hardware | Version | Inpainting | Videogenerierung | Node-/Graph-Workflow-Editor | Erweiterungen / Plugins | Low-VRAM-Modus | Lokaler API-Server | Test | Produktlink · offengelegt |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AnimateDiff | Kostenlos | Apache-2.0 | Windows, Linux, macOS | Lokal | 13 GB VRAM | — | — | Ja | — | — | — | — | Test lesen → | AnimateDiff |
| AUTOMATIC1111 | Kostenlos | AGPL-3.0 | macOS, Windows, Linux | Lokal | CPU genügt | v1.10.1 | Ja | — | — | Ja | Ja | Ja | Test lesen → | AUTOMATIC1111 |
| ComfyUI | Kostenlos | GPL-3.0 | macOS, Windows, Linux | Lokal | CPU genügt | v0.36.0 | — | — | — | — | — | Ja | Test lesen → | ComfyUI |
| ControlNet | Kostenlos | Apache-2.0 | Windows, Linux, macOS | Lokal | 8 GB VRAM | — | — | — | — | — | Ja | — | Test lesen → | ControlNet |
| DiffusionBee | Kostenlos | AGPL-3.0 | macOS | Lokal | CPU genügt | — | Ja | Ja | — | — | — | — | Test lesen → | DiffusionBee |
| Draw Things | Kostenlos | Proprietary | macOS, iOS | Lokal | 8 GB RAM | — | — | Ja | — | — | — | — | Test lesen → | Draw Things |
| Fooocus | Kostenlos | GPL-3.0 | Windows, Linux, macOS | Lokal | CPU genügt | v2.5.5 | Ja | — | — | — | Ja | — | Test lesen → | Fooocus |
| Invoke AI | Freemium | Apache-2.0 | Windows, Linux, macOS | Lokal | 4 GB VRAM | — | Ja | — | Ja | — | — | — | Test lesen → | Invoke AI |
| Locally Uncensored | Kostenpflichtig | AGPL-3.0 | Windows | Lokal | Je nach Modell unterschiedlich | — | — | — | — | — | — | — | Test lesen → | Locally Uncensored |
| Stable Diffusion | Kostenlos | OpenRAIL | macOS, Windows, Linux | Lokal | 10 GB VRAM | — | — | — | — | — | — | — | Test lesen → | Stable Diffusion |
| Stable Diffusion WebUI Forge | Kostenlos | AGPL-3.0 | Linux, macOS, Windows | Lokal | Je nach Modell unterschiedlich | — | — | — | — | Ja | — | Ja | Test lesen → | Stable Diffusion WebUI Forge |
| StableSwarmUI | Kostenlos | MIT | Windows, Linux | Lokal | 8 GB VRAM | — | — | Ja | Ja | Ja | — | — | Test lesen → | StableSwarmUI |
| ToolNeuron | Kostenlos | MIT | Android | Lokal | Je nach Modell unterschiedlich | — | — | — | — | — | — | Ja | Test lesen → | ToolNeuron |
„—“ bedeutet, dass die eigene Dokumentation des Projekts es nicht angibt, nicht dass die Funktion fehlt. Die Werte stammen aus der offiziellen README oder Website des jeweiligen Projekts und werden erneut geprüft, wenn der Test eines Werkzeugs aktualisiert wird.
Bild- und Videogenerierung: Was sich unterscheidet
- Workflow-Stil. ComfyUI, Invoke AI und StableSwarmUI dokumentieren knoten- oder graphbasierte Workflows. Die Dokumentation der übrigen Tools beschreibt keinen Node-Editor.
- Erweiterungen und Plugins. AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge, StableSwarmUI und ToolNeuron dokumentieren ein Erweiterungs- oder Plugin-System.
- Video. ComfyUI, StableSwarmUI, DiffusionBee, Draw Things, Locally Uncensored und AnimateDiff dokumentieren die Erzeugung von Video oder Animation.
- Inpainting. AUTOMATIC1111, ComfyUI, DiffusionBee, Fooocus und Invoke AI dokumentieren Inpainting.
- Betrieb mit wenig VRAM. AUTOMATIC1111, Fooocus und ControlNet dokumentieren einen Low-VRAM-Modus oder eine angegebene geringe VRAM-Anforderung; bei den übrigen im Test nachlesen, da die Anforderung vom geladenen Modell abhängt.
- Lokale API. AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge und ToolNeuron dokumentieren eine API, die andere Apps aufrufen können.
- Lizenz und Preis. AUTOMATIC1111, DiffusionBee, Stable Diffusion WebUI Forge und Locally Uncensored stehen unter AGPL-3.0; ComfyUI und Fooocus unter GPL-3.0; AnimateDiff, ControlNet und Invoke AI unter Apache-2.0; StableSwarmUI und ToolNeuron unter MIT; Stable Diffusion verwendet eine OpenRAIL-Lizenz. Draw Things ist eine Closed-Source-App, Locally Uncensored ist eine kostenpflichtige App und Invoke AI ist Freemium. Copyleft-Lizenzen knüpfen Bedingungen an die Weitergabe veränderter Versionen — siehe KI-Tool-Lizenzen erklärt.
Vision und OCR: Was sich unterscheidet
- Text in Bildern lesen. LLaVA und Ollama-Vision-Modelle dokumentieren das Lesen oder Erkennen von Text in Bildern.
- Mehrere Bilder pro Prompt. Idefics dokumentiert die Annahme mehrerer Bilder in einem Prompt.
- Lokale API. Ollama-Vision-Modelle dokumentieren eine lokale API; die dokumentierte API von Idefics ist gehostet statt lokal und wird daher nicht mitgezählt.
- Lizenz. LLaVA und Idefics stehen unter Apache-2.0; Ollama-Vision-Modelle sind eine Sammlung von Modellen mit unterschiedlichen Lizenzen, prüfen Sie also die Lizenz des jeweiligen Modells.
Was dieser Vergleich nicht leisten kann
- Er vergleicht dokumentierte Fähigkeiten, nicht Qualität. Er sagt nichts darüber aus, wie gut die Bilder aussehen oder wie genau das Textlesen ist — dafür braucht es Ihre eigenen Prompts und Ihre eigene Hardware.
- Er enthält keine Geschwindigkeits-Benchmarks: PromptQuorum hat diese für die Tools nicht gemessen.
- Striche sind Lücken in der Dokumentation der Projekte, keine negativen Befunde. Manche Tools unterstützen möglicherweise eine Funktion, die ihre README nicht erwähnt.
- Bearbeitungs- und Upscaling-Tools (Real-ESRGAN, FunClip) sowie DALL-E 3 über Ollama werden hier nicht verglichen: Die ersten beiden haben zu wenig gemeinsam, und für das letzte gibt es keinen PromptQuorum-Test.
- Tools ändern sich schnell. Der Test jedes Tools nennt die geprüfte Version, und dieser Leitfaden wird aktualisiert, wenn ein Test aktualisiert wird.
Häufig gestellte Fragen
Warum werden Bildgenerierung und Vision-Modelle getrennt verglichen?
Sie erfüllen unterschiedliche Aufgaben, daher ergeben die meisten Merkmale nur innerhalb einer Aufgabe Sinn — Inpainting gehört zur Bildgenerierung, das Lesen von Text in Bildern zu Vision-Modellen. In einer gemeinsamen Tabelle blieben die meisten Zellen leer oder bedeutungslos.
Was bedeutet ein Strich in der Vergleichstabelle?
Er bedeutet, dass die Dokumentation des Projekts dieses Merkmal nicht angibt. Er bedeutet nicht, dass die Funktion fehlt; schauen Sie in den Test des Tools oder in dessen Repository.
Ist Stable Diffusion selbst eine App?
Stable Diffusion ist eine Familie von Bildmodellen und keine App. Es steht neben den Apps, weil es einen eigenen PromptQuorum-Test hat und die meisten Generierungs-Tools hier Stable-Diffusion-Modelle ausführen können.
Hat eines dieser Tools einen Affiliate-Link?
Nein. PromptQuorum hat zum Zeitpunkt der Erstellung keine Affiliate-Beziehung zu einem Tool in diesem Vergleich, und kein Link hier bringt eine Provision.
Wie oft wird dieser Vergleich aktualisiert?
Er wird zweimal im Jahr aktualisiert und immer dann, wenn der Test eines der aufgeführten Tools aktualisiert wird, weil die Tabelle aus denselben Daten wie diese Tests erzeugt wird.
Quellen
- Die offizielle README oder Website jedes Tools, aufgeführt im PromptQuorum-Test des jeweiligen Tools (in der Vergleichstabelle verlinkt).
- PromptQuorum-Verzeichnis für lokale KI-Apps — der Datensatz, aus dem jede Zeile der Tabelle erzeugt wird.
- KI-Tool-Lizenzen erklärt — was die oben genannten Lizenzfamilien bedeuten.