Skip to main content
PromptQuorum
Startseite/Lokale LLMs Pro/Lokale Bild-, Video- und Vision-Tools im Vergleich (2026): Generierung, Vision und OCR
Image & Video Generation

Lokale Bild-, Video- und Vision-Tools im Vergleich (2026): Generierung, Vision und OCR

·9 Min. Lesezeit·Von Hans Kuepper · Gründer von PromptQuorum, Multi-Model-AI-Dispatch-Tool · PromptQuorum

Die 16 lokalen Bild-Tools im PromptQuorum-Verzeichnis teilen sich in zwei Aufgaben, die getrennt verglichen werden sollten: Bild- und Videogenerierung (13 Tools) sowie Vision und OCR (3). Innerhalb der Generierung dokumentieren ComfyUI, InvokeAI und StableSwarmUI knotenbasierte Workflows; AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge, StableSwarmUI und ToolNeuron dokumentieren Erweiterungssysteme; und AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge und ToolNeuron dokumentieren eine lokale API. Bei Vision dokumentiert LLaVA das Lesen von Text in Bildern und Idefics mehrere Bilder pro Prompt. Nutzen Sie die Vergleichstabelle unten und lesen Sie vor der Installation den jeweiligen Test des Tools.

Lokale Bild-Tools erfüllen zwei unterschiedliche Aufgaben — Bilder und Videos aus einem Prompt erzeugen und Bilder verstehen, die man ihnen gibt — und keine einzelne Funktionsliste vergleicht sie fair. Dieser Leitfaden vergleicht 16 kostenlose und kostenpflichtige Tools, die auf der eigenen Hardware laufen, Aufgabe für Aufgabe. Grundlage ist eine Vergleichstabelle, die aus denselben Daten erzeugt wird wie der jeweilige PromptQuorum-Test des Tools, sodass sich Tabelle und Tests nicht widersprechen können.

Diese Seite enthält Verweislinks zu Produkten von Drittanbietern. PromptQuorum ist an keinem Partnerprogramm beteiligt — es sind reine Referenzlinks, die keine Provision erzielen. Das Anklicken von Links und Ihre nächsten Schritte liegen in Ihrer eigenen Verantwortung. Diese Links stellen keine Billigung oder Verifizierung durch PromptQuorum dar.

Wichtigste Erkenntnisse

  • 16 Tools, zwei Aufgaben: Bild- und Videogenerierung (13) sowie Vision und OCR (3).
  • Die Tabelle wird aus dem Datensatz jedes Tools erzeugt und mit dessen offizieller README oder Website abgeglichen; ein Strich bedeutet „in der Dokumentation nicht angegeben“, nie „nein“.
  • Lizenzen unterscheiden sich in relevanter Weise: Zum Beispiel stehen AUTOMATIC1111, DiffusionBee, Stable Diffusion WebUI Forge und Locally Uncensored unter AGPL-3.0, ComfyUI und Fooocus unter GPL-3.0, AnimateDiff, ControlNet und InvokeAI unter Apache-2.0, StableSwarmUI und ToolNeuron unter MIT, und Stable Diffusion verwendet eine OpenRAIL-Lizenz.
  • Jeder Toolname in der Tabelle verlinkt auf den eigenen PromptQuorum-Test, in dem Installationsschritte und Grenzen behandelt werden.

📍 In einem Satz

Lokale Bild-Tools sind zwei verschiedene Aufgaben — Bilder und Videos erzeugen sowie Bilder verstehen — daher werden die 16 Tools im PromptQuorum-Verzeichnis innerhalb jeder Aufgabe verglichen, anhand einer Tabelle, die aus denselben Tooldaten erzeugt wird wie der jeweilige Test des Tools.

💬 In einfachen Worten

Manche Tools zeichnen Bilder aus einem Text-Prompt, andere betrachten ein Bild und beantworten Fragen dazu. Ein Zeichen-Tool und ein bildlesendes Modell beim „Inpainting“ zu vergleichen, ergibt keinen Sinn, deshalb vergleicht dieser Leitfaden Gleiches mit Gleichem.

So haben wir verglichen

Die Fakten jedes Tools — Preis, Lizenz, Plattformen, Hardwareanforderungen und aufgabenspezifische Merkmale — werden einmal im Verzeichniseintrag des Tools gespeichert. Die Vergleichstabelle unten wird aus diesen Einträgen erzeugt, und der Test des Tools stützt sich auf denselben Eintrag, sodass beide keine unterschiedlichen Werte nennen können.

Aufgabenspezifische Merkmale (zum Beispiel Inpainting oder Erweiterungsunterstützung) wurden der offiziellen README oder Website des jeweiligen Projekts entnommen und am genauen Wortlaut dort überprüft. Wo die Dokumentation schweigt, zeigt die Tabelle einen Strich, statt zu raten; wo eine Aussage eingeschränkt ist (experimentell, abhängig von einem Fork oder ein gehosteter Dienst statt einer lokalen Funktion), wird das Merkmal aus der Tabelle weggelassen und stattdessen im Test des Tools behandelt.

Nur Tools mit eigenem PromptQuorum-Test stehen in der Tabelle. Der Vergleich listet Tools, die auf der eigenen Hardware laufen; er ordnet sie nicht in eine Rangfolge, weil das passende Tool von Ihrer Einschränkung abhängt.

Vergleichstabelle

Wählen Sie unten eine Aufgabe und lesen Sie dann quer durch eine Zeile. Klicken Sie auf einen Toolnamen, um den vollständigen PromptQuorum-Test zu öffnen.

WerkzeugPreisLizenzPlattformenAusführungHardwareVersionInpaintingVideogenerierungNode-/Graph-Workflow-EditorErweiterungen / PluginsLow-VRAM-ModusLokaler API-ServerTestProduktlink · offengelegt
AnimateDiffKostenlosApache-2.0Windows, Linux, macOSLokal13 GB VRAMJaTest lesenAnimateDiff
AUTOMATIC1111KostenlosAGPL-3.0macOS, Windows, LinuxLokalCPU genügtv1.10.1JaJaJaJaTest lesenAUTOMATIC1111
ComfyUIKostenlosGPL-3.0macOS, Windows, LinuxLokalCPU genügtv0.36.0JaTest lesenComfyUI
ControlNetKostenlosApache-2.0Windows, Linux, macOSLokal8 GB VRAMJaTest lesenControlNet
DiffusionBeeKostenlosAGPL-3.0macOSLokalCPU genügtJaJaTest lesenDiffusionBee
Draw ThingsKostenlosProprietarymacOS, iOSLokal8 GB RAMJaTest lesenDraw Things
FooocusKostenlosGPL-3.0Windows, Linux, macOSLokalCPU genügtv2.5.5JaJaTest lesenFooocus
Invoke AIFreemiumApache-2.0Windows, Linux, macOSLokal4 GB VRAMJaJaTest lesenInvoke AI
Locally UncensoredKostenpflichtigAGPL-3.0WindowsLokalJe nach Modell unterschiedlichTest lesenLocally Uncensored
Stable DiffusionKostenlosOpenRAILmacOS, Windows, LinuxLokal10 GB VRAMTest lesenStable Diffusion
Stable Diffusion WebUI ForgeKostenlosAGPL-3.0Linux, macOS, WindowsLokalJe nach Modell unterschiedlichJaJaTest lesenStable Diffusion WebUI Forge
StableSwarmUIKostenlosMITWindows, LinuxLokal8 GB VRAMJaJaJaTest lesenStableSwarmUI
ToolNeuronKostenlosMITAndroidLokalJe nach Modell unterschiedlichJaTest lesenToolNeuron

„—“ bedeutet, dass die eigene Dokumentation des Projekts es nicht angibt, nicht dass die Funktion fehlt. Die Werte stammen aus der offiziellen README oder Website des jeweiligen Projekts und werden erneut geprüft, wenn der Test eines Werkzeugs aktualisiert wird.

Bild- und Videogenerierung: Was sich unterscheidet

  • Workflow-Stil. ComfyUI, Invoke AI und StableSwarmUI dokumentieren knoten- oder graphbasierte Workflows. Die Dokumentation der übrigen Tools beschreibt keinen Node-Editor.
  • Erweiterungen und Plugins. AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge, StableSwarmUI und ToolNeuron dokumentieren ein Erweiterungs- oder Plugin-System.
  • Video. ComfyUI, StableSwarmUI, DiffusionBee, Draw Things, Locally Uncensored und AnimateDiff dokumentieren die Erzeugung von Video oder Animation.
  • Inpainting. AUTOMATIC1111, ComfyUI, DiffusionBee, Fooocus und Invoke AI dokumentieren Inpainting.
  • Betrieb mit wenig VRAM. AUTOMATIC1111, Fooocus und ControlNet dokumentieren einen Low-VRAM-Modus oder eine angegebene geringe VRAM-Anforderung; bei den übrigen im Test nachlesen, da die Anforderung vom geladenen Modell abhängt.
  • Lokale API. AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge und ToolNeuron dokumentieren eine API, die andere Apps aufrufen können.
  • Lizenz und Preis. AUTOMATIC1111, DiffusionBee, Stable Diffusion WebUI Forge und Locally Uncensored stehen unter AGPL-3.0; ComfyUI und Fooocus unter GPL-3.0; AnimateDiff, ControlNet und Invoke AI unter Apache-2.0; StableSwarmUI und ToolNeuron unter MIT; Stable Diffusion verwendet eine OpenRAIL-Lizenz. Draw Things ist eine Closed-Source-App, Locally Uncensored ist eine kostenpflichtige App und Invoke AI ist Freemium. Copyleft-Lizenzen knüpfen Bedingungen an die Weitergabe veränderter Versionen — siehe KI-Tool-Lizenzen erklärt.

Vision und OCR: Was sich unterscheidet

  • Text in Bildern lesen. LLaVA und Ollama-Vision-Modelle dokumentieren das Lesen oder Erkennen von Text in Bildern.
  • Mehrere Bilder pro Prompt. Idefics dokumentiert die Annahme mehrerer Bilder in einem Prompt.
  • Lokale API. Ollama-Vision-Modelle dokumentieren eine lokale API; die dokumentierte API von Idefics ist gehostet statt lokal und wird daher nicht mitgezählt.
  • Lizenz. LLaVA und Idefics stehen unter Apache-2.0; Ollama-Vision-Modelle sind eine Sammlung von Modellen mit unterschiedlichen Lizenzen, prüfen Sie also die Lizenz des jeweiligen Modells.

Was dieser Vergleich nicht leisten kann

  • Er vergleicht dokumentierte Fähigkeiten, nicht Qualität. Er sagt nichts darüber aus, wie gut die Bilder aussehen oder wie genau das Textlesen ist — dafür braucht es Ihre eigenen Prompts und Ihre eigene Hardware.
  • Er enthält keine Geschwindigkeits-Benchmarks: PromptQuorum hat diese für die Tools nicht gemessen.
  • Striche sind Lücken in der Dokumentation der Projekte, keine negativen Befunde. Manche Tools unterstützen möglicherweise eine Funktion, die ihre README nicht erwähnt.
  • Bearbeitungs- und Upscaling-Tools (Real-ESRGAN, FunClip) sowie DALL-E 3 über Ollama werden hier nicht verglichen: Die ersten beiden haben zu wenig gemeinsam, und für das letzte gibt es keinen PromptQuorum-Test.
  • Tools ändern sich schnell. Der Test jedes Tools nennt die geprüfte Version, und dieser Leitfaden wird aktualisiert, wenn ein Test aktualisiert wird.

Häufig gestellte Fragen

Warum werden Bildgenerierung und Vision-Modelle getrennt verglichen?

Sie erfüllen unterschiedliche Aufgaben, daher ergeben die meisten Merkmale nur innerhalb einer Aufgabe Sinn — Inpainting gehört zur Bildgenerierung, das Lesen von Text in Bildern zu Vision-Modellen. In einer gemeinsamen Tabelle blieben die meisten Zellen leer oder bedeutungslos.

Was bedeutet ein Strich in der Vergleichstabelle?

Er bedeutet, dass die Dokumentation des Projekts dieses Merkmal nicht angibt. Er bedeutet nicht, dass die Funktion fehlt; schauen Sie in den Test des Tools oder in dessen Repository.

Ist Stable Diffusion selbst eine App?

Stable Diffusion ist eine Familie von Bildmodellen und keine App. Es steht neben den Apps, weil es einen eigenen PromptQuorum-Test hat und die meisten Generierungs-Tools hier Stable-Diffusion-Modelle ausführen können.

Hat eines dieser Tools einen Affiliate-Link?

Nein. PromptQuorum hat zum Zeitpunkt der Erstellung keine Affiliate-Beziehung zu einem Tool in diesem Vergleich, und kein Link hier bringt eine Provision.

Wie oft wird dieser Vergleich aktualisiert?

Er wird zweimal im Jahr aktualisiert und immer dann, wenn der Test eines der aufgeführten Tools aktualisiert wird, weil die Tabelle aus denselben Daten wie diese Tests erzeugt wird.

Quellen

← Zurück zu Lokale LLMs Pro