Points clés
- 16 outils, deux missions : génération d'images et de vidéos (13) et vision et OCR (3).
- Le tableau est généré à partir de la fiche de chaque outil et vérifié par rapport à son README ou à son site officiel ; un tiret signifie « non précisé dans la documentation », jamais « non ».
- Les licences diffèrent d'une façon qui compte : par exemple AUTOMATIC1111, DiffusionBee, Stable Diffusion WebUI Forge et Locally Uncensored sont sous AGPL-3.0, ComfyUI et Fooocus sous GPL-3.0, AnimateDiff, ControlNet et InvokeAI sous Apache-2.0, StableSwarmUI et ToolNeuron sous MIT, et Stable Diffusion utilise une licence OpenRAIL.
- Chaque nom d'outil du tableau renvoie vers son propre avis PromptQuorum, où figurent les étapes d'installation et les limites.
📍 En une phrase
Les outils d'image locaux recouvrent deux missions différentes — générer des images et des vidéos, et comprendre des images — si bien que les 16 outils du répertoire PromptQuorum sont comparés au sein de chaque mission, à l'aide d'un tableau généré à partir des mêmes données que l'avis de chaque outil.
💬 En termes simples
Certains outils dessinent des images à partir d'un texte, d'autres regardent une image et répondent à des questions à son sujet. Comparer un outil de dessin et un modèle de lecture d'images sur l'« inpainting » n'a aucun sens : ce guide compare donc des outils comparables.
Notre méthode de comparaison
Les informations sur chaque outil — prix, licence, plateformes, besoins matériels et attributs propres à la catégorie — sont enregistrées une seule fois, dans la fiche de l'outil dans le répertoire. Le tableau comparatif ci-dessous est généré à partir de ces fiches, et l'avis de l'outil s'appuie sur la même fiche : les deux ne peuvent donc pas indiquer des valeurs différentes.
Les attributs propres à la catégorie (par exemple l'inpainting ou la prise en charge des extensions) ont été relevés dans le README ou sur le site officiel de chaque projet, puis vérifiés au mot près. Lorsque la documentation est muette, le tableau affiche un tiret plutôt que de deviner ; lorsqu'une affirmation est nuancée (expérimentale, dépendante d'un fork, ou service hébergé plutôt que fonctionnalité locale), l'attribut est retiré du tableau et traité dans l'avis de l'outil.
Seuls les outils dotés de leur propre avis PromptQuorum figurent dans le tableau. Le comparatif recense des outils qui fonctionnent sur votre propre matériel ; il ne les classe pas, car le bon choix dépend de votre contrainte.
Tableau comparatif
Choisissez une mission ci-dessous, puis lisez la ligne de gauche à droite. Cliquez sur le nom d'un outil pour ouvrir son avis PromptQuorum complet.
| Outil | Prix | Licence | Plateformes | Exécution | Matériel | Version | Inpainting | Génération de vidéo | Éditeur de workflow par nœuds / graphe | Extensions / plugins | Mode faible VRAM | Serveur API local | Avis | lien produit · divulgué |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AnimateDiff | Gratuit | Apache-2.0 | Windows, Linux, macOS | Local | 13 Go de VRAM | — | — | Oui | — | — | — | — | Lire l'avis → | AnimateDiff |
| AUTOMATIC1111 | Gratuit | AGPL-3.0 | macOS, Windows, Linux | Local | Un CPU suffit | v1.10.1 | Oui | — | — | Oui | Oui | Oui | Lire l'avis → | AUTOMATIC1111 |
| ComfyUI | Gratuit | GPL-3.0 | macOS, Windows, Linux | Local | Un CPU suffit | v0.36.0 | — | — | — | — | — | Oui | Lire l'avis → | ComfyUI |
| ControlNet | Gratuit | Apache-2.0 | Windows, Linux, macOS | Local | 8 Go de VRAM | — | — | — | — | — | Oui | — | Lire l'avis → | ControlNet |
| DiffusionBee | Gratuit | AGPL-3.0 | macOS | Local | Un CPU suffit | — | Oui | Oui | — | — | — | — | Lire l'avis → | DiffusionBee |
| Draw Things | Gratuit | Proprietary | macOS, iOS | Local | 8 Go de RAM | — | — | Oui | — | — | — | — | Lire l'avis → | Draw Things |
| Fooocus | Gratuit | GPL-3.0 | Windows, Linux, macOS | Local | Un CPU suffit | v2.5.5 | Oui | — | — | — | Oui | — | Lire l'avis → | Fooocus |
| Invoke AI | Freemium | Apache-2.0 | Windows, Linux, macOS | Local | 4 Go de VRAM | — | Oui | — | Oui | — | — | — | Lire l'avis → | Invoke AI |
| Locally Uncensored | Payant | AGPL-3.0 | Windows | Local | Variable selon le modèle | — | — | — | — | — | — | — | Lire l'avis → | Locally Uncensored |
| Stable Diffusion | Gratuit | OpenRAIL | macOS, Windows, Linux | Local | 10 Go de VRAM | — | — | — | — | — | — | — | Lire l'avis → | Stable Diffusion |
| Stable Diffusion WebUI Forge | Gratuit | AGPL-3.0 | Linux, macOS, Windows | Local | Variable selon le modèle | — | — | — | — | Oui | — | Oui | Lire l'avis → | Stable Diffusion WebUI Forge |
| StableSwarmUI | Gratuit | MIT | Windows, Linux | Local | 8 Go de VRAM | — | — | Oui | Oui | Oui | — | — | Lire l'avis → | StableSwarmUI |
| ToolNeuron | Gratuit | MIT | Android | Local | Variable selon le modèle | — | — | — | — | — | — | Oui | Lire l'avis → | ToolNeuron |
« — » signifie que la documentation du projet ne le précise pas, et non que la fonctionnalité est absente. Les valeurs proviennent du README ou du site officiel de chaque projet et sont revérifiées lors de la mise à jour de l'avis d'un outil.
Génération d'images et de vidéos : ce qui diffère
- Style de workflow. ComfyUI, Invoke AI et StableSwarmUI documentent des workflows par nœuds ou par graphe. La documentation des autres outils ne décrit pas d'éditeur de nœuds.
- Extensions et plugins. AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge, StableSwarmUI et ToolNeuron documentent un système d'extensions ou de plugins.
- Vidéo. ComfyUI, StableSwarmUI, DiffusionBee, Draw Things, Locally Uncensored et AnimateDiff documentent la génération de vidéos ou d'animations.
- Inpainting. AUTOMATIC1111, ComfyUI, DiffusionBee, Fooocus et Invoke AI documentent l'inpainting.
- Fonctionnement avec peu de VRAM. AUTOMATIC1111, Fooocus et ControlNet documentent un mode faible VRAM ou une exigence de VRAM réduite ; pour les autres, consultez l'avis, car l'exigence dépend du modèle que vous chargez.
- API locale. AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge et ToolNeuron documentent une API que d'autres applications peuvent appeler.
- Licence et prix. AUTOMATIC1111, DiffusionBee, Stable Diffusion WebUI Forge et Locally Uncensored sont sous AGPL-3.0 ; ComfyUI et Fooocus sous GPL-3.0 ; AnimateDiff, ControlNet et Invoke AI sous Apache-2.0 ; StableSwarmUI et ToolNeuron sous MIT ; Stable Diffusion utilise une licence OpenRAIL. Draw Things est une application à code source fermé, Locally Uncensored est une application payante et Invoke AI est freemium. Les licences copyleft assortissent de conditions la distribution de versions modifiées — voir Les licences des outils d'IA expliquées.
Vision et OCR : ce qui diffère
- Lecture de texte dans les images. LLaVA et Ollama vision models documentent la lecture ou la reconnaissance de texte dans les images.
- Plusieurs images par prompt. Idefics documente la prise en charge de plusieurs images dans un même prompt.
- API locale. Ollama vision models documentent une API locale ; l'API documentée d'Idefics est hébergée et non locale, elle n'est donc pas comptée.
- Licence. LLaVA et Idefics sont sous Apache-2.0 ; Ollama vision models sont un ensemble de modèles aux licences variables : vérifiez donc la licence propre à chaque modèle.
Ce que ce comparatif ne peut pas vous dire
- Il compare des capacités documentées, pas la qualité. Il ne dit rien de la qualité visuelle des images ni de la justesse de la lecture du texte — cela demande vos propres prompts et votre propre matériel.
- Il ne comprend pas de benchmarks de vitesse : PromptQuorum ne les a pas mesurés pour ces outils.
- Les tirets correspondent à des lacunes dans la documentation des projets, pas à des constats négatifs. Certains outils peuvent prendre en charge une fonctionnalité que leur README ne mentionne pas.
- Les outils de retouche et de suréchantillonnage (Real-ESRGAN, FunClip) et DALL-E 3 via Ollama ne sont pas comparés ici : les deux premiers ont trop peu en commun pour être comparés, et le dernier n'a pas d'avis PromptQuorum.
- Les outils évoluent vite. L'avis de chaque outil indique la version sur laquelle il a été vérifié, et ce guide est actualisé lorsqu'un avis l'est.
Questions fréquentes
Pourquoi comparer séparément la génération d'images et les modèles de vision ?
Ils remplissent des missions différentes, si bien que la plupart des attributs n'ont de sens qu'au sein d'une seule mission — l'inpainting concerne la génération d'images, la lecture de texte dans les images concerne les modèles de vision. Les réunir dans un seul tableau laisserait la plupart des cellules vides ou dénuées de sens.
Que signifie un tiret dans le tableau comparatif ?
Cela signifie que la documentation du projet ne précise pas cet attribut. Cela ne veut pas dire que la fonctionnalité est absente ; consultez l'avis de l'outil ou son dépôt.
Stable Diffusion est-il lui-même une application ?
Stable Diffusion est une famille de modèles d'image plutôt qu'une application. Il figure à côté des applications parce qu'il a son propre avis PromptQuorum, et que la plupart des outils de génération présentés ici peuvent exécuter des modèles Stable Diffusion.
Ces outils ont-ils un lien d'affiliation ?
Non. PromptQuorum n'a, au moment de la rédaction, aucune relation d'affiliation avec aucun des outils de ce comparatif, et aucun lien présent ici ne rapporte de commission.
À quelle fréquence ce comparatif est-il mis à jour ?
Il est actualisé deux fois par an, ainsi qu'à chaque mise à jour de l'avis de l'un des outils listés, puisque le tableau est généré à partir des mêmes données que ces avis.
Sources
- Le README ou le site officiel de chaque outil, indiqué dans l'avis PromptQuorum de cet outil (lié depuis le tableau comparatif).
- Répertoire PromptQuorum des applications d'IA locales — la fiche à partir de laquelle chaque ligne du tableau est générée.
- Les licences des outils d'IA expliquées — ce que signifient les familles de licences citées ci-dessus.