Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/Outils locaux d'image, de vidéo et de vision : comparatif (2026) — génération, vision et OCR
Image & Video Generation

Outils locaux d'image, de vidéo et de vision : comparatif (2026) — génération, vision et OCR

·9 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

Les 16 outils d'image locaux du répertoire PromptQuorum se répartissent en deux missions qu'il faut comparer séparément : la génération d'images et de vidéos (13 outils) et la vision et l'OCR (3). Côté génération, ComfyUI, InvokeAI et StableSwarmUI documentent des workflows par nœuds ; AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge, StableSwarmUI et ToolNeuron documentent un système d'extensions ; et AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge et ToolNeuron documentent une API locale. Côté vision, LLaVA documente la lecture de texte dans les images et Idefics documente plusieurs images par prompt. Utilisez le tableau comparatif ci-dessous, et lisez l'avis de chaque outil avant de l'installer.

Les outils d'image locaux remplissent deux missions distinctes — générer des images et des vidéos à partir d'un prompt, et comprendre les images qu'on leur fournit — et aucune liste de fonctionnalités unique ne permet de les comparer équitablement. Ce guide compare 16 outils gratuits et payants qui fonctionnent sur votre propre matériel, une mission à la fois, à l'aide d'un tableau comparatif généré à partir des mêmes données que l'avis PromptQuorum de chaque outil : le tableau et les avis ne peuvent donc pas se contredire.

Cette page contient des liens de référence vers des produits tiers. PromptQuorum n'est inscrit à aucun programme d'affiliation — ce sont de simples liens qui ne génèrent aucune commission. Cliquer sur les liens et vos prochaines étapes relèvent entièrement de votre responsabilité. Ces liens ne représentent aucune approbation ou vérification par PromptQuorum.

Points clés

  • 16 outils, deux missions : génération d'images et de vidéos (13) et vision et OCR (3).
  • Le tableau est généré à partir de la fiche de chaque outil et vérifié par rapport à son README ou à son site officiel ; un tiret signifie « non précisé dans la documentation », jamais « non ».
  • Les licences diffèrent d'une façon qui compte : par exemple AUTOMATIC1111, DiffusionBee, Stable Diffusion WebUI Forge et Locally Uncensored sont sous AGPL-3.0, ComfyUI et Fooocus sous GPL-3.0, AnimateDiff, ControlNet et InvokeAI sous Apache-2.0, StableSwarmUI et ToolNeuron sous MIT, et Stable Diffusion utilise une licence OpenRAIL.
  • Chaque nom d'outil du tableau renvoie vers son propre avis PromptQuorum, où figurent les étapes d'installation et les limites.

📍 En une phrase

Les outils d'image locaux recouvrent deux missions différentes — générer des images et des vidéos, et comprendre des images — si bien que les 16 outils du répertoire PromptQuorum sont comparés au sein de chaque mission, à l'aide d'un tableau généré à partir des mêmes données que l'avis de chaque outil.

💬 En termes simples

Certains outils dessinent des images à partir d'un texte, d'autres regardent une image et répondent à des questions à son sujet. Comparer un outil de dessin et un modèle de lecture d'images sur l'« inpainting » n'a aucun sens : ce guide compare donc des outils comparables.

Notre méthode de comparaison

Les informations sur chaque outil — prix, licence, plateformes, besoins matériels et attributs propres à la catégorie — sont enregistrées une seule fois, dans la fiche de l'outil dans le répertoire. Le tableau comparatif ci-dessous est généré à partir de ces fiches, et l'avis de l'outil s'appuie sur la même fiche : les deux ne peuvent donc pas indiquer des valeurs différentes.

Les attributs propres à la catégorie (par exemple l'inpainting ou la prise en charge des extensions) ont été relevés dans le README ou sur le site officiel de chaque projet, puis vérifiés au mot près. Lorsque la documentation est muette, le tableau affiche un tiret plutôt que de deviner ; lorsqu'une affirmation est nuancée (expérimentale, dépendante d'un fork, ou service hébergé plutôt que fonctionnalité locale), l'attribut est retiré du tableau et traité dans l'avis de l'outil.

Seuls les outils dotés de leur propre avis PromptQuorum figurent dans le tableau. Le comparatif recense des outils qui fonctionnent sur votre propre matériel ; il ne les classe pas, car le bon choix dépend de votre contrainte.

Tableau comparatif

Choisissez une mission ci-dessous, puis lisez la ligne de gauche à droite. Cliquez sur le nom d'un outil pour ouvrir son avis PromptQuorum complet.

OutilPrixLicencePlateformesExécutionMatérielVersionInpaintingGénération de vidéoÉditeur de workflow par nœuds / grapheExtensions / pluginsMode faible VRAMServeur API localAvislien produit · divulgué
AnimateDiffGratuitApache-2.0Windows, Linux, macOSLocal13 Go de VRAMOuiLire l'avisAnimateDiff
AUTOMATIC1111GratuitAGPL-3.0macOS, Windows, LinuxLocalUn CPU suffitv1.10.1OuiOuiOuiOuiLire l'avisAUTOMATIC1111
ComfyUIGratuitGPL-3.0macOS, Windows, LinuxLocalUn CPU suffitv0.36.0OuiLire l'avisComfyUI
ControlNetGratuitApache-2.0Windows, Linux, macOSLocal8 Go de VRAMOuiLire l'avisControlNet
DiffusionBeeGratuitAGPL-3.0macOSLocalUn CPU suffitOuiOuiLire l'avisDiffusionBee
Draw ThingsGratuitProprietarymacOS, iOSLocal8 Go de RAMOuiLire l'avisDraw Things
FooocusGratuitGPL-3.0Windows, Linux, macOSLocalUn CPU suffitv2.5.5OuiOuiLire l'avisFooocus
Invoke AIFreemiumApache-2.0Windows, Linux, macOSLocal4 Go de VRAMOuiOuiLire l'avisInvoke AI
Locally UncensoredPayantAGPL-3.0WindowsLocalVariable selon le modèleLire l'avisLocally Uncensored
Stable DiffusionGratuitOpenRAILmacOS, Windows, LinuxLocal10 Go de VRAMLire l'avisStable Diffusion
Stable Diffusion WebUI ForgeGratuitAGPL-3.0Linux, macOS, WindowsLocalVariable selon le modèleOuiOuiLire l'avisStable Diffusion WebUI Forge
StableSwarmUIGratuitMITWindows, LinuxLocal8 Go de VRAMOuiOuiOuiLire l'avisStableSwarmUI
ToolNeuronGratuitMITAndroidLocalVariable selon le modèleOuiLire l'avisToolNeuron

« — » signifie que la documentation du projet ne le précise pas, et non que la fonctionnalité est absente. Les valeurs proviennent du README ou du site officiel de chaque projet et sont revérifiées lors de la mise à jour de l'avis d'un outil.

Génération d'images et de vidéos : ce qui diffère

  • Style de workflow. ComfyUI, Invoke AI et StableSwarmUI documentent des workflows par nœuds ou par graphe. La documentation des autres outils ne décrit pas d'éditeur de nœuds.
  • Extensions et plugins. AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge, StableSwarmUI et ToolNeuron documentent un système d'extensions ou de plugins.
  • Vidéo. ComfyUI, StableSwarmUI, DiffusionBee, Draw Things, Locally Uncensored et AnimateDiff documentent la génération de vidéos ou d'animations.
  • Inpainting. AUTOMATIC1111, ComfyUI, DiffusionBee, Fooocus et Invoke AI documentent l'inpainting.
  • Fonctionnement avec peu de VRAM. AUTOMATIC1111, Fooocus et ControlNet documentent un mode faible VRAM ou une exigence de VRAM réduite ; pour les autres, consultez l'avis, car l'exigence dépend du modèle que vous chargez.
  • API locale. AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge et ToolNeuron documentent une API que d'autres applications peuvent appeler.
  • Licence et prix. AUTOMATIC1111, DiffusionBee, Stable Diffusion WebUI Forge et Locally Uncensored sont sous AGPL-3.0 ; ComfyUI et Fooocus sous GPL-3.0 ; AnimateDiff, ControlNet et Invoke AI sous Apache-2.0 ; StableSwarmUI et ToolNeuron sous MIT ; Stable Diffusion utilise une licence OpenRAIL. Draw Things est une application à code source fermé, Locally Uncensored est une application payante et Invoke AI est freemium. Les licences copyleft assortissent de conditions la distribution de versions modifiées — voir Les licences des outils d'IA expliquées.

Vision et OCR : ce qui diffère

  • Lecture de texte dans les images. LLaVA et Ollama vision models documentent la lecture ou la reconnaissance de texte dans les images.
  • Plusieurs images par prompt. Idefics documente la prise en charge de plusieurs images dans un même prompt.
  • API locale. Ollama vision models documentent une API locale ; l'API documentée d'Idefics est hébergée et non locale, elle n'est donc pas comptée.
  • Licence. LLaVA et Idefics sont sous Apache-2.0 ; Ollama vision models sont un ensemble de modèles aux licences variables : vérifiez donc la licence propre à chaque modèle.

Ce que ce comparatif ne peut pas vous dire

  • Il compare des capacités documentées, pas la qualité. Il ne dit rien de la qualité visuelle des images ni de la justesse de la lecture du texte — cela demande vos propres prompts et votre propre matériel.
  • Il ne comprend pas de benchmarks de vitesse : PromptQuorum ne les a pas mesurés pour ces outils.
  • Les tirets correspondent à des lacunes dans la documentation des projets, pas à des constats négatifs. Certains outils peuvent prendre en charge une fonctionnalité que leur README ne mentionne pas.
  • Les outils de retouche et de suréchantillonnage (Real-ESRGAN, FunClip) et DALL-E 3 via Ollama ne sont pas comparés ici : les deux premiers ont trop peu en commun pour être comparés, et le dernier n'a pas d'avis PromptQuorum.
  • Les outils évoluent vite. L'avis de chaque outil indique la version sur laquelle il a été vérifié, et ce guide est actualisé lorsqu'un avis l'est.

Questions fréquentes

Pourquoi comparer séparément la génération d'images et les modèles de vision ?

Ils remplissent des missions différentes, si bien que la plupart des attributs n'ont de sens qu'au sein d'une seule mission — l'inpainting concerne la génération d'images, la lecture de texte dans les images concerne les modèles de vision. Les réunir dans un seul tableau laisserait la plupart des cellules vides ou dénuées de sens.

Que signifie un tiret dans le tableau comparatif ?

Cela signifie que la documentation du projet ne précise pas cet attribut. Cela ne veut pas dire que la fonctionnalité est absente ; consultez l'avis de l'outil ou son dépôt.

Stable Diffusion est-il lui-même une application ?

Stable Diffusion est une famille de modèles d'image plutôt qu'une application. Il figure à côté des applications parce qu'il a son propre avis PromptQuorum, et que la plupart des outils de génération présentés ici peuvent exécuter des modèles Stable Diffusion.

Ces outils ont-ils un lien d'affiliation ?

Non. PromptQuorum n'a, au moment de la rédaction, aucune relation d'affiliation avec aucun des outils de ce comparatif, et aucun lien présent ici ne rapporte de commission.

À quelle fréquence ce comparatif est-il mis à jour ?

Il est actualisé deux fois par an, ainsi qu'à chaque mise à jour de l'avis de l'un des outils listés, puisque le tableau est généré à partir des mêmes données que ces avis.

Sources

← Retour aux LLM locaux avancés