Skip to main content
PromptQuorum
Accueil/LLM locaux avancés/AnimateDiff : animer un modèle Stable Diffusion (guide 2026)
Image & Video Generation

AnimateDiff : animer un modèle Stable Diffusion (guide 2026)

·11 min de lecture·Par Hans Kuepper · Fondateur de PromptQuorum, outil de dispatch multi-modèle · PromptQuorum

AnimateDiff est le bon choix pour les lecteurs qui utilisent déjà Stable Diffusion en local et veulent animer un checkpoint ou un LoRA existant sans rien réentraîner. C'est un module de mouvement gratuit, sous licence Apache 2.0 — pas un modèle vidéo complet —, utilisé via le nœud communautaire ComfyUI-AnimateDiff-Evolved ou l'extension AUTOMATIC1111 sd-webui-animatediff, générant de courts clips (environ 2 secondes, 16 images) sur des GPU grand public. Les lecteurs qui veulent des vidéos plus longues, plus cohérentes ou photoréalistes devraient le comparer aux modèles vidéo natifs plus récents dans Génération vidéo IA locale vs. cloud ; ceux qui n'ont pas de GPU local devraient d'abord lire Location de GPU cloud.

AnimateDiff (github.com/guoyww/AnimateDiff) est un module de mouvement open source qui ajoute une capacité d'animation à un checkpoint Stable Diffusion existant, sans réentraîner le modèle de base. Plutôt qu'un modèle vidéo autonome, il s'agit d'un composant enfichable : vous l'associez à un checkpoint Stable Diffusion 1.5 ou SDXL que vous utilisez déjà, et le module de mouvement ajoute la cohérence temporelle (d'une image à l'autre) afin que le même style, personnage ou direction artistique que ce modèle produit déjà en image fixe ressorte sous forme de court clip animé. Il tourne entièrement sur votre propre GPU via ComfyUI ou l'interface AUTOMATIC1111, gratuitement, et le projet est sous licence Apache 2.0 — avec une nuance à connaître avant toute utilisation commerciale, détaillée dans la section sur la licence ci-dessous.

Cette page contient des liens de référence vers des produits tiers. PromptQuorum n'est inscrit à aucun programme d'affiliation — ce sont de simples liens qui ne génèrent aucune commission. Cliquer sur les liens et vos prochaines étapes relèvent entièrement de votre responsabilité. Ces liens ne représentent aucune approbation ou vérification par PromptQuorum.

AnimateDiff : animer un modèle Stable Diffusion (guide 2026)

Points clés

  • AnimateDiff (github.com/guoyww/AnimateDiff) est un module de mouvement plug-and-play pour les checkpoints Stable Diffusion 1.5 et SDXL — aucun fine-tuning du modèle de base nécessaire.
  • Il est utilisé presque exclusivement via deux intégrations communautaires : ComfyUI-AnimateDiff-Evolved (maintenu par Kosinkadink) et l'extension AUTOMATIC1111 sd-webui-animatediff (maintenue par continue-revolution).
  • AnimateDiff basé sur SD1.5 tourne généralement avec 8-12 Go de VRAM pour du texte-vers-vidéo basique ; le support SDXL (mm_sdxl_v10_beta) demande environ 13 Go+ selon le dépôt officiel.
  • La sortie par défaut du module de mouvement est un clip de 16 images, environ 2 secondes — les clips plus longs utilisent une technique communautaire de fenêtre glissante, qui coûte un peu de cohérence temporelle aux limites des fenêtres.
  • 8 motion LoRAs officiels (zoom avant/arrière, panoramique gauche/droite, inclinaison haut/bas, roulis horaire/antihoraire) ajoutent un mouvement de caméra basique, environ 77 Mo chacun.
  • AnimateDiff-Lightning (ByteDance, arXiv:2403.12706) est une variante distillée séparée qui génère en 1, 2, 4 ou 8 étapes au lieu des 20-50 habituelles, échangeant de la qualité contre de la vitesse.
  • Le code AnimateDiff est Apache 2.0, mais le README officiel précise que la publication est destinée à un usage académique — et le checkpoint SD1.5 animé porte généralement sa propre licence (souvent CreativeML OpenRAIL-M), donc affirmer « entièrement libre d'usage commercial » sans vérifier les deux n'est pas exact.

📍 En une phrase

AnimateDiff est un module de mouvement gratuit, sous licence Apache 2.0, qui anime un checkpoint Stable Diffusion existant sans le réentraîner, exécuté localement via ComfyUI ou AUTOMATIC1111.

💬 En termes simples

Voyez-le comme un module que vous greffez sur un modèle Stable Diffusion déjà utilisé — le modèle continue de dessiner dans son style habituel, mais AnimateDiff ajoute le mouvement d'une image à l'autre pour obtenir un court clip au lieu d'une image fixe.

Qu'est-ce qu'AnimateDiff ?

AnimateDiff est un module de mouvement, pas un modèle de génération vidéo autonome. Il se greffe sur un checkpoint Stable Diffusion 1.5 ou SDXL que vous avez déjà — y compris les fine-tunes communautaires et LoRA — et ajoute la cohérence temporelle (d'une image à l'autre) pour que ce modèle produise de courts clips animés dans son style visuel existant, sans réentraîner le checkpoint lui-même.

Le projet est l'implémentation officielle de l'article Guo et al., « AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning », ICLR 2024 Spotlight, arXiv:2307.04725, maintenu sur GitHub à github.com/guoyww/AnimateDiff.

C'est une lignée différente des modèles vidéo natifs plus récents comme Wan 2.2, LTX-2 ou HunyuanVideo, entraînés depuis zéro sur des données vidéo — voir Génération vidéo IA locale vs. cloud pour cette comparaison. La valeur spécifique d'AnimateDiff est la préservation du style : parce qu'il réutilise votre checkpoint existant plutôt qu'un modèle vidéo entraîné séparément, la sortie conserve exactement le personnage, le style artistique ou le LoRA sur lequel vous comptez déjà pour vos images fixes.

Une publication distincte et distillée — AnimateDiff-Lightning (Lin & Yang, ByteDance, « Cross-Model Diffusion Distillation », arXiv:2403.12706) — échange un peu de qualité contre de la vitesse, générant en aussi peu que 1, 2, 4 ou 8 étapes de diffusion au lieu des 20-50 habituelles, via une distillation adversariale progressive.

Comment fonctionne le module de mouvement ?

Le module de mouvement est un ensemble séparé de poids entraînés inséré dans le U-Net de Stable Diffusion aux côtés des couches existantes du checkpoint, sans modifier ce checkpoint. Pendant la génération, les couches d'attention temporelle du module de mouvement coordonnent ce qui serait autrement un lot de générations d'images fixes indépendantes en une séquence cohérente d'images.

Trois versions du module de mouvement existent pour SD1.5 : mm_sd_v15_v2.ckpt (environ 1,7 Go) et le plus récent v3_sd15_mm.ckpt (environ 1,56 Go), qui améliore l'amplitude du mouvement et ajoute la compatibilité avec les motion LoRAs. Un module de mouvement SDXL séparé, mm_sdxl_v10_beta.ckpt (environ 950 Mo), cible la famille de checkpoints SDXL plus large via une branche bêta.

Comme le module de mouvement est un composant enfichable plutôt qu'un fine-tune de votre checkpoint, tout checkpoint SD1.5 compatible et la plupart des LoRA SD1.5 déjà installés peuvent être animés directement, sans télécharger une version « vidéo » séparée de ce modèle — le compromis est que le module de mouvement lui-même, pas votre checkpoint, détermine l'amplitude de mouvement que la sortie peut exprimer.

Comment installer AnimateDiff ?

La majorité de l'usage d'AnimateDiff en 2026 passe par l'une de deux intégrations communautaires, le dépôt de base étant une base de code de recherche plutôt qu'une application aboutie. ComfyUI-AnimateDiff-Evolved est l'option la plus activement développée ; l'extension AUTOMATIC1111 couvre les lecteurs déjà standardisés sur cette interface.

  1. 1
    Installez ComfyUI si ce n'est pas déjà fait, puis ouvrez ComfyUI Manager et recherchez « AnimateDiff Evolved » (dépôt : Kosinkadink/ComfyUI-AnimateDiff-Evolved) — installez et redémarrez.
  2. 2
    Téléchargez un checkpoint de module de mouvement (v3_sd15_mm.ckpt pour SD1.5, ou mm_sdxl_v10_beta.ckpt pour SDXL) dans le dossier ComfyUI/custom_nodes/ComfyUI-AnimateDiff-Evolved/models/.
  3. 3
    Chargez ou construisez un workflow : un loader de checkpoint SD1.5 ou SDXL alimentant un nœud AnimateDiff Loader, puis un KSampler standard et un nœud video-combine ou de sortie GIF à la place d'un nœud de sauvegarde d'image unique.
  4. 4
    Réglez le nombre d'images (16 est la fenêtre native du module) et la fréquence d'images, écrivez votre prompt comme pour une image fixe, et lancez la génération — comptez plusieurs minutes sur un GPU grand public selon la résolution et le nombre d'images.
  5. 5
    Pour AUTOMATIC1111 à la place : installez continue-revolution/sd-webui-animatediff depuis l'onglet Extensions, téléchargez le même module de mouvement dans le dossier de modèles de l'extension, puis activez le panneau AnimateDiff sous l'onglet txt2img et générez comme d'habitude.

ComfyUI-AnimateDiff-Evolved

Idéal pour:
Contrôle par nœuds, développement actif, options motion LoRA et fenêtre de contexte
Étapes d'installation:
Installation via ComfyUI Manager ou clonage dans custom_nodes ; téléchargement d'un checkpoint de module de mouvement ; construction/chargement d'un graphe de workflow texte-vers-vidéo

sd-webui-animatediff (AUTOMATIC1111)

Idéal pour:
Lecteurs déjà utilisateurs d'AUTOMATIC1111 pour les images fixes qui veulent une interface familière
Étapes d'installation:
Installation via l'onglet Extensions de la WebUI (ou clonage dans extensions/) ; téléchargement d'un module de mouvement ; activation du panneau AnimateDiff sous un onglet txt2img

Les chemins de dossiers et libellés de menus exacts changent entre les versions de ComfyUI et de l'extension — vérifiez le README du dépôt lié pour le chemin d'installation actuel avant de diagnostiquer une erreur de nœud manquant. Vérifié par rapport à la documentation des dépôts, le 2026-09-02.

De combien de VRAM AnimateDiff a-t-il besoin ?

Les workflows AnimateDiff basés sur SD1.5 tournent couramment avec 8-12 Go de VRAM pour du texte-vers-vidéo basique en résolution modérée (environ 512x512, la fenêtre native de 16 images du module) ; le support SDXL demande sensiblement plus.

Le dépôt officiel indique que l'inférence SDXL « nécessite habituellement environ 13 Go de VRAM », selon le checkpoint personnalisé et les paramètres de génération utilisés. Les retours communautaires pour les workflows SD1.5 varient selon la résolution, le nombre d'images, et la présence ou non de ControlNet — attendez-vous au bas de la fourchette 8-12 Go pour un clip court avec les réglages par défaut, et au haut de la fourchette (voire au-delà, vers 16 Go+) une fois que vous ajoutez une résolution plus élevée, plus d'images, ou plusieurs ControlNets dans un pipeline vidéo-vers-vidéo. Ce sont des fourchettes prudentes rapportées par la communauté plutôt qu'un benchmark unique vérifié, car l'usage réel de VRAM dépend fortement du workflow spécifique.

Conseil pratique : une carte à 8 Go est un point de départ viable pour l'expérimentation texte-vers-vidéo SD1.5 aux réglages par défaut ; une carte à 12 Go offre une marge confortable pour les workflows SD1.5 avec ControlNet ; une carte à 16 Go (par ex. une RTX 4070 Ti Super) est le minimum plus confortable une fois que vous passez à AnimateDiff basé sur SDXL ou à des pipelines vidéo-vers-vidéo plus lourds. Les lecteurs dont le GPU est en deçà de ces paliers, ou qui n'ont pas de GPU local, devraient comparer la location — voir Guide de location de GPU cloud 2026 — à l'achat, dans le Meilleur guide d'achat de GPU pour LLM locaux 2026 (les mêmes paliers de VRAM s'appliquent à AnimateDiff qu'aux autres charges de travail d'IA générative locale).

Que sont les motion LoRAs, et quelles sont les limites d'AnimateDiff ?

**Les motion LoRAs sont de petits poids additionnels (environ 77 Mo) qui orientent AnimateDiff vers un mouvement de caméra spécifique — zoom avant, zoom arrière, panoramique gauche, panoramique droite, inclinaison haut, inclinaison bas, roulis horaire ou antihoraire — compatibles avec le module de mouvement mm_sd_v15_v2.** Ils fonctionnent comme les LoRA d'image : on en charge un aux côtés du module de mouvement pour orienter la sortie vers ce mouvement, sans changer le style visuel du checkpoint.

Les limites les plus citées, issues du suivi d'incidents du projet lui-même et de retours communautaires, se regroupent autour de trois axes :

  • Durée native de clip courte. La fenêtre entraînée du module de mouvement est de 16 images (environ 2 secondes à 8 fps). Les techniques communautaires de fenêtre glissante (traitement de fenêtres de 16 images qui se chevauchent puis fusion des résultats) prolongent la durée totale, mais la cohérence temporelle se dégrade généralement à chaque limite de fenêtre, et les résultats deviennent peu fiables bien au-delà d'environ 30-60 images.
  • Scintillement, surtout sur les visages et les détails fins. La cohérence temporelle se dégrade le plus souvent lors de mouvements rapides, de visages détaillés à basse résolution, et d'arrière-plans chargés avec plusieurs sujets — une limite connue et fréquemment discutée, pas un cas marginal.
  • Amplitude de mouvement limitée. Surtout sur le module de mouvement v1 d'origine, le mouvement de caméra et de sujet tend vers des panoramiques lents et de petits mouvements plutôt qu'une action spectaculaire ; les modules ultérieurs (v2, v3) et les motion LoRAs améliorent cela sans l'éliminer entièrement.
  • Dégradation du suivi de prompt par rapport à une image fixe du même checkpoint. Comme le module de mouvement doit concilier chaque image avec ses voisines, des prompts qui se rendent précisément en image fixe unique peuvent se rendre moins précisément une fois la cohérence temporelle imposée sur 16 images.

Compromis : avantages vs. limites

Gratuit et code Apache 2.0

Ce que cela signifie en pratique:
Aucun abonnement, aucun coût par génération, et la base de code est ouverte à l'inspection et à la modification.
Limite / réserve:
Le dépôt officiel indique une publication à usage académique — vérifiez la section licence avant de présumer des droits commerciaux sans restriction.

Aucun réentraînement nécessaire

Ce que cela signifie en pratique:
Tout checkpoint SD1.5 compatible ou LoRA déjà utilisé peut être animé directement.
Limite / réserve:
La qualité de sortie et la fidélité au style dépendent entièrement de la qualité de ce checkpoint en image fixe.

Tourne sur des GPU grand public

Ce que cela signifie en pratique:
Les workflows SD1.5 sont viables dès environ 8 Go de VRAM ; aucun compte cloud requis.
Limite / réserve:
Le support SDXL demande sensiblement plus (~13 Go+), et les pipelines ControlNet ou vidéo-vers-vidéo plus lourds font grimper les besoins davantage.

Motion LoRAs pour le contrôle caméra

Ce que cela signifie en pratique:
8 LoRAs officiels offrent un mouvement de zoom, panoramique, inclinaison et roulis basique sans rien réentraîner.
Limite / réserve:
Couvre uniquement les mouvements de caméra basiques — aucun contrôle précis de trajectoire caméra par horodatage comme le proposent certains outils commerciaux.

Outillage communautaire actif

Ce que cela signifie en pratique:
ComfyUI-AnimateDiff-Evolved et l'extension AUTOMATIC1111 sont toutes deux activement maintenues et largement documentées.
Limite / réserve:
Le dépôt de base officiel lui-même est une base de code de recherche, pas une application utilisateur finale aboutie — vous dépendez des intégrations communautaires pour un workflow utilisable.

AnimateDiff-Lightning pour la vitesse

Ce que cela signifie en pratique:
La variante distillée génère en 1-8 étapes au lieu de 20-50, réduisant substantiellement le temps de génération.
Limite / réserve:
Moins d'étapes de diffusion échange un peu de qualité et de détail contre cette vitesse.

AnimateDiff vs. alternatives

AnimateDiff

Approche:
Module de mouvement greffé sur un checkpoint SD1.5/SDXL existant, aucun réentraînement
Idéal pour:
Boucles de mouvement stylisées ou de style anime réutilisant un checkpoint ou LoRA déjà possédé
Limite clé vs. AnimateDiff:
Articles sur AnimateDiff (1)

Également mentionné dans :

Stable Video Diffusion (SVD)

Approche:
Modèle image-vers-vidéo entraîné séparément par Stability AI, lignée différente de la ligne texte-vers-image de Stable Diffusion
Idéal pour:
Animer une image existante en un court mouvement, plutôt que générer des clips au style cohérent depuis un checkpoint
Limite clé vs. AnimateDiff:
Ne préserve pas le style visuel exact d'un checkpoint ou LoRA spécifique comme AnimateDiff — il anime l'image d'entrée, pas le style appris d'un modèle texte-vers-image.

Deforum

Approche:
Technique plus ancienne d'interpolation de keyframes et de paramètres — transformations de caméra 2D/3D appliquées entre images de diffusion successives
Idéal pour:
Animations pilotées par trajectoire caméra du type « zoom vers l'infini » et dérives lentes de paramètres
Limite clé vs. AnimateDiff:
Aucun a priori de mouvement appris — la cohérence repose sur l'interpolation de paramètres d'une image à l'autre plutôt que sur un module d'attention temporelle entraîné, donc le mouvement du sujet (par opposition au mouvement de caméra) est bien moins naturel.

Modèles vidéo cloud commerciaux (Runway, Pika, modèles de classe Sora)

Lien:
Approche:
Génération vidéo propriétaire hébergée sur le cloud, par abonnement ou crédits
Idéal pour:
Vidéo plus longue, plus fidèle, plus cohérente dans le temps, et sortie photoréaliste ou cinématique
Limite clé vs. AnimateDiff:
Coût d'abonnement continu, aucune confidentialité locale, et aucun moyen de réutiliser le style entraîné exact d'un checkpoint open source spécifique — voir Génération vidéo IA locale vs. cloud pour une comparaison complète de coût et de qualité face aux modèles vidéo locaux plus récents.

Ce tableau compare l'approche et l'adéquation, pas un classement noté — chaque outil résout un problème différent. Pour les modèles vidéo natifs plus récents (Wan 2.2, LTX-2, HunyuanVideo) qui rivalisent plus directement avec la vidéo cloud commerciale sur des clips plus longs, consultez la comparaison dédiée liée ci-dessus plutôt que ce guide centré sur AnimateDiff.

AnimateDiff est-il libre d'usage commercial ?

Le code AnimateDiff lui-même est publié sous licence Apache 2.0, mais le README du projet précise que la publication est destinée à un usage académique — affirmer « entièrement libre d'usage commercial » n'est donc pas exact sans vérification supplémentaire. C'est exactement le type de surenchère à éviter : Apache 2.0 permet normalement l'usage commercial du code, mais le cadrage académique ajouté par les auteurs signifie que les lecteurs prévoyant de vendre ou de distribuer commercialement leurs sorties devraient lire directement les conditions de licence actuelles du dépôt plutôt que de se fier uniquement à l'étiquette Apache 2.0.

Une seconde couche de licence, distincte, s'applique au checkpoint Stable Diffusion animé. Le checkpoint Stable Diffusion 1.5 d'origine (et de nombreux fine-tunes communautaires qui en dérivent) est distribué sous licence CreativeML OpenRAIL-M, qui autorise l'usage commercial mais comporte ses propres restrictions basées sur l'usage (par exemple, l'interdiction de générer certaines catégories de contenu nuisible) — distinctes de la licence propre d'AnimateDiff et non annulées par celle-ci.

En pratique : vérifiez les deux licences avant tout usage commercial — les conditions de publication d'AnimateDiff dans son dépôt, et la licence attachée au checkpoint spécifique animé (conditions OpenRAIL-M pour le checkpoint SD1.5 d'origine, ou toute licence spécifiée par un fine-tune communautaire particulier, car les fine-tunes peuvent porter des conditions différentes du modèle de base). Ceci n'est pas un conseil juridique ; consultez le texte de licence actuel ou un professionnel du droit avant un déploiement commercial.

Qui devrait utiliser AnimateDiff

  • Lecteur qui possède déjà un checkpoint ou LoRA Stable Diffusion qu'il apprécie. La valeur centrale d'AnimateDiff est de réutiliser exactement ce style visuel en mouvement, sans rien réentraîner.
  • Lecteur qui veut des boucles de mouvement stylisées, de style anime ou illustratives. La technique tient le mieux sur le type de contenu où les checkpoints Stable Diffusion excellent déjà — les styles artistiques plutôt que le photoréalisme.
  • Lecteur à l'aise avec ComfyUI ou AUTOMATIC1111. L'installation suppose une familiarité avec l'une de ces interfaces ; il n'existe pas d'application AnimateDiff autonome dédiée.
  • Lecteur qui veut des clips courts (quelques secondes) plutôt qu'une vidéo longue. La fenêtre native de 16 images convient mieux aux boucles, GIFs et courts clips stylisés qu'à une séquence narrative.
  • Lecteur avec un GPU grand public milieu de gamme (8 Go+ de VRAM) qui veut zéro coût récurrent. Aucun abonnement, aucun crédit, aucun compte cloud pour la génération locale.

Qui ne devrait pas utiliser AnimateDiff

  • Lecteur qui a besoin de vidéo photoréaliste, longue ou avec un contrôle caméra précis. Les modèles vidéo natifs — locaux comme Wan 2.2 ou LTX-2, ou commerciaux comme Runway ou Pika — le gèrent mieux ; voir Génération vidéo IA locale vs. cloud.
  • Lecteur sans checkpoint Stable Diffusion qu'il apprécie déjà. Sans point de départ digne d'être animé, l'avantage sur un modèle vidéo natif générant directement depuis un prompt texte est faible.
  • Lecteur qui a besoin de droits d'usage commercial garantis sans lire de texte de licence. Le cadrage académique dans le README propre d'AnimateDiff, plus la licence de checkpoint séparée, signifient que ce n'est pas un outil « libre d'usage commercial » sans diligence — voir la section Clarté sur la licence ci-dessus.
  • Lecteur sans GPU local, ou avec une carte sous environ 8 Go de VRAM. AnimateDiff basé sur SD1.5 est viable dès 8 Go, mais les lecteurs en deçà devraient envisager la location de GPU cloud ou un service vidéo cloud à la place.
  • Lecteur qui veut une expérience d'application en un clic. ComfyUI et AUTOMATIC1111 supposent tous deux une certaine aisance avec les graphes de nœuds ou les réglages d'extension — ce n'est pas un produit grand public abouti.

Questions fréquemment posées

Qu'est-ce qu'AnimateDiff ?

AnimateDiff est un module de mouvement open source qui ajoute une capacité d'animation à un checkpoint Stable Diffusion 1.5 ou SDXL existant sans le réentraîner. C'est l'implémentation officielle de Guo et al., « AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning » (ICLR 2024 Spotlight, arXiv:2307.04725), maintenu sur github.com/guoyww/AnimateDiff sous licence de code Apache 2.0.

AnimateDiff est-il gratuit ?

Oui — le code est gratuit à télécharger et exécuter, et il n'y a aucun abonnement pour la génération locale sur votre propre matériel. Le coût de génération est l'électricité et le temps GPU que vous possédez déjà, pas des frais versés à AnimateDiff lui-même.

AnimateDiff est-il gratuit pour un usage commercial ?

Pas automatiquement. Le code est sous licence Apache 2.0, mais le README du projet précise que la publication est destinée à un usage académique, et le checkpoint Stable Diffusion animé porte généralement sa propre licence distincte (souvent CreativeML OpenRAIL-M pour SD1.5), qui autorise l'usage commercial mais avec ses propres restrictions de contenu. Vérifiez les deux textes de licence avant un déploiement commercial — ceci n'est pas un conseil juridique.

Comment installer AnimateDiff dans ComfyUI ?

Installez le nœud communautaire ComfyUI-AnimateDiff-Evolved (github.com/Kosinkadink/ComfyUI-AnimateDiff-Evolved) via ComfyUI Manager ou en le clonant dans votre dossier custom_nodes, puis téléchargez un checkpoint de module de mouvement (v3_sd15_mm.ckpt pour SD1.5 ou mm_sdxl_v10_beta.ckpt pour SDXL) dans le dossier de modèles de ce nœud avant de construire un workflow texte-vers-vidéo.

AnimateDiff fonctionne-t-il avec AUTOMATIC1111 ?

Oui, via l'extension communautaire sd-webui-animatediff (github.com/continue-revolution/sd-webui-animatediff), installée via l'onglet Extensions de la WebUI. Elle ajoute un panneau AnimateDiff sous l'onglet txt2img standard.

De combien de VRAM AnimateDiff a-t-il besoin ?

AnimateDiff basé sur SD1.5 tourne couramment avec 8-12 Go de VRAM pour du texte-vers-vidéo basique en résolution modérée et la fenêtre native de 16 images du module. Le support SDXL demande sensiblement plus — le dépôt officiel indique que l'inférence SDXL nécessite habituellement environ 13 Go de VRAM, selon le checkpoint et les réglages utilisés. Une résolution plus élevée, des clips plus longs, ou l'ajout de ControlNet font grimper les besoins.

Quelle est la durée des clips AnimateDiff ?

La fenêtre native entraînée du module de mouvement est de 16 images — environ 2 secondes à 8 fps. Les techniques communautaires de fenêtre glissante peuvent prolonger la durée totale en traitant des fenêtres de 16 images qui se chevauchent puis en les fusionnant, mais la cohérence temporelle se dégrade généralement à chaque limite de fenêtre, et les résultats deviennent peu fiables bien au-delà d'environ 30-60 images.

Que sont les motion LoRAs ?

Les motion LoRAs sont de petits fichiers de poids additionnels (environ 77 Mo), compatibles avec le module de mouvement mm_sd_v15_v2, qui orientent la génération vers l'un des 8 mouvements de caméra basiques : zoom avant, zoom arrière, panoramique gauche, panoramique droite, inclinaison haut, inclinaison bas, roulis horaire ou antihoraire. Ils se chargent aux côtés du module de mouvement de la même façon qu'un LoRA d'image se charge aux côtés d'un checkpoint.

Pourquoi ma sortie AnimateDiff scintille-t-elle ?

Le scintillement — surtout sur les visages et les détails fins — est une limite largement rapportée, pas une erreur de configuration. La cohérence temporelle se dégrade le plus souvent lors de mouvements rapides, de visages détaillés à basse résolution, et d'arrière-plans chargés avec plusieurs sujets ; les modules de mouvement ultérieurs (v2, v3) et les motion LoRAs réduisent le phénomène sans l'éliminer.

Qu'est-ce qu'AnimateDiff-Lightning ?

AnimateDiff-Lightning est une publication distincte et distillée de ByteDance (Lin & Yang, « AnimateDiff-Lightning: Cross-Model Diffusion Distillation », arXiv:2403.12706) qui utilise une distillation adversariale progressive pour générer en aussi peu que 1, 2, 4 ou 8 étapes de diffusion au lieu des 20-50 habituelles — nettement plus rapide, au prix d'une certaine qualité et de détails.

En quoi AnimateDiff diffère-t-il de Stable Video Diffusion ?

AnimateDiff greffe un module de mouvement sur un checkpoint texte-vers-image Stable Diffusion existant, préservant le style visuel exact de ce checkpoint. Stable Video Diffusion (SVD) est un modèle image-vers-vidéo entraîné séparément par Stability AI, de lignée différente — il anime une image d'entrée donnée plutôt que de réutiliser le style appris d'un checkpoint texte-vers-image. Choisissez AnimateDiff pour conserver le look d'un checkpoint ou LoRA spécifique ; choisissez SVD pour animer une image existante précise.

Verdict

AnimateDiff mérite sa place comme la façon la plus directe d'animer un checkpoint Stable Diffusion déjà apprécié, sans rien réentraîner ni quitter son propre matériel. Le compromis est réel et concret : les clips sont courts par défaut (16 images, environ 2 secondes, extensibles mais avec perte de qualité sur des durées plus longues), l'amplitude de mouvement et le suivi de prompt se dégradent quelque peu par rapport à une image fixe du même checkpoint, et la situation de licence exige deux vérifications distinctes — le cadrage académique propre du projet en plus de son code Apache 2.0, et la licence portée par le checkpoint animé — avant tout usage commercial. Pour les lecteurs qui possèdent déjà un checkpoint SD1.5 ou SDXL stylisé et veulent de courtes boucles de mouvement au style cohérent sur leur propre GPU sans coût récurrent, AnimateDiff via ComfyUI-AnimateDiff-Evolved ou l'extension AUTOMATIC1111 est le point de départ pratique. Les lecteurs qui ont besoin de vidéo plus longue, plus cohérente ou photoréaliste devraient plutôt le comparer aux modèles vidéo natifs plus récents dans Génération vidéo IA locale vs. cloud.

← Retour aux LLM locaux avancés