Conclusiones clave
- AnimateDiff (github.com/guoyww/AnimateDiff) es un módulo de movimiento plug-and-play para checkpoints de Stable Diffusion 1.5 y SDXL — no requiere ajuste fino del modelo base.
- Se usa casi exclusivamente a través de dos integraciones comunitarias: ComfyUI-AnimateDiff-Evolved (mantenido por Kosinkadink) y la extensión de AUTOMATIC1111 sd-webui-animatediff (mantenida por continue-revolution).
- AnimateDiff basado en SD1.5 suele funcionar con 8-12 GB de VRAM para texto a video básico; el soporte de SDXL (mm_sdxl_v10_beta) necesita aproximadamente 13 GB o más según el repositorio oficial.
- La salida por defecto del módulo de movimiento es un clip de 16 fotogramas, unos 2 segundos — los clips más largos usan una técnica comunitaria de ventana deslizante que sacrifica algo de coherencia temporal en los límites de cada ventana.
- Existen 8 motion LoRAs oficiales (zoom in/out, paneo izquierda/derecha, inclinación arriba/abajo, giro horario/antihorario) que añaden movimiento básico de cámara, unos 77 MB cada uno.
- AnimateDiff-Lightning (ByteDance, arXiv:2403.12706) es una variante destilada separada que genera en 1, 2, 4 u 8 pasos en vez de los 20-50 habituales, cambiando algo de calidad por velocidad.
- El código de AnimateDiff es Apache 2.0, pero el README oficial indica que la publicación es para uso académico — y el checkpoint SD1.5 que animas suele tener su propia licencia (a menudo CreativeML OpenRAIL-M), por lo que decir "totalmente libre para uso comercial" sin verificar ambas no es exacto.
📍 En una frase
AnimateDiff es un módulo de movimiento gratuito con licencia Apache 2.0 que anima un checkpoint de Stable Diffusion existente sin reentrenarlo, ejecutado en local a través de ComfyUI o AUTOMATIC1111.
💬 En términos simples
Piénsalo como un complemento que conectas a un modelo de Stable Diffusion que ya usas — el modelo sigue dibujando en su estilo habitual, pero AnimateDiff añade el movimiento de un fotograma a otro para que la salida sea un clip corto en vez de una imagen fija.
¿Qué es AnimateDiff?
AnimateDiff es un módulo de movimiento, no un modelo de generación de video independiente. Se conecta a un checkpoint de Stable Diffusion 1.5 o SDXL que ya tienes — incluyendo ajustes finos comunitarios y LoRA — y añade coherencia temporal (de fotograma a fotograma) para que ese modelo produzca breves clips animados en su estilo visual existente, sin reentrenar el checkpoint en sí.
El proyecto es la implementación oficial del artículo Guo et al., «AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning», ICLR 2024 Spotlight, arXiv:2307.04725, mantenido en GitHub en github.com/guoyww/AnimateDiff.
Es un linaje distinto al de los modelos de video nativos más recientes como Wan 2.2, LTX-2 o HunyuanVideo, entrenados desde cero con datos de video — consulta Generación de video IA local vs. la nube para esa comparación. El valor específico de AnimateDiff es la preservación del estilo: como reutiliza tu checkpoint existente en lugar de un modelo de video entrenado por separado, la salida mantiene exactamente el personaje, estilo artístico o LoRA en el que ya confías para imágenes fijas.
Una publicación separada y destilada — AnimateDiff-Lightning (Lin y Yang, ByteDance, «Cross-Model Diffusion Distillation», arXiv:2403.12706) — cambia algo de calidad por velocidad, generando en tan solo 1, 2, 4 u 8 pasos de difusión en lugar de los 20-50 habituales, mediante destilación de difusión adversarial progresiva.
¿Cómo funciona el módulo de movimiento?
El módulo de movimiento es un conjunto separado de pesos entrenados que se inserta en la U-Net de Stable Diffusion junto a las capas existentes del checkpoint, sin modificar ese checkpoint. Durante la generación, las capas de atención temporal del módulo de movimiento coordinan lo que de otro modo sería un lote de generaciones de imágenes fijas independientes en una secuencia coherente de fotogramas.
Existen tres versiones del módulo de movimiento para SD1.5: mm_sd_v15_v2.ckpt (unos 1,7 GB) y el más reciente v3_sd15_mm.ckpt (unos 1,56 GB), que mejora la amplitud del movimiento y añade compatibilidad con motion LoRAs. Un módulo de movimiento SDXL separado, mm_sdxl_v10_beta.ckpt (unos 950 MB), apunta a la familia más grande de checkpoints SDXL a través de una rama beta.
Como el módulo de movimiento es un componente conectable en lugar de un ajuste fino de tu checkpoint, cualquier checkpoint SD1.5 compatible y la mayoría de los LoRA SD1.5 que ya tengas instalados pueden animarse directamente, sin descargar una versión «de video» separada de ese modelo — la contrapartida es que el módulo de movimiento en sí, no tu checkpoint, decide cuánto movimiento puede expresar la salida.
¿Cómo se instala AnimateDiff?
La mayor parte del uso de AnimateDiff en 2026 pasa por una de dos integraciones comunitarias, ya que el repositorio base es más una base de código de investigación que una app pulida. ComfyUI-AnimateDiff-Evolved es la opción con desarrollo más activo; la extensión de AUTOMATIC1111 cubre a los lectores ya estandarizados en esa WebUI.
- 1Instala ComfyUI si aún no lo tienes, luego abre ComfyUI Manager y busca «AnimateDiff Evolved» (repositorio: Kosinkadink/ComfyUI-AnimateDiff-Evolved) — instala y reinicia.
- 2Descarga un checkpoint de módulo de movimiento (
v3_sd15_mm.ckptpara SD1.5, omm_sdxl_v10_beta.ckptpara SDXL) en la carpetaComfyUI/custom_nodes/ComfyUI-AnimateDiff-Evolved/models/. - 3Carga o construye un workflow: un cargador de checkpoint SD1.5 o SDXL que alimenta un nodo AnimateDiff Loader, luego un KSampler estándar y un nodo video-combine o de salida GIF en lugar de un nodo de guardado de imagen única.
- 4Configura el número de fotogramas (16 es la ventana nativa del módulo) y la velocidad de fotogramas, escribe tu prompt como lo harías para una imagen fija, y encola la generación — espera varios minutos en una GPU de consumo según la resolución y el número de fotogramas.
- 5Para AUTOMATIC1111 en su lugar: instala continue-revolution/sd-webui-animatediff desde la pestaña Extensions, descarga el mismo módulo de movimiento en la carpeta de modelos de la extensión, luego activa el panel AnimateDiff bajo la pestaña txt2img y genera como de costumbre.
ComfyUI-AnimateDiff-Evolved
- Ideal para:
- Control basado en nodos, desarrollo activo, opciones de motion LoRA y ventana de contexto
- Pasos de instalación:
- Instalar vía ComfyUI Manager o clonar en custom_nodes; descargar un checkpoint de módulo de movimiento; construir/cargar un grafo de workflow texto a video
sd-webui-animatediff (AUTOMATIC1111)
- Ideal para:
- Lectores que ya usan AUTOMATIC1111 WebUI para imágenes fijas y quieren una interfaz familiar
- Pasos de instalación:
- Instalar vía la pestaña Extensions de la WebUI (o clonar en extensions/); descargar un módulo de movimiento; activar el panel AnimateDiff bajo una pestaña txt2img
Las rutas exactas de carpetas y las etiquetas de menú cambian entre versiones de ComfyUI y de la extensión — revisa el README del repositorio enlazado para la ruta de instalación actual antes de solucionar un error de nodo faltante. Verificado contra la documentación de los repositorios, 2026-09-02.
¿Cuánta VRAM necesita AnimateDiff?
Los workflows de AnimateDiff basados en SD1.5 suelen funcionar con 8-12 GB de VRAM para texto a video básico en resolución moderada (aproximadamente 512x512, la ventana nativa de 16 fotogramas del módulo); el soporte de SDXL necesita bastante más.
El repositorio oficial indica que la inferencia SDXL «normalmente requiere ~13 GB de VRAM», dependiendo del checkpoint personalizado y la configuración de generación usada. Los reportes de la comunidad para workflows SD1.5 varían según la resolución, el número de fotogramas y si se añade ControlNet — espera el extremo inferior del rango 8-12 GB para un clip corto con la configuración por defecto, y el extremo superior (o más, hacia 16 GB+) al añadir mayor resolución, más fotogramas, o múltiples ControlNets en un pipeline de video a video. Son rangos comunitarios reportados con cautela, no un único benchmark verificado, ya que el uso real de VRAM depende mucho del workflow específico.
Guía práctica: una tarjeta de 8 GB es un punto de partida viable para experimentar con texto a video SD1.5 en configuración por defecto; una tarjeta de 12 GB da margen cómodo para workflows SD1.5 con ControlNet; una tarjeta de 16 GB (por ejemplo, una RTX 4070 Ti Super) es el mínimo más cómodo al pasar a AnimateDiff basado en SDXL o pipelines de video a video más pesados. Los lectores cuya GPU quede por debajo de estos niveles, o que no tengan GPU local, deberían comparar alquilar — ver Guía de alquiler de GPU en la nube 2026 — frente a comprar, en la Mejor guía de compra de GPU para LLM locales 2026 (la misma orientación por nivel de VRAM aplica a AnimateDiff igual que a otras cargas de trabajo de IA generativa local).
¿Qué son los motion LoRAs y cuáles son las limitaciones de AnimateDiff?
**Los motion LoRAs son pesos adicionales pequeños (unos 77 MB) que orientan a AnimateDiff hacia un movimiento de cámara específico — zoom in, zoom out, paneo izquierda, paneo derecha, inclinación arriba, inclinación abajo, giro horario o antihorario — compatibles con el módulo de movimiento mm_sd_v15_v2.** Funcionan igual que los LoRA de imagen: se carga uno junto al módulo de movimiento para sesgar la salida hacia ese movimiento, sin cambiar el estilo visual del checkpoint.
Las limitaciones más citadas, extraídas del propio registro de incidencias del proyecto y de reseñas de la comunidad, se agrupan en tres áreas:
- Duración nativa de clip corta. La ventana entrenada del módulo de movimiento es de 16 fotogramas (unos 2 segundos a 8 fps). Las técnicas comunitarias de ventana deslizante (procesar ventanas superpuestas de 16 fotogramas y mezclar los resultados) extienden la duración total, pero la coherencia temporal suele degradarse en cada límite de ventana, y los resultados se vuelven poco fiables bastante más allá de unos 30-60 fotogramas.
- Parpadeo, especialmente en rostros y detalles finos. La coherencia temporal se rompe con más frecuencia en movimientos rápidos, rostros detallados en resolución más baja, y fondos ocupados con varios sujetos — una limitación conocida y frecuentemente comentada, no un caso extremo.
- Rango de movimiento limitado. Especialmente en el módulo de movimiento v1 original, el movimiento de cámara y sujeto tiende hacia paneos lentos y movimientos pequeños en lugar de acción dramática; los módulos posteriores (v2, v3) y los motion LoRAs mejoran esto sin eliminarlo por completo.
- Degradación del seguimiento del prompt frente a una imagen fija del mismo checkpoint. Como el módulo de movimiento debe conciliar cada fotograma con sus vecinos, prompts que se renderizan con precisión como una sola imagen fija pueden renderizarse con menos precisión una vez que se impone coherencia temporal en 16 fotogramas.
Compensaciones: ventajas vs. limitaciones
Gratuito y código Apache 2.0
- Qué significa en uso real:
- Sin suscripción, sin costo por generación, y la base de código está abierta para inspección y modificación.
- Limitación / matiz:
- El repositorio oficial indica una publicación para uso académico — revisa la sección de licencia antes de asumir derechos comerciales sin restricciones.
No requiere reentrenamiento
- Qué significa en uso real:
- Cualquier checkpoint SD1.5 compatible o LoRA que ya uses puede animarse directamente.
- Limitación / matiz:
- La calidad de salida y la fidelidad de estilo dependen por completo de qué tan bueno sea ya ese checkpoint en imágenes fijas.
Funciona en GPU de consumo
- Qué significa en uso real:
- Los workflows SD1.5 son viables desde unos 8 GB de VRAM; no se necesita cuenta en la nube.
- Limitación / matiz:
- El soporte SDXL necesita bastante más (~13 GB+), y los pipelines de ControlNet o video a video más pesados elevan aún más los requisitos.
Motion LoRAs para control de cámara
- Qué significa en uso real:
- 8 LoRAs oficiales dan movimiento básico de zoom, paneo, inclinación y giro sin reentrenar nada.
- Limitación / matiz:
- Cubre solo movimientos básicos de cámara — sin control preciso de trayectoria de cámara por marca de tiempo como ofrecen algunas herramientas comerciales.
Herramientas comunitarias activas
- Qué significa en uso real:
- ComfyUI-AnimateDiff-Evolved y la extensión de AUTOMATIC1111 están ambas activamente mantenidas y ampliamente documentadas.
- Limitación / matiz:
- El propio repositorio base oficial es una base de código de investigación, no una app pulida para usuario final — dependes de integraciones comunitarias para un workflow usable.
AnimateDiff-Lightning para velocidad
- Qué significa en uso real:
- La variante destilada genera en 1-8 pasos en vez de 20-50, reduciendo sustancialmente el tiempo de generación.
- Limitación / matiz:
- Menos pasos de difusión sacrifican algo de calidad y detalle por esa velocidad.
AnimateDiff vs. alternativas
AnimateDiff
- Enfoque:
- Módulo de movimiento conectado a un checkpoint SD1.5/SDXL existente, sin reentrenamiento
- Ideal para:
- Bucles de movimiento estilizados o de estilo anime que reutilizan un checkpoint o LoRA ya existente
- Limitación clave frente a AnimateDiff:
- —
Artículos sobre AnimateDiff (1)
- AnimateDiff Guide 2026: Animate Any Stable Diffusion ModelActualizado 2 de septiembre de 2026
También mencionado en:
- Invideo vs Local AI Video: One Costs $0 Plus Your Weekend — the Other Costs $17Actualizado 1 de septiembre de 2026
- Local AI Images Are Free. Cloud AI Images Are Instant. Your GPU Decides.Actualizado 21 de agosto de 2026
Stable Video Diffusion (SVD)
- Enfoque:
- Modelo imagen a video entrenado por separado por Stability AI, linaje distinto al de la línea texto a imagen de Stable Diffusion
- Ideal para:
- Animar una imagen existente en un movimiento corto, en lugar de generar clips con estilo consistente desde un checkpoint
- Limitación clave frente a AnimateDiff:
- No preserva el estilo visual exacto de un checkpoint o LoRA específico como lo hace AnimateDiff — anima la imagen de entrada, no el estilo aprendido de un modelo texto a imagen.
Deforum
- Enfoque:
- Técnica más antigua de interpolación de keyframes y parámetros — transformaciones de cámara 2D/3D aplicadas entre fotogramas de difusión sucesivos
- Ideal para:
- Animaciones impulsadas por trayectoria de cámara tipo «zoom al infinito» y derivas lentas de parámetros
- Limitación clave frente a AnimateDiff:
- Sin un prior de movimiento aprendido — la coherencia depende de la interpolación de parámetros de un fotograma a otro en lugar de un módulo de atención temporal entrenado, por lo que el movimiento del sujeto (a diferencia del movimiento de cámara) resulta mucho menos natural.
Modelos de video comerciales en la nube (Runway, Pika, modelos de clase Sora)
- Enlace:
- —
- Enfoque:
- Generación de video propietaria alojada en la nube mediante suscripción o créditos
- Ideal para:
- Video más largo, de mayor fidelidad, más coherente en el tiempo, y salida fotorrealista o cinematográfica
- Limitación clave frente a AnimateDiff:
- Costo de suscripción continuo, sin privacidad local, y sin forma de reutilizar el estilo entrenado exacto de un checkpoint específico de código abierto — consulta Generación de video IA local vs. la nube para una comparación completa de costo y calidad frente a modelos de video locales más nuevos.
Esta tabla compara enfoque y adecuación, no un ranking puntuado — cada herramienta resuelve un problema distinto. Para modelos de video nativos más nuevos (Wan 2.2, LTX-2, HunyuanVideo) que compiten más directamente con el video comercial en la nube en clips más largos, consulta la comparación dedicada enlazada arriba en lugar de esta guía centrada en AnimateDiff.
¿Es AnimateDiff libre de usar comercialmente?
El código de AnimateDiff en sí se publica bajo licencia Apache 2.0, pero el propio README del proyecto indica que la publicación es para uso académico — por lo que afirmar «totalmente libre para uso comercial» no es exacto sin verificarlo. Esto es exactamente el tipo de afirmación exagerada que hay que evitar: Apache 2.0 normalmente permite el uso comercial del código, pero el marco académico añadido por los autores significa que los lectores que planeen vender o distribuir comercialmente la salida deberían leer directamente los términos de licencia actuales del repositorio en lugar de confiar solo en la etiqueta Apache 2.0.
Una segunda capa de licencia, separada, se aplica al checkpoint de Stable Diffusion que animes. El checkpoint original de Stable Diffusion 1.5 (y muchos ajustes finos comunitarios derivados de él) se distribuye bajo la licencia CreativeML OpenRAIL-M, que permite el uso comercial pero conlleva sus propias restricciones basadas en el uso (por ejemplo, prohibiciones de generar ciertas categorías de contenido dañino) — separadas de la licencia propia de AnimateDiff y no anuladas por ella.
En la práctica: verifica ambas licencias antes de cualquier uso comercial — los términos de publicación de AnimateDiff en su repositorio, y la licencia adjunta al checkpoint específico que animes (términos OpenRAIL-M para el checkpoint SD1.5 original, o la licencia que especifique un ajuste fino comunitario concreto, ya que los ajustes finos pueden tener términos distintos al modelo base). Esto no es asesoría legal; consulta el texto de licencia vigente o a un profesional del derecho antes de un despliegue comercial.
Quién debería usar AnimateDiff
- Lector que ya tiene un checkpoint o LoRA de Stable Diffusion que le gusta. El valor central de AnimateDiff es reutilizar exactamente ese estilo visual en movimiento, sin reentrenar nada.
- Lector que quiere bucles de movimiento estilizados, de estilo anime o ilustrativos. La técnica funciona mejor en el tipo de contenido en el que los checkpoints de Stable Diffusion ya destacan — estilos artísticos en lugar de fotorrealismo.
- Lector cómodo con ComfyUI o AUTOMATIC1111. La instalación asume familiaridad con una de esas interfaces; no existe una app AnimateDiff independiente dedicada.
- Lector que quiere clips cortos (unos segundos) en lugar de video largo. La ventana nativa de 16 fotogramas se ajusta mejor a bucles, GIFs y clips estilizados cortos que a una secuencia narrativa.
- Lector con una GPU de consumo de gama media (8 GB+ de VRAM) que quiere costo recurrente cero. Sin suscripción, sin créditos, sin cuenta en la nube para la generación local.
Quién no debería usar AnimateDiff
- Lector que necesita video fotorrealista, de formato largo, o con control de cámara preciso. Los modelos de video nativos — locales como Wan 2.2 o LTX-2, o comerciales como Runway o Pika — manejan esto mejor; ver Generación de video IA local vs. la nube.
- Lector sin un checkpoint de Stable Diffusion que ya le guste. Sin un punto de partida que valga la pena animar, hay poca ventaja frente a un modelo de video nativo que genera directamente desde un prompt de texto.
- Lector que necesita derechos de uso comercial garantizados sin leer texto legal. El marco de uso académico en el propio README de AnimateDiff, más la licencia separada del checkpoint, significan que esto no es una herramienta «libre para uso comercial» sin diligencia previa — ver la sección Claridad sobre la licencia arriba.
- Lector sin GPU local, o con una tarjeta por debajo de unos 8 GB de VRAM. AnimateDiff basado en SD1.5 es viable desde 8 GB, pero los lectores por debajo de ese nivel deberían considerar Alquiler de GPU en la nube o un servicio de video en la nube en su lugar.
- Lector que quiere una experiencia de app de un solo clic. Tanto ComfyUI como AUTOMATIC1111 asumen cierta comodidad con grafos de nodos o configuraciones de extensión — no es un producto de consumo pulido.
Preguntas frecuentes
¿Qué es AnimateDiff?
AnimateDiff es un módulo de movimiento de código abierto que añade capacidad de animación a un checkpoint existente de Stable Diffusion 1.5 o SDXL sin reentrenar ese checkpoint. Es la implementación oficial de Guo et al., «AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning» (ICLR 2024 Spotlight, arXiv:2307.04725), mantenido en github.com/guoyww/AnimateDiff bajo licencia de código Apache 2.0.
¿Es gratis AnimateDiff?
Sí — el código es gratuito para descargar y ejecutar, y no hay suscripción para la generación local en tu propio hardware. El costo de generación es la electricidad y el tiempo de GPU que ya posees, no una tarifa hacia AnimateDiff en sí.
¿Es AnimateDiff gratis para uso comercial?
No automáticamente. El código tiene licencia Apache 2.0, pero el propio README del proyecto indica que la publicación es para uso académico, y el checkpoint de Stable Diffusion que animas típicamente tiene su propia licencia separada (comúnmente CreativeML OpenRAIL-M para SD1.5), que permite el uso comercial pero con sus propias restricciones de contenido. Verifica ambos textos de licencia antes de un despliegue comercial — esto no es asesoría legal.
¿Cómo instalo AnimateDiff en ComfyUI?
Instala el nodo comunitario ComfyUI-AnimateDiff-Evolved (github.com/Kosinkadink/ComfyUI-AnimateDiff-Evolved) vía ComfyUI Manager o clonándolo en tu carpeta custom_nodes, luego descarga un checkpoint de módulo de movimiento (v3_sd15_mm.ckpt para SD1.5 o mm_sdxl_v10_beta.ckpt para SDXL) en la carpeta de modelos de ese nodo antes de construir un workflow texto a video.
¿Funciona AnimateDiff con AUTOMATIC1111?
Sí, mediante la extensión comunitaria sd-webui-animatediff (github.com/continue-revolution/sd-webui-animatediff), instalada a través de la pestaña Extensions de la WebUI. Añade un panel AnimateDiff bajo la pestaña txt2img estándar.
¿Cuánta VRAM necesita AnimateDiff?
AnimateDiff basado en SD1.5 suele funcionar con 8-12 GB de VRAM para texto a video básico en resolución moderada y la ventana nativa de 16 fotogramas del módulo. El soporte de SDXL necesita bastante más — el repositorio oficial indica que la inferencia SDXL normalmente requiere unos 13 GB de VRAM, dependiendo del checkpoint y la configuración usados. Mayor resolución, clips más largos, o añadir ControlNet elevan más los requisitos.
¿Cuánto duran los clips de AnimateDiff?
La ventana nativa entrenada del módulo de movimiento es de 16 fotogramas — unos 2 segundos a 8 fps. Las técnicas comunitarias de ventana deslizante pueden extender la duración total procesando ventanas superpuestas de 16 fotogramas y mezclándolas, pero la coherencia temporal suele degradarse en cada límite de ventana, y los resultados se vuelven poco fiables bastante más allá de unos 30-60 fotogramas.
¿Qué son los motion LoRAs?
Los motion LoRAs son archivos de pesos adicionales pequeños (unos 77 MB), compatibles con el módulo de movimiento mm_sd_v15_v2, que sesgan la generación hacia uno de 8 movimientos básicos de cámara: zoom in, zoom out, paneo izquierda, paneo derecha, inclinación arriba, inclinación abajo, giro horario o antihorario. Se cargan junto al módulo de movimiento de la misma forma en que un LoRA de imagen se carga junto a un checkpoint.
¿Por qué parpadea mi salida de AnimateDiff?
El parpadeo — especialmente en rostros y detalles finos — es una limitación ampliamente reportada, no un error de configuración. La coherencia temporal se rompe con más frecuencia en movimientos rápidos, rostros detallados en resolución más baja, y fondos ocupados con varios sujetos; los módulos de movimiento posteriores (v2, v3) y los motion LoRAs reducen esto pero no lo eliminan.
¿Qué es AnimateDiff-Lightning?
AnimateDiff-Lightning es una publicación separada y destilada de ByteDance (Lin y Yang, «AnimateDiff-Lightning: Cross-Model Diffusion Distillation», arXiv:2403.12706) que usa destilación de difusión adversarial progresiva para generar en tan solo 1, 2, 4 u 8 pasos de difusión en vez de los 20-50 habituales — sustancialmente más rápido, con cierto costo en calidad y detalle.
¿En qué se diferencia AnimateDiff de Stable Video Diffusion?
AnimateDiff conecta un módulo de movimiento a un checkpoint texto a imagen existente de Stable Diffusion, preservando el estilo visual exacto de ese checkpoint. Stable Video Diffusion (SVD) es un modelo imagen a video entrenado por separado por Stability AI, de linaje distinto — anima una imagen de entrada dada en lugar de reutilizar el estilo aprendido de un checkpoint texto a imagen. Elige AnimateDiff para mantener el aspecto de un checkpoint o LoRA específico; elige SVD para animar una imagen existente concreta.
Veredicto
AnimateDiff se gana su lugar como la forma más directa de animar un checkpoint de Stable Diffusion que ya te gusta, sin reentrenar nada ni salir de tu propio hardware. La contrapartida es real y concreta: los clips son cortos por defecto (16 fotogramas, unos 2 segundos, ampliables pero con pérdida de calidad en duraciones mayores), el rango de movimiento y el seguimiento del prompt se degradan algo frente a una imagen fija del mismo checkpoint, y el panorama de licencias requiere dos verificaciones separadas — el marco de uso académico propio del proyecto además de su código Apache 2.0, y la licencia que lleve el checkpoint que animes — antes de cualquier uso comercial. Para lectores que ya tienen un checkpoint SD1.5 o SDXL estilizado y quieren bucles de movimiento cortos y consistentes en estilo en su propia GPU sin costo recurrente, AnimateDiff a través de ComfyUI-AnimateDiff-Evolved o la extensión de AUTOMATIC1111 es el punto de partida práctico. Los lectores que necesiten video más largo, coherente o fotorrealista deberían compararlo en su lugar con modelos de video nativos más nuevos en Generación de video IA local vs. la nube.
Fuentes
- Repositorio oficial de AnimateDiff — código, descargas de módulos de movimiento, términos de licencia.
- Guo et al., «AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning», ICLR 2024 Spotlight, arXiv:2307.04725 — el artículo original.
- Lin y Yang (ByteDance), «AnimateDiff-Lightning: Cross-Model Diffusion Distillation», arXiv:2403.12706 — la variante destilada de pocos pasos.
- ComfyUI-AnimateDiff-Evolved (Kosinkadink) — la integración comunitaria de ComfyUI.
- sd-webui-animatediff (continue-revolution) — la extensión comunitaria de AUTOMATIC1111.
