Skip to main content
PromptQuorum
主页/本地LLM进阶/AnimateDiff 2026指南:让Stable Diffusion模型动起来
Image & Video Generation

AnimateDiff 2026指南:让Stable Diffusion模型动起来

·11分钟阅读·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

AnimateDiff适合已经在本地使用Stable Diffusion、并希望在不重新训练任何东西的情况下为现有检查点或LoRA添加动画的读者。 它是一款免费、采用Apache 2.0许可证的运动模块——而非完整的视频模型——通过社区维护的ComfyUI-AnimateDiff-Evolved节点或AUTOMATIC1111的sd-webui-animatediff扩展使用,在消费级GPU上生成短片段(约2秒、16帧)。希望获得更长、更连贯或更具照片级真实感视频的读者,应在本地AI视频生成 vs. 云端中与更新的原生视频模型进行比较;完全没有本地GPU的读者应先阅读云端GPU租赁指南

AnimateDiff(github.com/guoyww/AnimateDiff)是一款开源运动模块,可为现有的Stable Diffusion检查点添加动画能力,无需重新训练基础模型。它不是一个独立的视频模型,而是一个即插即用的组件:将它与您已经在使用的Stable Diffusion 1.5或SDXL检查点搭配,运动模块会注入帧间的时间一致性,让该模型原本以静态图像呈现的风格、角色或艺术方向,变成一段短暂的动画片段。它完全通过ComfyUI或AUTOMATIC1111 WebUI在您自己的GPU上运行,免费使用,项目采用Apache 2.0许可证——但在规划任何商业用途前,有一点需要注意,详见下方许可证部分。

本页包含指向第三方产品的参考链接。PromptQuorum 未加入任何联盟计划——这些是不产生佣金的普通链接。点击链接和后续步骤由您自行承担责任。这些链接不代表 PromptQuorum 的任何认可或验证。

在GitHub查看AnimateDiff →产品链接 · 已披露在Amazon查看RTX 4070 Ti Super 16GB价格产品链接 · 已披露
AnimateDiff 2026指南:让Stable Diffusion模型动起来

关键要点

  • AnimateDiff(github.com/guoyww/AnimateDiff)是面向Stable Diffusion 1.5和SDXL检查点的即插即用运动模块——无需微调基础模型。
  • 它几乎完全通过两种社区集成方案使用:ComfyUI-AnimateDiff-Evolved(由Kosinkadink维护)和AUTOMATIC1111的sd-webui-animatediff扩展(由continue-revolution维护)。
  • 基于SD1.5的AnimateDiff通常在8-12GB VRAM下运行基础文本转视频;根据官方仓库说明,SDXL支持(mm_sdxl_v10_beta)大约需要13GB以上。
  • 运动模块的默认输出为16帧片段,约2秒——更长的片段使用社区的滑动窗口技术,会在窗口边界处损失一定的时间一致性。
  • 官方提供8种运动LoRA(放大/缩小、左移/右移、上倾/下倾、顺时针/逆时针旋转),可添加基础镜头运动,每个约77MB。
  • AnimateDiff-Lightning(ByteDance,arXiv:2403.12706)是一个独立的蒸馏版本,可用1、2、4或8步生成,而非常规的20-50步,以速度换取部分质量。
  • AnimateDiff代码采用Apache 2.0许可证,但官方README说明该发布版本用于学术用途——而您所动画化的SD1.5检查点通常带有自己的许可证(常见为CreativeML OpenRAIL-M),因此在未核实二者的情况下宣称"完全免费用于商业用途"并不准确。

📍 简单一句话

AnimateDiff是一款免费、采用Apache 2.0许可证的运动模块,可在不重新训练的情况下为现有Stable Diffusion检查点添加动画,通过ComfyUI或AUTOMATIC1111在本地运行。

💬 简单来说

可以把它想象成挂载在您已使用的Stable Diffusion模型上的插件——模型仍以其惯常风格作画,但AnimateDiff增加了帧与帧之间的运动,让输出成为一段短片,而不是单张静态图像。

AnimateDiff是什么?

AnimateDiff是一款运动模块,而非独立的视频生成模型。 它挂载在您已拥有的Stable Diffusion 1.5或SDXL检查点上——包括社区微调模型和LoRA——并添加帧间的时间一致性,使该模型能够以其现有的视觉风格生成短暂的动画片段,而无需重新训练检查点本身。

该项目是论文Guo等人,《AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning》,ICLR 2024 Spotlight,arXiv:2307.04725的官方实现,维护在GitHub上的github.com/guoyww/AnimateDiff

这与Wan 2.2、LTX-2或HunyuanVideo等从零开始基于视频数据训练的更新一代原生视频模型属于不同的技术路线——相关比较请参见本地AI视频生成 vs. 云端。AnimateDiff的独特价值在于风格保留:由于它复用您现有的检查点而非单独训练的视频模型,输出能够保持您在静态图像中已依赖的确切角色、艺术风格或LoRA。

另有一个独立的蒸馏版本——AnimateDiff-Lightning(Lin与Yang,ByteDance,《Cross-Model Diffusion Distillation》,arXiv:2403.12706)——以部分质量换取速度,通过渐进式对抗扩散蒸馏,仅需1、2、4或8个扩散步骤即可生成,而非通常的20-50步。

运动模块是如何工作的?

运动模块是一组独立训练的权重,被插入到Stable Diffusion的U-Net中,与检查点现有的层并列,而不会修改该检查点本身。 在生成过程中,运动模块的时间注意力层会将本来会是一批独立静态图像生成的结果,协调成一段连贯的帧序列。

SD1.5存在三个运动模块版本:mm_sd_v15_v2.ckpt(约1.7GB)和更新的v3_sd15_mm.ckpt(约1.56GB),后者改善了运动幅度并增加了运动LoRA兼容性。另有一个独立的SDXL运动模块mm_sdxl_v10_beta.ckpt(约950MB),通过一个beta分支针对更大的SDXL检查点系列。

由于运动模块是一个即插即用的组件,而非对您检查点的微调,任何兼容的SD1.5检查点以及您已安装的大多数SD1.5 LoRA都可以直接动画化,无需下载该模型的独立"视频"版本——代价是,输出能表达多少运动幅度,取决于运动模块本身而非您的检查点。

如何安装AnimateDiff?

2026年绝大多数的AnimateDiff使用都通过两种社区集成方案之一进行,因为基础代码仓库更像是一个研究代码库,而非成熟的应用程序。 ComfyUI-AnimateDiff-Evolved是开发更活跃的选项;AUTOMATIC1111扩展则适合已经以该WebUI为标准的读者。

  1. 1
    如果尚未安装ComfyUI则先安装,然后打开ComfyUI Manager,搜索"AnimateDiff Evolved"(仓库:Kosinkadink/ComfyUI-AnimateDiff-Evolved)——安装并重启。
  2. 2
    下载一个运动模块检查点(SD1.5用v3_sd15_mm.ckpt,或SDXL用mm_sdxl_v10_beta.ckpt),放入ComfyUI/custom_nodes/ComfyUI-AnimateDiff-Evolved/models/文件夹。
  3. 3
    加载或构建工作流:一个SD1.5或SDXL检查点加载器接入AnimateDiff Loader节点,随后是标准KSampler,以及用于替代单图保存节点的video-combine或GIF输出节点。
  4. 4
    设置帧数(16为模块的原生窗口)和帧率,像编写静态图像那样撰写提示词,然后排队生成——根据分辨率和帧数,在消费级GPU上预计需要数分钟。
  5. 5
    若改用AUTOMATIC1111:从Extensions标签安装continue-revolution/sd-webui-animatediff,将同一运动模块下载到该扩展的模型文件夹中,然后在txt2img标签下启用AnimateDiff面板并照常生成。

ComfyUI-AnimateDiff-Evolved

最适合:
基于节点的精细控制、活跃的开发、运动LoRA与上下文窗口选项
安装步骤:
通过ComfyUI Manager安装或克隆到custom_nodes;下载运动模块检查点;构建/加载文本转视频工作流图

sd-webui-animatediff(AUTOMATIC1111)

最适合:
已经使用AUTOMATIC1111 WebUI生成静态图像、希望沿用熟悉界面的读者
安装步骤:
通过WebUI的Extensions标签安装(或克隆到extensions/);下载运动模块;在txt2img标签下启用AnimateDiff面板

ComfyUI与扩展版本之间的具体文件夹路径和菜单标签会有变化——在排查"节点缺失"错误前,请查看所链接仓库的README以获取当前安装路径。已根据各仓库文档核实,截至2026-09-02。

AnimateDiff需要多少VRAM?

基于SD1.5的AnimateDiff工作流在中等分辨率(约512x512,模块原生的16帧窗口)下进行基础文本转视频时,通常在8-12GB VRAM下运行;SDXL支持则需要明显更多。

官方仓库说明SDXL推理"通常需要约13GB VRAM",具体取决于所使用的个性化检查点和生成设置。社区对SD1.5工作流的报告因分辨率、帧数以及是否叠加ControlNet而有所不同——在默认设置下生成单个短片段时,预计接近8-12GB区间的下限;而在提高分辨率、增加帧数,或在图生图管线中叠加多个ControlNet时,预计接近区间上限(甚至超出,达到16GB以上)。这些是经过谨慎表述的社区报告范围,而非单一经过验证的基准测试,因为实际VRAM占用高度取决于具体工作流。

实用建议:8GB显卡是SD1.5文本转视频默认设置实验的可行起点;12GB显卡为搭配ControlNet的SD1.5工作流提供了充裕余量;16GB显卡(例如RTX 4070 Ti Super)在转向基于SDXL的AnimateDiff或更重的图生图管线时是更舒适的最低配置。GPU未达到这些档位、或没有本地GPU的读者,应在2026年云端GPU租赁指南中比较租用与购买——参见2026年本地LLM最佳GPU选购指南(同样的VRAM档位建议适用于AnimateDiff,与其他本地生成式AI工作负载一致)。

什么是运动LoRA?AnimateDiff有哪些局限性?

**运动LoRA是小型(约77MB)附加权重,用于引导AnimateDiff产生特定的镜头运动——放大、缩小、左移、右移、上倾、下倾、顺时针旋转或逆时针旋转——与mm_sd_v15_v2运动模块兼容。** 它们的工作方式与图像LoRA相同:与运动模块一并加载,使输出偏向该运动方向,而不改变检查点的视觉风格。

根据项目自身的问题追踪器和社区评测,最常被提及的局限性集中在三个方面:

  • 原生片段时长较短。 运动模块的训练窗口为16帧(8fps下约2秒)。社区的滑动窗口技术(处理重叠的16帧窗口并混合结果)可以延长总时长,但时间一致性通常会在每个窗口边界处下降,超过约30-60帧后结果会明显变得不可靠。
  • 闪烁,尤其在面部和精细细节上。 时间一致性最常在快速运动、低分辨率下的精细面部,以及包含多个主体的复杂背景中崩溃——这是一个已知且被频繁讨论的局限,而非个别边缘情况。
  • 运动幅度有限。 特别是在最初的v1运动模块上,镜头和主体运动倾向于缓慢的平移和微小的移动,而非戏剧性的动作;后续模块(v2、v3)和运动LoRA有所改善,但并未完全消除这一问题。
  • 相比同一检查点的静态图像,提示词遵循度有所下降。 由于运动模块必须让每一帧与相邻帧保持协调,单张静态图像能够精确呈现的提示词,在16帧上强制保持时间一致性后,可能呈现得不那么精确。

权衡:优点与局限

免费且代码采用Apache 2.0

实际使用中的意义:
没有订阅费,没有单次生成费用,代码库开放供检查和修改。
局限 / 注意事项:
官方仓库说明该发布版本用于学术用途——在假定拥有不受限的商业权利前,请先查看许可证部分。

无需重新训练

实际使用中的意义:
任何您已使用的兼容SD1.5检查点或LoRA都可以直接动画化。
局限 / 注意事项:
输出质量和风格保真度完全取决于该检查点在静态图像方面本身的水平。

可在消费级GPU上运行

实际使用中的意义:
SD1.5工作流从约8GB VRAM起即可实用;无需云端账户。
局限 / 注意事项:
SDXL支持需要明显更多(约13GB以上),更重的ControlNet或图生图管线会进一步推高需求。

用于镜头控制的运动LoRA

实际使用中的意义:
8种官方LoRA无需重新训练即可提供基础的缩放、平移、倾斜和旋转运动。
局限 / 注意事项:
仅覆盖基础镜头运动——不像部分商用工具那样提供按时间戳精确控制的镜头路径。

活跃的社区工具

实际使用中的意义:
ComfyUI-AnimateDiff-Evolved和AUTOMATIC1111扩展都得到积极维护,并有广泛的文档记录。
局限 / 注意事项:
官方基础代码库本身是一个研究代码库,而非成熟的终端用户应用——可用的工作流依赖于社区集成方案。

追求速度的AnimateDiff-Lightning

实际使用中的意义:
蒸馏版本仅需1-8步生成,而非20-50步,大幅缩短生成时间。
局限 / 注意事项:
更少的扩散步骤以部分质量和细节换取这种速度。

AnimateDiff 对比 替代方案

AnimateDiff

方法:
将运动模块挂载到现有的SD1.5/SDXL检查点上,无需重新训练
最适合:
复用已有检查点或LoRA的风格化或动漫风格运动循环
相对AnimateDiff的主要局限:
关于AnimateDiff的文章(1篇)

其他提及:

Stable Video Diffusion(SVD)

方法:
由Stability AI单独训练的图生视频模型,与Stable Diffusion的文生图路线属于不同谱系
最适合:
将一张已有图像动画化为短暂运动,而非从检查点生成风格一致的片段
相对AnimateDiff的主要局限:
不像AnimateDiff那样保留特定检查点或LoRA的确切视觉风格——它动画化的是输入图像,而非某个文生图模型的学习风格。

Deforum

方法:
较早的关键帧与参数插值技术——在连续扩散帧之间应用2D/3D镜头变换
最适合:
由镜头路径驱动的"无限缩放"式动画和缓慢的参数漂移
相对AnimateDiff的主要局限:
没有习得的运动先验——一致性依赖于逐帧的参数插值,而非经过训练的时间注意力模块,因此主体运动(相对于镜头运动)明显更不自然。

商用云端视频模型(Runway、Pika、Sora级模型)

链接:
方法:
通过订阅或积分提供的专有云端托管视频生成
最适合:
更长、保真度更高、时间上更连贯的视频,以及照片级真实感或电影感的输出
相对AnimateDiff的主要局限:
持续的订阅费用、没有本地隐私保护,也无法复用特定开源检查点的确切训练风格——完整的成本与质量对比请参见本地AI视频生成 vs. 云端,其中对比了更新的本地视频模型。

本表比较的是方法与适用性,而非评分排名——每种工具解决的问题不同。对于在更长片段长度上与商用云端视频更直接竞争的更新一代原生视频模型(Wan 2.2、LTX-2、HunyuanVideo),请参见上方链接的专门对比文章,而非本篇以AnimateDiff为核心的指南。

AnimateDiff可以免费用于商业用途吗?

AnimateDiff代码本身采用Apache 2.0许可证发布,但项目自身的README说明该发布版本用于学术用途——因此在未进一步核实的情况下,宣称"完全免费用于商业用途"并不准确。 这正是应当避免的过度宣称类型:Apache 2.0通常允许代码的商业使用,但作者附加的学术用途表述意味着,计划出售或商业分发输出的读者应直接阅读仓库中当前的许可证条款,而不应仅依赖Apache 2.0这一标签。

第二层独立的许可要求适用于您所动画化的Stable Diffusion检查点。原始的Stable Diffusion 1.5检查点(以及从中衍生的许多社区微调模型)以CreativeML OpenRAIL-M许可证分发,该许可证允许商业使用,但附带其自身基于使用方式的限制(例如禁止生成某些类别的有害内容)——这与AnimateDiff自身的许可证是分开的,也不会被后者取代。

实践中:在任何商业使用前,请核实两份许可证——仓库中AnimateDiff的发布条款,以及您所动画化的具体检查点所附带的许可证(原始SD1.5检查点适用OpenRAIL-M条款,或特定社区微调模型指定的任何许可证,因为微调模型可能带有与基础模型不同的条款)。这不构成法律建议;在商业部署前,请查阅当前的许可证文本或咨询法律专业人士。

谁适合使用AnimateDiff

  • 已经拥有喜欢的Stable Diffusion检查点或LoRA的读者。 AnimateDiff的核心价值在于,在不重新训练任何东西的情况下,将这种确切的视觉风格转化为动态。
  • 希望获得风格化、动漫风格或插画风格运动循环的读者。 该技术在Stable Diffusion检查点已经擅长的内容类型上表现最佳——艺术风格而非照片级真实感。
  • 熟悉ComfyUI或AUTOMATIC1111的读者。 安装过程假定用户熟悉其中一个界面;目前没有专门的独立AnimateDiff应用程序。
  • 希望获得短片段(数秒)而非长篇视频的读者。 原生16帧窗口更适合循环、GIF和短暂的风格化片段,而非叙事性序列。
  • 拥有中端消费级GPU(8GB以上VRAM)、希望零持续成本的读者。 本地生成无需订阅、无需积分、无需云端账户。

谁不适合使用AnimateDiff

  • 需要照片级真实感、长篇或精确镜头控制视频的读者。 无论是Wan 2.2或LTX-2等本地原生视频模型,还是Runway或Pika等商用模型,在这方面都表现更好;参见本地AI视频生成 vs. 云端
  • 没有已经喜欢的Stable Diffusion检查点的读者。 若没有值得动画化的起点,相比能够直接从文本提示生成的原生视频模型,优势不大。
  • 需要在不阅读许可证文本的情况下获得有保障商业使用权的读者。 AnimateDiff自身README中的学术用途表述,加上单独的检查点许可证,意味着这并非一个无需尽职调查的"免费商用"工具——参见上方的许可证解析部分。
  • 没有本地GPU、或显卡VRAM低于约8GB的读者。 基于SD1.5的AnimateDiff从8GB起即可实用,但低于该档位的读者应改为考虑云端GPU租赁或云端视频服务。
  • 希望获得一键式应用体验的读者。 ComfyUI和AUTOMATIC1111都假定用户对节点图或扩展设置有一定的熟悉度——这不是一款打磨精良的大众消费级产品。

常见问题

AnimateDiff是什么?

AnimateDiff是一款开源运动模块,可为现有的Stable Diffusion 1.5或SDXL检查点添加动画能力,而无需重新训练该检查点。它是论文Guo等人《AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning》(ICLR 2024 Spotlight,arXiv:2307.04725)的官方实现,维护在github.com/guoyww/AnimateDiff,采用Apache 2.0代码许可证。

AnimateDiff是免费的吗?

是的——代码可免费下载和运行,在自己的硬件上进行本地生成无需订阅。生成成本只是您已经拥有的电费和GPU使用时间,而非支付给AnimateDiff本身的费用。

AnimateDiff可以免费用于商业用途吗?

并非自动如此。代码采用Apache 2.0许可证,但项目自身的README说明该发布版本用于学术用途,而您所动画化的Stable Diffusion检查点通常带有自己独立的许可证(SD1.5常见为CreativeML OpenRAIL-M),该许可证允许商业使用,但附带自身的内容限制。在商业部署前请核实两份许可证文本——这不构成法律建议。

如何在ComfyUI中安装AnimateDiff?

通过ComfyUI Manager安装社区维护的ComfyUI-AnimateDiff-Evolved节点(github.com/Kosinkadink/ComfyUI-AnimateDiff-Evolved),或将其克隆到您的custom_nodes文件夹,然后在构建文本转视频工作流之前,将运动模块检查点(SD1.5用v3_sd15_mm.ckpt,或SDXL用mm_sdxl_v10_beta.ckpt)下载到该节点的models文件夹中。

AnimateDiff可以在AUTOMATIC1111中使用吗?

可以,通过社区维护的sd-webui-animatediff扩展(github.com/continue-revolution/sd-webui-animatediff),从WebUI的Extensions标签安装。它会在标准的txt2img标签下添加一个AnimateDiff面板。

AnimateDiff需要多少VRAM?

基于SD1.5的AnimateDiff在中等分辨率和模块原生的16帧窗口下进行基础文本转视频时,通常在8-12GB VRAM下运行。SDXL支持需要明显更多——官方仓库说明,根据所用检查点和设置,SDXL推理通常需要约13GB VRAM。更高的分辨率、更长的片段,或叠加ControlNet会进一步推高需求。

AnimateDiff生成的片段有多长?

运动模块原生训练的窗口为16帧——8fps下约2秒。社区的滑动窗口技术可以通过处理重叠的16帧窗口并进行混合来延长总时长,但时间一致性通常会在每个窗口边界处下降,超过约30-60帧后结果会明显变得不可靠。

什么是运动LoRA?

运动LoRA是与mm_sd_v15_v2运动模块兼容的小型(约77MB)附加权重文件,可将生成引导至8种基础镜头运动之一:放大、缩小、左移、右移、上倾、下倾、顺时针旋转或逆时针旋转。它们与运动模块一并加载,方式与图像LoRA与检查点一并加载相同。

为什么我的AnimateDiff输出会闪烁?

闪烁——尤其是在面部和精细细节上——是一个被广泛报告的局限,而非配置错误。时间一致性最常在快速运动、低分辨率下的精细面部,以及包含多个主体的复杂背景中崩溃;后续的运动模块(v2、v3)和运动LoRA可以减轻但无法完全消除这一问题。

什么是AnimateDiff-Lightning?

AnimateDiff-Lightning是ByteDance发布的一个独立蒸馏版本(Lin与Yang,《AnimateDiff-Lightning: Cross-Model Diffusion Distillation》,arXiv:2403.12706),通过渐进式对抗扩散蒸馏,仅需1、2、4或8个扩散步骤即可生成,而非通常的20-50步——速度大幅提升,但会牺牲一定的质量和细节。

AnimateDiff与Stable Video Diffusion有什么区别?

AnimateDiff将运动模块挂载到现有的Stable Diffusion文生图检查点上,保留该检查点的确切视觉风格。Stable Video Diffusion(SVD)是Stability AI单独训练的图生视频模型,谱系不同——它动画化的是给定的输入图像,而非复用某个文生图检查点的学习风格。若想保留特定检查点或LoRA的外观,请选择AnimateDiff;若想动画化一张具体的现有图像,请选择SVD。

结论

AnimateDiff凭借在不重新训练任何东西、也无需离开自有硬件的情况下动画化您已喜欢的Stable Diffusion检查点这一点,确立了其作为最直接方法的地位。这种权衡是真实且具体的:片段默认较短(16帧,约2秒,可延长但时长越长质量损失越大),运动幅度和提示词遵循度相比同一检查点的静态图像有所下降,而在任何商业使用之前,许可证情况都需要两项独立核实——项目自身在Apache 2.0代码之上附加的学术用途表述,以及您所动画化的检查点所带有的许可证。对于已经拥有风格化SD1.5或SDXL检查点、希望在自己的GPU上以零持续成本获得简短、风格一致的运动循环的读者,通过ComfyUI-AnimateDiff-Evolved或AUTOMATIC1111扩展使用AnimateDiff是实用的起点。需要更长、更连贯或照片级真实感视频的读者,则应改为在本地AI视频生成 vs. 云端中与更新的原生视频模型进行比较。

← 返回 本地LLM进阶