关键要点
- Wan 2.2 是唯一零许可限制的顶级本地视频模型。 Apache 2.0 许可,商业用途不受限,无营收上限,无地区排除——同时拥有已验证开源模型中最高的 VBench 质量分数(约 84.7%)。
- InVideo 将 200 多个模型——包括 Kling 3、Veo 3.1 和 Seedance 2.5——打包进一个基于浏览器的流水线,起价为每月 17 美元(Plus 套餐,按年计费),脚本、配音、音乐和字幕全部自动处理。
- HunyuanVideo 1.5 的许可证明确排除欧盟、英国和韩国——模型本身和其输出内容均受限。这些地区的读者应改用 Wan 2.2 或 LTX-2。
- LTX-2 是三者中速度最快、唯一内置同步音频的模型,年营收低于 1000 万美元的公司可免费商用。
- 12GB 显存是认真进行本地视频生成的现实底线。 低于这个数字,InVideo 是更实际的选择。
- 本地模型生成的是 5–20 秒的原始无声片段,而不是成品视频。 脚本、配音、音乐、字幕和剪辑都是需要你自己组装的独立工具——InVideo 一次性完成所有这些工作。
- 不存在"Wan 2.7"。 提供该版本下载的页面都是 SEO 骗局——Wan 官方发布到 2.2 为止。
为什么 2026 年是 AI 视频领域的一个奇怪时刻
专有视频市场一直处于混乱状态。OpenAI 在 2026 年 3 月关闭了 Sora 消费者应用,距离上线不到六个月,原因是下载量较峰值下滑了约 66%(API 仍独立在线)。字节跳动的 Seedance 2.0 同月陷入好莱坞诉讼并暂停全球推广,起因是迪士尼、派拉蒙和华纳兄弟发出的停止侵权函——该模型在中国仍可使用,但国际商业用途面临法律风险。阿里巴巴的 HappyHorse 模型在 2026 年 4 月登顶质量排行榜——却从未向公众开放。
这种混乱正是两扇门都吸引人的原因。开放的本地模型让你不受供应商风波的影响。而 InVideo 替你承担了这种混乱:它的订阅打包了 200 多个模型的访问权限——包括 Kling 3、Veo 3.1 和 Seedance 2.5——这样当某个模型消失或被起诉时,你的工作流程不会受到影响。
本地这扇门:你自己 GPU 上的三个免费模型
目前有三个开放权重系统主导着本地视频生成领域,以下载量、社区活跃度和基准测试结果衡量。三者都通过 ComfyUI 运行,这是一个安装在你自己机器上的基于节点的界面——不是像 Ollama 那样的聊天式工具。这些是扩散模型,不是大语言模型。
📍 简单一句话
Wan 2.2 是 2026 年综合表现最好的本地视频模型——Apache 2.0、质量最高、无限制——而 LTX-2 在速度和同步音频上胜出,HunyuanVideo 1.5 画面最具电影感,但许可证将欧盟/英国/韩国用户排除在外。
💬 简单来说
如果你只想要一个答案:准备一块 12GB 以上显存的 GPU,运行 Wan 2.2。它质量最好、许可证最简单、没有任何细则条款。
| 模型 | 许可证 | 显存 | 输出 | 突出特点 |
|---|---|---|---|---|
| Wan 2.2(阿里巴巴) | Apache 2.0——无限制 | 6–8GB(5B)/ 15–25GB(14B) | 480p/720p,约 5 秒片段 | 已验证的最高 VBench 质量分数(约 84.7%) |
| LTX-2(Lightricks) | LTX 社区许可证——年营收低于 1000 万美元可免费使用 | 量化版 18–20GB,完整精度 32GB 以上 | 480p–1080p,5–20 秒,带音频 | 唯一能在单次生成中同步输出音视频的模型 |
| HunyuanVideo 1.5(腾讯) | 腾讯社区许可证——排除欧盟/英国/韩国 | 最低 14GB,24GB 更舒适 | 480p/720p,最长 10 秒 | 社区偏爱的电影感光影效果;显存占用最轻 |
⚠️ 骗局提醒:不存在"Wan 2.7"。声称提供"Wan 2.7 开放权重"下载的页面都是 SEO 骗局。Wan 官方发布到 2.2 为止——只从下方链接的官方 GitHub 或 Hugging Face 仓库下载。
Wan 2.2(阿里巴巴)——质量之王,真正免费
Wan 2.2 是部署最广泛的开放视频模型:仅其 I2V-A14B 仓库单月就记录了约 424 万次 Hugging Face 下载量,还衍生出数百个社区变体。它提供三个版本——T2V-A14B 和 I2V-A14B(混合专家架构,总参数 27B / 激活参数 14B),以及一个紧凑的 TI2V-5B,支持文本转视频和图像转视频,最低只需 6–8GB 显存。14B 档位需要 15GB(GGUF Q3)到 25GB(FP8);官方非量化命令要求 80GB。它的许可证是 Apache 2.0——真正免费,商业用途不受限,无营收门槛,无地区排除。
具体速度: 在 RTX 4090 上,单个 5 秒片段大约需要 4–9 分钟(这是一个独立报告的数据——Wan 2.2 原生不能一次输出更长的片段)。要制作一段 20 秒的序列,你需要生成 4 段独立的 5 秒片段再拼接——大约需要 16–36 分钟的原始生成时间,再加上手动剪辑以让它们平滑衔接。这个区间是从单片段数据推算得出的,不是直接测量的 20 秒基准测试结果。
LTX-2(Lightricks)——速度加同步声音
LTX-2 是这三者中唯一能在单次生成中同步输出音视频的开放模型——脚步声、环境音和特效都随画面一起生成。它也是三者中最快、对硬件最宽容的。其架构是一个 22B 扩散 Transformer;LTX-2.3(2026 年 3 月发布)与当前的 LTX-2.5 版本并行获得完整支持。许可证是 LTX 社区许可证——如果你公司的总营收低于每年 1000 万美元,可免费商用,超过该门槛需要付费商业许可证。(部分第三方文章错误地称其为 Apache 2.0——官方许可证页面才是唯一可靠的来源。)硬件需求为量化版 18–20GB 显存,完整精度 32GB 以上;在 12GB 显卡上,更老的 LTX-Video 0.9.5 仍是实际可行的选择。
具体速度: LTX-2 在定性层面是三者中最快的,在高端消费级显卡上能实现接近实时的预览——但截至本文撰写时,并不存在经独立验证的 RTX 4090 每片段耗时分钟数,因此我们不会编造一个。目前唯一确切的数据来自 Lightricks 自己在数据中心级"Nvidia superchips"(而非消费级 GPU)上的基准测试:一个 10 秒片段大约耗时 6.8 秒。请将其视为这套架构在专业级硬件上能达到的上限,而非你家用设备实际会看到的速度。
HunyuanVideo 1.5(腾讯)——电影感画面,但有法律隐患
腾讯的这个 8.3B 模型于 2025 年 11 月发布,以电影感的光影和质感受到社区青睐,也是三者中显存占用最轻的:通过卸载最低需要 14GB,24GB 更舒适,在 RTX 4090 上生成一个 480p 片段约需 75 秒。它原生生成 480p/720p,通过内置超分辨率可达 1080p,片段最长 10 秒。
具体速度: 以每个 5 秒 480p 片段约 75 秒计算,大约相当于每秒视频需要 15 秒渲染时间。它原生最大片段长度为 10 秒,所以一段 20 秒的序列需要两次最大长度的生成——按每秒速率推算,大约需要 5 分钟的原始生成时间才能得到 20 秒的画面,还不算拼接。这是从已有的 5 秒数据推算出的结果,不是直接测量的 10 秒或 20 秒基准测试。
⚠️Warning: 许可证警告——下载前请先阅读。HunyuanVideo 1.5 使用的是腾讯混元社区许可证,不是 Apache 2.0。该许可证不适用于欧盟、英国或韩国——这些地区的用户无权使用该模型或其输出内容。它还将使用规模上限设定为月活跃用户 1 亿,并禁止使用其输出内容训练竞争模型。如果你身处欧盟、英国或韩国,请跳过这个模型:Wan 2.2 能提供同等质量档位,且零限制。
值得关注:MiniMax H3
MiniMax H3 于 2026 年 8 月 3 日发布,是一个 33.1B 全模态模型,原生支持立体声音频,首日就获得 ComfyUI 支持,还提供可在 RTX 3060 上运行的量化版本。在把它当作第四选择之前有两点需要注意:本地版本上限为 768p(完整 2K 流水线仍仅限托管使用),而且据报道其社区许可证附带自己的地区限制和 2000 万美元营收门槛——在使用前请查看官方模型卡。早期迹象良好,但发布仅三周和真正可用于生产环境是两回事。
硬件门槛
本地视频生成的"免费"就像小狗是"免费"的一样:模型权重不花钱,但 GPU 才是真正的入场费。如果你的 GPU 显存低于 12GB 且不打算升级,就完全跳过本地生成——上述三个模型没有一个能在这个档位以下达到可用质量,云端平台会更快给你更好的输出。
不确定这些数字对你的机器意味着什么?这些指南能帮你理清:显存计算器 提供每个模型的确切要求,你需要多少显存? 提供跨模型规模的图表,本地 AI 最佳 GPU 和 最佳预算 GPU 提供硬件选购建议,GPU vs CPU vs Apple Silicon 提供平台比较。一个诚实的提醒:那些指南使用的是大语言模型显存公式(参数量 × 位数 ÷ 8)。视频扩散模型的显存需求还会随分辨率和片段长度变化,所以对视频工作负载而言,把那些数字当作下限而非上限来看待。
| 你的 GPU | 你能运行什么 |
|---|---|
| 6–8GB 显存 | Wan 2.2 TI2V-5B(量化版)——可用,入门质量 |
| 12GB 显存 | LTX-Video 0.9.5——这个档位唯一靠谱的选择 |
| 16GB 显存 | HunyuanVideo 1.5(许可证允许的情况下)、Wan 2.2 14B 的 GGUF Q3 版本 |
| 24GB 以上显存 | 全部选项:高质量的 Wan 2.2 14B、量化版 LTX-2 |
截至 2026 年 8 月的大致硬件成本:二手 RTX 3060 12GB 约 170–220 美元,二手 RTX 3090 组合约 900–1,100 美元。GPU 价格会波动——购买前请核实当前价格,不要在几个月后仍相信这些数字。
运行本地视频生成实际需要做什么
使用本地模型,你安装的不是一个视频工具——而是在组装一条流水线。
生成环境搭建。 ComfyUI 是基于节点的:你需要搭建,或导入并调试,一张由加载器、采样器和解码器组成的工作流图。在渲染出第一帧之前,预计会遇到 CUDA 版本不匹配、PyTorch 版本锁定,以及偶尔出现的 flash_attn 安装错误。
提示词编写。 视频模型需要结构化提示词——镜头类型、运镜方式、光照、主体动作——而不是一句话。没有内置的提示词助手,也没有系统提示层;完整结构要你自己写。我们关于系统提示词与用户提示词和本地模型的提示词工程的指南涵盖的基础知识可以直接迁移到视频提示词编写上。
片段之外的一切。 本地模型输出的是 5–20 秒的原始无声片段(LTX 除外)。脚本、配音、音乐、素材片段、字幕和剪辑,每一项都是你需要自己挑选、安装并串联起来的独立工具。
薄弱(一句话)
“A dog on a beach”
结构化(视频模型需要的)
“Golden retriever sprinting along a wet shoreline at golden hour, low tracking shot following from the side, shallow depth of field, warm backlight, gentle slow motion, cinematic 24fps”
云端这扇门:InVideo 打包了什么
想在没有本地搭建的情况下制作 AI 视频? 如果你没有强大的 GPU——或者只是不想花几个小时安装和配置本地 AI 视频工具——InVideo 值得一试。试用 InVideo 免费版 →
InVideo 只是云端这扇门的一个例子——不是唯一的一个,在假设"云端"就代表某一种固定形式之前,值得先了解它与其他方案的区别。Runway 直接集成进专业剪辑软件(Premiere Pro、Final Cut、DaVinci Resolve),面向的是 AI 加剪辑师混合工作流,而不是一段成品的完整视频。Luma AI 的 Dream Machine 专攻原生 16 位 HDR 输出,面向视效合成流水线(After Effects、Nuke)——完全是另一批受众。Pika 保持轻量:快速生成原始片段,不内置脚本、配音或素材库组装,所以片段之外的一切你仍需要单独的工具——这与运行本地模型面临的 DIY 流水线问题相同,只是不需要 GPU。InVideo 与这三者的不同之处在于,它并非主要是一个原始生成工具:它是一个把脚本变成成品视频的组装器,同时在你需要时也提供原始生成模型(Kling、Veo、Seedance)的访问权限。
InVideo 不是一个视频模型——它是把整条生产流水线作为服务提供给你。你输入一个主题或粘贴一段脚本;它的 v4 智能体会返回一段最长 30 分钟的成品视频:AI 生成的脚本、从超过 1600 万素材的素材库中挑选或全新生成的画面、50 多种语言的 AI 配音(包括声音克隆)、音乐、字幕和品牌套装样式。它在浏览器中运行——你的 GPU 无关紧要。
对于想今天就开始制作视频、而不是研究 GPU 和量化格式的人来说,InVideo 是实际的选择:不需要本地硬件,不需要安装 ComfyUI 或排查 CUDA 问题,一套工作流就已经包含大多数人真正需要的脚本、配音、音乐和字幕。它尤其适合那些更在意成品视频、而不在意控制底层生成模型的创作者——由于存在免费套餐,你可以先弄清楚它是否适合你,再决定是否付费。
就本文的对比而言,有三点值得关注:
- 模型乱局,由 InVideo 承担。 所有付费套餐都包含对 200 多个模型的访问权限——其中包括 Seedance 2.5、Veo 3.1 和 Kling 3。当某个模型被起诉或下线,InVideo 会替换它;你的工作流程照常继续。
- 自动化是内置的,不是后加的。 它提供官方 MCP 服务器,因此从提示词 → 脚本 → 素材 → 字幕的整条流水线都可以通过程序触发——这正是你原本需要围绕 ComfyUI 自己搭建的那种框架。
- 免费套餐是真正的试驾。 带水印且有分钟数限制,但足以在付费之前判断输出质量。
具体速度——以及诚实的隐患: 单次原始生成很快,通常只需几分钟。但 InVideo 自己的 FAQ 指出,一部短片的完整端到端制作需要 2–5 天,而不是几分钟——因为真正耗时的是在多个生成选项中挑选和组装,而不是生成本身。将"2 天作为现实下限"用于一部 1–3 分钟的成品短片,作为与本地这扇门"20 秒未剪辑素材需要 16–36 分钟原始生成时间"的公平对比:InVideo 用它自己的制作时间换掉了你的搭建和剪辑时间,而不是彻底消除时间成本。
当前套餐起价为每月 17 美元(Plus 套餐,按年计费,2026 年 8 月核实——具体数字请查看 InVideo 的定价页面):
| 套餐 | 价格 | 每月额度 | 适合人群 |
|---|---|---|---|
| Free | $0 | 有限 | 先试试水(带水印) |
| Plus | $17/月($200/年) | 75 | 常规创作者——所有 AI 模型、4 个数字人及声音克隆、100 个 iStock 素材、无限次去水印导出 |
| Max | $85/月($1,000/年) | 390 | 高产量频道,16 个数字人 |
| Generative | $170/月($2,000/年) | 800+ | 短片/制作级产量 |
| Elite | $900/月($10,800/年) | 4,250+ | 系列剧和商业级规模 |
以上所有价格均为截至 2026 年 8 月的按年计费价——按月付费的成本更高(InVideo 自己的 FAQ 显示 Plus 为每月 20 美元、Max 为 100 美元、Generative 为 200 美元、Elite 为 1,000 美元)。在依赖此处任何数字之前,请查看 InVideo 的实时定价页面;套餐和价格会变动。
云端还是本地:哪扇门属于你?
简版对照,映射到常见情况:
| 你的情况 | 建议 |
|---|---|
| 没有 GPU,或显存低于 12GB | InVideo(云端)——这个档位以下没有本地模型能表现良好 |
| 想要带配音的成品视频,不是原始片段 | InVideo(云端)——本地模型无法组装完整的成品 |
| 截止日期紧迫,零容忍搭建折腾 | InVideo(云端) |
| 拥有 12GB 以上显存 GPU,愿意折腾搭建,看重隐私和 0 边际成本 | 本地:LTX-Video(12GB)或 Wan 2.2(24GB 达到完整质量) |
| 身处欧盟、英国或韩国 | 本地仅限 Wan 2.2 或 LTX-2(HunyuanVideo 的许可证将你排除在外) |
| 需要大规模自动化/API 而不想自己搭建 | InVideo(云端,MCP 服务器) |
谁应该选择 InVideo?
不确定哪条路适合你? 如果你想避开硬件和技术搭建,最简单的实验就是直接试用 InVideo,看看它的工作流是否适合你的需求。免费试用 InVideo →
如果你符合以下情况,InVideo 可能是更好的选择:
- 没有强大的 GPU
- 想立刻开始制作视频
- 不想安装和配置 ComfyUI、CUDA、模型或 Python 环境
- 想要一体化工作流,而不是拼凑多个本地工具
- 需要在同一个工作流中完成脚本、配音、音乐、字幕和视频生成
- 更在意成品视频,而不是折腾底层模型
如果你符合以下情况,本地 AI 可能是更好的选择:
- 已经拥有合适的 GPU 硬件
- 想要最大程度的控制权
- 想要试验模型和工作流
- 具备较强的技术能力
- 优先考虑让生成过程保持本地可控
- 预计会有非常大的生成量,想优化边际生成成本
看它们实际运行
- 4 款开源 AI 视频模型对比——哪一个真正免费?——LTX 2.3、Wan 2.2、HunyuanVideo 1.5 和 MiniMax H3 的并排输出对比,包含许可证细则。
- InVideo Agent One 评测——从提示词到成品视频的完整工作流。
- Wan 2.2 完整本地演示——消费级硬件上的真实渲染时间(发布周,2025 年 7 月)。
- 低显存 Wan 2.2 教程——在 6GB 显存的笔记本电脑上运行 14B 模型(2025 年)。
常见问题
我能在 8GB 显存上运行 AI 视频生成吗?
勉强可以。Wan 2.2 的 TI2V-5B 版本可在 6–8GB 量化条件下运行,但质量降低、片段较短。对于正经的模型,12GB 才是真正的底线——低于这个数字,像 InVideo 这样的云端工具是更实际的答案。
Wan 2.2 真的可以免费商用吗?
是的。它采用 Apache 2.0 许可——商业用途不受限,无营收上限,无地区排除,也不对你的输出内容主张任何权利。它是所有顶级本地模型中唯一没有许可证细则条款的。
我能在欧盟或英国使用 HunyuanVideo 吗?
不能。腾讯混元社区许可证明确规定不适用于欧盟、英国或韩国——这既包括模型本身,也包括其输出内容。请改用 Wan 2.2 或 LTX-2。
使用 InVideo 需要 GPU 吗?
不需要。InVideo 完全在浏览器中运行;所有生成过程都在他们的基础设施上完成。一台五年前的笔记本电脑就能正常使用。
本地模型能生成一段带配音的完整 YouTube 视频吗?
单靠它们本身不行。本地模型生成的是 5–20 秒的原始片段(LTX-2 包含同步音频;其他都是无声的)。脚本、配音、音乐、字幕和剪辑各自需要单独的工具,由你自己组装成一条流水线。
"免费"的本地 AI 视频实际的代价是什么?
硬件成本(一块够强的 GPU)、搭建时间(ComfyUI 及其各种依赖),以及围绕原始输出片段所需的 DIY 流水线。模型权重本身确实每次生成都是 0 美元,永远如此。
有 Wan 2.7 或更新的 Wan 模型吗?
没有。Wan 官方发布到 2.2 为止。任何提供"Wan 2.7 权重"的网站都是骗局——只从官方 GitHub 或 Hugging Face 仓库下载。
我是完全的新手,应该从哪里开始?
InVideo 的免费套餐——几分钟内你就能拿到一段带旁白的成品视频,并判断 AI 视频是否真的对你有用。如果之后你买了一块够强的 GPU,想要完全的控制权和隐私,本地这扇门依然敞开。
在 Mac 和 Windows 上运行这些本地模型有什么区别?
ComfyUI 可以通过 PyTorch 的 MPS 后端在 Apple Silicon(M1–M4)上运行,但生成速度大约比同等级 NVIDIA GPU 慢 3–5 倍——可用,但速度上不具竞争力。更实际的问题在于软件支持:这些模型依赖的 CUDA 专属优化(flash-attention、GGUF/FP8 量化工具)在 Mac 上远不够成熟,因此不少社区工作流和安装指南默认使用 Windows 或 Linux 加 NVIDIA 显卡,可能需要调整,或者干脆无法按文档运行。一个优势是:Apple Silicon 的统一内存能让你装下比同等显存的独立 GPU 更大的模型,尽管运行速度较慢。如果你是专门为本地视频生成购买硬件,Windows 或 Linux 加 NVIDIA 是支持完善的路线;如果你已经有一台 Mac,拿来做实验没问题,但不建议作为追求高产量的目标平台。
我能在多个本地视频片段之间保持同一个角色一致吗?
可以,但需要额外的功夫——这三个模型都不会在不同的独立生成之间自动保证这一点。两种有效的方法是:把同一张参考图片输入图像转视频模式(三者都支持 I2V),或者为你的角色训练一个小型 LoRA。Wan 2.2 和 LTX-2 都有针对这个用途的成熟 LoRA 工作流——LTX-2 的版本叫 IC-LoRA(上下文内 LoRA),明确支持多角色一致性。社区的共识很一致:训练好的 LoRA 比单纯依靠提示词或参考图片可靠得多。InVideo 的品牌套装和 AI 数字人功能用不同的方式解决了同一个底层问题——一个只需配置一次、可反复使用的固定数字人和声音档案,无需训练。
决定前先试用
你不需要为了评估云端工作流而先投入一套本地 GPU 配置——或一份付费订阅。在购买硬件或花一个周末折腾 ComfyUI 之前,值得先花五分钟反过来试一试:
1. 试用 InVideo 的免费版本。 2. 制作一段短视频。 3. 评估输出质量以及工作流的使用体验。 4. 将这次体验与本地安装所需的搭建成本做对比。
这样一来,这个对比就从"读来的信息"变成了"你自己能测试的东西",而且花费的时间比读完本文剩余部分还要短。
结论
如果你拥有(或打算购买)12GB 以上显存的 GPU,喜欢自己搭建工具,并且看重隐私和无限次 0 美元生成胜过便利性,那就选本地。Wan 2.2 是最安全的基础选项——顶级质量、Apache 2.0、没有细则条款——LTX-2 则是速度与音频方面的专才。
如果你没有硬件、不想折腾搭建,或者需要成品视频而不是原始片段,那就选云端。对大多数只是想制作 AI 生成视频的人来说,云端路线是更轻松的起点:如果你本来就没有本地生成所需的硬件和技术兴趣,InVideo 用一个提示词就能替你消除大部分复杂性,所有模型和素材都已打包,还包含自动化功能——测试起价为 0 美元,去水印起价为每月 17 美元(按年计费)。判断它是否适合你工作流最简单的方法,就是先试用免费版本。
两扇门都通向 AI 视频。问题从来不是哪种技术更好——而是哪种工作流适合你的设备、你的耐心和你的目标。
资料来源
- Wan 2.2 on GitHub——官方仓库、许可证和安装说明。
- Wan 2.2 on Hugging Face——官方模型卡及下载。
- LTX model license——LTX 社区许可证官方条款。
- LTX-2 model page——官方架构和发布详情。
- HunyuanVideo 1.5 on GitHub——官方仓库和 LICENSE 文件,包含欧盟/英国/韩国排除条款。
- VBench-2.0 leaderboard——独立基准测试,用于质量和物理真实性数据。
- InVideo pricing——官方套餐及定价详情。
- InVideo MCP server——官方自动化文档。
- MiniMax H3 on GitHub——官方仓库。
- MiniMax H3 on Hugging Face——官方模型权重。
- InVideo: How Long Does It Take to Make an AI Short Film?——InVideo 自己给出的端到端制作时间数据(2–5 天)。
- ComfyUI system requirements——官方 Mac/Apple Silicon MPS 支持文档。
- LTX Blog: How to Use IC-LoRA in LTX-2——官方角色一致性(IC-LoRA)指南。
