Skip to main content
PromptQuorum
主页/本地LLM进阶/InVideo 与本地 AI 视频对比:一个 0 美元加你的周末,另一个 17 美元
Image & Video Generation

InVideo 与本地 AI 视频对比:一个 0 美元加你的周末,另一个 17 美元

·阅读约10分钟·Hans Kuepper 作者 · PromptQuorum创始人,多模型AI调度工具 · PromptQuorum

对大多数拥有 12GB 以上显存 GPU 的用户来说,Wan 2.2 是 2026 年最好的本地 AI 视频模型——采用 Apache 2.0 许可,无营收上限、无地区限制,且拥有所有开放模型中公开验证的最高质量分数(VBench 约 84.7%),完全免费。如果你没有这样的 GPU,或者想要一段成品旁白视频而不是一段原始片段,InVideo 是更好的选择——其 Plus 套餐起价为每月 17 美元(按年计费),将 200 多个模型(包括 Kling 3、Veo 3.1 和 Seedance 2.5)打包进一个基于浏览器的流水线,脚本、配音、音乐和字幕全部包含在内。HunyuanVideo 1.5 拥有最具电影感的本地画面效果,但其许可证完全排除了欧盟、英国和韩国——如果你身处这些地区,请跳过这个模型。

2026 年,通往 AI 视频有两扇门。第一扇是本地:免费、开放的视频模型运行在你自己的 GPU 上——无限次生成、完全私密、无需订阅,但整个工作流程要你自己搭建。第二扇是云端:InVideo,输入一个提示词,输出的就是一段带旁白的完整视频——脚本、素材片段、配音、音乐和字幕全部包含在内,直接在浏览器里完成。没有哪扇门"更好"。本指南提供大多数对比文章都会跳过的许可证细则、真实的硬件要求,以及一个能把你的实际情况映射到具体建议的决策工具。

本页包含指向第三方产品的参考链接。PromptQuorum 未加入任何联盟计划——这些是不产生佣金的普通链接。点击链接和后续步骤由您自行承担责任。这些链接不代表 PromptQuorum 的任何认可或验证。

InVideo 与本地 AI 视频对比:一个 0 美元加你的周末,另一个 17 美元

关键要点

  • Wan 2.2 是唯一零许可限制的顶级本地视频模型。 Apache 2.0 许可,商业用途不受限,无营收上限,无地区排除——同时拥有已验证开源模型中最高的 VBench 质量分数(约 84.7%)。
  • InVideo 将 200 多个模型——包括 Kling 3、Veo 3.1 和 Seedance 2.5——打包进一个基于浏览器的流水线,起价为每月 17 美元(Plus 套餐,按年计费),脚本、配音、音乐和字幕全部自动处理。
  • HunyuanVideo 1.5 的许可证明确排除欧盟、英国和韩国——模型本身和其输出内容均受限。这些地区的读者应改用 Wan 2.2 或 LTX-2。
  • LTX-2 是三者中速度最快、唯一内置同步音频的模型,年营收低于 1000 万美元的公司可免费商用。
  • 12GB 显存是认真进行本地视频生成的现实底线。 低于这个数字,InVideo 是更实际的选择。
  • 本地模型生成的是 5–20 秒的原始无声片段,而不是成品视频。 脚本、配音、音乐、字幕和剪辑都是需要你自己组装的独立工具——InVideo 一次性完成所有这些工作。
  • 不存在"Wan 2.7"。 提供该版本下载的页面都是 SEO 骗局——Wan 官方发布到 2.2 为止。

为什么 2026 年是 AI 视频领域的一个奇怪时刻

专有视频市场一直处于混乱状态。OpenAI 在 2026 年 3 月关闭了 Sora 消费者应用,距离上线不到六个月,原因是下载量较峰值下滑了约 66%(API 仍独立在线)。字节跳动的 Seedance 2.0 同月陷入好莱坞诉讼并暂停全球推广,起因是迪士尼、派拉蒙和华纳兄弟发出的停止侵权函——该模型在中国仍可使用,但国际商业用途面临法律风险。阿里巴巴的 HappyHorse 模型在 2026 年 4 月登顶质量排行榜——却从未向公众开放。

这种混乱正是两扇门都吸引人的原因。开放的本地模型让你不受供应商风波的影响。而 InVideo 替你承担了这种混乱:它的订阅打包了 200 多个模型的访问权限——包括 Kling 3、Veo 3.1 和 Seedance 2.5——这样当某个模型消失或被起诉时,你的工作流程不会受到影响。

本地这扇门:你自己 GPU 上的三个免费模型

目前有三个开放权重系统主导着本地视频生成领域,以下载量、社区活跃度和基准测试结果衡量。三者都通过 ComfyUI 运行,这是一个安装在你自己机器上的基于节点的界面——不是像 Ollama 那样的聊天式工具。这些是扩散模型,不是大语言模型。

📍 简单一句话

Wan 2.2 是 2026 年综合表现最好的本地视频模型——Apache 2.0、质量最高、无限制——而 LTX-2 在速度和同步音频上胜出,HunyuanVideo 1.5 画面最具电影感,但许可证将欧盟/英国/韩国用户排除在外。

💬 简单来说

如果你只想要一个答案:准备一块 12GB 以上显存的 GPU,运行 Wan 2.2。它质量最好、许可证最简单、没有任何细则条款。

模型许可证显存输出突出特点
Wan 2.2(阿里巴巴)Apache 2.0——无限制6–8GB(5B)/ 15–25GB(14B)480p/720p,约 5 秒片段已验证的最高 VBench 质量分数(约 84.7%)
LTX-2(Lightricks)LTX 社区许可证——年营收低于 1000 万美元可免费使用量化版 18–20GB,完整精度 32GB 以上480p–1080p,5–20 秒,带音频唯一能在单次生成中同步输出音视频的模型
HunyuanVideo 1.5(腾讯)腾讯社区许可证——排除欧盟/英国/韩国最低 14GB,24GB 更舒适480p/720p,最长 10 秒社区偏爱的电影感光影效果;显存占用最轻

⚠️ 骗局提醒:不存在"Wan 2.7"。声称提供"Wan 2.7 开放权重"下载的页面都是 SEO 骗局。Wan 官方发布到 2.2 为止——只从下方链接的官方 GitHub 或 Hugging Face 仓库下载。

Wan 2.2(阿里巴巴)——质量之王,真正免费

Wan 2.2 是部署最广泛的开放视频模型:仅其 I2V-A14B 仓库单月就记录了约 424 万次 Hugging Face 下载量,还衍生出数百个社区变体。它提供三个版本——T2V-A14B 和 I2V-A14B(混合专家架构,总参数 27B / 激活参数 14B),以及一个紧凑的 TI2V-5B,支持文本转视频和图像转视频,最低只需 6–8GB 显存。14B 档位需要 15GB(GGUF Q3)到 25GB(FP8);官方非量化命令要求 80GB。它的许可证是 Apache 2.0——真正免费,商业用途不受限,无营收门槛,无地区排除。

具体速度: 在 RTX 4090 上,单个 5 秒片段大约需要 4–9 分钟(这是一个独立报告的数据——Wan 2.2 原生不能一次输出更长的片段)。要制作一段 20 秒的序列,你需要生成 4 段独立的 5 秒片段再拼接——大约需要 16–36 分钟的原始生成时间,再加上手动剪辑以让它们平滑衔接。这个区间是从单片段数据推算得出的,不是直接测量的 20 秒基准测试结果。

Wan 2.2 on GitHub产品链接 · 已披露Wan 2.2 on Hugging Face产品链接 · 已披露

LTX-2(Lightricks)——速度加同步声音

LTX-2 是这三者中唯一能在单次生成中同步输出音视频的开放模型——脚步声、环境音和特效都随画面一起生成。它也是三者中最快、对硬件最宽容的。其架构是一个 22B 扩散 Transformer;LTX-2.3(2026 年 3 月发布)与当前的 LTX-2.5 版本并行获得完整支持。许可证是 LTX 社区许可证——如果你公司的总营收低于每年 1000 万美元,可免费商用,超过该门槛需要付费商业许可证。(部分第三方文章错误地称其为 Apache 2.0——官方许可证页面才是唯一可靠的来源。)硬件需求为量化版 18–20GB 显存,完整精度 32GB 以上;在 12GB 显卡上,更老的 LTX-Video 0.9.5 仍是实际可行的选择。

具体速度: LTX-2 在定性层面是三者中最快的,在高端消费级显卡上能实现接近实时的预览——但截至本文撰写时,并不存在经独立验证的 RTX 4090 每片段耗时分钟数,因此我们不会编造一个。目前唯一确切的数据来自 Lightricks 自己在数据中心级"Nvidia superchips"(而非消费级 GPU)上的基准测试:一个 10 秒片段大约耗时 6.8 秒。请将其视为这套架构在专业级硬件上能达到的上限,而非你家用设备实际会看到的速度。

LTX-2 on GitHub产品链接 · 已披露LTX-2 on Hugging Face产品链接 · 已披露

HunyuanVideo 1.5(腾讯)——电影感画面,但有法律隐患

腾讯的这个 8.3B 模型于 2025 年 11 月发布,以电影感的光影和质感受到社区青睐,也是三者中显存占用最轻的:通过卸载最低需要 14GB,24GB 更舒适,在 RTX 4090 上生成一个 480p 片段约需 75 秒。它原生生成 480p/720p,通过内置超分辨率可达 1080p,片段最长 10 秒。

具体速度: 以每个 5 秒 480p 片段约 75 秒计算,大约相当于每秒视频需要 15 秒渲染时间。它原生最大片段长度为 10 秒,所以一段 20 秒的序列需要两次最大长度的生成——按每秒速率推算,大约需要 5 分钟的原始生成时间才能得到 20 秒的画面,还不算拼接。这是从已有的 5 秒数据推算出的结果,不是直接测量的 10 秒或 20 秒基准测试。

⚠️Warning: 许可证警告——下载前请先阅读。HunyuanVideo 1.5 使用的是腾讯混元社区许可证,不是 Apache 2.0。该许可证不适用于欧盟、英国或韩国——这些地区的用户无权使用该模型或其输出内容。它还将使用规模上限设定为月活跃用户 1 亿,并禁止使用其输出内容训练竞争模型。如果你身处欧盟、英国或韩国,请跳过这个模型:Wan 2.2 能提供同等质量档位,且零限制。

HunyuanVideo 1.5 on GitHub产品链接 · 已披露HunyuanVideo 1.5 on Hugging Face产品链接 · 已披露

值得关注:MiniMax H3

MiniMax H3 于 2026 年 8 月 3 日发布,是一个 33.1B 全模态模型,原生支持立体声音频,首日就获得 ComfyUI 支持,还提供可在 RTX 3060 上运行的量化版本。在把它当作第四选择之前有两点需要注意:本地版本上限为 768p(完整 2K 流水线仍仅限托管使用),而且据报道其社区许可证附带自己的地区限制和 2000 万美元营收门槛——在使用前请查看官方模型卡。早期迹象良好,但发布仅三周和真正可用于生产环境是两回事。

MiniMax H3 on GitHub产品链接 · 已披露MiniMax H3 on Hugging Face产品链接 · 已披露

硬件门槛

本地视频生成的"免费"就像小狗是"免费"的一样:模型权重不花钱,但 GPU 才是真正的入场费。如果你的 GPU 显存低于 12GB 且不打算升级,就完全跳过本地生成——上述三个模型没有一个能在这个档位以下达到可用质量,云端平台会更快给你更好的输出。

不确定这些数字对你的机器意味着什么?这些指南能帮你理清:显存计算器 提供每个模型的确切要求,你需要多少显存? 提供跨模型规模的图表,本地 AI 最佳 GPU最佳预算 GPU 提供硬件选购建议,GPU vs CPU vs Apple Silicon 提供平台比较。一个诚实的提醒:那些指南使用的是大语言模型显存公式(参数量 × 位数 ÷ 8)。视频扩散模型的显存需求还会随分辨率和片段长度变化,所以对视频工作负载而言,把那些数字当作下限而非上限来看待。

你的 GPU你能运行什么
6–8GB 显存Wan 2.2 TI2V-5B(量化版)——可用,入门质量
12GB 显存LTX-Video 0.9.5——这个档位唯一靠谱的选择
16GB 显存HunyuanVideo 1.5(许可证允许的情况下)、Wan 2.2 14B 的 GGUF Q3 版本
24GB 以上显存全部选项:高质量的 Wan 2.2 14B、量化版 LTX-2

截至 2026 年 8 月的大致硬件成本:二手 RTX 3060 12GB 约 170–220 美元,二手 RTX 3090 组合约 900–1,100 美元。GPU 价格会波动——购买前请核实当前价格,不要在几个月后仍相信这些数字。

运行本地视频生成实际需要做什么

使用本地模型,你安装的不是一个视频工具——而是在组装一条流水线。

生成环境搭建。 ComfyUI 是基于节点的:你需要搭建,或导入并调试,一张由加载器、采样器和解码器组成的工作流图。在渲染出第一帧之前,预计会遇到 CUDA 版本不匹配、PyTorch 版本锁定,以及偶尔出现的 flash_attn 安装错误。

提示词编写。 视频模型需要结构化提示词——镜头类型、运镜方式、光照、主体动作——而不是一句话。没有内置的提示词助手,也没有系统提示层;完整结构要你自己写。我们关于系统提示词与用户提示词本地模型的提示词工程的指南涵盖的基础知识可以直接迁移到视频提示词编写上。

片段之外的一切。 本地模型输出的是 5–20 秒的原始无声片段(LTX 除外)。脚本、配音、音乐、素材片段、字幕和剪辑,每一项都是你需要自己挑选、安装并串联起来的独立工具。

薄弱(一句话)

A dog on a beach

结构化(视频模型需要的)

Golden retriever sprinting along a wet shoreline at golden hour, low tracking shot following from the side, shallow depth of field, warm backlight, gentle slow motion, cinematic 24fps

云端还是本地:哪扇门属于你?

简版对照,映射到常见情况:

你的情况建议
没有 GPU,或显存低于 12GBInVideo(云端)——这个档位以下没有本地模型能表现良好
想要带配音的成品视频,不是原始片段InVideo(云端)——本地模型无法组装完整的成品
截止日期紧迫,零容忍搭建折腾InVideo(云端)
拥有 12GB 以上显存 GPU,愿意折腾搭建,看重隐私和 0 边际成本本地:LTX-Video(12GB)或 Wan 2.2(24GB 达到完整质量)
身处欧盟、英国或韩国本地仅限 Wan 2.2 或 LTX-2(HunyuanVideo 的许可证将你排除在外)
需要大规模自动化/API 而不想自己搭建InVideo(云端,MCP 服务器)

谁应该选择 InVideo?

不确定哪条路适合你? 如果你想避开硬件和技术搭建,最简单的实验就是直接试用 InVideo,看看它的工作流是否适合你的需求。免费试用 InVideo →

如果你符合以下情况,InVideo 可能是更好的选择:

  • 没有强大的 GPU
  • 想立刻开始制作视频
  • 不想安装和配置 ComfyUI、CUDA、模型或 Python 环境
  • 想要一体化工作流,而不是拼凑多个本地工具
  • 需要在同一个工作流中完成脚本、配音、音乐、字幕和视频生成
  • 更在意成品视频,而不是折腾底层模型

如果你符合以下情况,本地 AI 可能是更好的选择:

  • 已经拥有合适的 GPU 硬件
  • 想要最大程度的控制权
  • 想要试验模型和工作流
  • 具备较强的技术能力
  • 优先考虑让生成过程保持本地可控
  • 预计会有非常大的生成量,想优化边际生成成本

看它们实际运行

常见问题

我能在 8GB 显存上运行 AI 视频生成吗?

勉强可以。Wan 2.2 的 TI2V-5B 版本可在 6–8GB 量化条件下运行,但质量降低、片段较短。对于正经的模型,12GB 才是真正的底线——低于这个数字,像 InVideo 这样的云端工具是更实际的答案。

Wan 2.2 真的可以免费商用吗?

是的。它采用 Apache 2.0 许可——商业用途不受限,无营收上限,无地区排除,也不对你的输出内容主张任何权利。它是所有顶级本地模型中唯一没有许可证细则条款的。

我能在欧盟或英国使用 HunyuanVideo 吗?

不能。腾讯混元社区许可证明确规定不适用于欧盟、英国或韩国——这既包括模型本身,也包括其输出内容。请改用 Wan 2.2 或 LTX-2。

使用 InVideo 需要 GPU 吗?

不需要。InVideo 完全在浏览器中运行;所有生成过程都在他们的基础设施上完成。一台五年前的笔记本电脑就能正常使用。

本地模型能生成一段带配音的完整 YouTube 视频吗?

单靠它们本身不行。本地模型生成的是 5–20 秒的原始片段(LTX-2 包含同步音频;其他都是无声的)。脚本、配音、音乐、字幕和剪辑各自需要单独的工具,由你自己组装成一条流水线。

"免费"的本地 AI 视频实际的代价是什么?

硬件成本(一块够强的 GPU)、搭建时间(ComfyUI 及其各种依赖),以及围绕原始输出片段所需的 DIY 流水线。模型权重本身确实每次生成都是 0 美元,永远如此。

有 Wan 2.7 或更新的 Wan 模型吗?

没有。Wan 官方发布到 2.2 为止。任何提供"Wan 2.7 权重"的网站都是骗局——只从官方 GitHub 或 Hugging Face 仓库下载。

我是完全的新手,应该从哪里开始?

InVideo 的免费套餐——几分钟内你就能拿到一段带旁白的成品视频,并判断 AI 视频是否真的对你有用。如果之后你买了一块够强的 GPU,想要完全的控制权和隐私,本地这扇门依然敞开。

在 Mac 和 Windows 上运行这些本地模型有什么区别?

ComfyUI 可以通过 PyTorch 的 MPS 后端在 Apple Silicon(M1–M4)上运行,但生成速度大约比同等级 NVIDIA GPU 慢 3–5 倍——可用,但速度上不具竞争力。更实际的问题在于软件支持:这些模型依赖的 CUDA 专属优化(flash-attention、GGUF/FP8 量化工具)在 Mac 上远不够成熟,因此不少社区工作流和安装指南默认使用 Windows 或 Linux 加 NVIDIA 显卡,可能需要调整,或者干脆无法按文档运行。一个优势是:Apple Silicon 的统一内存能让你装下比同等显存的独立 GPU 更大的模型,尽管运行速度较慢。如果你是专门为本地视频生成购买硬件,Windows 或 Linux 加 NVIDIA 是支持完善的路线;如果你已经有一台 Mac,拿来做实验没问题,但不建议作为追求高产量的目标平台。

我能在多个本地视频片段之间保持同一个角色一致吗?

可以,但需要额外的功夫——这三个模型都不会在不同的独立生成之间自动保证这一点。两种有效的方法是:把同一张参考图片输入图像转视频模式(三者都支持 I2V),或者为你的角色训练一个小型 LoRA。Wan 2.2 和 LTX-2 都有针对这个用途的成熟 LoRA 工作流——LTX-2 的版本叫 IC-LoRA(上下文内 LoRA),明确支持多角色一致性。社区的共识很一致:训练好的 LoRA 比单纯依靠提示词或参考图片可靠得多。InVideo 的品牌套装和 AI 数字人功能用不同的方式解决了同一个底层问题——一个只需配置一次、可反复使用的固定数字人和声音档案,无需训练。

决定前先试用

试用 InVideo 免费版 →

你不需要为了评估云端工作流而先投入一套本地 GPU 配置——或一份付费订阅。在购买硬件或花一个周末折腾 ComfyUI 之前,值得先花五分钟反过来试一试:

1. 试用 InVideo 的免费版本。 2. 制作一段短视频。 3. 评估输出质量以及工作流的使用体验。 4. 将这次体验与本地安装所需的搭建成本做对比。

这样一来,这个对比就从"读来的信息"变成了"你自己能测试的东西",而且花费的时间比读完本文剩余部分还要短。

结论

如果你拥有(或打算购买)12GB 以上显存的 GPU,喜欢自己搭建工具,并且看重隐私和无限次 0 美元生成胜过便利性,那就选本地。Wan 2.2 是最安全的基础选项——顶级质量、Apache 2.0、没有细则条款——LTX-2 则是速度与音频方面的专才。

如果你没有硬件、不想折腾搭建,或者需要成品视频而不是原始片段,那就选云端。对大多数只是想制作 AI 生成视频的人来说,云端路线是更轻松的起点:如果你本来就没有本地生成所需的硬件和技术兴趣,InVideo 用一个提示词就能替你消除大部分复杂性,所有模型和素材都已打包,还包含自动化功能——测试起价为 0 美元,去水印起价为每月 17 美元(按年计费)。判断它是否适合你工作流最简单的方法,就是先试用免费版本。

两扇门都通向 AI 视频。问题从来不是哪种技术更好——而是哪种工作流适合你的设备、你的耐心和你的目标。

资料来源

← 返回 本地LLM进阶