重要なポイント
- Wan 2.2は、ライセンス制限がゼロの唯一のトップクラス・ローカル動画モデルです。 Apache 2.0で商用利用も無制限、収益上限も地域制限もありません。さらにオープンソースのVBench品質スコアでも検証済み最高値(約84.7%)を記録しています。
- InVideoは、Kling 3、Veo 3.1、Seedance 2.5を含む200以上のモデルを、1つのブラウザベースのパイプラインにまとめています。 月額$17から(Plusプラン、年間契約)で、台本・ナレーション・音楽・字幕は自動で処理されます。
- HunyuanVideo 1.5のライセンスは、EU、英国、韓国を明確に除外しています。 モデル本体だけでなく、その出力にも適用されます。これらの地域の読者は代わりにWan 2.2かLTX-2を使ってください。
- LTX-2はローカル3モデルの中で最速で、唯一組み込みの同期音声を持ちます。 年間売上高$10M未満の企業なら商用利用も無料です。
- 本格的なローカル動画生成の現実的な最低ラインはVRAM 12GBです。 それ未満では、InVideoの方が実用的な選択肢になります。
- ローカルモデルが生成するのは5〜20秒の無音の生クリップであり、完成した動画ではありません。 台本、ナレーション、音楽、字幕、編集はそれぞれ別のツールで自分で組み立てる必要があります。InVideoはこれをすべて一度に処理します。
- 「Wan 2.7」は存在しません。 それを提供すると謳うダウンロードページはSEO詐欺です。公式のWanリリースは2.2で止まっています。
なぜ2026年はAI動画にとって奇妙な時期なのか
プロプライエタリな動画市場は混乱を続けています。OpenAIは2026年3月、ローンチからわずか6か月足らずでSoraのコンシューマー向けアプリを終了しました。ダウンロード数がピーク時から約66%減少したためです(APIは別途稼働を続けています)。ByteDanceのSeedance 2.0は同じ月、ハリウッドからの訴訟に直面し、グローバル展開を一時停止しました。Disney、Paramount、Warner Bros.からの停止要求書が原因です。中国国内では引き続き利用可能ですが、国際的な商用利用には法的リスクが伴います。AlibabaのHappyHorseモデルは2026年4月、品質リーダーボードで首位に立ちましたが、一般公開されることはありませんでした。
この混乱こそが、両方の入り口を魅力的なものにしています。オープンなローカルモデルは、ベンダーの騒動から独立した存在です。そしてInVideoは、その混乱をあなたの代わりに吸収します。サブスクリプションには、Kling 3、Veo 3.1、Seedance 2.5を含む200以上のモデルへのアクセスが含まれているため、あるモデルが消えたり訴訟を起こされたりしても、あなたのワークフローは影響を受けません。
ローカルという入り口:自分のGPUで動く3つの無料モデル
ダウンロード数、コミュニティの活動、ベンチマーク結果で見ると、現時点でローカル動画生成を主導しているのは3つのオープンウェイトシステムです。3つとも、ComfyUIというノードベースのインターフェース上で動作します。これは自分のマシンにインストールするもので、Ollamaのようなチャット形式のツールではありません。これらは拡散モデル(diffusion model)であり、LLMではありません。
📍 一文で説明
Wan 2.2は2026年時点で最もバランスの取れたローカル動画モデルです。Apache 2.0で最高品質、制限なし。一方LTX-2は速度と同期音声で優れ、HunyuanVideo 1.5は最も映画的な見た目を持ちますが、ライセンス上EU/英国/韓国のユーザーは利用できません。
💬 簡潔に説明
一つだけ答えが欲しいなら、VRAM 12GB以上のGPUを用意してWan 2.2を使ってください。品質が最も高く、ライセンスもシンプルで、細かい注意点もありません。
| モデル | ライセンス | VRAM | 出力 | 特長 |
|---|---|---|---|---|
| Wan 2.2(Alibaba) | Apache 2.0 — 制限なし | 6〜8GB(5B)/15〜25GB(14B) | 480p/720p、約5秒のクリップ | 検証済みVBench品質スコア最高値(約84.7%) |
| LTX-2(Lightricks) | LTXコミュニティライセンス — 年間売上$10M未満は無料 | 量子化で18〜20GB、フル精度で32GB以上 | 480p〜1080p、5〜20秒、音声付き | 映像と音声を同時に同期生成できる唯一のモデル |
| HunyuanVideo 1.5(Tencent) | Tencentコミュニティライセンス — EU/英国/韓国を除外 | 最低14GB、快適には24GB | 480p/720p、最長10秒 | 映画的なライティングでコミュニティの人気が高く、VRAM消費も最も軽い |
⚠️ 詐欺注意:「Wan 2.7」は存在しません。「Wan 2.7のオープンウェイトを提供する」と謳うダウンロードページはSEO詐欺です。公式のWanリリースは2.2で止まっています。下記の公式GitHubまたはHugging Faceリポジトリからのみダウンロードしてください。
Wan 2.2(Alibaba)— 品質の王者、正真正銘の無料
Wan 2.2は最も広く使われているオープンな動画モデルです。I2V-A14Bリポジトリだけで、1か月あたり約424万件のHugging Faceダウンロードを記録し、数百のコミュニティ派生版が作られています。T2V-A14BとI2V-A14B(Mixture-of-Experts、合計27B/アクティブ14Bパラメータ)に加え、テキストと画像の両方から動画を生成できるコンパクトなTI2V-5Bの3種類が提供されており、TI2V-5Bはわずか6〜8GBのVRAMで動作します。14Bクラスは15GB(GGUF Q3)から25GB(FP8)が必要で、公式の非量子化版は80GBを要求します。ライセンスはApache 2.0で、商用利用も無制限、収益しきい値も地域制限も一切ない、正真正銘の無料モデルです。
速度について具体的に: RTX 4090では5秒のクリップ1本の生成に約4〜9分かかります(これは独立した1件の報告値です。Wan 2.2はネイティブでは1回のパスでより長いクリップを出力しません)。20秒のシーケンスを作るには、5秒のクリップを4本生成してつなぎ合わせる必要があり、生の生成時間だけで約16〜36分、さらにスムーズにつなげるための手作業の編集が加わります。この範囲は1クリップあたりの数値からの外挿であり、20秒を直接計測したベンチマークではありません。
LTX-2(Lightricks)— 速度と同期サウンド
LTX-2は、この3つの中で唯一、1回のパスで同期した音声と映像を生成するモデルです。足音、環境音、効果音が映像と同時に生成されます。また3つの中で最速であり、ハードウェアへの要求も最も緩やかです。アーキテクチャは22Bの拡散トランスフォーマーで、LTX-2.3(2026年3月)は現行のLTX-2.5リリースと並んで引き続き完全サポートされています。ライセンスはLTXコミュニティライセンスで、会社の年間総売上が$10M未満であれば商用利用は無料、それを超える場合は有料の商用ライセンスが必要です(一部のサードパーティ記事はApache 2.0だと誤って記載していますが、公式ライセンスページのみが信頼できる情報源です)。ハードウェア要件は量子化で18〜20GB、フル精度で32GB以上のVRAMです。12GBのカードでは、旧世代のLTX-Video 0.9.5が現実的な選択肢として残ります。
速度について具体的に: LTX-2は定性的には3つの中で最速で、ハイエンドなコンシューマーカードではほぼリアルタイムのプレビューが可能です。ただし、本記事執筆時点でRTX 4090上での独立検証済みの「1クリップあたり何分」という数値は存在しないため、ここでは推測を書きません。唯一入手できる確かな数値は、Lightricks自身によるデータセンター級「NVIDIAスーパーチップ」(コンシューマー向けGPUではありません)でのベンチマークで、10秒のクリップを約6.8秒で生成したというものです。これは本格的なハードウェアでこのアーキテクチャが達成できる上限値として捉えるべきであり、自宅のマシンで得られる数値ではありません。
HunyuanVideo 1.5(Tencent)— 映画的な見た目、ただし法的な注意点あり
2025年11月にリリースされたTencentの8.3Bモデルは、映画的なライティングと質感でコミュニティの人気を集めており、3つの中でVRAM消費が最も軽いモデルです。オフロードを使えば最低14GB、快適に使うなら24GBで、RTX 4090では480pのクリップ1本あたり約75秒かかります。ネイティブで480p/720pを生成し、内蔵の超解像機能で1080pまで対応、クリップ長は最長10秒です。
速度について具体的に: 480pの5秒クリップ1本あたり約75秒ということは、動画1秒あたり約15秒のレンダリング時間がかかる計算です。ネイティブの最大クリップ長は10秒のため、20秒のシーケンスを作るには最大長での生成を2回行う必要があります。1秒あたりのレートから外挿すると、20秒分の映像を生成する生の時間はおよそ5分、これにつなぎ合わせの作業が加わります。これは5秒クリップの実測値からの外挿であり、10秒や20秒を直接計測したベンチマークではありません。
⚠️Warning: ライセンスに関する警告 — ダウンロード前にお読みください。HunyuanVideo 1.5はTencent Hunyuanコミュニティライセンスを採用しており、Apache 2.0ではありません。このライセンスは欧州連合、英国、韓国には適用されません。これらの地域のユーザーは、モデル本体もその出力も利用する権限がありません。また、月間アクティブユーザー数1億人という上限があり、その出力を使って競合モデルを学習させることも禁止されています。EU、英国、韓国にお住まいの場合は、このモデルを避けてください。Wan 2.2なら同等の品質クラスを、制限ゼロで利用できます。
注目株:MiniMax H3
2026年8月3日にリリースされたMiniMax H3は、ネイティブなステレオ音声、リリース初日からのComfyUIサポート、そしてRTX 3060でも動く量子化バージョンを備えた33.1Bのオムニモーダルモデルです。これを4つ目の選択肢として扱う前に、2つの注意点があります。ローカル版の解像度は768pが上限で(フル2Kパイプラインはホスト型のみ)、そのコミュニティライセンスには独自の地域制限と$20Mの売上しきい値があると報告されています。決定する前に必ず公式のモデルカードを確認してください。初期の評判は良好ですが、公開から3週間というのは、まだ本番運用に耐えるかどうかとは別の話です。
ハードウェアという関門
ローカル動画生成が「無料」なのは、子犬が「無料」なのと同じ意味です。モデルの重み自体にはコストがかかりませんが、GPUこそが本当の参入コストです。GPUのVRAMが12GB未満で、アップグレードの予定もない場合は、ローカル生成は最初から見送るべきです。上記3モデルはいずれも、このクラス以下では実用的な品質で動作せず、クラウドプラットフォームの方が速く良い結果を得られます。
自分のマシンがどのクラスに当たるか分からない場合は、以下のガイドが参考になります。モデルごとの正確な要件はVRAM Calculator、モデルサイズ別の一覧表はHow Much VRAM Do You Need?、ハードウェア選びにはBest GPUs for Local AIとBest Budget GPUs、プラットフォーム比較にはGPU vs CPU vs Apple Siliconをご覧ください。一つ正直に断っておくと、これらのガイドはLLM用のVRAM計算式(パラメータ数×ビット数÷8)を使っています。動画拡散モデルの場合はVRAM使用量が解像度とクリップ長にも比例して増えるため、これらの数字は動画ワークロードにおいては下限であり上限ではないと考えてください。
| お使いのGPU | 実行可能なモデル |
|---|---|
| VRAM 6〜8GB | Wan 2.2 TI2V-5B(量子化)— 実用的、エントリー品質 |
| VRAM 12GB | LTX-Video 0.9.5 — このクラスで唯一の実用的な選択肢 |
| VRAM 16GB | HunyuanVideo 1.5(ライセンス条件が合えば)、Wan 2.2 14B(GGUF Q3) |
| VRAM 24GB以上 | すべて対応:高品質のWan 2.2 14B、量子化LTX-2 |
2026年8月時点のおおよそのハードウェア費用(kakaku.com・price-rank.com調べ):中古のRTX 3060 12GBは約¥28,000〜35,000、中古のRTX 3090は在庫不足の影響で価格が高騰しており約¥130,000〜180,000程度です。GPU価格は変動が大きいため、数か月以上前のこの数字を鵜呑みにせず、購入前に必ず最新価格を確認してください。
ローカル動画生成の運用が実際に求めること
ローカルモデルを使うということは、動画ツールを1つインストールするのではなく、パイプライン全体を自分で組み立てるということです。
生成環境の構築。 ComfyUIはノードベースです。ローダー、サンプラー、デコーダーからなるワークフローグラフを、自分で構築するか、あるいはインポートしてデバッグする必要があります。最初のフレームがレンダリングされるまでに、CUDAバージョンの不一致、PyTorchのバージョン固定、flash_attnのインストールエラーなどに遭遇することを覚悟してください。
プロンプトの作成。 動画モデルには、ショットタイプ、カメラの動き、ライティング、被写体の動作といった構造化されたプロンプトが必要で、一行だけの指示では不十分です。組み込みのプロンプトヘルパーもシステムプロンプト層もなく、構造全体を自分で書く必要があります。system prompts vs. user promptsとprompt engineering for local modelsのガイドで扱う基本は、そのまま動画プロンプティングにも応用できます。
クリップの周辺にあるすべて。 ローカルモデルが出力するのは、5〜20秒の無音(LTXを除く)の生クリップです。台本、ナレーション、音楽、ストック映像、字幕、編集は、それぞれ別のツールを自分で選び、インストールし、つなぎ合わせる必要があります。
弱い例(一行だけ)
“A dog on a beach(浜辺の犬)”
構造化された例(動画モデルに必要なもの)
“Golden retriever sprinting along a wet shoreline at golden hour, low tracking shot following from the side, shallow depth of field, warm backlight, gentle slow motion, cinematic 24fps(黄金色の夕暮れ時、濡れた海岸線を走るゴールデンレトリバー。横から追う低アングルのトラッキングショット、浅い被写界深度、暖色の逆光、緩やかなスローモーション、シネマティックな24fps)”
クラウドという入り口:InVideoがまとめて提供するもの
ローカルセットアップなしでAI動画を作りたいですか? パワフルなGPUを持っていない、あるいはローカルAI動画ツールのインストールと設定に何時間もかけたくないなら、InVideoを試してみる価値があります。InVideoの無料版を試す →
InVideoはクラウドという入り口の一例であり、唯一の選択肢ではありません。「クラウド」がすべて同じ意味だと思い込む前に、他のサービスとどう違うのか知っておく価値があります。Runwayはプロ向け編集ソフト(Premiere Pro、Final Cut、DaVinci Resolve)に直接統合されており、完成した1本の動画を組み立てるというより、AIと編集者を組み合わせたハイブリッドワークフローを想定しています。Luma AIのDream Machineは、VFX合成パイプライン(After Effects、Nuke)向けのネイティブ16ビットHDR出力に特化しており、まったく異なる層のユーザーを対象としています。Pikaは軽量さを維持しており、高速な生クリップ生成に特化する一方、台本・ナレーション・ストック映像の組み立て機能は内蔵していません。つまり、クリップの周辺にあるすべてのために別のツールが必要になる点は、ローカルモデルを動かすのと同じDIYパイプラインの問題であり、違いはGPUが不要という点だけです。この3つと比べてInVideoが際立っているのは、InVideoが主に生成専用ツールではないという点です。台本から完成動画までを組み立てるアセンブラーであり、必要なときにはKling、Veo、Seedanceといった生成モデルへのアクセスも提供します。
InVideoは動画モデルではなく、制作パイプライン全体をサービスとして提供するものです。トピックを入力するか台本を貼り付けるだけで、v4エージェントが最長30分の完成した動画を返します。AI生成の台本、1,600万点以上のストック素材ライブラリまたは新規生成クリップから組み立てられたシーン、50以上の言語に対応するAIナレーション(音声クローンを含む)、音楽、字幕、ブランドキットのスタイリングまで含まれます。すべてブラウザ上で動作するため、自分のGPU性能は関係ありません。
GPUの調査や量子化フォーマットの勉強ではなく、今すぐ動画作りを始めたい人にとって、InVideoは現実的な選択肢です。ローカルハードウェアも、ComfyUIのインストールも、CUDAのトラブルシューティングも不要で、台本・ナレーション・音楽・字幕まで、ほとんどの人が実際に必要とする要素を1つのワークフローで完結できます。生成モデルそのものを細かく制御することより、完成した動画を重視するクリエイターに特に向いています。無料プランがあるため、何かを支払う前にそれが自分に合うかどうかを確かめられます。
この比較において特に際立つ点が3つあります。
- モデルの混乱を吸収してくれる。 すべての有料プランには、Seedance 2.5、Veo 3.1、Kling 3を含む200以上のモデルへのアクセスが含まれます。あるモデルが訴訟を起こされたり停止したりしても、InVideoが差し替えてくれるため、あなたのワークフローは続行できます。
- 自動化が後付けではなく組み込まれている。 公式のMCPサーバーがあるため、プロンプト→台本→映像→字幕という一連のパイプライン全体をプログラムから起動できます。本来ComfyUIの周りに自分で構築するようなハーネスが、最初から用意されています。
- 無料プランは本物の試乗になる。 透かしと分数制限はありますが、支払う前に出力品質を判断するには十分です。
速度について具体的に、そして正直な注意点: 1回の生成自体は速く、通常は数分です。しかし、InVideo自身のFAQによれば、ショートフィルムのエンドツーエンドの制作全体には数分ではなく2〜5日かかるとされています。時間がかかるのは生成そのものではなく、複数の生成候補の中から選び、組み立てる作業だからです。1〜3分の完成した映像に対して「現実的な最低ラインとして2日」という数字を、ローカルの入り口で20秒の未編集映像を作るのにかかる16〜36分の生の生成時間と公平に比較すべきです。InVideoは、あなた自身のセットアップ時間と編集時間を、InVideo側の制作時間と引き換えているのであり、時間そのものをゼロにするわけではありません。
現在のプランは月額$17から(Plusプラン、年間契約、2026年8月時点で確認済み。最新の数字はInVideoの料金ページで確認してください):
| プラン | 価格 | 月間クレジット | 最適な用途 |
|---|---|---|---|
| Free | $0 | 制限あり | お試し利用(透かしあり) |
| Plus | $17/月($200/年) | 75 | 定期的に制作するクリエイター向け — 全AIモデル、アバター4体+音声クローン、iStock素材100点、透かしなしの無制限エクスポート |
| Max | $85/月($1,000/年) | 390 | 大量制作のチャンネル向け、アバター16体 |
| Generative | $170/月($2,000/年) | 800以上 | ショートフィルム/制作ボリューム向け |
| Elite | $900/月($10,800/年) | 4,250以上 | シリーズ制作・商業規模向け |
上記の価格はすべて2026年8月時点の年間契約レートです。月払いの場合はさらに高くなります(InVideo自身のFAQによると、Plus $20、Max $100、Generative $200、Elite $1,000/月)。プランと価格は変更されるため、依存する前に必ずInVideoの最新の料金ページを確認してください。
クラウドかローカルか:あなたに合う入り口は?
短くまとめると、よくある状況ごとの推奨は次のとおりです。
| あなたの状況 | 推奨 |
|---|---|
| GPUがない、またはVRAM 12GB未満 | InVideo(クラウド)— このクラス以下ではどのローカルモデルもうまく動きません |
| 生のクリップではなく、ナレーション付きの完成した動画が欲しい | InVideo(クラウド)— ローカルモデルは完全な制作物を組み立ててくれません |
| 納期優先で、セットアップの手間を一切許容できない | InVideo(クラウド) |
| VRAM 12GB以上のGPUがあり、セットアップに抵抗がなく、プライバシーと限界費用$0を重視する | ローカル:LTX-Video(12GB)またはWan 2.2(フル品質には24GB) |
| EU、英国、韓国在住 | ローカルはWan 2.2かLTX-2のみ(HunyuanVideoのライセンス対象外) |
| 自分で構築せずに大規模な自動化・APIが必要 | InVideo(クラウド、MCPサーバー) |
InVideoを選ぶべきなのは誰か?
どちらのルートが自分に合うか分からないですか? ハードウェアと技術的なセットアップを避けたいなら、一番手軽な実験方法は、まずInVideoを試してワークフローが自分に合うか確かめることです。InVideoを無料で試す →
InVideoの方が良い選択になりやすいのは、次のような方です。
- パワフルなGPUを持っていない
- すぐに動画制作を始めたい
- ComfyUI、CUDA、モデル、Python環境のインストールや設定をしたくない
- 複数のローカルツールを組み合わせるより、統合されたワークフローが欲しい
- 台本、音声、音楽、字幕、動画生成を1つのワークフローで済ませたい
- 基盤となるモデルを試すことより、完成した動画そのものを重視する
ローカルAIの方が良い選択になりやすいのは、次のような方です。
- すでに適切なGPUハードウェアを持っている
- 最大限のコントロールが欲しい
- モデルやワークフローを自由に試したい
- 高い技術スキルを持っている
- 生成をローカルで完結させることを優先する
- 非常に大量の生成を見込んでおり、限界生成コストを最適化したい
実際の動作を見る
- 4 Open Source AI Video Models Compared — Which One's Actually Free? — LTX 2.3、Wan 2.2、HunyuanVideo 1.5、MiniMax H3の出力を並べて比較。ライセンスの細則も解説。
- InVideo Agent One Review — プロンプトから完成動画までの全ワークフローを紹介。
- Wan 2.2 Full Local Demo — コンシューマー向けハードウェアでの正直なレンダリング時間(発売週、2025年7月)。
- Low-VRAM Wan 2.2 Tutorial — 14BモデルをVRAM 6GBのノートPCで動かす方法(2025年)。
FAQ
VRAM 8GBでAI動画生成は実行できますか?
ぎりぎり可能です。Wan 2.2のTI2V-5Bバリアントは量子化すれば6〜8GBで動作しますが、品質は下がり、クリップ長も短くなります。本格的なモデルを動かすなら、実質的な最低ラインは12GBです。それを下回る場合は、InVideoのようなクラウドツールが現実的な答えです。
Wan 2.2は本当に商用利用が無料ですか?
はい。Apache 2.0ライセンスで、商用利用は無制限、収益上限も地域制限もなく、あなたの生成物に対する権利主張もありません。トップクラスのローカルモデルの中で、細かい注意点が一切ない唯一のモデルです。
HunyuanVideoはEUや英国で使えますか?
いいえ。Tencent Hunyuanコミュニティライセンスは、EU、英国、韓国には明確に適用されません。これはモデル本体だけでなく、その出力にも及びます。代わりにWan 2.2かLTX-2を使ってください。
InVideoを使うのにGPUは必要ですか?
不要です。InVideoはすべてブラウザ上で動作し、生成処理はすべてInVideo側のインフラで行われます。5年前のノートPCでも問題なく使えます。
ローカルモデルだけでナレーション付きの完成したYouTube動画を作れますか?
それ単体では作れません。ローカルモデルが生成するのは5〜20秒の生クリップです(LTX-2は同期音声を含みますが、他は無音です)。台本、ナレーション、音楽、字幕、編集はそれぞれ別のツールが必要で、パイプラインとして自分で組み立てる必要があります。
「無料」のローカルAI動画には、実際どんな落とし穴がありますか?
ハードウェア費用(対応可能なGPU)、セットアップにかかる時間(ComfyUIとその依存関係)、そして生の出力クリップの周りに必要なDIYパイプラインです。モデルの重み自体は、生成1回あたり本当に永久に$0です。
Wan 2.7や、それより新しいWanモデルはありますか?
いいえ。公式のWanリリースは2.2で止まっています。「Wan 2.7のウェイト」を提供すると謳うサイトは詐欺です。公式のGitHubかHugging Faceリポジトリからのみダウンロードしてください。
完全な初心者です。何から始めればいいですか?
InVideoの無料プランから始めてください。数分でナレーション付きの完成した動画が手に入り、AI動画がそもそも自分の目的に合うかどうかを判断できます。後から対応可能なGPUを購入し、フルコントロールとプライバシーが欲しくなったら、ローカルという入り口はいつでも開いています。
これらのローカルモデルをMacとWindowsで動かす場合、何が違いますか?
ComfyUIはApple Silicon(M1〜M4)上でも、PyTorchのMPSバックエンド経由で動作しますが、同等のNVIDIA GPUと比べて生成速度はおよそ3〜5倍遅くなると考えてください。使えないわけではありませんが、速度面では競争力がありません。より実務的な問題はソフトウェアサポートです。これらのモデルが依存するCUDA固有の最適化(flash-attention、GGUF/FP8量子化ツール群)はMac上では成熟度が低く、多くのコミュニティ製ワークフローやインストールガイドはWindowsまたはNVIDIAカード搭載のLinuxを前提としているため、調整が必要になったり、ドキュメント通りには動かなかったりする場合があります。一つ利点があるとすれば、Apple Siliconのユニファイドメモリにより、同等のVRAMを持つディスクリートGPUよりも大きなモデルをメモリに収められる場合があることです。速度は遅くなりますが。ローカル動画生成専用にハードウェアを購入するなら、WindowsまたはLinux+NVIDIAがサポートの充実した選択肢です。すでに持っているMacで試すのは問題ありませんが、本格的なスループットを求めるなら推奨される選択肢ではありません。
複数のローカル動画クリップにわたって、同じキャラクターの一貫性を保てますか?
はい、ただし追加の作業が必要です。3モデルのいずれも、別々の生成間でこれを標準機能として保証していません。実用的な方法は2つあります。同じ参照画像をimage-to-videoモード(3モデルともI2Vをサポート)に入力する方法、またはキャラクター用に小さなLoRAを学習させる方法です。Wan 2.2とLTX-2の両方に、これ用の文書化されたLoRAワークフローがあります。LTX-2版はIC-LoRA(in-context LoRA)と呼ばれ、複数キャラクターの一貫性を明示的にサポートしています。コミュニティの見解は一致しており、学習済みのLoRAは、プロンプトや参照画像だけを使う場合よりもはるかに信頼できる結果を出します。InVideoのブランドキットとAIアバター機能は、同じ根本的な課題を別の方法で解決します。一度設定すれば繰り返し使える固定のアバターと音声プロファイルで、学習は不要です。
決める前に試す
ローカルGPUのセットアップや有料サブスクリプションにコミットしなくても、クラウドワークフローを評価することはできます。ハードウェアを購入したり、週末をComfyUIに費やしたりする前に、まず逆方向に5分使ってみる価値があります。
1. InVideoの無料版を試す。 2. 短い動画を1本作成する。 3. 出力品質と、ワークフローの使い心地を評価する。 4. その体験を、ローカルインストールにかかるセットアップの手間と比較する。
こうすることで、比較は単に読むものから、この記事の残りを読み終えるより短い時間で自分自身で試せるものへと変わります。
結論
VRAM 12GB以上のGPUを持っている(あるいはこれから購入する予定がある)、自分のツールを組み立てるのが好き、そしてプライバシーと無制限で$0の生成を利便性より重視するなら、ローカルを選んでください。Wan 2.2が最も安全な土台です。最高品質、Apache 2.0、細かい注意点なし。速度と音声を重視するならLTX-2が専門です。
ハードウェアがない、セットアップをしたくない、あるいは生のクリップではなく完成した動画が必要なら、クラウドを選んでください。単にAI生成の動画を作りたいだけのほとんどの人にとって、クラウドの方が入り口として簡単です。ローカル生成に必要なハードウェアと技術的な関心がまだないなら、InVideoはそのほとんどの複雑さを1つのプロンプトで取り除いてくれます。すべてのモデルと素材がまとめられ、自動化も含まれており、お試しは$0から、透かしを外すには月額$17(年間契約)からです。自分のワークフローに合うかどうかを知る一番簡単な方法は、無料版を試してみることです。
どちらの入り口も、AI動画へとつながっています。問われるべきなのは、どちらの技術が優れているかではなく、どちらのワークフローが自分のマシン、忍耐力、目的に合っているかです。
出典
- Wan 2.2 on GitHub — 公式リポジトリ、ライセンス、セットアップ手順。
- Wan 2.2 on Hugging Face — 公式モデルカードとダウンロード。
- LTX model license — 公式のLTXコミュニティライセンス条項。
- LTX-2 model page — 公式のアーキテクチャとリリース詳細。
- HunyuanVideo 1.5 on GitHub — 公式リポジトリとLICENSEファイル。EU/英国/韓国の除外を含む。
- VBench-2.0 leaderboard — 品質と物理的整合性の数値に使用された独立ベンチマーク。
- InVideo pricing — 公式プランと料金の詳細。
- InVideo MCP server — 公式の自動化ドキュメント。
- MiniMax H3 on GitHub — 公式リポジトリ。
- MiniMax H3 on Hugging Face — 公式モデルウェイト。
- InVideo: How Long Does It Take to Make an AI Short Film? — InVideo自身によるエンドツーエンドの制作時間データ(2〜5日)。
- ComfyUI system requirements — 公式のMac/Apple Silicon MPSサポートドキュメント。
- LTX Blog: How to Use IC-LoRA in LTX-2 — 公式のキャラクター一貫性(IC-LoRA)ガイド。
