핵심 요점
- Wan 2.2는 라이선스 제한이 전혀 없는 유일한 최상위급 로컬 비디오 모델입니다. Apache 2.0으로 상업적 사용에 제한이 없고, 매출 상한도 지역 제한도 없습니다 — 그리고 검증된 오픈소스 VBench 품질 점수 중 가장 높은 수치(약 84.7%)를 기록했습니다.
- InVideo는 Kling 3, Veo 3.1, Seedance 2.5를 포함한 200개 이상의 모델을 하나의 브라우저 기반 파이프라인으로 묶습니다. 월 $17(Plus 플랜, 연간 결제)부터 시작하며 스크립트, 음성, 음악, 자막이 자동으로 처리됩니다.
- HunyuanVideo 1.5의 라이선스는 EU, 영국, 대한민국을 명시적으로 제외합니다 — 모델 자체와 그 결과물 모두에 적용됩니다. 해당 지역의 독자는 대신 Wan 2.2나 LTX-2를 사용해야 합니다.
- LTX-2는 로컬 3종 중 가장 빠르며, 동기화된 오디오를 내장한 유일한 모델입니다. 연 매출 $10M 미만의 기업에는 상업적으로 무료입니다.
- 진지한 로컬 비디오 생성의 현실적인 최저 기준은 VRAM 12GB입니다. 그 이하에서는 InVideo가 더 실용적인 선택이 됩니다.
- 로컬 모델은 완성된 비디오가 아니라 5~20초 길이의 원시 무음 클립을 생성합니다. 스크립트, 음성, 음악, 자막, 편집은 각각 별도의 도구를 직접 조합해야 합니다 — InVideo는 이 모든 것을 한 번에 처리합니다.
- "Wan 2.7"이라는 모델은 존재하지 않습니다. 이를 제공한다는 다운로드 페이지는 SEO 사기입니다 — 공식 Wan 릴리스는 2.2에서 멈춰 있습니다.
2026년이 AI 비디오에 있어 이례적인 시기인 이유
독점(proprietary) 비디오 시장은 혼란스러웠습니다. OpenAI는 출시 6개월도 채 되지 않은 2026년 3월, 다운로드 수가 최고점 대비 약 66% 하락한 후 소비자용 Sora 앱을 종료했습니다(API는 별도로 계속 운영됩니다). ByteDance의 Seedance 2.0은 같은 달 Disney, Paramount, Warner Bros.로부터 중지 요청서(cease-and-desist letter)를 받은 후 할리우드 소송에 휘말려 글로벌 출시가 중단되었습니다 — 중국 내에서는 계속 이용 가능하지만 국제 상업적 사용에는 법적 위험이 따릅니다. Alibaba의 HappyHorse 모델은 2026년 4월 품질 리더보드 1위를 차지했지만 일반에는 공개되지 않았습니다.
바로 이런 혼란이 두 문 모두를 매력적으로 만듭니다. 개방형 로컬 모델은 여러분을 벤더의 드라마로부터 자유롭게 합니다. 그리고 InVideo는 그 드라마를 대신 흡수합니다. 이 구독 서비스는 Kling 3, Veo 3.1, Seedance 2.5를 포함한 200개 이상의 모델에 대한 접근을 번들로 제공하므로, 어떤 모델이 사라지거나 소송을 당해도 여러분의 워크플로우는 영향을 받지 않습니다.
로컬 문: 자신의 GPU에서 실행하는 무료 모델 3종
현재 다운로드 수, 커뮤니티 활동, 벤치마크 결과를 기준으로 로컬 비디오 생성 분야를 지배하는 오픈 웨이트 시스템은 세 가지입니다. 세 모델 모두 자신의 컴퓨터에 설치하는 노드 기반 인터페이스인 ComfyUI를 통해 실행됩니다 — Ollama 같은 채팅형 도구가 아닙니다. 이들은 LLM이 아니라 디퓨전(diffusion) 모델입니다.
📍 한 문장으로
Wan 2.2는 2026년 가장 전반적으로 우수한 로컬 비디오 모델입니다 — Apache 2.0, 최고 품질, 제한 없음 — LTX-2는 속도와 동기화된 오디오에서 앞서며, HunyuanVideo 1.5는 가장 영화적인 화질을 제공하지만 라이선스상 EU/영국/대한민국 사용자를 제외합니다.
💬 쉽게 말하면
하나의 답만 원한다면: 12GB 이상의 GPU를 마련하고 Wan 2.2를 실행하십시오. 최고 품질, 가장 단순한 라이선스, 별다른 세부 조항이 없습니다.
| 모델 | 라이선스 | VRAM | 출력 | 특징 |
|---|---|---|---|---|
| Wan 2.2 (Alibaba) | Apache 2.0 — 제한 없음 | 6~8GB (5B) / 15~25GB (14B) | 480p/720p, 약 5초 클립 | 검증된 VBench 품질 점수 최고치(약 84.7%) |
| LTX-2 (Lightricks) | LTX 커뮤니티 라이선스 — 매출 $10M 미만은 무료 | 18~20GB 양자화, 32GB 이상(풀 정밀도) | 480p~1080p, 5~20초, 오디오 포함 | 한 번에 동기화된 오디오+비디오를 생성하는 유일한 모델 |
| HunyuanVideo 1.5 (Tencent) | Tencent 커뮤니티 라이선스 — EU/영국/대한민국 제외 | 최소 14GB, 24GB 권장 | 480p/720p, 최대 10초 | 영화적인 조명 표현으로 커뮤니티에서 인기; VRAM 요구량이 가장 낮음 |
⚠️ 사기 경고: "Wan 2.7"이라는 모델은 존재하지 않습니다. "Wan 2.7 오픈 웨이트"를 제공한다는 다운로드 페이지는 SEO 사기입니다. 공식 Wan 릴리스는 2.2에서 멈춰 있습니다 — 아래 링크된 공식 GitHub 또는 Hugging Face 저장소에서만 다운로드하십시오.
Wan 2.2 (Alibaba) — 품질의 왕, 진정한 무료
Wan 2.2는 가장 널리 배포된 오픈 비디오 모델입니다. I2V-A14B 저장소 하나만으로도 한 달간 약 424만 회의 Hugging Face 다운로드를 기록했으며, 수백 개의 커뮤니티 파생 모델이 그 위에 구축되었습니다. T2V-A14B와 I2V-A14B(전문가 혼합 구조, 총 27B / 활성 14B 파라미터), 그리고 6~8GB VRAM만으로 텍스트-투-비디오와 이미지-투-비디오를 모두 처리하는 소형 TI2V-5B까지 세 가지 변형으로 출시되었습니다. 14B 등급은 15GB(GGUF Q3)에서 25GB(FP8)까지 필요하며, 공식 비양자화 실행에는 80GB가 요구됩니다. 라이선스는 Apache 2.0으로 진정한 무료이며 상업적 사용에 제한이 없고 매출 기준도, 지역 제외도 없습니다.
구체적인 속도: 5초 클립 하나를 생성하는 데 RTX 4090 기준 약 4~9분이 걸립니다(독립적으로 보고된 수치 하나 기준 — Wan 2.2는 한 번에 더 긴 클립을 기본적으로 출력하지 않습니다). 20초 시퀀스를 만들려면 5초짜리 클립 4개를 별도로 생성한 뒤 이어 붙여야 합니다 — 원시 생성 시간만 약 16~36분이며, 매끄럽게 연결하기 위한 수작업 편집이 추가로 필요합니다. 이 수치는 클립당 수치로부터 추정한 값이며, 20초 클립을 직접 측정한 벤치마크가 아닙니다.
LTX-2 (Lightricks) — 속도와 동기화된 사운드
LTX-2는 이 3종 중 유일하게 동기화된 오디오와 비디오를 한 번에 생성하는 모델입니다 — 발소리, 주변음, 효과음이 영상과 함께 도착합니다. 세 모델 중 가장 빠르며 하드웨어 요구사항도 가장 관대합니다. 아키텍처는 22B 디퓨전 트랜스포머이며, 현재의 LTX-2.5 릴리스와 함께 LTX-2.3(2026년 3월)도 계속 지원됩니다. 라이선스는 LTX 커뮤니티 라이선스로, 회사의 연간 총매출이 $10M 미만이면 상업적 사용이 무료이며 그 이상이면 유료 상업 라이선스가 필요합니다. (일부 서드파티 자료는 이를 Apache 2.0으로 잘못 표기하고 있습니다 — 공식 라이선스 페이지만이 신뢰할 수 있는 출처입니다.) 하드웨어 요구사항은 양자화 시 18~20GB VRAM, 풀 정밀도에서는 32GB 이상입니다. 12GB 카드에서는 이전 버전인 LTX-Video 0.9.5가 현실적인 선택입니다.
구체적인 속도: LTX-2는 정성적으로 3종 중 가장 빠르며, 고급 소비자용 카드에서 거의 실시간에 가까운 미리보기를 제공합니다 — 다만 이 글 작성 시점 기준 RTX 4090에서의 독립적으로 검증된 클립당 소요 시간 수치는 존재하지 않으므로 임의로 만들어내지 않겠습니다. 확인 가능한 유일한 확정 수치는 Lightricks 자체가 데이터센터급 "Nvidia 슈퍼칩"(소비자용 GPU가 아님)에서 진행한 벤치마크로, 10초 클립을 약 6.8초 만에 생성했습니다. 이는 진지한 하드웨어에서 이 아키텍처가 낼 수 있는 상한선으로 봐야 하며, 가정용 장비에서 체감할 성능이 아닙니다.
HunyuanVideo 1.5 (Tencent) — 영화적인 화질과 법적인 함정
2025년 11월 출시된 Tencent의 8.3B 모델은 영화적인 조명과 질감 표현으로 커뮤니티의 사랑을 받고 있으며, VRAM 요구량이 3종 중 가장 낮습니다: 오프로딩 시 최소 14GB, 24GB에서 쾌적하게 동작하며 RTX 4090 기준 480p 클립 하나당 약 75초가 걸립니다. 480p/720p를 기본으로 생성하며, 내장된 초해상도(super-resolution) 기능으로 최대 1080p까지, 클립 길이는 최대 10초까지 지원합니다.
구체적인 속도: 5초 480p 클립 하나당 약 75초라면, 영상 1초당 렌더링 시간은 약 15초입니다. 네이티브 최대 클립 길이가 10초이므로, 20초 시퀀스를 만들려면 최대 길이로 두 번 생성해야 합니다 — 초당 속도를 그대로 확장하면 20초 분량의 영상을 생성하는 데 원시 생성 시간만 약 5분이 걸리며, 이어붙이기 작업은 별도입니다. 이는 확인된 5초 수치로부터의 추정치이며, 10초나 20초를 직접 측정한 벤치마크가 아닙니다.
⚠️Warning: 라이선스 경고 — 다운로드하기 전에 반드시 읽으십시오. HunyuanVideo 1.5는 Apache 2.0이 아니라 Tencent Hunyuan 커뮤니티 라이선스를 사용합니다. 이 라이선스는 유럽연합(EU), 영국, 대한민국에는 적용되지 않습니다 — 해당 지역의 사용자는 이 모델이나 그 결과물을 사용할 권한이 없습니다. 또한 월간 활성 사용자 1억 명을 상한으로 설정하고 있으며, 그 결과물로 경쟁 모델을 학습시키는 것을 금지합니다. EU, 영국, 대한민국에 거주한다면 이 모델은 건너뛰십시오. Wan 2.2가 제한 없이 동일한 품질 등급을 제공합니다.
주목할 모델: MiniMax H3
2026년 8월 3일 출시된 MiniMax H3는 네이티브 스테레오 오디오, 출시 첫날부터의 ComfyUI 지원, RTX 3060에서도 실행 가능한 양자화 버전을 갖춘 331억 파라미터 규모의 옴니모달 모델입니다. 네 번째 선택지로 다루기 전에 두 가지 유의점이 있습니다. 로컬 릴리스는 768p로 상한이 설정되어 있으며(완전한 2K 파이프라인은 호스티드 버전에서만 제공됩니다), 커뮤니티 라이선스에는 자체적인 지역 제한과 $20M 매출 기준이 포함되어 있다고 알려져 있으므로 사용 전에 공식 모델 카드를 확인해야 합니다. 초기 반응은 좋지만, 출시된 지 3주밖에 되지 않은 것과 실무에 바로 투입 가능한 것은 별개의 문제입니다.
하드웨어 관문
로컬 비디오 생성은 강아지가 "공짜"인 것과 같은 의미로 무료입니다. 모델 가중치 자체는 비용이 들지 않지만, GPU가 진짜 입장료입니다. GPU의 VRAM이 12GB 미만이고 업그레이드 계획이 없다면 로컬 생성은 아예 건너뛰십시오 — 위의 세 모델 모두 이 등급 이하에서는 실용적인 품질로 동작하지 않으며, 클라우드 플랫폼이 더 빠르게 더 나은 결과를 제공할 것입니다.
이 내용이 자신의 컴퓨터에 어떻게 적용되는지 잘 모르시겠습니까? 다음 가이드가 자세히 설명합니다: 모델별 정확한 요구사항은 VRAM 계산기, 모델 크기별 도표는 필요한 VRAM은 얼마인가?, 하드웨어 선택은 로컬 AI를 위한 최고의 GPU와 최고의 예산형 GPU, 플랫폼 비교는 GPU vs CPU vs Apple Silicon을 참고하십시오. 한 가지 솔직한 유의점: 이 가이드들은 LLM용 VRAM 공식(파라미터 수 × 비트 ÷ 8)을 사용합니다. 비디오 디퓨전 모델은 해상도와 클립 길이에 따라서도 VRAM 사용량이 달라지므로, 이 수치들은 비디오 작업에서는 상한이 아니라 최저 기준으로 받아들이십시오.
| 보유 GPU | 실행 가능한 것 |
|---|---|
| VRAM 6~8GB | Wan 2.2 TI2V-5B(양자화) — 사용 가능, 입문 수준 품질 |
| VRAM 12GB | LTX-Video 0.9.5 — 이 등급에서 유일하게 진지하게 고려할 만한 옵션 |
| VRAM 16GB | HunyuanVideo 1.5(라이선스 허용 시), Wan 2.2 14B(GGUF Q3) |
| VRAM 24GB 이상 | 모든 것 가능: Wan 2.2 14B 고품질, LTX-2 양자화 |
2026년 8월 기준 대략적인 하드웨어 비용: 중고 RTX 3060 12GB는 약 $170~220, 중고 RTX 3090 구성은 약 $900~1,100입니다. GPU 가격은 변동하므로, 몇 달이 지난 이 수치를 그대로 믿기보다 구매 전 현재 시세를 확인하십시오.
로컬 비디오 생성을 실제로 실행한다는 것의 의미
로컬 모델을 사용한다는 것은 비디오 도구 하나를 설치하는 것이 아니라 파이프라인 전체를 조립한다는 뜻입니다.
생성 환경 설정. ComfyUI는 노드 기반 도구입니다. 로더, 샘플러, 디코더로 이루어진 워크플로우 그래프를 직접 구축하거나, 가져와서 디버깅해야 합니다. 첫 프레임이 렌더링되기 전까지 CUDA 버전 불일치, PyTorch 버전 고정, 이따금 발생하는 flash_attn 설치 오류를 각오해야 합니다.
프롬프트 작성. 비디오 모델은 한 줄짜리 프롬프트가 아니라 구조화된 프롬프트가 필요합니다 — 샷 종류, 카메라 움직임, 조명, 피사체의 동작 등입니다. 내장된 프롬프트 도우미도, 시스템 프롬프트 레이어도 없습니다. 전체 구조를 직접 작성해야 합니다. 시스템 프롬프트와 사용자 프롬프트의 차이와 로컬 모델을 위한 프롬프트 엔지니어링 가이드는 비디오 프롬프트 작성에도 그대로 적용되는 기본 원칙을 다룹니다.
클립 주변의 모든 것. 로컬 모델은 5~20초 길이의 원시 무음(LTX 제외) 클립을 출력합니다. 스크립트, 음성, 음악, 스톡 영상, 자막, 편집은 각각 선택하고 설치하고 서로 연결해야 하는 별도의 도구입니다.
약한 프롬프트 (한 줄짜리)
“해변의 개”
구조화된 프롬프트 (비디오 모델이 필요로 하는 형태)
“황금빛 시간대에 젖은 해안선을 질주하는 골든 리트리버, 낮은 위치에서 측면으로 따라가는 트래킹 샷, 얕은 피사계 심도, 따뜻한 역광, 부드러운 슬로우 모션, 시네마틱 24fps”
클라우드 문: InVideo가 제공하는 것
로컬 설정 없이 AI 비디오를 만들고 싶으신가요? 강력한 GPU가 없거나, 로컬 AI 비디오 도구를 설치하고 설정하는 데 시간을 쓰고 싶지 않다면 InVideo를 시도해볼 만합니다. InVideo 무료 버전 사용해보기 →
InVideo는 클라우드 문의 한 예시일 뿐, 유일한 선택지는 아닙니다. "클라우드"가 하나의 방식만을 의미한다고 단정하기 전에, 다른 서비스들과 어떻게 다른지 알아둘 가치가 있습니다. Runway는 완성된 조립 비디오보다는 AI와 편집기를 결합한 하이브리드 워크플로우를 지향하며 전문 편집 도구(Premiere Pro, Final Cut, DaVinci Resolve)에 직접 통합됩니다. Luma AI의 Dream Machine은 VFX 합성 파이프라인(After Effects, Nuke)을 위한 네이티브 16비트 HDR 출력을 전문으로 합니다 — 완전히 다른 대상 사용자층입니다. Pika는 가볍게 유지됩니다. 스크립트, 음성, 스톡 영상 조립 기능이 내장되어 있지 않은 빠른 원시 클립 생성에 집중하므로, 클립 주변의 모든 것에 여전히 별도 도구가 필요합니다 — GPU가 필요 없다는 점만 빼면 로컬 모델을 실행하는 것과 동일한 DIY 파이프라인 문제입니다. 이 세 서비스와 InVideo를 구분 짓는 지점은, InVideo가 원시 생성 도구를 우선하지 않는다는 점입니다. 이는 스크립트에서 완성된 비디오까지 조립해주는 서비스이며, 필요할 때 원시 생성 모델(Kling, Veo, Seedance)에도 접근할 수 있게 해줍니다.
InVideo는 비디오 모델이 아니라 제작 파이프라인 전체를 서비스로 제공합니다. 주제나 스크립트를 입력하면 v4 에이전트가 최대 30분 길이의 완성된 비디오를 반환합니다 — AI가 생성한 스크립트, 1,600만 개 이상의 자산 스톡 라이브러리 또는 새로 생성된 클립으로 조립된 장면, 50개 이상 언어(음성 복제 포함)의 AI 음성, 음악, 자막, 브랜드 키트 스타일링까지 포함됩니다. 브라우저에서 실행되므로 여러분의 GPU는 무관합니다.
GPU와 양자화 방식을 조사하기보다 오늘 당장 비디오 제작을 시작하고 싶은 사람에게는 InVideo가 현실적인 선택입니다. 로컬 하드웨어 요구사항이 없고, ComfyUI 설치나 CUDA 문제 해결이 필요 없으며, 대부분의 사람이 실제로 필요로 하는 스크립트, 음성, 음악, 자막이 이미 포함된 하나의 워크플로우를 제공합니다. 기반 생성 모델을 직접 제어하는 것보다 완성된 비디오 자체를 더 중시하는 창작자에게 특히 적합합니다 — 무료 티어가 존재하므로 비용을 들이기 전에 이것이 맞는지 확인할 수 있습니다.
이 비교에서 눈에 띄는 세 가지가 있습니다:
- 모델의 혼란을 대신 흡수합니다. 모든 유료 플랜은 Seedance 2.5, Veo 3.1, Kling 3를 포함해 200개 이상의 모델에 대한 접근을 포함합니다. 어떤 모델이 소송을 당하거나 서비스가 중단되어도 InVideo가 이를 교체해주므로 여러분의 워크플로우는 계속됩니다.
- 자동화가 나중에 덧붙은 것이 아니라 기본으로 내장되어 있습니다. 공식 MCP 서버가 있어 프롬프트 → 스크립트 → 영상 → 자막에 이르는 전체 파이프라인을 프로그래밍 방식으로 실행할 수 있습니다 — 그렇지 않으면 ComfyUI를 중심으로 직접 구축해야 할 종류의 하네스입니다.
- 무료 티어는 실질적인 시험판입니다. 워터마크가 있고 분량 제한이 있지만, 비용을 지불하기 전에 결과물 품질을 판단하기에는 충분합니다.
구체적인 속도 — 그리고 솔직한 함정: 원시 생성 한 건은 보통 몇 분이면 끝날 만큼 빠릅니다. 하지만 InVideo 자체 FAQ에 따르면 단편 영상의 완전한 엔드투엔드 제작에는 몇 분이 아니라 2~5일이 걸립니다 — 생성 자체가 아니라 여러 생성 결과 중에서 선택하고 조립하는 과정이 시간이 걸리는 지점이기 때문입니다. 1~3분 길이의 완성된 영상에 대해 "현실적인 최저 기준은 2일"이라는 수치를, 편집되지 않은 20초 분량 영상의 원시 생성에 16~36분이 걸리는 로컬 문과 공정하게 비교할 기준점으로 삼으십시오. InVideo는 여러분의 설정 및 편집 시간을 자체 제작 시간으로 맞바꾸는 것이지, 시간 자체를 없애주는 것이 아닙니다.
현재 요금제는 월 $17(Plus 플랜, 연간 결제, 2026년 8월 확인 기준 — 실시간 수치는 InVideo 요금제 페이지에서 확인하십시오)부터 시작합니다:
| 플랜 | 가격 | 월간 크레딧 | 적합한 대상 |
|---|---|---|---|
| Free | $0 | 제한적 | 테스트용(워터마크 있음) |
| Plus | $17/월 ($200/년) | 75 | 일반 창작자 — 모든 AI 모델, 아바타 및 음성 클론 4개, iStock 자산 100개, 무제한 워터마크 없는 내보내기 |
| Max | $85/월 ($1,000/년) | 390 | 대량 제작 채널, 아바타 16개 |
| Generative | $170/월 ($2,000/년) | 800+ | 단편 영화 / 제작 물량 |
| Elite | $900/월 ($10,800/년) | 4,250+ | 에피소드 및 상업적 규모 |
위 가격은 모두 2026년 8월 기준 연간 결제 요율입니다 — 월별 결제는 더 비쌉니다(InVideo 자체 FAQ는 Plus $20, Max $100, Generative $200, Elite $1,000의 월별 요금을 명시합니다). 이 수치를 그대로 신뢰하기보다 InVideo의 실시간 요금제 페이지를 확인하십시오. 플랜과 가격은 변경될 수 있습니다.
클라우드냐 로컬이냐: 어느 문이 나에게 맞을까?
간단히 정리하면, 흔한 상황별로 다음과 같습니다:
| 나의 상황 | 추천 |
|---|---|
| GPU가 없거나 VRAM 12GB 미만 | InVideo(클라우드) — 이 등급 이하에서는 로컬 모델이 잘 동작하지 않습니다 |
| 원시 클립이 아니라 음성이 포함된 완성된 비디오를 원함 | InVideo(클라우드) — 로컬 모델은 완전한 제작물을 조립해주지 않습니다 |
| 마감이 급하고 설정에 시간을 쓸 여유가 전혀 없음 | InVideo(클라우드) |
| VRAM 12GB 이상 GPU 보유, 설정에 익숙함, 프라이버시와 $0 한계비용을 원함 | 로컬: LTX-Video(12GB) 또는 Wan 2.2(고품질을 위해 24GB) |
| EU, 영국, 대한민국 거주 | 로컬 = Wan 2.2 또는 LTX-2만 가능(HunyuanVideo는 라이선스상 제외됨) |
| 직접 구축하지 않고 규모 있는 자동화/API가 필요함 | InVideo(클라우드, MCP 서버) |
누가 InVideo를 선택해야 할까?
어느 쪽이 맞는지 확실하지 않으신가요? 하드웨어와 기술적 설정을 피하고 싶다면 가장 쉬운 실험은 InVideo를 직접 사용해보고 그 워크플로우가 자신에게 맞는지 확인하는 것입니다. InVideo 무료로 사용해보기 →
다음에 해당한다면 InVideo가 더 나은 선택일 가능성이 높습니다:
- 강력한 GPU를 보유하고 있지 않음
- 즉시 비디오 제작을 시작하고 싶음
- ComfyUI, CUDA, 모델, Python 환경을 설치하고 설정하고 싶지 않음
- 여러 로컬 도구를 조합하기보다 통합된 워크플로우를 원함
- 스크립트, 음성, 음악, 자막, 비디오 생성을 하나의 워크플로우에서 처리하고 싶음
- 기반 모델을 실험하는 것보다 완성된 비디오 자체를 더 중시함
다음에 해당한다면 로컬 AI가 더 나은 선택일 가능성이 높습니다:
- 이미 적합한 GPU 하드웨어를 보유하고 있음
- 최대한의 통제권을 원함
- 모델과 워크플로우를 실험하고 싶음
- 강한 기술적 역량이 있음
- 생성 과정을 로컬에서 통제된 상태로 유지하는 것을 우선시함
- 매우 많은 양을 생성할 예정이며 한계 생성 비용을 최적화하고 싶음
실제로 보기
- 4가지 오픈소스 AI 비디오 모델 비교 — 정말 무료인 것은 어느 것인가? — LTX 2.3, Wan 2.2, HunyuanVideo 1.5, MiniMax H3의 결과물을 나란히 비교하며 라이선스 세부 조항까지 다룹니다.
- InVideo Agent One 리뷰 — 프롬프트에서 완성된 비디오까지의 전체 워크플로우를 다룹니다.
- Wan 2.2 전체 로컬 데모 — 소비자용 하드웨어에서의 솔직한 렌더링 시간을 다룹니다(출시 주간, 2025년 7월).
- 저VRAM Wan 2.2 튜토리얼 — 6GB 노트북에서 14B 모델을 실행하는 방법을 다룹니다(2025년).
FAQ
VRAM 8GB로 AI 비디오 생성을 실행할 수 있나요?
간신히 가능합니다. Wan 2.2의 TI2V-5B 변형은 6~8GB 양자화 환경에서 실행되지만 품질과 클립 길이가 제한됩니다. 진지한 모델을 사용하려면 12GB가 실질적인 최저 기준입니다 — 그 이하라면 InVideo 같은 클라우드 도구가 현실적인 답입니다.
Wan 2.2는 정말 상업적으로 무료인가요?
그렇습니다. Apache 2.0 라이선스로 상업적 사용에 제한이 없으며, 매출 상한도 지역 제한도 없고, 결과물에 대한 권리도 주장하지 않습니다. 세부 조항이 전혀 없는 유일한 최상위급 로컬 모델입니다.
HunyuanVideo를 EU나 영국에서 사용할 수 있나요?
아니요. Tencent Hunyuan 커뮤니티 라이선스는 EU, 영국, 대한민국에는 명시적으로 적용되지 않으며, 이는 모델 자체와 그 결과물 모두에 해당됩니다. 대신 Wan 2.2나 LTX-2를 사용하십시오.
InVideo를 사용하려면 GPU가 필요한가요?
아니요. InVideo는 완전히 브라우저에서 실행되며 모든 생성 작업은 자체 인프라에서 이루어집니다. 5년 된 노트북으로도 충분합니다.
로컬 모델로 음성이 포함된 완성된 유튜브 비디오를 만들 수 있나요?
단독으로는 불가능합니다. 로컬 모델은 5~20초 길이의 원시 클립을 생성합니다(LTX-2는 동기화된 오디오를 포함하고, 나머지는 무음입니다). 스크립트, 음성, 음악, 자막, 편집은 각각 별도의 도구가 필요하며 직접 파이프라인으로 조립해야 합니다.
"무료" 로컬 AI 비디오의 진짜 함정은 무엇인가요?
하드웨어 비용(성능 좋은 GPU), 설정 시간(ComfyUI와 그 의존성), 그리고 원시 출력 클립 주변에 필요한 DIY 파이프라인입니다. 모델 가중치 자체는 생성당 정말로 $0이며 앞으로도 그렇습니다.
Wan 2.7이나 더 새로운 Wan 모델이 있나요?
없습니다. 공식 Wan 릴리스는 2.2에서 멈춰 있습니다. "Wan 2.7 가중치"를 제공한다는 사이트는 모두 사기이며, 공식 GitHub나 Hugging Face 저장소에서만 다운로드해야 합니다.
완전 초보자입니다. 어디서 시작해야 할까요?
InVideo의 무료 티어로 시작하십시오 — 몇 분 안에 완성된 내레이션 비디오를 얻을 수 있으며, AI 비디오가 자신의 목표에 애초에 부합하는지 판단할 수 있습니다. 이후에 성능 좋은 GPU를 구매해 완전한 통제권과 프라이버시를 원한다면 로컬 문은 언제든 열려 있습니다.
Mac과 Windows에서 이 로컬 모델을 실행하는 것은 무엇이 다른가요?
ComfyUI는 PyTorch의 MPS 백엔드를 통해 Apple Silicon(M1~M4)에서도 실행되지만, 동급 NVIDIA GPU 대비 약 3~5배 느린 생성 속도를 각오해야 합니다 — 사용은 가능하지만 속도 면에서 경쟁력은 없습니다. 더 실질적인 문제는 소프트웨어 지원입니다. 이 모델들이 의존하는 CUDA 전용 최적화(flash-attention, GGUF/FP8 양자화 도구)는 Mac에서는 성숙도가 훨씬 떨어지므로, 여러 커뮤니티 워크플로우와 설치 가이드가 Windows나 Linux + NVIDIA 카드를 전제로 하고 있어 조정이 필요하거나 문서대로 아예 동작하지 않을 수 있습니다. 한 가지 장점은, Apple Silicon의 통합 메모리 덕분에 동일한 VRAM 용량의 개별 GPU보다 더 큰 모델을 메모리에 담을 수 있다는 점입니다. 속도는 더 느리더라도 말입니다. 로컬 비디오 생성을 위해 하드웨어를 구입하는 것이라면 Windows나 Linux에 NVIDIA를 조합하는 것이 잘 지원되는 경로이며, 이미 보유한 Mac은 실험용으로는 괜찮지만 진지한 처리량을 위한 권장 대상은 아닙니다.
여러 로컬 비디오 클립에 걸쳐 같은 캐릭터를 일관되게 유지할 수 있나요?
가능하지만 추가 작업이 필요합니다 — 세 모델 모두 별도의 생성 간에 이를 기본적으로 보장하지 않습니다. 실제로 통하는 두 가지 방법이 있습니다. 동일한 참조 이미지를 이미지-투-비디오 모드에 입력하거나(세 모델 모두 I2V를 지원합니다), 캐릭터에 대해 소형 LoRA를 학습시키는 것입니다. Wan 2.2와 LTX-2 모두 이를 위한 문서화된 LoRA 워크플로우를 제공합니다 — LTX-2의 버전은 IC-LoRA(인컨텍스트 LoRA)라고 불리며 다중 캐릭터 일관성을 명시적으로 지원합니다. 커뮤니티의 의견은 한 가지 점에서 일치합니다: 학습된 LoRA가 프롬프트나 참조 이미지만 사용하는 것보다 훨씬 더 안정적인 결과를 냅니다. InVideo의 브랜드 키트와 AI 아바타 기능은 동일한 근본 문제를 다르게 해결합니다 — 한 번 설정하고 재사용하는 고정된 아바타와 음성 프로필로, 별도의 학습이 필요 없습니다.
결정 전에 먼저 시도해보기
클라우드 워크플로우를 평가하기 위해 로컬 GPU 환경을 구축하거나 유료 구독을 결제할 필요는 없습니다. 하드웨어를 구매하거나 ComfyUI에 주말을 쏟기 전에, 먼저 반대 방향으로 5분을 써보는 것이 좋습니다:
1. InVideo의 무료 버전을 사용해보십시오. 2. 짧은 비디오 하나를 만들어보십시오. 3. 결과물 품질과 워크플로우가 어떻게 느껴졌는지 평가하십시오. 4. 그 경험을 로컬 설치에 드는 노력과 비교해보십시오.
이렇게 하면 이 비교가 단순히 읽는 것에서 그치지 않고, 이 글의 나머지를 읽는 것보다 짧은 시간 안에 직접 테스트해볼 수 있는 것으로 바뀝니다.
결론
12GB 이상의 GPU를 이미 보유했거나 구매할 계획이 있고, 직접 도구를 구축하는 것을 즐기며, 편의성보다 프라이버시와 무제한 $0 생성을 더 중시한다면 로컬을 선택하십시오. Wan 2.2가 가장 안전한 토대입니다 — 최고 품질, Apache 2.0, 세부 조항 없음 — 속도와 사운드에 특화된 LTX-2도 함께 고려하십시오.
하드웨어가 없거나, 설정을 원하지 않거나, 원시 클립이 아닌 완성된 비디오가 필요하다면 클라우드를 선택하십시오. 단순히 AI로 비디오를 만들고 싶은 대부분의 사람에게는 클라우드 경로가 더 쉬운 출발점입니다. 로컬 생성에 필요한 하드웨어와 기술적 관심이 이미 없다면, InVideo는 프롬프트 하나로 그 복잡함의 대부분을 없애줍니다. 모든 모델과 자산이 번들로 제공되고 자동화까지 포함되어 있으며, 테스트는 $0부터, 워터마크 제거는 월 $17(연간 결제)부터 시작합니다. 자신의 워크플로우에 맞는지 알아보는 가장 간단한 방법은 무료 버전을 먼저 시도해보는 것입니다.
두 문 모두 AI 비디오로 이어집니다. 애초에 질문은 어느 기술이 더 나은가가 아니라, 어느 워크플로우가 여러분의 컴퓨터, 인내심, 목표에 맞는가였습니다.
출처
- Wan 2.2 GitHub — 공식 저장소, 라이선스, 설치 안내.
- Wan 2.2 Hugging Face — 공식 모델 카드 및 다운로드.
- LTX 모델 라이선스 — 공식 LTX 커뮤니티 라이선스 조항.
- LTX-2 모델 페이지 — 공식 아키텍처 및 출시 세부정보.
- HunyuanVideo 1.5 GitHub — EU/영국/대한민국 제외 조항을 포함한 공식 저장소 및 LICENSE 파일.
- VBench-2.0 리더보드 — 품질 및 물리적 사실성 수치에 사용된 독립 벤치마크.
- InVideo 요금제 — 공식 플랜 및 가격 세부정보.
- InVideo MCP 서버 — 공식 자동화 문서.
- MiniMax H3 GitHub — 공식 저장소.
- MiniMax H3 Hugging Face — 공식 모델 가중치.
- InVideo: AI 단편 영화 제작에 걸리는 시간은? — InVideo 자체의 엔드투엔드 제작 시간 수치(2~5일).
- ComfyUI 시스템 요구사항 — Mac/Apple Silicon MPS 지원에 관한 공식 문서.
- LTX 블로그: LTX-2에서 IC-LoRA 사용법 — 공식 캐릭터 일관성(IC-LoRA) 가이드.
