Conclusiones clave
- Wan 2.2 es el único modelo de video local de primer nivel sin restricciones de licencia. Apache 2.0, uso comercial sin restricciones, sin límites de ingresos, sin exclusiones territoriales — y la puntuación de calidad VBench más alta verificada entre los modelos open source (~84.7%).
- InVideo integra más de 200 modelos — incluyendo Kling 3, Veo 3.1 y Seedance 2.5 — en un solo pipeline basado en navegador, desde $17/mes (plan Plus, facturado anualmente), con guion, locución, música y subtítulos gestionados automáticamente.
- La licencia de HunyuanVideo 1.5 excluye explícitamente a la UE, el Reino Unido y Corea del Sur — tanto para el modelo como para sus resultados. Los lectores en esas regiones deben usar Wan 2.2 o LTX-2 en su lugar.
- LTX-2 es el más rápido del trío local y el único con audio sincronizado integrado, gratuito para uso comercial en empresas con ingresos anuales inferiores a $10M.
- 12 GB de VRAM es el piso realista para generación de video local en serio. Por debajo de eso, InVideo se vuelve la opción más práctica.
- Los modelos locales generan clips silenciosos en bruto de 5 a 20 segundos, no videos terminados. Guion, locución, música, subtítulos y edición son herramientas separadas que tú mismo ensamblas — InVideo hace todo esto en un solo paso.
- No existe "Wan 2.7". Las páginas de descarga que lo ofrecen son estafas de SEO — los lanzamientos oficiales de Wan se detienen en 2.2.
Por qué 2026 es un momento extraño para la IA de video
El mercado propietario de video ha sido caótico. OpenAI cerró la app de consumo Sora en marzo de 2026, menos de seis meses después de su lanzamiento, tras una caída de descargas de aproximadamente 66% desde su pico (la API sigue activa por separado). Seedance 2.0 de ByteDance se topó con demandas de Hollywood y un lanzamiento global pausado ese mismo mes, tras cartas de cese y desista de Disney, Paramount y Warner Bros. — sigue siendo accesible en China, pero conlleva riesgo legal para uso comercial internacional. El modelo HappyHorse de Alibaba encabezó las tablas de calidad en abril de 2026 — y nunca se abrió al público.
Ese caos es exactamente lo que hace atractivas a ambas puertas. Los modelos locales abiertos te hacen independiente del drama de los proveedores. E InVideo absorbe ese drama por ti: su suscripción integra acceso a más de 200 modelos — incluyendo Kling 3, Veo 3.1 y Seedance 2.5 — así que cuando un modelo desaparece o es demandado, tu flujo de trabajo ni se entera.
La puerta local: tres modelos gratuitos en tu propia GPU
Tres sistemas de pesos abiertos dominan la generación de video local ahora mismo, medido por descargas, actividad de la comunidad y resultados de benchmarks. Los tres corren a través de ComfyUI, una interfaz basada en nodos que instalas en tu propia máquina — no una herramienta tipo chat como Ollama. Son modelos de difusión, no LLMs.
📍 En una frase
Wan 2.2 es el mejor modelo de video local en general en 2026 — Apache 2.0, máxima calidad, sin restricciones — mientras que LTX-2 gana en velocidad y audio sincronizado, y HunyuanVideo 1.5 ofrece el look más cinematográfico pero excluye por licencia a los usuarios de la UE/Reino Unido/Corea del Sur.
💬 En términos simples
Si solo quieres una respuesta: consigue una GPU de 12 GB o más y corre Wan 2.2. Tiene la mejor calidad, la licencia más simple y ninguna letra pequeña.
| Modelo | Licencia | VRAM | Salida | Característica destacada |
|---|---|---|---|---|
| Wan 2.2 (Alibaba) | Apache 2.0 — sin restricciones | 6–8GB (5B) / 15–25GB (14B) | 480p/720p, clips de ~5s | Mayor calidad VBench verificada (~84.7%) |
| LTX-2 (Lightricks) | LTX Community License — gratis por debajo de $10M en ingresos | 18–20GB cuantizado, 32GB+ completo | 480p–1080p, 5–20s, con audio | Único modelo con audio y video sincronizados en un solo paso |
| HunyuanVideo 1.5 (Tencent) | Tencent Community License — excluye a UE/Reino Unido/Corea del Sur | 14GB mínimo, 24GB cómodo | 480p/720p, hasta 10s | Favorito de la comunidad por su iluminación cinematográfica; el más ligero en VRAM |
⚠️ Alerta de estafa: no existe "Wan 2.7". Las páginas de descarga que afirman ofrecer "pesos abiertos de Wan 2.7" son estafas de SEO. Los lanzamientos oficiales de Wan se detienen en 2.2 — descarga solo desde los repositorios oficiales de GitHub o Hugging Face enlazados abajo.
Wan 2.2 (Alibaba) — el rey de la calidad, verdaderamente gratis
Wan 2.2 es el modelo de video abierto más ampliamente desplegado: solo su repositorio I2V-A14B registró aproximadamente 4.24 millones de descargas en Hugging Face en un solo mes, con cientos de derivados de la comunidad construidos sobre él. Se distribuye en tres variantes — T2V-A14B e I2V-A14B (mezcla de expertos, 27B parámetros totales / 14B activos), más una TI2V-5B compacta que gestiona tanto texto-a-video como imagen-a-video con apenas 6–8GB de VRAM. El nivel 14B necesita entre 15GB (GGUF Q3) y 25GB (FP8); el comando oficial sin cuantizar pide 80GB. Su licencia es Apache 2.0 — verdaderamente gratuita, uso comercial sin restricciones, sin umbrales de ingresos, sin exclusiones territoriales.
Velocidad, en concreto: un solo clip de 5 segundos tarda aproximadamente entre 4 y 9 minutos en una RTX 4090 (una cifra reportada de forma independiente — Wan 2.2 no genera clips más largos de forma nativa en un solo paso). Para construir una secuencia de 20 segundos, generarías 4 clips separados de 5 segundos y los unirías — calcula entre 16 y 36 minutos de tiempo de generación en bruto, más la edición manual para unirlos de forma fluida. Ese rango es una extrapolación de la cifra por clip, no un benchmark de 20 segundos medido directamente.
LTX-2 (Lightricks) — velocidad más sonido sincronizado
LTX-2 es el único modelo abierto de este trío que genera audio y video sincronizados en un solo paso — pasos, ambiente y efectos llegan junto con la imagen. También es el más rápido de los tres y el más flexible en cuanto a hardware. La arquitectura es un transformador de difusión de 22B; LTX-2.3 (marzo de 2026) sigue siendo totalmente compatible junto al actual LTX-2.5. La licencia es la LTX Community License — gratuita para uso comercial si los ingresos totales de tu empresa son inferiores a $10M al año, con una licencia comercial de pago requerida por encima de ese umbral. (Algunos análisis de terceros la llaman incorrectamente Apache 2.0 — la página oficial de la licencia es la única fuente fiable.) Los requisitos de hardware van de 18–20GB de VRAM cuantizado a 32GB+ a precisión completa; en tarjetas de 12GB, el más antiguo LTX-Video 0.9.5 sigue siendo la opción práctica.
Velocidad, en concreto: LTX-2 es cualitativamente el más rápido del trío, con vistas previas casi en tiempo real en tarjetas de consumo de gama alta — pero no existe una cifra de minutos por clip verificada de forma independiente en una RTX 4090 al momento de escribir esto, así que no vamos a inventar una. La única cifra concreta disponible proviene del propio benchmark de Lightricks en "superchips de Nvidia" de nivel datacenter (no una GPU de consumo): un clip de 10 segundos en unos 6.8 segundos. Trátalo como un techo de lo que la arquitectura puede hacer en hardware serio, no como lo que verá tu equipo en casa.
HunyuanVideo 1.5 (Tencent) — el look cinematográfico, con una trampa legal
El modelo de 8.3B de Tencent, lanzado en noviembre de 2025, es el favorito de la comunidad por su iluminación y textura cinematográficas, y el más ligero del trío en VRAM: 14GB mínimo con offloading, 24GB cómodo, a razón de unos 75 segundos por clip de 480p en una RTX 4090. Genera de forma nativa 480p/720p, hasta 1080p mediante superresolución integrada, con clips de hasta 10 segundos.
Velocidad, en concreto: con ~75 segundos por clip de 480p de 5 segundos, eso son unos 15 segundos de renderizado por cada segundo de video. Su duración máxima nativa por clip es de 10 segundos, así que una secuencia de 20 segundos requiere dos generaciones al máximo de duración — extrapolando la tasa por segundo, calcula unos 5 minutos de generación en bruto para 20 segundos de metraje, antes de unirlos. Esto es una extrapolación de la cifra de 5 segundos que tenemos como fuente, no un benchmark de 10 o 20 segundos medido directamente.
⚠️Warning: Advertencia de licencia — lee antes de descargar. HunyuanVideo 1.5 usa la Tencent Hunyuan Community License, no Apache 2.0. La licencia no aplica en la Unión Europea, el Reino Unido ni Corea del Sur — usuarios en esas regiones no están autorizados a usar el modelo ni sus resultados. También limita el uso a 100 millones de usuarios activos mensuales y prohíbe entrenar modelos competidores con sus resultados. Si estás en la UE, el Reino Unido o Corea del Sur, evita este modelo: Wan 2.2 cubre el mismo nivel de calidad sin restricciones.
Uno para vigilar: MiniMax H3
Lanzado el 3 de agosto de 2026, MiniMax H3 es un modelo omni-modal de 33.1B con audio estéreo nativo, compatibilidad con ComfyUI desde el primer día y versiones cuantizadas que corren en una RTX 3060. Dos advertencias antes de tratarlo como una cuarta opción: el lanzamiento local se limita a 768p (el pipeline completo de 2K sigue siendo solo alojado), y su Community License, según se informa, incluye sus propias restricciones geográficas y un umbral de ingresos de $20M — revisa la ficha oficial del modelo antes de comprometerte. Las señales iniciales son sólidas, pero tres semanas de existencia y estar listo para producción son cosas distintas.
El filtro del hardware
La generación de video local es gratis de la misma manera en que un cachorro es gratis: los pesos del modelo no cuestan nada, pero la GPU es el verdadero precio de entrada. Sáltate por completo la generación local si tu GPU tiene menos de 12 GB de VRAM y no planeas actualizarla — ninguno de los tres modelos anteriores corre con calidad utilizable por debajo de ese nivel, y una plataforma en la nube te dará mejores resultados más rápido.
¿No estás seguro de qué significa todo esto para tu equipo? Estas guías lo explican: Calculadora de VRAM para requisitos exactos por modelo, ¿Cuánta VRAM necesitas? para tablas comparativas entre tamaños de modelo, Mejores GPU para IA local y Mejores GPU económicas para recomendaciones de hardware, y GPU vs CPU vs Apple Silicon para comparaciones de plataformas. Una advertencia honesta: esas guías usan la fórmula de VRAM para LLMs (parámetros × bits ÷ 8). Los modelos de difusión de video también escalan la VRAM con la resolución y la duración del clip, así que trata esas cifras como un piso, no un techo, para cargas de trabajo de video.
| Tu GPU | Qué puedes correr |
|---|---|
| 6–8GB VRAM | Wan 2.2 TI2V-5B (cuantizado) — utilizable, calidad de entrada |
| 12GB VRAM | LTX-Video 0.9.5 — la única opción seria en este nivel |
| 16GB VRAM | HunyuanVideo 1.5 (si la licencia lo permite), Wan 2.2 14B en GGUF Q3 |
| 24GB+ VRAM | Todo: Wan 2.2 14B en alta calidad, LTX-2 cuantizado |
Costo aproximado de hardware en agosto de 2026: una RTX 3060 12GB usada ronda los $170–220, una RTX 3090 usada ronda los $900–1,100. Los precios de GPU varían — verifica el precio actual antes de comprar en lugar de confiar en estas cifras pasados unos meses. Los precios en tu país pueden variar según impuestos locales.
Lo que realmente implica correr generación de video local
Con modelos locales, no estás instalando una herramienta de video — estás ensamblando un pipeline.
La configuración de generación. ComfyUI está basado en nodos: construyes, o importas y depuras, un grafo de flujo de trabajo con loaders, samplers y decoders. Espera desajustes de versión de CUDA, versiones fijadas de PyTorch y algún que otro error de instalación de flash_attn antes de que se renderice tu primer frame.
El prompting. Los modelos de video necesitan prompts estructurados — tipo de plano, movimiento de cámara, iluminación, acción del sujeto — no frases de una línea. No hay un asistente de prompts integrado ni una capa de system prompt; tú escribes toda la estructura. Nuestras guías sobre system prompts vs. user prompts y prompt engineering para modelos locales cubren fundamentos que se transfieren directamente al prompting de video.
Todo lo que rodea al clip. Los modelos locales generan clips en bruto y silenciosos (excepto LTX) de 5 a 20 segundos. Guion, locución, música, imágenes de stock, subtítulos y edición son herramientas separadas que tú eliges, instalas y conectas entre sí.
Débil (una línea)
“Un perro en una playa”
Estructurado (lo que necesitan los modelos de video)
“Golden retriever corriendo por una orilla mojada durante la hora dorada, plano de seguimiento bajo desde el lateral, poca profundidad de campo, contraluz cálido, cámara lenta suave, 24fps cinematográfico”
La puerta de la nube: qué incluye InVideo
¿Quieres crear videos con IA sin la configuración local? Si no tienes una GPU potente — o simplemente no quieres pasar horas instalando y configurando herramientas locales de IA de video — vale la pena probar InVideo. Prueba la versión gratuita de InVideo →
InVideo es un ejemplo de la puerta de la nube — no el único, y vale la pena saber en qué se diferencia de los demás antes de asumir que "nube" significa una sola cosa. Runway se integra directamente en editores profesionales (Premiere Pro, Final Cut, DaVinci Resolve), orientado a flujos de trabajo híbridos de IA más editor en lugar de un video terminado y ensamblado. Dream Machine de Luma AI se especializa en salida HDR nativa de 16 bits para pipelines de composición VFX (After Effects, Nuke) — una audiencia completamente distinta. Pika se mantiene ligero: generación rápida de clips en bruto sin guion, locución ni ensamblaje de imágenes de stock integrados, así que igual necesitas herramientas separadas para todo lo que rodea al clip — el mismo problema de pipeline DIY que correr un modelo local, solo que sin el requisito de GPU. Lo que distingue a InVideo de los tres es que no es principalmente una herramienta de generación en bruto: es un ensamblador de guion-a-video-terminado que además te da acceso a modelos de generación en bruto (Kling, Veo, Seedance) cuando los necesitas.
InVideo no es un modelo de video — es todo el pipeline de producción como servicio. Escribes un tema o pegas un guion; su agente v4 devuelve un video terminado de hasta 30 minutos: guion generado por IA, escenas ensambladas desde una biblioteca de stock de más de 16M de activos o clips generados al momento, locución con IA en más de 50 idiomas (incluyendo clonación de voz), música, subtítulos y estilo de marca. Corre en el navegador — tu GPU es irrelevante.
Tres cosas destacan para esta comparación:
- El caos de los modelos, absorbido. Todos los planes de pago incluyen acceso a más de 200 modelos — Seedance 2.5, Veo 3.1 y Kling 3 entre ellos. Cuando un modelo es demandado o cerrado, InVideo lo sustituye; tu flujo de trabajo continúa.
- La automatización viene integrada, no añadida. Hay un servidor MCP oficial, así que todo el pipeline prompt → guion → metraje → subtítulos se puede activar de forma programática — el tipo de infraestructura que de otro modo tendrías que construir tú mismo alrededor de ComfyUI.
- El nivel gratuito es una prueba real. Con marca de agua y minutos limitados, pero suficiente para juzgar la calidad del resultado antes de pagar.
Velocidad, en concreto — y la trampa honesta: una sola generación en bruto es rápida, típicamente minutos. Pero el propio FAQ de InVideo sitúa la producción completa de extremo a extremo de un cortometraje en 2 a 5 días, no minutos — porque elegir y ensamblar entre múltiples opciones generadas, no la generación en sí, es lo que consume el tiempo. Trata "2 días como un piso realista" para un cortometraje terminado de 1 a 3 minutos como el punto de comparación justo frente a los 16–36 minutos de generación en bruto de la puerta local para 20 segundos de metraje sin editar: InVideo cambia tu tiempo de configuración y edición por su propio tiempo de producción, no elimina el tiempo por completo.
Planes actuales, desde $17/mes (plan Plus, facturado anualmente, verificado en agosto de 2026 — consulta la página de precios de InVideo para cifras actualizadas):
| Plan | Precio | Créditos/mes | Ideal para |
|---|---|---|---|
| Free | $0 | limitados | Probar el terreno (con marca de agua) |
| Plus | $17/mes ($200/año) | 75 | Creadores habituales — todos los modelos de IA, 4 avatares y clonaciones de voz, 100 activos de iStock, exportaciones ilimitadas sin marca de agua |
| Max | $85/mes ($1,000/año) | 390 | Canales de alto volumen, 16 avatares |
| Generative | $170/mes ($2,000/año) | 800+ | Volumen de cortometrajes / producción |
| Elite | $900/mes ($10,800/año) | 4,250+ | Escala episódica y comercial |
Todos los precios anteriores son tarifas de facturación anual a agosto de 2026 — pagar mes a mes cuesta más (el propio FAQ de InVideo cita Plus $20, Max $100, Generative $200, Elite $1,000 al mes). Consulta la página de precios en vivo de InVideo antes de confiar en cualquier cifra aquí; los planes y precios cambian.
Nube o local: ¿cuál es tu puerta?
La versión corta, mapeada a situaciones comunes:
| Tu situación | Recomendación |
|---|---|
| Sin GPU, o menos de 12GB de VRAM | InVideo (nube) — ningún modelo local corre bien por debajo de este nivel |
| Quieres un video terminado con locución, no clips en bruto | InVideo (nube) — los modelos locales no ensamblan una producción completa |
| Con plazo urgente, cero tolerancia a la configuración | InVideo (nube) |
| GPU de 12GB+, cómodo con la configuración, quieres privacidad y $0 de costo marginal | Local: LTX-Video (12GB) o Wan 2.2 (24GB para máxima calidad) |
| En la UE, el Reino Unido o Corea del Sur | Local = solo Wan 2.2 o LTX-2 (la licencia de HunyuanVideo te excluye) |
| Necesitas automatización/API a escala sin construirla | InVideo (nube, servidor MCP) |
¿Quién debería elegir InVideo?
¿No estás seguro de cuál ruta es la adecuada para ti? Si quieres evitar el hardware y la configuración técnica, el experimento más sencillo es simplemente probar InVideo y ver si su flujo de trabajo se ajusta a tus necesidades. Prueba InVideo gratis →
InVideo probablemente sea la mejor opción si:
- No tienes una GPU potente
- Quieres empezar a crear videos de inmediato
- No quieres instalar y configurar ComfyUI, CUDA, modelos o entornos de Python
- Quieres un flujo de trabajo integrado en lugar de ensamblar varias herramientas locales
- Necesitas guiones, voz, música, subtítulos y generación de video en un solo flujo de trabajo
- Te importa más el video terminado que experimentar con los modelos subyacentes
La IA local probablemente sea la mejor opción si:
- Ya tienes el hardware de GPU adecuado
- Quieres el máximo control
- Quieres experimentar con modelos y flujos de trabajo
- Tienes habilidades técnicas sólidas
- Priorizas mantener la generación controlada localmente
- Esperas generar volúmenes muy grandes y quieres optimizar el costo marginal de generación
Míralos en acción
- 4 modelos de video con IA open source comparados — ¿cuál es realmente gratis? — comparación directa de resultados de LTX 2.3, Wan 2.2, HunyuanVideo 1.5 y MiniMax H3, incluyendo la letra pequeña de las licencias.
- Reseña de InVideo Agent One — el flujo de trabajo completo de prompt a video terminado.
- Demo local completa de Wan 2.2 — tiempos de renderizado honestos en hardware de consumo (semana de lanzamiento, julio de 2025).
- Tutorial de Wan 2.2 con poca VRAM — corriendo el modelo 14B en una laptop de 6GB (2025).
Preguntas frecuentes
¿Puedo generar AI video con 8GB de VRAM?
Apenas. La variante TI2V-5B de Wan 2.2 corre en 6–8GB cuantizada, con calidad reducida y clips cortos. Para los modelos serios, 12GB es el piso real — y por debajo de eso, una herramienta en la nube como InVideo es la respuesta práctica.
¿Es Wan 2.2 realmente gratis para uso comercial?
Sí. Es Apache 2.0 — uso comercial sin restricciones, sin límites de ingresos, sin exclusiones territoriales, sin derechos reclamados sobre tus resultados. Es el único de los principales modelos locales sin letra pequeña en la licencia.
¿Puedo usar HunyuanVideo en la UE o el Reino Unido?
No. La Tencent Hunyuan Community License explícitamente no aplica en la UE, el Reino Unido ni Corea del Sur — eso cubre tanto al modelo en sí como a sus resultados. Usa Wan 2.2 o LTX-2 en su lugar.
¿Necesito una GPU para usar InVideo?
No. InVideo corre completamente en el navegador; toda la generación ocurre en su infraestructura. Una laptop de cinco años funciona perfectamente.
¿Pueden los modelos locales producir un video completo de YouTube con locución?
No por sí solos. Los modelos locales generan clips en bruto de 5 a 20 segundos (LTX-2 incluye audio sincronizado; los demás son silenciosos). Guion, locución, música, subtítulos y edición requieren cada uno herramientas separadas que tú mismo ensamblas en un pipeline.
¿Cuál es la trampa real de la IA de video local "gratuita"?
El costo del hardware (una GPU capaz), el tiempo de configuración (ComfyUI y sus dependencias), y el pipeline DIY necesario alrededor de los clips de salida en bruto. Los pesos del modelo en sí realmente cuestan $0 por generación, para siempre.
¿Existe un Wan 2.7 o un modelo Wan más reciente?
No. Los lanzamientos oficiales de Wan se detienen en 2.2. Cualquier sitio que ofrezca "pesos de Wan 2.7" es una estafa — descarga solo desde los repositorios oficiales de GitHub o Hugging Face.
Soy un principiante total. ¿Por dónde debería empezar?
El nivel gratuito de InVideo — tendrás un video terminado y narrado en minutos y podrás juzgar si la IA de video sirve a tus objetivos. Si más adelante compras una GPU capaz y quieres control total y privacidad, la puerta local sigue abierta.
¿Qué diferencia hay al correr estos modelos locales en Mac vs Windows?
ComfyUI corre en Apple Silicon (M1–M4) a través del backend MPS de PyTorch, pero espera una generación aproximadamente de 3 a 5 veces más lenta que una GPU NVIDIA equivalente — utilizable, no competitiva en velocidad. El problema práctico mayor es el soporte de software: las optimizaciones específicas de CUDA en las que se apoyan estos modelos (flash-attention, herramientas de cuantización GGUF/FP8) son mucho menos maduras en Mac, así que varios flujos de trabajo y guías de instalación de la comunidad asumen Windows o Linux con una tarjeta NVIDIA y pueden necesitar ajustes, o simplemente no correr como está documentado. Una ventaja: la memoria unificada de Apple Silicon puede permitirte encajar un modelo más grande en memoria de lo que permitiría una GPU discreta con la misma VRAM, aunque corra más lento. Si estás comprando hardware específicamente para generación de video local, Windows o Linux más NVIDIA es el camino bien soportado; un Mac que ya tienes está bien para experimentar, no el objetivo recomendado para volumen serio.
¿Puedo mantener el mismo personaje consistente entre varios clips de video local?
Sí, con trabajo extra — ninguno de los tres modelos garantiza esto de fábrica entre generaciones separadas. Los dos enfoques que funcionan: alimentar la misma imagen de referencia en modo imagen-a-video (los tres admiten I2V), o entrenar un pequeño LoRA de tu personaje. Wan 2.2 y LTX-2 tienen flujos de trabajo LoRA documentados para esto — la versión de LTX-2 se llama IC-LoRA (in-context LoRA) y admite explícitamente consistencia multi-personaje. La orientación de la comunidad es consistente en un punto: un LoRA entrenado da resultados mucho más fiables que el prompting o una imagen de referencia por sí solos. Las funciones de kit de marca y avatar de IA de InVideo resuelven el mismo problema subyacente de otra forma — un avatar y perfil de voz fijos que configuras una vez y reutilizas, sin necesidad de entrenamiento.
Pruébalo antes de decidir
No necesitas comprometerte con una configuración de GPU local — ni con una suscripción de pago — solo para evaluar el flujo de trabajo en la nube. Antes de comprar hardware o de pasar un fin de semana con ComfyUI, vale la pena dedicar cinco minutos a la otra vía primero:
1. Prueba la versión gratuita de InVideo. 2. Crea un video corto. 3. Evalúa la calidad del resultado y cómo se sintió el flujo de trabajo. 4. Compara esa experiencia con el esfuerzo de configuración que requeriría una instalación local.
Eso convierte la comparación de algo que lees en algo que puedes probar tú mismo en menos tiempo del que toma leer el resto de este artículo.
El veredicto
Ve por lo local si tienes (o vas a comprar) una GPU de 12GB o más, disfrutas construir tus propias herramientas y valoras la privacidad y las generaciones ilimitadas a $0 por encima de la comodidad. Wan 2.2 es la base más segura — máxima calidad, Apache 2.0, sin letra pequeña — con LTX-2 como el especialista en velocidad y sonido.
Ve por la nube si no tienes el hardware, no quieres la configuración, o necesitas videos terminados en lugar de clips en bruto. Para la mayoría de las personas que simplemente quieren hacer videos generados con IA, la ruta en la nube es el punto de partida más fácil: si no tienes ya el hardware y el interés técnico que requiere la generación local, InVideo elimina la mayor parte de esa complejidad en un solo prompt, con cada modelo y activo integrado y automatización incluida — desde $0 para probar y $17/mes (facturado anualmente) para quitar la marca de agua. La forma más sencilla de averiguar si te encaja es probar la versión gratuita.
Ambas puertas llevan a la IA de video. La pregunta nunca fue cuál tecnología es mejor — sino qué flujo de trabajo se ajusta a tu equipo, tu paciencia y tus objetivos.
Fuentes
- Wan 2.2 en GitHub — repositorio oficial, licencia e instrucciones de configuración.
- Wan 2.2 en Hugging Face — ficha oficial del modelo y descarga.
- Licencia del modelo LTX — términos oficiales de la LTX Community License.
- Página del modelo LTX-2 — arquitectura oficial y detalles de lanzamiento.
- HunyuanVideo 1.5 en GitHub — repositorio oficial y archivo LICENSE, incluyendo la exclusión de UE/Reino Unido/Corea del Sur.
- Tabla de posiciones VBench-2.0 — benchmark independiente usado para las cifras de calidad y fidelidad física.
- Precios de InVideo — detalles oficiales de planes y precios.
- Servidor MCP de InVideo — documentación oficial de automatización.
- MiniMax H3 en GitHub — repositorio oficial.
- MiniMax H3 en Hugging Face — pesos oficiales del modelo.
- InVideo: ¿Cuánto tiempo toma hacer un cortometraje con IA? — cifras propias de InVideo sobre el tiempo de producción de extremo a extremo (2–5 días).
- Requisitos del sistema de ComfyUI — documentación oficial de soporte MPS para Mac/Apple Silicon.
- Blog de LTX: Cómo usar IC-LoRA en LTX-2 — guía oficial de consistencia de personaje (IC-LoRA).
