Conclusiones clave
- 16 herramientas, dos trabajos: generación de imagen y vídeo (13) y visión y OCR (3).
- La tabla se genera a partir del registro de cada herramienta y se contrasta con su README o sitio oficial; un guion significa "no indicado en la documentación", nunca "no".
- Las licencias difieren de formas que importan: por ejemplo, AUTOMATIC1111, DiffusionBee, Stable Diffusion WebUI Forge y Locally Uncensored son AGPL-3.0, ComfyUI y Fooocus son GPL-3.0, AnimateDiff, ControlNet e InvokeAI son Apache-2.0, StableSwarmUI y ToolNeuron son MIT, y Stable Diffusion usa una licencia OpenRAIL.
- Cada nombre de herramienta de la tabla enlaza a su propio análisis en PromptQuorum, donde se explican los pasos de instalación y los límites.
📍 En una frase
Las herramientas locales de imagen son dos trabajos distintos — generar imágenes y vídeo, y entender imágenes — por lo que las 16 herramientas del directorio de PromptQuorum se comparan dentro de cada trabajo, con una tabla generada a partir de los mismos datos que el análisis propio de cada herramienta.
💬 En términos simples
Algunas herramientas dibujan imágenes a partir de un prompt de texto, y otras miran una imagen y responden preguntas sobre ella. Comparar una herramienta de dibujo con un modelo que lee imágenes en "inpainting" no tiene sentido, así que esta guía compara solo lo comparable.
Cómo comparamos
Los datos de cada herramienta — precio, licencia, plataformas, requisitos de hardware y atributos específicos de la categoría — se guardan una sola vez, en el registro de esa herramienta en el directorio. La tabla comparativa de abajo se genera a partir de esos registros, y el análisis de cada herramienta se basa en el mismo registro, por lo que ambos no pueden indicar valores distintos.
Los atributos específicos de la categoría (por ejemplo, inpainting o compatibilidad con extensiones) se tomaron del README o sitio web oficial de cada proyecto y se contrastaron con la redacción exacta allí. Cuando la documentación no dice nada, la tabla muestra un guion en lugar de adivinar; cuando una afirmación tiene matices (experimental, dependiente de un fork o un servicio alojado y no una función local), el atributo se deja fuera de la tabla y se trata en el análisis de la herramienta.
Solo las herramientas con análisis propio en PromptQuorum están en la tabla. La comparación recoge herramientas que se ejecutan en tu propio hardware; no las clasifica, porque la adecuada depende de tu restricción.
Tabla comparativa
Elige un trabajo abajo y lee a lo largo de una fila. Haz clic en el nombre de una herramienta para abrir su análisis completo en PromptQuorum.
| Herramienta | Precio | Licencia | Plataformas | Ejecución | Hardware | Versión | Inpainting | Generación de video | Editor de flujos por nodos / grafos | Extensiones / plugins | Modo de poca VRAM | Servidor API local | Análisis | enlace de producto · divulgado |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| AnimateDiff | Gratis | Apache-2.0 | Windows, Linux, macOS | Local | 13 GB de VRAM | — | — | Sí | — | — | — | — | Leer análisis → | AnimateDiff |
| AUTOMATIC1111 | Gratis | AGPL-3.0 | macOS, Windows, Linux | Local | Basta con CPU | v1.10.1 | Sí | — | — | Sí | Sí | Sí | Leer análisis → | AUTOMATIC1111 |
| ComfyUI | Gratis | GPL-3.0 | macOS, Windows, Linux | Local | Basta con CPU | v0.36.0 | — | — | — | — | — | Sí | Leer análisis → | ComfyUI |
| ControlNet | Gratis | Apache-2.0 | Windows, Linux, macOS | Local | 8 GB de VRAM | — | — | — | — | — | Sí | — | Leer análisis → | ControlNet |
| DiffusionBee | Gratis | AGPL-3.0 | macOS | Local | Basta con CPU | — | Sí | Sí | — | — | — | — | Leer análisis → | DiffusionBee |
| Draw Things | Gratis | Proprietary | macOS, iOS | Local | 8 GB de RAM | — | — | Sí | — | — | — | — | Leer análisis → | Draw Things |
| Fooocus | Gratis | GPL-3.0 | Windows, Linux, macOS | Local | Basta con CPU | v2.5.5 | Sí | — | — | — | Sí | — | Leer análisis → | Fooocus |
| Invoke AI | Freemium | Apache-2.0 | Windows, Linux, macOS | Local | 4 GB de VRAM | — | Sí | — | Sí | — | — | — | Leer análisis → | Invoke AI |
| Locally Uncensored | De pago | AGPL-3.0 | Windows | Local | Depende del modelo | — | — | — | — | — | — | — | Leer análisis → | Locally Uncensored |
| Stable Diffusion | Gratis | OpenRAIL | macOS, Windows, Linux | Local | 10 GB de VRAM | — | — | — | — | — | — | — | Leer análisis → | Stable Diffusion |
| Stable Diffusion WebUI Forge | Gratis | AGPL-3.0 | Linux, macOS, Windows | Local | Depende del modelo | — | — | — | — | Sí | — | Sí | Leer análisis → | Stable Diffusion WebUI Forge |
| StableSwarmUI | Gratis | MIT | Windows, Linux | Local | 8 GB de VRAM | — | — | Sí | Sí | Sí | — | — | Leer análisis → | StableSwarmUI |
| ToolNeuron | Gratis | MIT | Android | Local | Depende del modelo | — | — | — | — | — | — | Sí | Leer análisis → | ToolNeuron |
«—» significa que la documentación del propio proyecto no lo indica, no que la función no exista. Los valores proceden del README oficial o del sitio de cada proyecto y se vuelven a comprobar cuando se actualiza el análisis de una herramienta.
Generación de imagen y vídeo: qué cambia
- Estilo de flujo de trabajo. ComfyUI, Invoke AI y StableSwarmUI documentan flujos basados en nodos o grafos. La documentación de las demás herramientas no describe un editor de nodos.
- Extensiones y plugins. AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge, StableSwarmUI y ToolNeuron documentan un sistema de extensiones o plugins.
- Vídeo. ComfyUI, StableSwarmUI, DiffusionBee, Draw Things, Locally Uncensored y AnimateDiff documentan la generación de vídeo o animación.
- Inpainting. AUTOMATIC1111, ComfyUI, DiffusionBee, Fooocus e Invoke AI documentan el inpainting.
- Funcionamiento con poca VRAM. AUTOMATIC1111, Fooocus y ControlNet documentan un modo de poca VRAM o un requisito declarado de VRAM reducida; para las demás, consulta el análisis, ya que el requisito depende del modelo que cargues.
- API local. AUTOMATIC1111, ComfyUI, Stable Diffusion WebUI Forge y ToolNeuron documentan una API a la que pueden llamar otras apps.
- Licencia y precio. AUTOMATIC1111, DiffusionBee, Stable Diffusion WebUI Forge y Locally Uncensored son AGPL-3.0; ComfyUI y Fooocus son GPL-3.0; AnimateDiff, ControlNet e Invoke AI son Apache-2.0; StableSwarmUI y ToolNeuron son MIT; Stable Diffusion usa una licencia OpenRAIL. Draw Things es una app de código cerrado, Locally Uncensored es una app de pago e Invoke AI es freemium. Las licencias copyleft imponen condiciones al distribuir versiones modificadas — consulta Licencias de herramientas de IA explicadas.
Visión y OCR: qué cambia
- Lectura de texto en imágenes. LLaVA y los modelos de visión de Ollama documentan la lectura o el reconocimiento de texto en imágenes.
- Varias imágenes por prompt. Idefics documenta que acepta varias imágenes en un mismo prompt.
- API local. Los modelos de visión de Ollama documentan una API local; la API documentada de Idefics está alojada y no es local, por lo que no se cuenta.
- Licencia. LLaVA e Idefics son Apache-2.0; los modelos de visión de Ollama son un conjunto de modelos con licencias distintas, así que consulta la licencia de cada modelo.
Lo que esta comparación no puede decirte
- Compara capacidades documentadas, no calidad. No dice nada sobre lo buenas que se ven las imágenes ni lo precisa que es la lectura de texto — para eso necesitas tus propios prompts y tu propio hardware.
- No incluye pruebas de velocidad: PromptQuorum no las ha medido para estas herramientas.
- Los guiones son lagunas en la documentación de los proyectos, no hallazgos negativos. Algunas herramientas pueden admitir una función que su README no menciona.
- Las herramientas de edición y escalado (Real-ESRGAN, FunClip) y DALL-E 3 mediante Ollama no se comparan aquí: las dos primeras tienen muy poco en común para compararse, y la última no tiene análisis en PromptQuorum.
- Las herramientas cambian rápido. El análisis de cada herramienta indica la versión con la que se contrastó, y esta guía se actualiza cuando se actualiza un análisis.
Preguntas frecuentes
¿Por qué se comparan por separado la generación de imágenes y los modelos de visión?
Hacen trabajos distintos, así que la mayoría de los atributos solo tienen sentido dentro de un trabajo — el inpainting se aplica a la generación de imágenes, la lectura de texto en imágenes a los modelos de visión. Compararlos en una sola tabla dejaría la mayoría de las celdas vacías o sin sentido.
¿Qué significa un guion en la tabla comparativa?
Significa que la documentación del propio proyecto no indica ese atributo. No significa que la función no exista; consulta el análisis de la herramienta o su repositorio.
¿Es Stable Diffusion en sí una app?
Stable Diffusion es una familia de modelos de imagen, no una app. Aparece junto a las apps porque tiene su propio análisis en PromptQuorum, y la mayoría de las herramientas de generación de aquí pueden ejecutar modelos de Stable Diffusion.
¿Alguna de estas herramientas tiene un enlace de afiliado?
No. PromptQuorum no tiene ninguna relación de afiliación con ninguna herramienta de esta comparación en el momento de escribir esto, y ningún enlace de aquí genera comisión.
¿Con qué frecuencia se actualiza esta comparación?
Se actualiza dos veces al año y siempre que se actualiza el análisis de alguna de las herramientas incluidas, porque la tabla se genera a partir de los mismos datos que esos análisis.
Fuentes
- El README o sitio web oficial de cada herramienta, indicado en el análisis de esa herramienta en PromptQuorum (enlazado desde la tabla comparativa).
- Directorio de apps de IA local de PromptQuorum — el registro a partir del cual se genera cada fila de la tabla.
- Licencias de herramientas de IA explicadas — qué significan las familias de licencias mencionadas arriba.