Conclusiones clave
- Stable Diffusion es una familia abierta de modelos de texto a imagen, no una app independiente — necesitas una interfaz aparte (AUTOMATIC1111, ComfyUI, InvokeAI o Fooocus) para ejecutarla localmente.
- Se lanzó por primera vez el 22 de agosto de 2022, en conjunto por Stability AI, el grupo de investigación CompVis de la LMU de Múnich y Runway ML, entrenado en parte con el conjunto de imágenes LAION-5B.
- Los términos de licencia difieren según la versión: SD 1.5/2.1/SDXL usan la licencia CreativeML Open RAIL-M / RAIL++-M (uso comercial permitido, sin límite de ingresos); SD 3/3.5 usan la Stability AI Community License (gratis por debajo de $1M de ingresos anuales con registro, licencia Enterprise requerida por encima).
- Las necesidades de hardware escalan según la versión: 4 GB de VRAM cubren SD 1.5, SDXL quiere 8–12 GB, y SD 3.5 Large quiere aproximadamente 12–16 GB según la precisión.
- Autoalojar es gratis bajo la licencia correspondiente; Stability AI vende por separado créditos de API alojada y una membresía de pago para quienes no quieren usar su propia GPU.
- FLUX (Black Forest Labs) generalmente lidera en fotorrealismo y fidelidad al prompt en 2026; Stable Diffusion sigue liderando en profundidad de ecosistema — la mayor cantidad de checkpoints, LoRAs y herramientas ControlNet de la comunidad.
Qué es Stable Diffusion
Stable Diffusion es un modelo de difusión latente (LDM, latent diffusion model): genera imágenes eliminando gradualmente ruido de una representación comprimida de una imagen, guiado por un prompt de texto, en lugar de trabajar directamente sobre píxeles de resolución completa. Por eso puede ejecutarse en GPUs de consumo en lugar de requerir hardware de centro de datos.
El modelo fue desarrollado por el grupo de investigación CompVis (Computer Vision & Learning) de la LMU de Múnich, dirigido por el profesor Björn Ommer, con Robin Rombach (más tarde en Stability AI) y Patrick Esser (Runway ML) como investigadores clave de la arquitectura de difusión latente subyacente. Stability AI financió el cómputo y colanzó la primera versión pública el 22 de agosto de 2022, junto con CompVis y Runway ML.
Los datos de entrenamiento de las versiones originales usaron subconjuntos de LAION-5B, un gran conjunto público de imágenes y texto creado por la organización sin fines de lucro alemana LAION — un punto relevante para el debate legal y ético en curso sobre el consentimiento de los datos de entrenamiento, que afecta a la mayoría de los modelos de imagen a gran escala, no solo a Stable Diffusion.
Es fundamental entender que "Stable Diffusion" se refiere a los pesos del modelo y el código de inferencia, no a una aplicación terminada. Para realmente escribir un prompt y ver una imagen, necesitas una interfaz. Las opciones más usadas son Stable Diffusion WebUI de AUTOMATIC1111, ComfyUI (basado en nodos, más control), InvokeAI (interfaz profesional pulida) y Fooocus (simplificado, el mínimo de clics para tu primera imagen). PromptQuorum cubrirá cada una de estas interfaces en reseñas dedicadas; este artículo se enfoca en el modelo subyacente.
📍 En una frase
Stable Diffusion es un modelo de difusión latente de pesos abiertos que convierte un prompt de texto en una imagen, distribuido como archivos de modelo y código descargables en lugar de como una app de consumo.
💬 En términos simples
Piénsalo como un motor, no como un coche — Stable Diffusion genera las imágenes, pero igual necesitas un tablero (AUTOMATIC1111, ComfyUI, InvokeAI o Fooocus) para escribir un prompt y ver el resultado.
Historial de versiones de Stable Diffusion
SD 1.4 / SD 1.5
- Lanzamiento:
- Agosto–octubre de 2022
- Familia de licencia:
- CreativeML Open RAIL-M
- Cambio destacado:
- Primera versión pública ampliamente adoptada; sigue siendo la base de miles de checkpoints de la comunidad
SD 2.0 / SD 2.1
- Lanzamiento:
- Noviembre–diciembre de 2022
- Familia de licencia:
- CreativeML Open RAIL++-M
- Cambio destacado:
- Nuevo codificador de texto (OpenCLIP); recepción mixta de la comunidad frente al ecosistema de checkpoints de 1.5
SDXL 1.0
- Lanzamiento:
- Julio de 2023
- Familia de licencia:
- CreativeML Open RAIL++-M
- Cambio destacado:
- Modelo base más grande (~3.5B parámetros), mayor detalle y composición a 1024×1024
SD 3 Medium
- Lanzamiento:
- Junio de 2024 (pesos)
- Familia de licencia:
- Stability AI Community License
- Cambio destacado:
- Nueva arquitectura de transformador de difusión multimodal (MMDiT), mejor renderizado de texto y fidelidad al prompt
SD 3.5 (Large, Large Turbo, Medium)
- Lanzamiento:
- Octubre de 2024
- Familia de licencia:
- Stability AI Community License
- Cambio destacado:
- Large (8B parámetros) mejora calidad y diversidad; Large Turbo cambia algo de calidad por velocidad de generación en 4 pasos; Medium (2.5B) apunta a hardware con menos VRAM
Las fechas de versión y conteos de parámetros están ampliamente reportados por Stability AI y fuentes de terceros; verifica cifras exactas y nuevos lanzamientos en Stability AI antes de citarlos en una especificación técnica. Última verificación: 2026-09-05.
Cómo ejecutar Stable Diffusion localmente
Ejecutar Stable Diffusion en tu propia GPU sigue el mismo esquema básico sin importar qué interfaz elijas al final.
- 1Revisa la VRAM de tu GPU
Why it matters: Confirma que tu GPU tiene suficiente VRAM para la versión que quieres (ver la tabla de hardware abajo) — esto determina qué versión y precisión de Stable Diffusion puedes ejecutar realmente. - 2Instala una interfaz
Why it matters: Descarga Stable Diffusion WebUI de AUTOMATIC1111, ComfyUI, InvokeAI o Fooocus — Stable Diffusion no tiene instalador propio, así que este paso es obligatorio, no opcional. - 3Descarga los pesos del modelo
Why it matters: Obtén el archivo de checkpoint (por ejemplo desde [Hugging Face](https://huggingface.co/stabilityai) o el sitio de Stability AI) para la versión específica que quieres — SD 1.5, SDXL o SD 3.5 — y confirma los términos de licencia para tu uso previsto antes de descargar. - 4Coloca el checkpoint en la carpeta de modelos de tu interfaz
Why it matters: Cada interfaz espera los archivos de modelo en un directorio específico (documentado en la guía de configuración de esa interfaz) para poder detectarlos y cargarlos al iniciar. - 5Escribe un prompt y genera
Why it matters: Ingresa un prompt de texto, ajusta la resolución y los pasos de muestreo, y genera — la primera ejecución suele ser más lenta mientras el modelo se carga en la VRAM. - 6Añade extensiones opcionales cuando te sientas cómodo
Why it matters: Los LoRAs (ajustes finos ligeros de estilo/sujeto), ControlNet (guía de pose y composición) y checkpoints personalizados son complementos de la comunidad sobre el modelo base, no parte de Stable Diffusion en sí.
Licencia de Stable Diffusion y términos de uso comercial
Esta distinción importa para cualquiera que planee usar imágenes generadas en un producto comercial. La licencia más antigua CreativeML Open RAIL-M / RAIL++-M, usada para SD 1.5, SD 2.1 y SDXL, permite el uso comercial sin límite de ingresos — sus restricciones se basan en el uso (no generar contenido dañino, ilegal o deshumanizante) en lugar de en los ingresos, y cualquier ajuste fino derivado debe mantener las mismas restricciones.
SD 3 y SD 3.5, en cambio, operan bajo la más reciente Stability AI Community License. Según el texto de licencia publicado en Hugging Face, el uso comercial u organizacional requiere registrarse con Stability AI, y si tú o tus filiales generan más de $1,000,000 de ingresos anuales agregados, la licencia otorgada bajo el acuerdo termina y debes solicitar una licencia Enterprise a Stability AI, que se otorga a discreción de Stability AI con términos negociados por separado.
El uso no comercial y de investigación de SD 3/3.5 no requiere registro bajo la Community License. Por separado, Stability AI también opera un programa de membresía (Non-Commercial, Professional, Enterprise) para su API alojada y herramientas — esa membresía es una oferta comercial distinta de los términos de licencia de autoalojamiento anteriores, y ambos términos pueden cambiar, así que confirma la redacción actual directamente en stability.ai antes de basar una decisión de negocio en ella.
📍 En una frase
Los términos de licencia de Stable Diffusion dependen de la versión: SD 1.5/2.1/SDXL usan la licencia CreativeML Open RAIL-M sin límite de ingresos comerciales, mientras que SD 3 y SD 3.5 usan la Stability AI Community License, gratis solo para organizaciones con menos de $1M de ingresos anuales.
💬 En términos simples
Las versiones antiguas de Stable Diffusion son amigables con el uso comercial sin condiciones adicionales más allá de restricciones de mal uso de contenido; las versiones más nuevas piden a las empresas grandes pagar una licencia Enterprise.
SD 1.5, SD 2.1, SDXL 1.0
- Licencia:
- CreativeML Open RAIL-M / RAIL++-M
- Uso comercial:
- Permitido, sin umbral de ingresos
- Condición clave:
- Restricciones basadas en el uso prohíben generar contenido dañino, ilegal o claramente engañoso; las obras derivadas deben mantener las mismas restricciones
SD 3, SD 3.5 (todas las variantes)
- Licencia:
- Stability AI Community License
- Uso comercial:
- Gratis por debajo de $1,000,000 de ingresos anuales (agregado, tú y filiales)
- Condición clave:
- Debes registrarte con Stability AI para uso comercial; la licencia termina al superar el umbral de $1M, requiriendo una licencia Enterprise aparte
Los términos de licencia son texto legal, no material de marketing — esta sección resume términos publicados públicamente con fecha 2026-09-05, pero no es asesoría legal. Lee el archivo de licencia real de la versión que planeas usar (por ejemplo, el LICENSE.md en la página de Hugging Face de cada modelo) antes de un despliegue comercial.
Requisitos de hardware por versión
SD 1.5
- VRAM mínima:
- 4 GB VRAM
- VRAM cómoda:
- 8 GB VRAM
- Notas:
- Funciona en la mayoría de las GPUs de la última década; el ecosistema de checkpoints/LoRA más grande de todas las versiones
SDXL 1.0
- VRAM mínima:
- 8 GB VRAM (con optimizaciones de memoria)
- VRAM cómoda:
- 12–16 GB VRAM
- Notas:
- Diseñado para salida nativa de 1024×1024; más lento y pesado por imagen que SD 1.5
SD 3.5 Medium
- VRAM mínima:
- ~6 GB VRAM (FP16)
- VRAM cómoda:
- 8–10 GB VRAM
- Notas:
- La variante más pequeña de SD 3.5 (2.5B parámetros), pensada para hardware con menos VRAM
SD 3.5 Large / Large Turbo
- VRAM mínima:
- ~11 GB VRAM (FP8)
- VRAM cómoda:
- 16 GB+ VRAM (FP16)
- Notas:
- 8B parámetros; Large Turbo cambia algo de calidad por velocidad de generación en 4 pasos
El uso exacto de VRAM depende de la resolución, el tamaño del lote, la precisión (FP16 vs. FP8/cuantizado) y las optimizaciones habilitadas en la interfaz (por ejemplo, attention slicing, model offloading) — trata esto como un rango de planificación, no como una garantía, y consulta la documentación actual de la interfaz específica.
Precio: autoalojamiento gratis vs. planes de Stability AI
Autoalojar Stable Diffusion es gratis — solo pagas por tu propio hardware y electricidad, bajo la licencia que aplique a la versión elegida (ver la sección de licencia arriba). No hay ninguna tarifa rastreada por PromptQuorum por descargar y ejecutar los pesos por tu cuenta, y no se requiere ninguna suscripción para la generación local sin conexión.
Stability AI vende por separado acceso alojado para quienes no quieren usar su propia GPU: una membresía Non-Commercial (gratis, para uso personal/de investigación), una membresía Professional de pago mensual (habilita uso comercial autoalojado y acceso a la API alojada), y una membresía Enterprise con precio personalizado para grandes organizaciones por encima del umbral de ingresos de la Community License. Stability AI también ofrece créditos de API de pago por uso para generación bajo demanda sin suscripción.
Stable Diffusion vs. alternativas
Stable Diffusion (vía AUTOMATIC1111/ComfyUI)
- Mejor para:
- El ecosistema más grande de checkpoints/LoRA/ControlNet, control local total
- Autoalojable:
- Sí — gratis, tu propia GPU
- Licencia / costo:
- RAIL-M (SD 1.5/2.1/SDXL, sin límite) o Community License (SD 3/3.5, gratis bajo $1M de ingresos)
- Compromiso clave:
- Requiere una interfaz aparte; las versiones nuevas exigen registro de licencia para uso comercial
FLUX (Black Forest Labs)
- Mejor para:
- Fotorrealismo y fidelidad al prompt desde el primer momento
- Autoalojable:
- Sí — gratis, tu propia GPU
- Licencia / costo:
- FLUX.1 schnell es Apache 2.0 (sin restricciones); FLUX dev/Kontext requieren una licencia de pago para uso comercial
- Compromiso clave:
- Ecosistema de comunidad más pequeño que Stable Diffusion; la licencia varía mucho según la variante
Checkpoints SDXL de la comunidad (forks en Civitai como Pony Diffusion, Juggernaut XL)
- Mejor para:
- Resultados específicos de estilo (anime, ilustración, ciertos looks fotorrealistas) sin trabajar el prompt
- Autoalojable:
- Sí — las mismas interfaces que el Stable Diffusion base
- Licencia / costo:
- Varía según checkpoint — muchos heredan los términos RAIL++-M, algunos añaden restricciones propias
- Compromiso clave:
- La calidad y claridad de licencia varían según el autor de la comunidad; verifica la página de licencia de cada checkpoint
Midjourney
- Mejor para:
- Estética por defecto distintiva con mínimo esfuerzo de prompt, flujo de trabajo en Discord/web
- Autoalojable:
- No — solo en la nube, requiere suscripción
- Licencia / costo:
- Niveles de suscripción de pago
- Compromiso clave:
- Sin privacidad local ni uso sin conexión; no se puede autoalojar ni ajustar el modelo base
DALL-E 3 (vía ChatGPT/API)
- Mejor para:
- Fuerte seguimiento de instrucciones para prompts directos, integrado con ChatGPT
- Autoalojable:
- No — solo en la nube
- Licencia / costo:
- Incluido en ChatGPT Plus/Pro o API de pago por uso
- Compromiso clave:
- Sin uso sin conexión, sin ajuste fino, sin ecosistema de checkpoints
Adobe Firefly
- Mejor para:
- Garantías de datos de entrenamiento comercialmente seguras para equipos empresariales/creativos
- Autoalojable:
- No — solo en la nube
- Licencia / costo:
- Suscripción, incluida en Creative Cloud o independiente
- Compromiso clave:
- Sin control local ni autoalojamiento; cambia flexibilidad por indemnización e integración con apps de Adobe
Esto es un resumen de posicionamiento, no un ranking de benchmarks — consulta Generación local de imágenes con IA vs. la nube para una comparación más profunda de FLUX, SD 3.5 y Qwen-Image en licencia y especificaciones de VRAM.
Para quién es Stable Diffusion
- Lectores que quieren el ecosistema de modelos de imagen locales más grande. Ningún otro modelo de imagen abierto tiene tantos checkpoints, LoRAs e integraciones de ControlNet de la comunidad construidos a su alrededor.
- Lectores dispuestos a instalar una interfaz. Si ya estás dispuesto a configurar AUTOMATIC1111, ComfyUI, InvokeAI o Fooocus, Stable Diffusion te da la gama más amplia de estilos preentrenados y ajustes finos para cargar en ella.
- Lectores que quieren control local total y privacidad. Una vez descargado, la generación ocurre completamente en tu propia GPU — ninguna imagen ni prompt sale de tu equipo.
- Pequeñas empresas o individuos bajo el umbral de $1M de ingresos. Tanto las versiones antiguas con licencia RAIL-M como la Community License de SD 3/3.5 (con registro gratuito) permiten uso comercial sin suscripción en esta escala.
- Aficionados o artistas que quieren ajustar un estilo personalizado. El tamaño y la madurez del ecosistema de checkpoints y entrenamiento de LoRA de Stable Diffusion lo convierte en la opción mejor documentada para entrenar un modelo de estilo personal.
Para quién NO es Stable Diffusion
- Lectores que quieren una app de un solo clic sin configuración. Stable Diffusion son pesos y código, no una app — todavía debes instalar y configurar una interfaz aparte. Quienes quieran cero configuración deberían considerar una herramienta en la nube como Midjourney o DALL-E 3.
- Lectores con poca VRAM y sin paciencia para optimizar. SDXL y SD 3.5 Large quieren 8 GB+ y 12–16 GB+ de VRAM respectivamente; quienes tengan GPUs antiguas o integradas pueden necesitar builds cuantizados/optimizados o deberían quedarse con SD 1.5, o usar una alternativa en la nube.
- Organizaciones por encima del umbral de $1M de ingresos anuales que planeen usar SD 3 o SD 3.5. La Community License exige una licencia Enterprise de Stability AI por encima de esa línea — presupuesta esa negociación, o usa una versión antigua con licencia RAIL-M si se ajusta a tu caso de uso.
- Lectores que quieren el mejor fotorrealismo desde el primer momento con el mínimo esfuerzo de prompt. Los informes de la comunidad y comparaciones en 2026 generalmente califican a FLUX por delante del Stable Diffusion base en fotorrealismo y fidelidad al prompt por defecto, aunque los checkpoints ajustados de Stable Diffusion pueden cerrar buena parte de esa brecha para estilos específicos.
- Equipos empresariales que necesiten indemnización contra reclamos por datos de entrenamiento. Los datos de entrenamiento de Stable Diffusion se basan en el conjunto público LAION-5B; los equipos que necesiten indemnización contractual para ese riesgo deberían evaluar Adobe Firefly en su lugar.
Preguntas frecuentes
¿Stable Diffusion es gratis?
Sí, para autoalojamiento. Los pesos del modelo y el código son gratis de descargar desde Hugging Face y GitHub, y ejecutarlos en tu propia GPU no cuesta nada más allá de tu propio hardware y electricidad. Stability AI vende por separado una membresía alojada y créditos de API de pago por uso para quienes no quieren usar su propia GPU — revisa los nombres de nivel y precios actuales en stability.ai.
¿Necesito una app especial para ejecutar Stable Diffusion?
Sí. Stable Diffusion se distribuye como pesos de modelo y código de inferencia, no como una aplicación independiente. Para realmente escribir un prompt y generar una imagen, necesitas una interfaz aparte como Stable Diffusion WebUI de AUTOMATIC1111, ComfyUI, InvokeAI o Fooocus instalada en tu equipo.
¿Puedo usar imágenes de Stable Diffusion comercialmente?
Depende de la versión. Las imágenes generadas con SD 1.5, SD 2.1 o SDXL caen bajo la licencia CreativeML Open RAIL-M / RAIL++-M, que permite uso comercial sin límite de ingresos (sujeto a restricciones de contenido basadas en el uso). Las imágenes generadas con SD 3 o SD 3.5 caen bajo la Stability AI Community License, que requiere registrarse con Stability AI para uso comercial y es gratis solo mientras tu organización se mantenga por debajo de $1,000,000 de ingresos anuales agregados — por encima de eso se requiere una licencia Enterprise de Stability AI.
¿Quién creó Stable Diffusion?
Stable Diffusion se lanzó públicamente por primera vez el 22 de agosto de 2022, como un esfuerzo conjunto entre Stability AI (que financió el cómputo), el grupo de investigación CompVis de la LMU de Múnich dirigido por el profesor Björn Ommer, y Runway ML. Robin Rombach y Patrick Esser estuvieron entre los investigadores clave de la arquitectura de difusión latente subyacente. Los datos de entrenamiento de las versiones originales usaron subconjuntos del conjunto de datos LAION-5B, creado por la organización sin fines de lucro LAION.
¿Cuánta VRAM necesita Stable Diffusion?
Depende de la versión: SD 1.5 funciona con tan solo 4 GB de VRAM, SDXL quiere aproximadamente 8–12 GB para un uso cómodo, SD 3.5 Medium necesita alrededor de 6–10 GB, y SD 3.5 Large quiere aproximadamente 11 GB (FP8) a 16 GB+ (FP16). El uso exacto varía según la resolución, el tamaño del lote y las optimizaciones que habilite tu interfaz elegida.
¿Dónde descargo Stable Diffusion?
Los pesos oficiales del modelo se publican en Hugging Face bajo la organización stabilityai, y el código de investigación original está en GitHub en stability-ai/stablediffusion y stability-ai/generative-models. Necesitarás por separado una interfaz como AUTOMATIC1111, ComfyUI, InvokeAI o Fooocus para cargar y ejecutar los pesos descargados.
¿Stable Diffusion es mejor que FLUX o Midjourney?
Depende de lo que valores. FLUX generalmente lidera en fotorrealismo y fidelidad al prompt desde el primer momento a partir de 2026, y Midjourney es conocido por una estética por defecto distintiva con mínimo esfuerzo de prompt, pero ninguno de los dos se puede autoalojar en tu propio hardware. La ventaja de Stable Diffusion es el tamaño de su ecosistema abierto — la mayor cantidad de checkpoints de la comunidad, ajustes finos LoRA y herramientas ControlNet de cualquier familia de modelos de imagen locales — además de control local total y, en versiones antiguas, sin límite de ingresos comerciales.
¿Cuál es la diferencia entre SD 1.5, SDXL y SD 3.5?
SD 1.5 (2022) es el más pequeño y ligero, con por mucho el ecosistema de checkpoints de la comunidad más grande. SDXL (2023) es un modelo base más grande construido para mayor detalle y salida nativa de 1024×1024. SD 3.5 (2024) usa una arquitectura de transformador de difusión multimodal más nueva con mejor renderizado de texto y fidelidad al prompt, pero cambia a la Stability AI Community License en lugar de la licencia RAIL-M más antigua usada por 1.5, 2.1 y SDXL.
¿Puedo ajustar mi propio modelo de Stable Diffusion?
Sí. Entrenar LoRAs (ajustes finos ligeros de estilo/sujeto) y checkpoints personalizados completos sobre Stable Diffusion es uno de los flujos de trabajo mejor documentados en la comunidad de generación de imágenes de código abierto, con herramientas construidas específicamente para este propósito. El ajuste fino resultante hereda las restricciones de licencia del modelo base del que fue entrenado.
Veredicto
Stable Diffusion se gana su lugar como el fundamento de la generación de imágenes local y abierta — no porque una sola versión sea hoy la de mejor rendimiento, sino por la profundidad del ecosistema construido a su alrededor desde 2022. Los lectores dispuestos a instalar una interfaz como AUTOMATIC1111, ComfyUI, InvokeAI o Fooocus obtienen acceso a la mayor biblioteca de checkpoints de la comunidad, ajustes finos LoRA y herramientas ControlNet de cualquier modelo de imagen local, además de control total sobre su propio hardware y datos. El compromiso es real: no es una app de un clic, las necesidades de hardware escalan de forma significativa según la versión, y la licencia pasó de la totalmente abierta CreativeML Open RAIL-M (SD 1.5/2.1/SDXL) a la Stability AI Community License limitada por ingresos (SD 3/3.5) — una distinción que vale la pena verificar antes de cualquier despliegue comercial. Los lectores que quieran el mejor fotorrealismo desde el primer momento también deberían evaluar FLUX; quienes quieran cero configuración deberían considerar una herramienta en la nube como Midjourney o Adobe Firefly. Para quien quiera autoalojar la generación de imágenes y beneficiarse del conjunto de herramientas más grande a su alrededor, Stable Diffusion sigue siendo el punto de partida razonable.
Fuentes
- Stability AI — Community License — anuncio oficial y términos de la Stability AI Community License para SD 3 y SD 3.5.
- Stability AI — sitio oficial — páginas de producto, niveles de membresía y precios actuales de la API.
- Stable Diffusion 3.5 Large — LICENSE.md en Hugging Face — texto legal completo de la Community License, incluido el umbral de $1M de ingresos.
- CreativeML Open RAIL-M License — GitHub de CompVis/stable-diffusion — texto legal completo de la licencia que cubre SD 1.x y SD 2.x.
- Modelos de Stability AI en Hugging Face — pesos oficiales de todas las versiones de Stable Diffusion.
- stability-ai/stablediffusion en GitHub — repositorio de código de investigación original.
- stability-ai/generative-models en GitHub — base de código de modelos generativos actual de Stability AI, incluido SD 3.x.
