Principais conclusões
- Stable Diffusion é uma família aberta de modelos de texto para imagem, não um aplicativo independente — você precisa de uma interface separada (AUTOMATIC1111, ComfyUI, InvokeAI ou Fooocus) para rodá-lo localmente.
- Foi lançado pela primeira vez em 22 de agosto de 2022, em conjunto pela Stability AI, pelo grupo de pesquisa CompVis da LMU de Munique e pela Runway ML, treinado em parte com o conjunto de imagens LAION-5B.
- Os termos de licença diferem por versão: SD 1.5/2.1/SDXL usam a licença CreativeML Open RAIL-M / RAIL++-M (uso comercial permitido, sem limite de receita); SD 3/3.5 usam a Stability AI Community License (gratuita abaixo de US$ 1 milhão de receita anual com registro, licença Enterprise exigida acima disso).
- As necessidades de hardware escalam conforme a versão: 4 GB de VRAM cobrem o SD 1.5, o SDXL quer 8–12 GB, e o SD 3.5 Large quer aproximadamente 12–16 GB dependendo da precisão.
- Hospedar por conta própria é gratuito sob a licença aplicável; a Stability AI vende separadamente créditos de API hospedada e uma assinatura paga para leitores sem GPU própria.
- O FLUX (Black Forest Labs) geralmente lidera em fotorrealismo e fidelidade ao prompt em 2026; o Stable Diffusion continua líder em profundidade de ecossistema — o maior número de checkpoints, LoRAs e ferramentas ControlNet da comunidade.
O que é o Stable Diffusion
Stable Diffusion é um modelo de difusão latente (LDM): ele gera imagens removendo gradualmente ruído de uma representação comprimida de uma imagem, guiado por um prompt de texto, em vez de trabalhar diretamente com pixels em resolução completa. É por isso que ele consegue rodar em GPUs de consumidor em vez de exigir hardware de data center.
O modelo foi desenvolvido pelo grupo de pesquisa CompVis (Computer Vision & Learning) da LMU de Munique, liderado pelo professor Björn Ommer, com Robin Rombach (depois na Stability AI) e Patrick Esser (Runway ML) como pesquisadores-chave da arquitetura de difusão latente subjacente. A Stability AI financiou o poder computacional e colançou a primeira versão pública em 22 de agosto de 2022, junto com o CompVis e a Runway ML.
Os dados de treinamento das versões originais usaram subconjuntos do LAION-5B, um grande conjunto público de imagens e textos reunido pela organização sem fins lucrativos alemã LAION — um ponto relevante para o debate jurídico e ético em curso sobre o consentimento dos dados de treinamento, que afeta a maioria dos modelos de imagem em larga escala, não apenas o Stable Diffusion.
É fundamental entender que "Stable Diffusion" se refere aos pesos do modelo e ao código de inferência, não a um aplicativo pronto. Para realmente digitar um prompt e ver uma imagem, você precisa de uma interface. As opções mais usadas são o Stable Diffusion WebUI da AUTOMATIC1111, o ComfyUI (baseado em nós, mais controle), o InvokeAI (interface profissional bem-acabada) e o Fooocus (simplificado, o menor número de cliques até a primeira imagem). O PromptQuorum vai cobrir cada uma dessas interfaces em análises dedicadas; este artigo foca no modelo em si.
📍 Em uma frase
Stable Diffusion é um modelo de difusão latente de pesos abertos que transforma um prompt de texto em uma imagem, distribuído como arquivos de modelo e código para download, e não como um aplicativo de consumidor.
💬 Em termos simples
Pense nele como um motor, não como um carro — o Stable Diffusion gera as imagens, mas você ainda precisa de um painel (AUTOMATIC1111, ComfyUI, InvokeAI ou Fooocus) para digitar um prompt e ver o resultado.
Histórico de versões do Stable Diffusion
SD 1.4 / SD 1.5
- Lançamento:
- Agosto–outubro de 2022
- Família de licença:
- CreativeML Open RAIL-M
- Mudança notável:
- Primeira versão pública amplamente adotada; ainda é a base de milhares de checkpoints da comunidade
SD 2.0 / SD 2.1
- Lançamento:
- Novembro–dezembro de 2022
- Família de licença:
- CreativeML Open RAIL++-M
- Mudança notável:
- Novo codificador de texto (OpenCLIP); recepção mista da comunidade em comparação ao ecossistema de checkpoints do 1.5
SDXL 1.0
- Lançamento:
- Julho de 2023
- Família de licença:
- CreativeML Open RAIL++-M
- Mudança notável:
- Modelo base maior (~3,5 bi de parâmetros), mais nitidez de detalhes e composição em 1024×1024
SD 3 Medium
- Lançamento:
- Junho de 2024 (pesos)
- Família de licença:
- Stability AI Community License
- Mudança notável:
- Nova arquitetura de transformador de difusão multimodal (MMDiT), melhor renderização de texto e fidelidade ao prompt
SD 3.5 (Large, Large Turbo, Medium)
- Lançamento:
- Outubro de 2024
- Família de licença:
- Stability AI Community License
- Mudança notável:
- Large (8 bi de parâmetros) melhora qualidade e diversidade; Large Turbo troca um pouco de qualidade por velocidade de geração em 4 passos; Medium (2,5 bi) foca em hardware com menos VRAM
Datas de versão e contagens de parâmetros são amplamente reportadas pela Stability AI e por fontes terceiras; verifique números exatos e novos lançamentos em Stability AI antes de citá-los em uma especificação técnica. Última verificação em 2026-09-05.
Como rodar o Stable Diffusion localmente
Rodar o Stable Diffusion na sua própria GPU segue o mesmo esquema básico independentemente da interface que você escolher no final.
- 1Verifique a VRAM da sua GPU
Why it matters: Confirme se sua GPU tem VRAM suficiente para a versão desejada (veja a tabela de hardware abaixo) — isso determina qual versão e precisão do Stable Diffusion você consegue rodar de fato. - 2Instale uma interface
Why it matters: Baixe o Stable Diffusion WebUI da AUTOMATIC1111, o ComfyUI, o InvokeAI ou o Fooocus — o Stable Diffusion não tem instalador próprio, então esta etapa é obrigatória, não opcional. - 3Baixe os pesos do modelo
Why it matters: Obtenha o arquivo de checkpoint (por exemplo, do [Hugging Face](https://huggingface.co/stabilityai) ou do site da Stability AI) para a versão específica desejada — SD 1.5, SDXL ou SD 3.5 — e confirme os termos de licença para o uso pretendido antes de baixar. - 4Coloque o checkpoint na pasta de modelos da sua interface
Why it matters: Cada interface espera os arquivos de modelo em um diretório específico (documentado no guia de configuração dessa interface) para poder detectá-los e carregá-los na inicialização. - 5Escreva um prompt e gere
Why it matters: Digite um prompt de texto, ajuste resolução e passos de amostragem, e gere — a primeira execução costuma ser mais lenta enquanto o modelo é carregado na VRAM. - 6Adicione extensões opcionais quando estiver confortável
Why it matters: LoRAs (ajustes finos leves de estilo/assunto), ControlNet (orientação de pose e composição) e checkpoints personalizados são complementos da comunidade sobre o modelo base, não fazem parte do Stable Diffusion em si.
Licença do Stable Diffusion e termos de uso comercial
Essa distinção importa para quem planeja usar imagens geradas em um produto comercial. A licença mais antiga CreativeML Open RAIL-M / RAIL++-M, usada para SD 1.5, SD 2.1 e SDXL, permite uso comercial sem limite de receita — suas restrições são baseadas em uso (nada de gerar conteúdo prejudicial, ilegal ou desumanizante) em vez de baseadas em receita, e qualquer ajuste fino derivado deve manter as mesmas restrições.
SD 3 e SD 3.5, por outro lado, operam sob a mais recente Stability AI Community License. Segundo o texto da licença publicado no Hugging Face, o uso comercial ou organizacional exige registro na Stability AI, e se você ou suas afiliadas gerarem juntas mais de US$ 1.000.000 em receita anual, a licença concedida pelo acordo é encerrada e você precisa solicitar uma licença Enterprise à Stability AI, concedida a critério da Stability AI com termos negociados separadamente.
O uso não comercial e de pesquisa do SD 3/3.5 não exige registro sob a Community License. Separadamente, a Stability AI também opera um programa de assinatura (Non-Commercial, Professional, Enterprise) para sua API hospedada e ferramentas — essa assinatura é uma oferta comercial distinta dos termos de licença de hospedagem própria acima, e ambos os termos podem mudar. Confirme a redação atual diretamente em stability.ai antes de basear uma decisão de negócio nela.
📍 Em uma frase
Os termos de licença do Stable Diffusion dependem da versão: SD 1.5/2.1/SDXL usam a licença CreativeML Open RAIL-M sem limite de receita comercial, enquanto SD 3 e SD 3.5 usam a Stability AI Community License, gratuita apenas para organizações com menos de US$ 1 milhão de receita anual.
💬 Em termos simples
Versões mais antigas do Stable Diffusion são amigáveis ao uso comercial sem outras condições além de restrições de uso indevido de conteúdo; as versões mais novas pedem que empresas maiores paguem por uma licença Enterprise.
SD 1.5, SD 2.1, SDXL 1.0
- Licença:
- CreativeML Open RAIL-M / RAIL++-M
- Uso comercial:
- Permitido, sem limite de receita
- Condição principal:
- Restrições baseadas em uso proíbem gerar conteúdo prejudicial, ilegal ou claramente enganoso; obras derivadas devem manter as mesmas restrições
SD 3, SD 3.5 (todas as variantes)
- Licença:
- Stability AI Community License
- Uso comercial:
- Gratuito abaixo de US$ 1.000.000 de receita anual (agregada, você e afiliadas)
- Condição principal:
- É preciso se registrar na Stability AI para uso comercial; a licença expira ao ultrapassar o limite de US$ 1 milhão, exigindo então uma licença Enterprise separada
Termos de licença são texto jurídico, não material de marketing — esta seção resume termos publicados publicamente com data de 2026-09-05, mas não é aconselhamento jurídico. Leia o arquivo de licença real da versão que pretende usar (por exemplo, o LICENSE.md na página do Hugging Face de cada modelo) antes de qualquer uso comercial.
Requisitos de hardware por versão
SD 1.5
- VRAM mínima:
- 4 GB VRAM
- VRAM confortável:
- 8 GB VRAM
- Notas:
- Roda na maioria das GPUs da última década; o maior ecossistema de checkpoints/LoRA de todas as versões
SDXL 1.0
- VRAM mínima:
- 8 GB VRAM (com otimizações de memória)
- VRAM confortável:
- 12–16 GB VRAM
- Notas:
- Projetado para saída nativa em 1024×1024; mais lento e pesado por imagem do que o SD 1.5
SD 3.5 Medium
- VRAM mínima:
- ~6 GB VRAM (FP16)
- VRAM confortável:
- 8–10 GB VRAM
- Notas:
- Menor variante do SD 3.5 (2,5 bi de parâmetros), voltada a hardware com menos VRAM
SD 3.5 Large / Large Turbo
- VRAM mínima:
- ~11 GB VRAM (FP8)
- VRAM confortável:
- 16 GB+ VRAM (FP16)
- Notas:
- 8 bi de parâmetros; Large Turbo troca um pouco de qualidade por velocidade de geração em 4 passos
O uso exato de VRAM depende da resolução, do tamanho do lote, da precisão (FP16 vs. FP8/quantizado) e das otimizações habilitadas na interface (por exemplo, attention slicing, model offloading) — trate isso como uma faixa de planejamento, não como garantia, e consulte a documentação atual da interface específica.
Preço: hospedagem própria gratuita vs. planos da Stability AI
Hospedar o Stable Diffusion por conta própria é gratuito — você paga apenas pelo seu hardware e pela eletricidade, sob a licença aplicável à versão escolhida (veja a seção de licença acima). Não há nenhuma taxa rastreada pelo PromptQuorum para baixar e executar os pesos por conta própria, e nenhuma assinatura é necessária para geração local offline.
A Stability AI vende separadamente acesso hospedado para leitores que não querem usar a própria GPU: uma assinatura Non-Commercial gratuita (para uso pessoal/pesquisa), uma assinatura Professional paga mensalmente (habilita uso comercial autoalojado e acesso à API hospedada), e uma assinatura Enterprise com preço personalizado para grandes organizações acima do limite de receita da Community License. A Stability AI também oferece créditos de API pré-pagos para geração sob demanda sem assinatura.
Stable Diffusion vs. alternativas
Stable Diffusion (via AUTOMATIC1111/ComfyUI)
- Melhor para:
- Maior ecossistema de checkpoints/LoRA/ControlNet, controle local total
- Pode ser autoalojado:
- Sim — gratuito, sua própria GPU
- Licença / custo:
- RAIL-M (SD 1.5/2.1/SDXL, sem limite) ou Community License (SD 3/3.5, gratuito abaixo de US$ 1 milhão de receita)
- Principal contrapartida:
- Exige uma interface separada; versões novas exigem registro de licença para uso comercial
FLUX (Black Forest Labs)
- Melhor para:
- Fotorrealismo e fidelidade ao prompt logo de cara
- Pode ser autoalojado:
- Sim — gratuito, sua própria GPU
- Licença / custo:
- FLUX.1 schnell é Apache 2.0 (irrestrito); FLUX dev/Kontext exigem licença paga para uso comercial
- Principal contrapartida:
- Ecossistema de comunidade menor que o Stable Diffusion; a licença varia bastante por variante
Checkpoints SDXL da comunidade (forks hospedados no Civitai como Pony Diffusion, Juggernaut XL)
- Melhor para:
- Resultados específicos de estilo (anime, ilustração, certos visuais fotorrealistas) sem trabalhar o prompt
- Pode ser autoalojado:
- Sim — as mesmas interfaces do Stable Diffusion base
- Licença / custo:
- Varia por checkpoint — muitos herdam os termos RAIL++-M, alguns adicionam restrições próprias
- Principal contrapartida:
- Qualidade e clareza de licença variam por autor da comunidade; verifique a página de licença de cada checkpoint
Midjourney
- Melhor para:
- Estética padrão marcante com o mínimo de esforço de prompt, fluxo de trabalho no Discord/web
- Pode ser autoalojado:
- Não — apenas nuvem, exige assinatura
- Licença / custo:
- Níveis de assinatura pagos
- Principal contrapartida:
- Sem privacidade local nem uso offline; não é possível autoalojar ou ajustar o modelo base
DALL-E 3 (via ChatGPT/API)
- Melhor para:
- Bom seguimento de instruções para prompts diretos, integrado ao ChatGPT
- Pode ser autoalojado:
- Não — apenas nuvem
- Licença / custo:
- Incluído no ChatGPT Plus/Pro ou API pré-paga
- Principal contrapartida:
- Sem uso offline, sem ajuste fino, sem ecossistema de checkpoints
Adobe Firefly
- Melhor para:
- Garantias de dados de treinamento comercialmente seguras para equipes empresariais/criativas
- Pode ser autoalojado:
- Não — apenas nuvem
- Licença / custo:
- Assinatura, empacotada com o Creative Cloud ou avulsa
- Principal contrapartida:
- Sem controle local nem autoalojamento; troca flexibilidade por indenização e integração com apps da Adobe
Isto é um resumo de posicionamento, não um ranking de benchmarks — veja Geração local de imagens com IA vs. nuvem para uma comparação mais profunda de FLUX, SD 3.5 e Qwen-Image em licença e VRAM.
Para quem o Stable Diffusion é indicado
- Leitor que quer o maior ecossistema de modelos de imagem locais. Nenhum outro modelo de imagem aberto tem tantos checkpoints, LoRAs e integrações ControlNet da comunidade construídos ao seu redor.
- Leitor disposto a instalar uma interface. Se você já está disposto a configurar AUTOMATIC1111, ComfyUI, InvokeAI ou Fooocus, o Stable Diffusion oferece a maior variedade de estilos pré-treinados e ajustes finos para carregar nele.
- Leitor que quer controle local total e privacidade. Após o download, a geração acontece inteiramente na sua própria GPU — nenhuma imagem ou prompt sai da sua máquina.
- Pequena empresa ou pessoa física abaixo do limite de US$ 1 milhão de receita. Tanto as versões antigas licenciadas via RAIL-M quanto a Community License do SD 3/3.5 (com registro gratuito) permitem uso comercial sem assinatura nessa escala.
- Hobbista ou artista que quer ajustar um estilo personalizado. O tamanho e a maturidade do ecossistema de checkpoints e treinamento de LoRA do Stable Diffusion o tornam a opção mais bem documentada para treinar um modelo de estilo pessoal.
Para quem o Stable Diffusion NÃO é indicado
- Leitor que quer um aplicativo de um clique sem configuração. Stable Diffusion são pesos e código, não um aplicativo — você ainda precisa instalar e configurar uma interface separada. Quem quiser zero configuração deveria considerar uma ferramenta em nuvem como Midjourney ou DALL-E 3.
- Leitor com pouca VRAM e sem paciência para otimizar. SDXL e SD 3.5 Large querem 8 GB+ e 12–16 GB+ de VRAM respectivamente; quem tem GPUs mais antigas ou integradas pode precisar de builds quantizados/otimizados ou deveria ficar no SD 1.5, ou usar uma alternativa em nuvem.
- Organização acima do limite de US$ 1 milhão de receita anual planejando usar SD 3 ou SD 3.5. A Community License exige uma licença Enterprise da Stability AI acima dessa linha — inclua essa negociação no orçamento, ou use uma versão antiga com licença RAIL-M se ela atender ao seu caso de uso.
- Leitor que quer o melhor fotorrealismo logo de cara com o mínimo de esforço de prompt. Relatos da comunidade e comparações em 2026 geralmente classificam o FLUX à frente do Stable Diffusion base em fotorrealismo e fidelidade ao prompt por padrão, embora checkpoints ajustados do Stable Diffusion possam reduzir bastante essa diferença para estilos específicos.
- Equipe empresarial que precisa de indenização contra reivindicações sobre dados de treinamento. Os dados de treinamento do Stable Diffusion se baseiam, entre outras fontes, no conjunto público LAION-5B; equipes que precisam de indenização contratual para esse risco devem avaliar o Adobe Firefly.
Perguntas frequentes
O Stable Diffusion é gratuito?
Sim, para hospedagem própria. Os pesos do modelo e o código são gratuitos para baixar do Hugging Face e do GitHub, e executá-los na sua própria GPU não custa nada além do seu próprio hardware e eletricidade. A Stability AI vende separadamente uma assinatura hospedada e créditos de API pré-pagos para leitores sem GPU própria — confira os nomes de nível e preços atuais em stability.ai.
Preciso de um aplicativo especial para rodar o Stable Diffusion?
Sim. O Stable Diffusion é distribuído como pesos de modelo e código de inferência, não como um aplicativo independente. Para realmente digitar um prompt e gerar uma imagem, você precisa de uma interface separada, como o Stable Diffusion WebUI da AUTOMATIC1111, o ComfyUI, o InvokeAI ou o Fooocus, instalada na sua máquina.
Posso usar imagens do Stable Diffusion comercialmente?
Depende da versão. Imagens geradas com SD 1.5, SD 2.1 ou SDXL se enquadram na licença CreativeML Open RAIL-M / RAIL++-M, que permite uso comercial sem limite de receita (sujeito a restrições de conteúdo baseadas em uso). Imagens geradas com SD 3 ou SD 3.5 se enquadram na Stability AI Community License, que exige registro na Stability AI para uso comercial e é gratuita apenas enquanto sua organização permanecer abaixo de US$ 1.000.000 de receita anual agregada — acima disso, é necessária uma licença Enterprise da Stability AI.
Quem criou o Stable Diffusion?
O Stable Diffusion foi lançado publicamente pela primeira vez em 22 de agosto de 2022, como um esforço conjunto entre a Stability AI (que financiou o poder computacional), o grupo de pesquisa CompVis da LMU de Munique liderado pelo professor Björn Ommer, e a Runway ML. Robin Rombach e Patrick Esser estavam entre os pesquisadores-chave da arquitetura de difusão latente subjacente. Os dados de treinamento das versões originais usaram subconjuntos do conjunto de dados LAION-5B, reunido pela organização sem fins lucrativos LAION.
Quanta VRAM o Stable Diffusion precisa?
Depende da versão: o SD 1.5 roda com apenas 4 GB de VRAM, o SDXL quer cerca de 8–12 GB para uso confortável, o SD 3.5 Medium precisa de cerca de 6–10 GB, e o SD 3.5 Large quer cerca de 11 GB (FP8) a 16 GB+ (FP16). O uso exato varia conforme a resolução, o tamanho do lote e as otimizações que sua interface escolhida habilita.
Onde baixo o Stable Diffusion?
Os pesos oficiais do modelo são publicados no Hugging Face sob a organização stabilityai, e o código de pesquisa original está no GitHub em stability-ai/stablediffusion e stability-ai/generative-models. Você vai precisar separadamente de uma interface como AUTOMATIC1111, ComfyUI, InvokeAI ou Fooocus para carregar e executar os pesos baixados.
O Stable Diffusion é melhor que o FLUX ou o Midjourney?
Depende do que você valoriza. O FLUX geralmente lidera em fotorrealismo e fidelidade ao prompt logo de cara a partir de 2026, e o Midjourney é conhecido por uma estética padrão marcante com o mínimo de esforço de prompt, mas nenhum dos dois pode ser autoalojado no seu próprio hardware. A vantagem do Stable Diffusion é o tamanho do seu ecossistema aberto — o maior número de checkpoints da comunidade, ajustes finos LoRA e ferramentas ControlNet de qualquer família de modelos de imagem locais — além de controle local total e, nas versões antigas, sem limite de receita comercial.
Qual é a diferença entre SD 1.5, SDXL e SD 3.5?
O SD 1.5 (2022) é o menor e mais leve, com de longe o maior ecossistema de checkpoints da comunidade. O SDXL (2023) é um modelo base maior, construído para mais detalhes e saída nativa em 1024×1024. O SD 3.5 (2024) usa uma arquitetura de transformador de difusão multimodal mais nova, com melhor renderização de texto e fidelidade ao prompt, mas passa a usar a Stability AI Community License em vez da licença RAIL-M mais antiga usada por 1.5, 2.1 e SDXL.
Posso ajustar meu próprio modelo de Stable Diffusion?
Sim. Treinar LoRAs (ajustes finos leves de estilo/assunto) e checkpoints personalizados completos sobre o Stable Diffusion é um dos fluxos de trabalho mais bem documentados na comunidade de geração de imagens de código aberto, apoiado por ferramentas criadas especificamente para esse propósito. O ajuste fino resultante herda as restrições de licença do modelo base a partir do qual foi treinado.
Veredito
O Stable Diffusion conquista seu lugar como a base da geração de imagens local e aberta — não porque uma única versão seja hoje a de melhor desempenho, mas pela profundidade do ecossistema construído ao seu redor desde 2022. Leitores dispostos a instalar uma interface como AUTOMATIC1111, ComfyUI, InvokeAI ou Fooocus têm acesso à maior biblioteca de checkpoints da comunidade, ajustes finos LoRA e ferramentas ControlNet de qualquer modelo de imagem local, além de controle total sobre seu próprio hardware e dados. A contrapartida é real: não é um aplicativo de um clique, as necessidades de hardware escalam de forma significativa por versão, e a licença mudou da totalmente aberta CreativeML Open RAIL-M (SD 1.5/2.1/SDXL) para a Stability AI Community License limitada por receita (SD 3/3.5) — uma distinção que vale a pena verificar antes de qualquer uso comercial. Leitores que querem o melhor fotorrealismo logo de cara também deveriam avaliar o FLUX; quem quiser zero configuração deveria considerar uma ferramenta em nuvem como Midjourney ou Adobe Firefly. Para quem quer hospedar a geração de imagens por conta própria e se beneficiar do maior conjunto de ferramentas ao redor, o Stable Diffusion continua sendo o ponto de partida razoável.
Fontes
- Stability AI — Community License — anúncio oficial e termos da Stability AI Community License para SD 3 e SD 3.5.
- Stability AI — site oficial — páginas de produto, níveis de assinatura e preços atuais da API.
- Stable Diffusion 3.5 Large — LICENSE.md no Hugging Face — texto legal completo da Community License, incluindo o limite de US$ 1 milhão de receita.
- Licença CreativeML Open RAIL-M — GitHub do CompVis/stable-diffusion — texto legal completo da licença que cobre SD 1.x e SD 2.x.
- Modelos da Stability AI no Hugging Face — pesos oficiais de todas as versões do Stable Diffusion.
- stability-ai/stablediffusion no GitHub — repositório de código de pesquisa original.
- stability-ai/generative-models no GitHub — base de código atual de modelos generativos da Stability AI, incluindo SD 3.x.
