Stable Cascade
Stable Cascade é um modelo de difusão de texto para imagem da Stability AI, construído na arquitetura Wurstchen. Ele utiliza um pipeline de três etapas (Etapas A, B e C) que comprime as imagens em um espaço latente de 24x24 antes de gerar uma saída de alta resolução, tornando o treinamento e a inferência muito mais baratos do que os modelos padrão de Stable Diffusion.
O design modular separa a geração condicional por texto (Etapa C) da decodificação de pixels (Etapas A e B). Essa divisão permite ajustar apenas a Etapa C para ControlNet, LoRA e fluxos de trabalho de treinamento personalizados, sem a necessidade de retreinar toda a pilha. A Stability AI lançou scripts para treinamento, ajuste fino, ControlNet e LoRA junto com o código de inferência no GitHub.
O Stable Cascade é voltado para pesquisadores, engenheiros de ML e artistas que desejam uma geração de imagens eficiente em hardware de consumo. Ele suporta texto-para-imagem, variações de imagem via embeddings de CLIP, e geração de imagem para imagem. Os pesos do modelo estão disponíveis no Hugging Face e são executados através da biblioteca diffusers.
Cascata de três estágios comprime imagens 1024x1024 para latentes de 24x24
A afinação fina do Estágio C é executada separadamente do decodificador para treinamento personalizado mais barato
Inclui suporte ao ControlNet para inpainting, detecção de borda Canny e super resolução 2x
Treinamento LoRA permite adicionar tokens personalizados e ajustar finamente o modelo condicional de texto
Variações de imagem funcionam alimentando embeddings CLIP de volta ao pipeline de geração
App Gradio incluído para inferência local sem precisar criar sua própria interface
Base de código open-source com licença MIT e scripts completos para treinamento, ajuste fino e inferência.
Design modular em três etapas permite ajustar finamente o Stage C de forma independente para fluxos de trabalho ControlNet e LoRA.
Alcança inferência mais rápida que o SDXL, apesar de ter mais parâmetros, graças ao espaço latente comprimido.
Variantes de tamanho de modelo múltiplas permitem equilibrar qualidade e requisitos de hardware.
Os pesos do modelo são restritos ao uso em pesquisas não comerciais sob a licença atual.
A inferência em tamanho real requer aproximadamente 20GB de VRAM, limitando o acesso em GPUs de entrada.
O código no GitHub está marcado como desenvolvimento inicial, com espaço para otimização.
A geração de rostos e pessoas pode produzir resultados inconsistentes, conforme a própria documentação da Stability AI.
O que é Stable Cascade?
Stable Cascade é um modelo de difusão texto-para-imagem desenvolvido pela Stability AI. Ele utiliza uma arquitetura em cascata de três estágios (Estágios A, B e C) construída sobre o framework Wurstchen para gerar imagens a partir de prompts de texto com alta eficiência de compressão.
O Stable Cascade pode ser usado para fins comerciais?
Atualmente, não. Os pesos do modelo Stable Cascade são disponibilizados sob a licença Stability AI Non-Commercial Research Community License. O código-fonte, por sua vez, é licenciado sob MIT. A Stability AI direciona usuários comerciais para a página de associação ou a plataforma para desenvolvedores para outros modelos de imagem.
Que hardware o Stable Cascade exige?
O Stable Cascade requer aproximadamente 20 GB de VRAM para inferência com os modelos de tamanho completo. Você pode reduzir os requisitos usando a variante do Estágio C com 1 bilhão de parâmetros e a do Estágio B com 700 milhões de parâmetros, embora a qualidade da saída possa diminuir.
Como executar o Stable Cascade?
Baixe os pesos do modelo no Hugging Face e use a biblioteca diffusers com StableCascadePriorPipeline e StableCascadeDecoderPipeline. A Stability AI também fornece scripts de treinamento e inferência, além de um aplicativo Gradio, no repositório oficial do GitHub.
Quais modos de geração o Stable Cascade suporta?
O Stable Cascade suporta geração padrão texto-para-imagem, variações de imagem usando embeddings de imagem CLIP, e geração de imagem-para-imagem adicionando ruído à imagem de entrada antes da remoção de ruído. As extensões ControlNet abrangem retoque (inpainting), ampliação (outpainting), borda Canny e super resolução 2x.
Como o Stable Cascade se compara ao Stable Diffusion?
O Stable Cascade alcança um fator de compressão espacial de 42x contra 8x do Stable Diffusion, codificando uma imagem 1024x1024 em latentes 24x24. A Stability AI reporta uma redução de custo de 16x para o treinamento do Estágio C comparado a um modelo Stable Diffusion de tamanho similar.

