Stable Cascade
Stable Cascade 是由 Stability AI 开发的一款文本到图像的扩散模型,基于 Wurstchen 架构。它采用三阶段流程(阶段 A、B 和 C),在将图像压缩到 24x24 潜在空间后再生成高分辨率输出,使训练和推理的成本远低于标准的 Stable Diffusion 模型。
模块化设计将文本条件生成(阶段 C)与像素解码(阶段 A 和 B)分开。这种分离允许你仅对阶段 C 进行微调,适用于 ControlNet、LoRA 和自定义训练流程,而无需重新训练整个模型。Stability AI 在 GitHub 上发布了训练、微调、ControlNet 和 LoRA 脚本,以及推理代码。
Stable Cascade 主要面向研究人员、机器学习工程师和艺术家,旨在实现对消费者硬件的高效图像生成。它支持文本转图像、通过 CLIP 嵌入的图像变体,以及图像到图像的生成。模型权重已在 Hugging Face 发布,并通过 diffusers 库运行。
三阶段级联将1024x1024图像压缩至24x24潜变量
阶段C微调独立于解码器运行,实现更便宜的定制训练
支持ControlNet,适用于修补、Canny边缘检测和2倍超分辨率
LoRA训练允许添加自定义标记并微调文本条件模型
图像变体通过将CLIP嵌入反馈到生成流程中实现
包含Gradio应用,可本地推理,无需自行编写UI
开源代码库,采用MIT许可,包含完整的训练、微调和推理脚本。
模块化三阶段设计允许您独立微调阶段C,支持ControlNet和LoRA工作流程。
尽管参数更多,但因压缩的潜在空间,实现了比SDXL更快的推理速度。
多种模型尺寸变体,让您在质量和硬件需求之间进行权衡。
模型权重在当前许可证下仅限于非商业研究用途。
完整尺寸的推理大约需要20GB的显存,限制了低端GPU的访问能力。
GitHub代码库标注为早期开发阶段,仍有优化空间。
根据Stability AI自有文档,面部和人物生成可能产生不一致的结果。
什么是 Stable Cascade?
Stable Cascade 是由 Stability AI 开发的文本到图像的扩散模型。它采用基于 Wurstchen 框架的三级级联架构(阶段 A、B 和 C),以高压缩效率从文本提示生成图像。
Stable Cascade 可以用于商业用途吗?
目前不可以。Stable Cascade 模型权重以 Stability AI 非商业研究社区许可协议发布。代码库本身则采用 MIT 许可。Stability AI 指导商业用户访问其会员页面或开发者平台以使用其他图像模型。
Stable Cascade 需要什么硬件?
使用全尺寸模型进行推理时,Stable Cascade 预计需要约 20GB 的显存。您可以使用较小的 1B 参数阶段 C 变体和 700M 参数阶段 B 变体来降低需求,但输出质量可能会有所下降。
如何运行 Stable Cascade?
从 Hugging Face 下载模型权重,使用 diffusers 库中的 StableCascadePriorPipeline 和 StableCascadeDecoderPipeline。Stability AI 在官方 GitHub 仓库中还提供了训练和推理脚本以及 Gradio 应用。
Stable Cascade 支持哪些生成模式?
Stable Cascade 支持标准的文本生成图像、使用 CLIP 图像嵌入的图像变体,以及通过向输入图像添加噪声然后去噪实现的图像到图像生成。ControlNet 扩展涵盖了图像修补、外扩、Canny 边缘检测和 2 倍超分辨率等功能。
Stable Cascade 与 Stable Diffusion 比较如何?
Stable Cascade 实现了 42 倍的空间压缩率,而 Stable Diffusion 为 8 倍,将 1024x1024 图像编码为 24x24 的潜在表示。Stability AI 报告称,与尺寸相似的 Stable Diffusion 模型相比,训练阶段 C 可节省 16 倍成本。

