开源项目 · Python · CreativeML OpenRAIL-M · 图像

在视频工作流中的位置
Stable Diffusion 是由德国慕尼黑大学 CompVis 实验室(Robin Rombach、Andreas Blattmann、Dominik Lorenz、Patrick Esser、Björn Ommer)在 2022 年发布的潜空间扩散模型(Latent Diffusion Model),论文 High-Resolution Image Synthesis with Latent Diffusion Models 入选 CVPR 2022 Oral。其训练得到了 Stability AI 与 Runway 的算力支持,并使用 LAION 的图像-文本数据集子集训练而成。2022 年 8 月 10 日 GitHub 开源后引发了整个 AI 绘画开源生态,是 SDXL、SD3、Flux、ComfyUI、WebUI 等所有后续工作的方法论起点。
核心能力围绕潜空间扩散这一架构创新展开:与直接在像素空间做扩散的 DALL-E 2 / Imagen 不同,Stable Diffusion 先用 KL-regularized autoencoder 将 512×512 图像压缩至 64×64×4 的潜空间,再在该潜空间做扩散过程,显著降低显存与算力门槛。具体模型规格:860M 参数 UNet + 123M 参数 CLIP ViT-L/14 文本编码器 + 下采样因子 8 的 autoencoder;先在 256×256 预训练再在 512×512 微调。仓库开源了 v1 系列的四个 checkpoint:sd-v1-1.ckpt(256² 237k steps + 512² 194k steps 在 laion2B-en 与 laion-high-resolution)、sd-v1-2.ckpt(在 laion-aesthetics v2 5+ 上 515k steps)、sd-v1-3.ckpt(在前者基础上加 10% 无文本条件 dropout)、sd-v1-4.ckpt(同样 225k steps)。参考采样脚本内置 Safety Checker(降低显式输出概率)与 invisible-watermark(标记机器生成)。HuggingFace diffusers 集成提供日常推理入口,期望社区主要在 diffusers 上做后续开发。
适用场景:作为方法论锚点被引用于绝大多数扩散模型研究论文;作为模型权重来源在 HuggingFace CompVis 组织下被各种 UI(A1111 WebUI / ComfyUI / Diffusers 脚本)加载;作为基础模型被 LoRA / Textual Inversion / Hypernetwork / DreamBooth 等微调方案反复训练。注意:仓库主分支自 2024 年 6 月起不再活跃提交(pushed_at = 2024-06-18),后续 SDXL / SD3 / SD3.5 的开发转至 Stability AI 自家仓库与 HuggingFace 上的非 CompVis 组织。硬件要求:脚本以 ldm conda 环境运行(conda env create -f environment.yaml),PyTorch + transformers 4.19.2 + diffusers + invisible-watermark;至少 10GB VRAM 才能出图。
License 为 CreativeML OpenRAIL-M(基于 Open RAIL M,含 use-based restrictions:禁止用于违法、歧视、生成虚假人物证词等具体场景,但保留商业使用权)。CompVis 团队在 README 中明确指出权重是研究产物而非产品,建议在生产环境中补充额外的安全机制。后续 SDXL、SD3 等 Stability AI 商业模型采用自家商用 License,与本仓库的 OpenRAIL-M 不一致。
效果展示







在视频工作流中的位置
快速开始
部署教程与文档以外链形式呈现,未做内嵌以保证时效性。