Skip to content

参考

基于 DDPM/DDIM/LDM/CFG/LCM 论文 + Lilian Weng 博客整理

速查

  • 前向闭式解x_t = √ᾱ_t·x_0 + √(1-ᾱ_t)·ε,令 α_t=1-β_t、ᾱ_t=∏α_i
  • DDPM 简化损失L_simple = E[‖ε - ε_θ(x_t,t)‖²],网络预测噪声
  • 去噪均值μ_θ = (1/√α_t)·(x_t - (1-α_t)/√(1-ᾱ_t)·ε_θ(x_t,t))
  • DDIM:η=0 确定性采样,20-50 步达 DDPM 1000 步质量,无需重训
  • CFGε̃ = (1+w)·ε(·|c) - w·ε(·|∅),w 常用 7-9
  • LDM:扩散在 VAE 潜空间,算力降几十倍,文本条件经交叉注意力注入
  • 分数等价∇log p(x_t) ≈ -ε_θ/√(1-ᾱ_t)
  • DDPM 默认:T=1000,β 线性 1e-4→2e-2,U-Net
  • Stable Diffusion v1.5:潜空间 64×64×4(图像 512×512),CLIP 文本编码器,CFG w=7.5

核心公式速查表

名称公式说明
前向单步q(x_t|x_{t-1}) = N(√(1-β_t)x_{t-1}, β_t·I)逐步加噪
前向闭式q(x_t|x_0) = N(√ᾱ_t·x_0, (1-ᾱ_t)·I)一步到任意 t
加噪采样x_t = √ᾱ_t·x_0 + √(1-ᾱ_t)·ε重参数化
反向过程p_θ(x_{t-1}|x_t) = N(μ_θ(x_t,t), Σ_θ)神经网络参数化
去噪均值μ_θ = (1/√α_t)(x_t - (1-α_t)/√(1-ᾱ_t)·ε_θ)由预测噪声重写
简化损失L_simple = E[‖ε - ε_θ(x_t,t)‖²]DDPM 训练目标
采样步x_{t-1} = μ_θ + σ_t·z, z~N(0,I)迭代去噪
CFGε̃ = (1+w)ε(·|c) - w·ε(·|∅)引导采样
分数等价∇log p(x_t) ≈ -ε_θ/√(1-ᾱ_t)与分数模型统一
朗之万x_t = x_{t-1} + (δ/2)∇log p + √δ·ε分数采样

方差调度(Variance Schedule)对比

调度类型形式特点代表
线性β_t 线性递增DDPM 默认,简单DDPM(1e-4→2e-2)
余弦余弦曲线递增ᾱ 衰减更平滑,高分辨率表现好Improved DDPM
平方根√t 形式早期加噪更慢部分 LDM
学习式β_t 可学习自适应,复杂较少用

变体与改进对比

模型/方法年份核心贡献解决问题
DDPM2020预测噪声 + 简化损失奠定扩散生成范式
DDIM2020非马尔可夫确定性采样采样慢(千步→几十步)
Improved DDPM2021余弦调度 + 学习方差提升质量与似然
Score SDE2021连续时间 SDE 统一框架理论统一 + 新采样器
LDM(Stable Diffusion)2022潜空间扩散 + 交叉注意力算力消耗大
CFG2022无分类器引导条件控制与质量提升
DALL·E 2 / Imagen2022文本到图像大模型高质量文生图
DPM-Solver2022高阶 ODE 求解器进一步加速采样
LCM2023一致性蒸馏几步极速生成
DiT(Diffusion Transformer)2023用 Transformer 替代 U-Net架构扩展性(Sora 基础)
Sora / 视频扩散2024时空扩散生成视频视频生成

U-Net 与 DiT 架构对比

维度U-Net(传统)DiT(Diffusion Transformer)
主体卷积编码器-解码器 + 跳跃连接Transformer blocks
条件注入交叉注意力 + 时间嵌入AdaLN-Zero(自适应 LayerNorm)
扩展性受限于卷积,难超大模型Scaling 友好,可吸收超大算力
代表Stable Diffusion v1.5/v2Sora、Stable Diffusion 3
趋势仍是多数模型默认大模型时代新方向

采样器对比(Stable Diffusion WebUI 常见)

采样器类型步数特点
Euler a原始20-30快、稳定,质量中上
DDIM确定性20-50经典加速,可语义插值
DPM++ 2M Karras高阶 ODE20-30主流推荐,质量高
UniPC高阶10-20新一代极速
LCM蒸馏4-8极速(结合 LCM-LoRA)

经典论文与资源