不是。生成从随机变量 开始,模型学习的是一系列反向条件分布;不存在一张预先藏在噪声里的唯一原图。
02–05DDPM core
两个过程,一次学习。
前向过程是人为规定的噪声机制;反向过程才是神经网络需要学习的生成机制。把两者混在一起,是理解 DDPM 最常见的障碍。
DDPM 是潜变量生成模型。 是可见数据, 是与数据同维度的潜变量;积分表示把所有可能的潜变量路径都边缘化,最后只关心模型赋予 的概率。
前向扩散
固定的 q 逐步破坏数据,无需训练。
进入章节 →反向过程
学习 ,把噪声一步步变回数据。
进入章节 →训练目标
把变分目标化为可操作的噪声 MSE。
进入章节 →采样算法
从标准高斯开始执行 T 次反向转移。
进入章节 →边界说明: 本站将 Ho、Jain、Abbeel(2020)的 DDPM 定义与 DDIM、CFG、v-prediction、Latent Diffusion 等后续工作明确分开。
先把似是而非的直觉拆掉。
学完主线以后,不要把新名词堆成一堵墙。
按“采样 → score → 连续时间 → 条件 → 潜空间”的问题顺序进入拓展;每一步都回答它修补了 DDPM 的哪一处限制。
01采样改进
DDIM
重新设计生成路径,让相同训练目标支持确定性或少步采样。
02统一视角
Score matching
学习 ∇x log p(x),从“预测噪声”看到背后的概率梯度。
03高阶数学
SDE / ODE
把离散时间步推广到连续时间,理解 reverse-time SDE。
04条件生成
Guidance
用分类器梯度或条件/无条件预测差,引导样本满足条件。
05系统扩展
Latent diffusion
先用自编码器压缩图像,再在潜空间做扩散。