扩散原野DIFFUSION FIELD
0/8
02–05DDPM core

两个过程,一次学习。

前向过程是人为规定的噪声机制;反向过程才是神经网络需要学习的生成机制。把两者混在一起,是理解 DDPM 最常见的障碍。

pθ(x0):=pθ(x0:T)dx1:Tp_\theta(x_0):=\int p_\theta(x_{0:T})\,dx_{1:T}

DDPM 是潜变量生成模型。x0x_0 是可见数据,x1,,xTx_1,\ldots,x_T 是与数据同维度的潜变量;积分表示把所有可能的潜变量路径都边缘化,最后只关心模型赋予 x0x_0 的概率。

原论文精读 · 公式 (1)–(16)

DDPM 不只是一条噪声 MSE。

沿着论文自己的编号,读清联合分布、变分界、真实后验、噪声参数化、简化目标,以及渐进式有损解压视角。

进入论文精读
边界说明: 本站将 Ho、Jain、Abbeel(2020)的 DDPM 定义与 DDIM、CFG、v-prediction、Latent Diffusion 等后续工作明确分开。
12 个高频误解

先把似是而非的直觉拆掉。

不是。生成从随机变量 xTx_T 开始,模型学习的是一系列反向条件分布;不存在一张预先藏在噪声里的唯一原图。

After DDPM

学完主线以后,不要把新名词堆成一堵墙。

按“采样 → score → 连续时间 → 条件 → 潜空间”的问题顺序进入拓展;每一步都回答它修补了 DDPM 的哪一处限制。

01

DDIM

重新设计生成路径,让相同训练目标支持确定性或少步采样。

采样改进
02

Score matching

学习 ∇x log p(x),从“预测噪声”看到背后的概率梯度。

统一视角
03

SDE / ODE

把离散时间步推广到连续时间,理解 reverse-time SDE。

高阶数学
04

Guidance

用分类器梯度或条件/无条件预测差,引导样本满足条件。

条件生成
05

Latent diffusion

先用自编码器压缩图像,再在潜空间做扩散。

系统扩展
打开论文地图 先查进阶术语