扩散原野DIFFUSION FIELD
0/8
A–ZGlossary

不只是翻译:每个词都要知道它在流程里的位置。

32 个核心术语同时给出一句话直觉、严格定义、在扩散模型中的作用、公式与关联章节。

diffusion model

扩散模型

DDPM 总览
先破坏数据,再学习逆转破坏的生成模型。

严格一点:一类通过已知前向随机过程与可学习反向过程定义的数据生成模型。

在扩散中:本站讨论的总称;DDPM 是其中一种离散时间概率模型。

q(x1:Tx0),pθ(x0:T)q(x_{1:T}\mid x_0),\quad p_\theta(x_{0:T})
DDPM

去噪扩散概率模型

DDPM 总览
用固定前向链与可学习反向链构成的潜变量模型。

严格一点:Ho、Jain、Abbeel(2020)采用的离散时间扩散概率模型与实用训练参数化。

在扩散中:本站的核心学习主线。

pθ(x0)=pθ(x0:T)dx1:Tp_\theta(x_0)=\int p_\theta(x_{0:T})\,dx_{1:T}
forward process

前向过程

前向扩散
按预定规则逐步向数据加入高斯噪声。

严格一点:固定马尔可夫链 q(x1:Tx0)q(x_{1:T}\mid x_0),通常不含可训练参数。

在扩散中:构造可控的带噪训练样本与潜变量路径。

q(xtxt1)=N(αtxt1,βtI)q(x_t\mid x_{t-1})=\mathcal N(\sqrt{\alpha_t}x_{t-1},\beta_tI)
reverse process

反向过程

反向过程
从噪声出发,逐步采样回数据空间。

严格一点:由神经网络参数化的反向条件马尔可夫链。

在扩散中:真正承担生成任务的可学习过程。

pθ(xt1xt)p_\theta(x_{t-1}\mid x_t)
noise schedule

噪声调度

前向扩散
规定每个时间步加入多少噪声。

严格一点:从时间步 tt 到方差 βt\beta_t 的映射。

在扩散中:控制信号信息随时间丢失的速度。

{β1,,βT}\{\beta_1,\ldots,\beta_T\}
beta

βt\beta_t

前向扩散
当前一步新加入噪声的方差。

严格一点:前向转移 q(xtxt1)q(x_t\mid x_{t-1}) 中的标量方差参数。

在扩散中:同时决定本步噪声量与信号缩放量。

0<βt<10<\beta_t<1
alpha

αt\alpha_t

前向扩散
当前一步保留信号的比例。

严格一点:定义为 1βt1-\beta_t

在扩散中:把前向转移写成更紧凑的形式。

αt=1βt\alpha_t=1-\beta_t
alpha bar

累计 αˉt\bar\alpha_t

闭式采样
从第 1 步到第 tt 步累计保留的信号比例。

严格一点:α1\alpha_1αt\alpha_t 的连乘。

在扩散中:让任意 xtx_t 可以直接由 x0x_0 闭式采样。

αˉt=s=1tαs\bar\alpha_t=\prod_{s=1}^{t}\alpha_s
SNR

信噪比

闭式采样
当前位置上,信号方差与噪声方差的比值。

严格一点:在标准 DDPM 闭式参数化中由累计信号保留率决定。

在扩散中:帮助判断某个时间步还能看到多少数据结构。

SNR(t)=αˉt1αˉt\mathrm{SNR}(t)=\frac{\bar\alpha_t}{1-\bar\alpha_t}
latent variable

潜变量

DDPM 总览
生成路径中未被直接观测的变量。

严格一点:边缘似然中需要被积分或求和消去的隐藏随机变量。

在扩散中:DDPM 中 x1,,xTx_1,\ldots,x_Tx0x_0 同维,但不可见。

x1:Tx_{1:T}
Markov chain

马尔可夫链

数学基础
下一状态在给定当前状态后,不再依赖更早状态。

严格一点:满足条件独立性质的随机过程。

在扩散中:使前向与反向联合分布都能按相邻转移分解。

q(x1:Tx0)=t=1Tq(xtxt1)q(x_{1:T}\mid x_0)=\prod_{t=1}^{T}q(x_t\mid x_{t-1})
Gaussian distribution

高斯分布

数学基础
由均值和协方差完全确定的连续分布。

严格一点:多元高斯由位置 μ\mu 与形状、相关性 Σ\Sigma 描述。

在扩散中:线性高斯转移使 DDPM 得到可解析的闭式与后验。

xN(μ,Σ)x\sim\mathcal N(\mu,\Sigma)
posterior

后验分布

反向过程
看到条件之后,对未知量更新后的分布。

严格一点:训练时的真实反向后验显式条件于 xtx_tx0x_0

在扩散中:模型反向分布在 ELBO 中要逼近的目标。

q(xt1xt,x0)q(x_{t-1}\mid x_t,x_0)
prior

先验分布

反向过程
观察生成结果前对潜变量的预设分布。

严格一点:DDPM 通常令末端先验为标准高斯。

在扩散中:生成时提供无需数据即可采样的起点。

p(xT)=N(0,I)p(x_T)=\mathcal N(0,I)
likelihood

似然

训练目标
模型给观测数据分配多大概率。

严格一点:把参数视为待学习量时,pθ(x0)p_\theta(x_0) 作为 θ\theta 的函数。

在扩散中:最大化数据似然是训练生成模型的根本目标。

maxθ Eq(x0)[logpθ(x0)]\max_\theta\ \mathbb E_{q(x_0)}[\log p_\theta(x_0)]
ELBO

证据下界

训练目标
把难算的边缘似然变成可优化的下界。

严格一点:由变分分布与 Jensen 不等式得到的对数边缘似然下界。

在扩散中:把 DDPM 训练目标拆成可处理的 KL 与重建项。

logpθ(x0)ELBO\log p_\theta(x_0)\ge \mathrm{ELBO}
KL divergence

KL 散度

数学基础
衡量用 pp 近似 qq 时的信息差异。

严格一点:qq 下对数密度比的期望;非负但通常不对称。

在扩散中:衡量模型反向转移与真实后验的差异。

DKL(qp)=Eq ⁣[logqp]D_{\mathrm{KL}}(q\Vert p)=\mathbb E_q\!\left[\log\frac qp\right]
score function

得分函数

进阶路线
指向对数密度上升最快方向的向量场。

严格一点:概率密度对输入 xx 的对数梯度。

在扩散中:在 score-based 视角下直接参数化去噪方向。

xlogp(x)\nabla_x\log p(x)
score matching

得分匹配

进阶路线
不直接拟合密度,而是学习密度的梯度。

严格一点:使模型 score 接近数据分布 score 的估计方法。

在扩散中:连接去噪目标、噪声预测与连续时间扩散。

Esθ(x)xlogp(x)2\mathbb E\lVert s_\theta(x)-\nabla_x\log p(x)\rVert^2
Langevin dynamics

朗之万动力学

进阶路线
沿高密度方向移动,同时保留随机扰动。

严格一点:交替使用 score 梯度漂移与高斯噪声的随机采样动力学。

在扩散中:早期多噪声尺度 score 模型的采样方法。

xx+ηsθ(x)+2ηzx\leftarrow x+\eta s_\theta(x)+\sqrt{2\eta}\,z
U-Net

U-Net

PyTorch 实现
把多尺度上下文和细节通过跳连结合的网络。

严格一点:具有下采样路径、瓶颈、上采样路径与对应层跳跃连接的架构。

在扩散中:DDPM 常用的噪声预测器,但不是扩散理论本身。

εθ:RB×C×H×WRB×C×H×W\varepsilon_\theta:\mathbb R^{B\times C\times H\times W}\to\mathbb R^{B\times C\times H\times W}
time embedding

时间嵌入

PyTorch 实现
告诉网络当前输入有多吵。

严格一点:把标量时间步编码为向量并注入残差块。

在扩散中:让同一个网络适应从低噪声到高噪声的不同任务。

emb(t)RB×d\operatorname{emb}(t)\in\mathbb R^{B\times d}
reparameterization

重参数化

数学基础
把随机性移到与参数无关的标准噪声中。

严格一点:将随机变量写成确定性参数与独立噪声的可微变换。

在扩散中:使 xtx_t 可由 x0x_0αˉt\bar\alpha_tε\varepsilon 一步构造。

xt=αˉtx0+1αˉtεx_t=\sqrt{\bar\alpha_t}x_0+\sqrt{1-\bar\alpha_t}\varepsilon
epsilon prediction

ε\varepsilon 预测

训练目标
让网络猜出加入 x0x_0 的标准高斯噪声。

严格一点:εθ(xt,t)\varepsilon_\theta(x_t,t) 回归前向闭式采样中的 ε\varepsilon

在扩散中:原始 DDPM 的实用参数化与简化预测目标。

Eεεθ(xt,t)2\mathbb E\lVert\varepsilon-\varepsilon_\theta(x_t,t)\rVert^2
x0 prediction

x0x_0 预测

交互实验
让网络直接预测无噪声数据。

严格一点:xtx_ttt 回归或重建 x0x_0 的参数化。

在扩散中:是与噪声预测可相互转换的后续常见目标之一。

x^0=xt1αˉtεθαˉt\hat x_0=\frac{x_t-\sqrt{1-\bar\alpha_t}\varepsilon_\theta}{\sqrt{\bar\alpha_t}}
v-prediction

vv 预测

交互实验
在信号与噪声之间采用旋转后的预测坐标。

严格一点:一种信号与噪声的线性组合参数化。

在扩散中:是后续模型常用参数化,不应归因于原始 DDPM。

v=αˉtε1αˉtx0v=\sqrt{\bar\alpha_t}\varepsilon-\sqrt{1-\bar\alpha_t}x_0
DDIM

去噪扩散隐式模型

论文地图
共享训练目标、但重新构造生成过程的少步采样方法。

严格一点:通过与 DDPM 相同边缘分布对应的非马尔可夫过程定义生成路径。

在扩散中:支持确定性采样与减少函数评估次数。

η=0  deterministic sampling\eta=0\ \Longrightarrow\ \text{deterministic sampling}
guidance

引导

进阶路线
在采样时把生成方向推向给定条件。

严格一点:利用条件梯度或条件、无条件模型输出调整 score 或噪声预测。

在扩散中:提升文本、类别等条件一致性,但过强可能损害多样性。

εcfg=εu+w(εcεu)\varepsilon_{\mathrm{cfg}}=\varepsilon_u+w(\varepsilon_c-\varepsilon_u)
latent diffusion

潜空间扩散

论文地图
先压缩图像,再在较小的潜空间里扩散。

严格一点:在预训练自编码器的潜变量 zz 上训练扩散模型。

在扩散中:降低高分辨率像素扩散的计算成本;不是原始 DDPM。

z=E(x),x^=D(z^)z=\mathcal E(x),\qquad \hat x=\mathcal D(\hat z)
SDE

随机微分方程

进阶路线
用连续时间随机过程描述加噪与反演。

严格一点:由漂移项 ff 与扩散项 gg 定义的连续时间动力系统。

在扩散中:统一 VP、VE、sub-VP 与反向时间 score 过程。

dx=f(x,t)dt+g(t)dwdx=f(x,t)\,dt+g(t)\,dw
ODE

常微分方程

进阶路线
没有随机增量的连续确定性轨迹。

严格一点:状态导数由当前位置和时间唯一确定的动力系统。

在扩散中:probability flow ODE 与对应 SDE 共享时间边缘分布。

dxdt=f~(x,t)\frac{dx}{dt}=\tilde f(x,t)
EMA

指数移动平均

PyTorch 实现
保留一份变化更平滑的模型参数。

严格一点:用衰减系数对历次参数做指数加权平均。

在扩散中:工程上常用 EMA 权重采样;属于实践技巧,不是 DDPM 定义。

θˉγθˉ+(1γ)θ\bar\theta\leftarrow\gamma\bar\theta+(1-\gamma)\theta