解释 中每个符号;说清条件分布为何不是唯一答案;判断马尔可夫依赖;计算一维高斯 KL;从边缘似然走到 ELBO。
1. 高斯分布:中心、尺度与方向
它在做什么:用少量参数描述一团连续随机变量可能出现在哪里。均值 μ 是中心;一维标准差 σ 是宽度;多维协方差矩阵 Σ 同时描述每个方向的尺度以及维度之间的相关性。
分布中心;DDPM 反向网络会参与预测条件均值。
方差 · 方差shape: 标量一维随机变量围绕均值的离散程度。
协方差 · 协方差shape: [D,D]多维尺度与方向;单位阵 表示各向同性。
单位阵 · 单位阵shape: [D,D]各维方差为 1、不同维度协方差为 0。
拖动一条高斯曲线
交换方向后数值通常不同:KL 散度不是对称距离。
协方差决定“云团朝哪里伸展”
标准差控制两个轴的尺度;相关系数 控制倾斜方向。单位阵 对应各向同性:每个方向的方差相同,等密度线是圆。
把二维协方差从 改成 ,等密度线会怎样?
2. 条件概率:给定 ,也不只有一个答案
为什么模型不直接输出唯一的 xₜ₋₁?
严重加噪后,不同原图可能得到相似 。反向必须保留多种可能性,而不是假装答案唯一。
给定条件 ≠ 消除所有随机性3. 马尔可夫链:给定上一步,就不再追问更早历史
马尔可夫性质不是说“系统没有历史”,而是说:在已经知道当前状态时,更早历史不再为下一状态提供额外条件信息。
:只依赖
给定 后,与 条件独立。
闭式公式能从 直接采样 ,这是否破坏前向过程的马尔可夫定义?
4. KL 散度:方向为什么重要
上方一维实验同时给出了 DKL(q∥p) 与 DKL(p∥q)。前者用 q 的高概率区域加权“p 是否覆盖它”;交换方向后,加权区域也交换,因此结果通常不同。KL 非负,但不是对称距离。
5. 重参数化:把随机性单独拿出来
随机采样集中在 ; 与 成为可微的确定量。对于 DDPM, 的闭式采样正是同一个结构:缩放后的信号 + 缩放后的标准噪声。
6. 为什么需要 ELBO
DDPM 引入 作为潜变量后,真正想最大化的是边缘似然 。但要把所有潜变量路径积分掉,直接计算很困难。ELBO 的作用不是“换一个无关目标”,而是构造一个可计算、可优化的下界。
从 log pθ(x₀) 走到 ELBO
一次只看一步。先说出这一步用了什么性质,再展开下一步。
我们的目标是让真实数据 x₀ 在模型下概率尽可能大。困难在于必须把所有潜变量路径积分掉。
使用:潜变量边缘化