尧图精选

从DDPM到Flow Matching:生成模型采样技术演进与实战

🕒 发布时间:2026/9/25 17:17:42 📁 来源:尧图网络
1. 从 DDPM 到 Flow Matching一条生成模型的主线搞生成模型的人绕不开一条主线从 DDPM 开始到 DDIM 加速采样再到把离散的扩散过程写成连续的 SDE/ODE最后收敛到 Flow Matching 这套更干净的框架。这条线不是简单的“模型换代”而是同一件事——把噪声变成数据——在不同数学视角下的反复重写。我最初接触 DDPM 的时候被那个“加噪一千步再一步步去噪”的流程绕得头晕后来把 SDE 和 ODE 的视角补上才真正理解为什么 DDIM 能跳步、为什么 Flow Matching 能把训练目标写得那么简单。这篇内容适合两类人一类是已经跑过 Stable Diffusion 或类似模型、想搞清楚采样器背后到底在算什么的人另一类是准备自己动手实现一个从零开始的扩散模型、但被各种公式和变体搞晕的人。我会按“DDPM → DDIM → SDE/ODE → Flow Matching”的顺序把每个阶段的核心思路、关键公式、实操要点和踩坑经验讲清楚。不会堆砌推导但该有的参数计算和代码片段会给到位保证你看完能自己复现一条完整的采样链路。2. DDPM把“去噪”这件事拆成一千步2.1 DDPM 到底在学什么DDPMDenoising Diffusion Probabilistic Model的核心思想可以用一句话概括如果我能把一张图一步步加噪变成纯高斯噪声那我反过来学一个网络一步步去噪就能从噪声里生成图。前向过程是固定的、不需要学的就是不断往数据里加高斯噪声反向过程才是要训练的部分网络在每个时间步预测“这一步加进去的噪声是什么”。前向过程的公式很简洁q(x_t | x_{t-1}) N(x_t; sqrt(1-β_t) x_{t-1}, β_t I)其中 β_t 是每一步的噪声方差通常从 1e-4 线性增加到 0.02总共 T1000 步。这个设计的好处是可以直接写出任意时刻 x_t 关于 x_0 的闭式表达x_t sqrt(ᾱ_t) x_0 sqrt(1-ᾱ_t) ε, ε ~ N(0, I)其中 α_t 1-β_tᾱ_t 是 α_t 的累乘。这个闭式表达是 DDPM 能高效训练的关键——不需要真的跑一千步加噪随机采一个 t 就能直接算出 x_t。训练目标也简单得不像话就是预测噪声的 MSEL E_{t,x_0,ε} [ || ε - ε_θ(x_t, t) ||² ]我一开始觉得这也太朴素了后来才明白这个目标等价于在优化证据下界ELBO的一个简化版本去掉了一些权重系数后反而更稳定。实际训练时t 是均匀采样的但有些实现会用重要性采样让难学的 t 多出现几次。2.2 反向采样为什么慢训练完之后采样是从 x_T ~ N(0, I) 开始逐步往回走x_{t-1} (1/sqrt(α_t)) (x_t - (β_t/sqrt(1-ᾱ_t)) ε_θ(x_t, t)) σ_t z其中 σ_t sqrt(β_t) 或 sqrt(β̃_t)z 是标准高斯噪声t0 时不加。问题就在这里每一步都要跑一次网络T1000 就意味着生成一张图要前向传播一千次。我在 1080Ti 上跑 512x512 的图一张要将近两分钟这在实际应用里完全不可接受。注意DDPM 的采样方差 σ_t 有两种选择原文里说两者效果差不多但实测下来用 β_t 在低分辨率下更稳用 β̃_t 在高分辨率下细节更好。这个差异在小图上不明显图越大越能看出来。2.3 实操中的几个关键参数参数常用值作用调整影响T1000总扩散步数太少则前向过程不够高斯化太多则训练慢β 调度linear 1e-4→0.02噪声方差cosine 调度在低步数下更好网络结构U-Net预测噪声带注意力的大 U-Net 效果最好时间嵌入正弦位置编码告诉网络当前 t必须做否则网络不知道在哪个噪声水平我踩过的一个坑是β 调度用 linear 的时候前向过程在 t 接近 T 时噪声已经饱和导致最后几百步的梯度几乎为零训练效率低。换成 cosine 调度后有效训练步数明显增加同样的 epoch 数下 FID 能降 2-3 个点。3. DDIM把随机采样变成确定性采样3.1 DDIM 的核心洞察DDIMDenoising Diffusion Implicit Model的出发点很直接DDPM 的反向过程是马尔可夫的必须一步步走但如果我把它改写成非马尔可夫的形式就能跳步。具体做法是重新定义前向过程让 x_t 不仅依赖 x_{t-1}还依赖 x_0这样反向过程就可以在任意子序列上定义。DDIM 的采样公式是x_{t-1} sqrt(ᾱ_{t-1}) x_0_pred sqrt(1-ᾱ_{t-1}) ε_θ(x_t, t)其中 x_0_pred 是从 x_t 和预测噪声反推出来的x_0_pred (x_t - sqrt(1-ᾱ_t) ε_θ(x_t, t)) / sqrt(ᾱ_t)这个公式里没有随机噪声项所以 DDIM 是确定性的。你可以从 T1000 里只取 50 步甚至 20 步来采样速度提升 20-50 倍而质量下降很小。3.2 跳步采样的参数选择DDIM 的跳步不是随便跳的常用的子序列构造方式是均匀间隔# 从 1000 步里取 50 步 step_ratio 1000 // 50 timesteps list(range(0, 1000, step_ratio))[::-1]但实测下来在低步数下均匀间隔不如非均匀间隔。原因是前向过程在 t 小的时候变化快t 大的时候变化慢所以应该在小 t 区域多采几步。我常用的一个启发式是# 非均匀采样小 t 密集 timesteps [int((i/num_steps)**2 * T) for i in range(num_steps)][::-1]这个平方映射让采样点在小 t 处更密20 步就能出可用的图50 步基本和 1000 步 DDPM 肉眼无差。3.3 DDIM 的确定性带来的额外好处DDIM 因为是确定性的所以有一个 DDPM 没有的能力隐空间插值。你可以从两张图分别反推回 x_T然后线性插值再采样回来得到平滑的过渡。这个在 DDPM 里做不到因为随机噪声会破坏插值的连续性。提示DDIM 反推inversion的精度受步数影响很大步数太少时反推再采样回来会有明显偏差。如果要做编辑类任务建议至少用 100 步做 inversion。我实际用下来DDIM 的 50 步采样在 512x512 上大概 3-5 秒一张V100比 DDPM 快了一个数量级质量损失在 FID 上大概 1-2 个点。这个 trade-off 在大多数应用里都是值得的。4. SDE/ODE 视角把扩散过程写成连续时间4.1 从离散到连续的桥梁DDPM 和 DDIM 都是离散时间步的但如果你把 T 推向无穷大步长趋向于零整个加噪过程就变成一个连续时间的随机微分方程SDEdx f(x, t) dt g(t) dw其中 f 是漂移项g 是扩散项w 是布朗运动。对于 DDPM 的设定f(x,t) -0.5 β(t) xg(t) sqrt(β(t))。这个 SDE 的前向过程会把数据分布逐渐变成标准高斯。反向过程也是一个 SDEdx [f(x,t) - g(t)² ∇_x log p_t(x)] dt g(t) dw̄其中 ∇_x log p_t(x) 是分数函数score function也就是网络要学的东西。这里有个关键联系网络预测的噪声 ε_θ 和分数函数是等价的只差一个缩放因子∇_x log p_t(x) ≈ -ε_θ(x, t) / sqrt(1-ᾱ_t)这个等价关系是理解后续所有变体的钥匙。4.2 Probability Flow ODE去掉随机性的连续版本反向 SDE 里还有布朗运动项所以采样仍然是随机的。但如果把扩散项去掉只保留漂移项就得到一个常微分方程ODEdx [f(x,t) - 0.5 g(t)² ∇_x log p_t(x)] dt这个 ODE 叫 Probability Flow ODE它的神奇之处在于在任意时刻 t它的边缘分布和反向 SDE 完全一样。也就是说你可以用确定性 ODE 采样得到和随机 SDE 相同的分布。DDIM 其实就是这个 ODE 的一个离散化特例。这个视角统一了很多东西DDPM 是 SDE 的离散化DDIM 是 ODE 的离散化而各种高阶求解器如 Heun、DPM-Solver都是在 ODE 上做更精确的数值积分。4.3 用 ODE 求解器加速采样既然写成了 ODE就可以用现成的数值方法。我试过几种求解器步数质量速度Euler50一般快Heun25好中DPM-Solver-220很好中DPM-Solver-315很好慢DPM-Solver 系列的核心是把 ODE 的解写成关于 t 的积分形式然后用泰勒展开近似这样每一步能利用多阶信息步数可以压到 15-20 步。我在实际项目里默认用 DPM-Solver-220 步就能达到 DDPM 1000 步的质量速度提升 50 倍。注意高阶求解器在步数极少10时会不稳定因为泰勒展开的截断误差变大。如果非要 10 步以内建议用专门的蒸馏方法而不是硬压求解器步数。4.4 SDE 和 ODE 的取舍SDE 采样有随机性好处是能产生更多样的结果坏处是同样步数下质量略低。ODE 采样确定性强同样步数下质量更高但多样性略差。我在做需要多样性的任务如艺术生成时用 SDE做需要精确控制的任务如编辑、超分时用 ODE。还有一个细节SDE 采样的随机性可以用来做“噪声注入”式的编辑比如在某个时间步注入特定噪声来改变局部内容这个在 ODE 里做不到。5. Flow Matching把扩散模型写成直线传输5.1 Flow Matching 的核心思想Flow Matching 的出发点和扩散模型不同我不关心加噪过程我只关心怎么把噪声分布传输到数据分布。具体来说我定义一个时间相关的向量场 v(x, t)它描述每个点在每个时刻应该往哪个方向走。如果我能学出这个向量场那从噪声出发沿着它积分就能到达数据。训练目标是让网络预测的向量场匹配一个目标向量场L E_{t,x_0,x_1} [ || v_θ(x_t, t) - (x_1 - x_0) ||² ]其中 x_0 是噪声x_1 是数据x_t 是两者之间的线性插值x_t (1-t) x_0 t x_1这个目标比扩散模型的噪声预测目标更直接而且路径是直线所以采样时可以用很少的步数。5.2 为什么直线路径能加速采样扩散模型的路径是弯曲的因为加噪过程是非线性的sqrt(ᾱ_t) 和 sqrt(1-ᾱ_t) 的关系不是线性的。弯曲路径意味着 ODE 求解器需要很多步才能准确积分。Flow Matching 的路径是直线理论上一步就能走完实际中因为网络预测有误差需要几步来修正但 5-10 步就能出很好的结果。我实测下来Flow Matching 在 10 步时的 FID 已经接近 DDPM 1000 步的水平而 DDIM 在 10 步时还有明显差距。这个优势在实时应用里非常关键。5.3 条件 Flow Matching 和实际训练实际训练时我们用的是条件 Flow Matching即给定数据 x_1噪声 x_0 是从一个简单的分布如高斯采的路径是两者之间的直线。但这里有个问题如果 x_0 和 x_1 是随机配对的路径会交叉导致向量场多值。解决办法是让 x_0 和 x_1 有条件地配对比如用最优传输OT来配对这样路径尽量不交叉。实操中最简单的做法是每个 batch 里随机配对效果已经不错。如果追求更好效果可以用 mini-batch OT即在一个 batch 内用匈牙利算法做最优配对。我试过FID 能再降 1-2 个点但训练代码复杂度上升不少。5.4 Flow Matching 和扩散模型的统一视角其实 Flow Matching 可以看成扩散模型的一个特例如果我把扩散模型的 SDE 写成概率流 ODE然后重新参数化时间让路径变成直线就得到 Flow Matching。反过来扩散模型也可以看成 Flow Matching 的一种只是路径是弯曲的。这个统一视角的好处是你可以把扩散模型里的所有技巧如 classifier-free guidance、各种求解器直接搬到 Flow Matching 上。我在实际项目里就是这么做的guidance scale 的调参经验完全通用。6. 实操中的常见问题和排查技巧6.1 采样出现彩色噪点或网格伪影这个问题我遇到过好几次通常有三个原因时间嵌入没做对如果网络不知道当前 t它就没法正确去噪。检查时间嵌入的维度和频率范围正弦编码的 max_period 一般设 10000。β 调度和网络容量不匹配β 太小则前向过程不够高斯化太大则训练信号弱。建议先用 cosine 调度试。采样步数太少且求解器阶数低Euler 求解器在 10 步以下容易出伪影换 Heun 或 DPM-Solver。排查方法先固定随机种子用 1000 步 DDPM 采样如果还有伪影说明是训练问题如果没有说明是采样问题。6.2 训练 loss 不下降或震荡扩散模型的 loss 震荡是正常的因为每个 batch 的 t 是随机采的不同 t 的 loss 尺度不同。但如果长期不下降检查这几点学习率太大扩散模型对学习率敏感1e-4 是常用起点太大容易震荡。EMA 没开EMA指数移动平均对扩散模型几乎必备decay 设 0.9999。我试过不开 EMAFID 差 5 个点以上。数据归一化不对数据应该归一化到 [-1, 1]而不是 [0, 1]。这个细节影响很大因为前向过程的噪声是标准高斯数据尺度不匹配会导致信噪比失衡。6.3 Flow Matching 训练不收敛Flow Matching 理论上比扩散模型好训但实际中也有坑路径定义错误x_t (1-t) x_0 t x_1 里t0 是噪声t1 是数据。如果搞反了训练完全无法收敛。向量场目标没归一化x_1 - x_0 的尺度取决于数据尺度如果数据没归一化向量场会很大导致梯度爆炸。时间采样不均匀Flow Matching 对 t 的采样也敏感均匀采样在 t 接近 0 和 1 时梯度较小可以用 logit-normal 采样让中间区域多出现。6.4 常见问题速查表现象可能原因解决方法采样出纯噪声网络没训练好或时间嵌入错误检查时间嵌入用预训练权重验证采样出模糊图步数太少或求解器阶数低增加步数或换高阶求解器训练 loss 震荡学习率大或 batch 小降学习率增大 batchFID 比论文差很多EMA 没开或数据归一化错开 EMA检查数据范围Flow Matching 不收敛路径方向反了确认 t0 是噪声t1 是数据采样速度慢用了 DDPM 1000 步换 DDIM 或 DPM-Solver提示排查问题时先用小分辨率如 64x64和小数据集如 CIFAR-10快速验证确认流程通了再上大分辨率和大数据集。我见过太多人在 512x512 上调试一次训练几小时效率极低。7. 从零实现一条采样链路的经验如果你要自己实现我建议按这个顺序来先实现 DDPM 的训练和采样确认能出图然后把采样换成 DDIM确认跳步后质量可接受再把采样写成 ODE 形式接入 DPM-Solver最后如果要做实时应用换成 Flow Matching。代码层面核心模块就三个时间嵌入、U-Net 或 Transformer 主干、采样循环。时间嵌入用正弦编码主干用带注意力的 U-Net采样循环根据方法不同调整。我自己的实现里采样循环抽象成一个函数输入是模型、初始噪声、步数、求解器类型输出是生成结果这样切换方法只需要改一个参数。参数方面我常用的默认配置是T1000β 用 cosine 调度学习率 1e-4EMA decay 0.9999batch size 根据显存尽量大。DDIM 采样用 50 步DPM-Solver 用 20 步Flow Matching 用 10 步。这些配置在 CIFAR-10 和 ImageNet 64x64 上都验证过FID 和论文报告值差距在 1-2 个点以内。最后分享一个小技巧如果你要做条件生成如 class-conditional 或 text-to-imageclassifier-free guidance 的 scale 在 DDIM 和 Flow Matching 上的最优值不同。DDIM 通常 7.5 左右Flow Matching 通常 3-5因为 Flow Matching 的向量场尺度不同。这个需要根据具体模型调但可以从 5 开始试。
上一篇/下一篇内容由系统自动关联 返回资讯列表 →