尧图精选

ChatGPT讲解——Denoising Diffusion Probabilistic Models

🕒 发布时间:2026/10/2 15:36:30 📁 来源:尧图网络
Abstract:论文整体想表达什么?这篇论文提出并系统研究了一类叫作Denoising Diffusion Probabilistic Models(DDPM,去噪扩散概率模型)的生成模型。论文的核心目标是:通过一个逐步加噪、再逐步去噪的过程生成高质量图像。1. DDPM 是什么?DDPM 把生成过程拆成两个方向。正向过程:逐步加噪从真实图像开始,经过很多个小步骤不断加入高斯噪声:清晰图像 → 轻微噪声 → 更强噪声 → 纯高斯噪声当步骤足够多时,原始图像中的结构和信息会被完全破坏,最终变成一个简单的标准高斯分布。反向过程:逐步去噪模型学习正向加噪过程的逆过程:纯噪声 → 去除一部分噪声 → 恢复更多结构 → 清晰图像生成时,从随机高斯噪声开始,逐步执行学习到的去噪过程,最后得到一张图像。2. 论文解决了什么问题?此前扩散概率模型虽然定义简单、训练效率也较高,但一直没有证明它能够生成高质量图像。这篇论文的主要贡献是证明:扩散模型不仅理论上可行,而且实际上能够生成质量非常高的图像。论文还提出了一种更好的参数化方式,使扩散模型与两个已有概念建立了联系:训练过程类似于多噪声水平下的去噪 score matching;采样过程类似于退火 Langevin dynamics。这帮助作者设计出效果更好的训练目标和采样方法。3. 论文采用了什么训练方式?模型使用一个加权的变分下界进行训练。简单来说,模型会学习:在当前噪声状态下,原始图像可能是什么;下一步应该如何去除噪声;如何从当前的xtx_txt​预测更干净的xt−1x_{t-1}xt−1​。论文发现,一种特别有效的参数化方式是:让神经网络预测加入到图像中的噪声,而不是直接预测干净图像或去噪后的均值。这样做可以让训练目标更简单,也更接近去噪 score matching。4. 论文取得了什么结果?在无条件 CIFAR-10 上,论文取得了:Inception Score:9.46FID:3.17FID 达到了当时的最佳水平。在256×256256\times256256×256的 LSUN 数据集上,生成图像质量已经接近 ProgressiveGAN。这说明 DDPM 不仅可以生成简单的小图像,也能生成高分辨率的自然场景图像。5. DDPM 的另一个重要特性:渐进式有损解压论文还指出,扩散模型的生成过程可以理解成一种逐步解码过程。在反向去噪的早期阶段,模型先恢复图像的大致结构;随着去噪继续,模型再逐渐恢复:物体形状;局部纹理;细节和高频信息。因此,DDPM 可以被解释为一种渐进式有损压缩/解压缩机制:早期只保留影响较大的结构信息;后期再恢复细微、甚至人眼不容易察觉的细节。论文认为,这种过程可以看作自回归生成的一种推广,只不过它不是按照像素顺序生成,而是按照扩散过程隐含的“信息重要性顺序”逐步解码。Abstract 的一句话总结这篇论文证明了扩散概率模型可以通过“逐步加噪、逐步去噪”生成高质量图像,并提出一种与去噪 score matching 相联系的有效参数化,使 DDPM 在 CIFAR-10 和 LSUN 上取得当时最先进的生成效果,同时揭示了扩散采样过程具有渐进式图像解码和压缩的含义。1. Introduction这一章主要说明扩散模型的研究背景、论文要解决的问题,以及 DDPM 的核心贡献。1. 生成模型已经取得了很大进展近年来,生成模型已经能够生成高质量的图像、音频和其他类型的数据。当时主要的生成模型包括:生成对抗网络(GAN);自回归模型;流模型;变分自编码器(VAE);能量模型和 score matching 模型。这些方法各有优点,但也存在不同的限制。2. 扩散概率模型是什么?论文研究的是一种扩散概率模型。它包含两个过程。正向扩散过程从真实数据开始,逐步加入高斯噪声,直到数据变成标准高斯噪声。反向生成过程从标准高斯噪声开始,逐步学习如何去除噪声,最终恢复出真实数据。这个反向过程是一个参数化的马尔可夫链,每一步都使用一个神经网络预测条件高斯分布。由于正向过程每一步只加入少量噪声,因此反向过程也可以用简单的高斯转移来表示。3. 扩散模型之前的问题扩散模型有一些理论和工程上的优点:定义简单;训练过程清晰;可以使用变分推断;每个时间步的转移都是简单高斯分布;训练时可以随机采样时间步,提高效率。但此前一直缺少一个关键证明:扩散模型到底能不能生成高质量的图像?尽管模型结构和训练目标都很自然,但早期工作并没有展示可以和 GAN 或其他先进生成模型相比的样本质量。这篇论文的一个主要目标就是证明:扩散模型实际上可以生成非常高质量的图像。4. 论文发现的关键联系论文建立了扩散模型与去噪 score matching之间的联系。作者发现,如果采用合适的反向过程参数化,那么:扩散模型的训练目标;可以改写成类似多噪声水平去噪 score matching 的目标;扩散模型的采样过程;也类似于退火 Langevin dynamics。这一联系非常重要,因为它帮助作者理解:神经网络应该预测什么;如何设计更有效的训练损失;为什么某种参数化比其他形式效果更好;为什么从大噪声逐步去噪能够生成高质量图像。5. 关键的网络参数化论文比较了不同的反向过程参数化方式。最终效果最好的是:让网络预测当前图像中加入的噪声ϵ\epsilonϵ。而不是直接预测:干净图像x0x_0x0​;反向过程的均值;或其他形式的去噪结果。这种噪声预测参数化有两个好处:训练目标更简单;与去噪 score matching 的关系更加直接。因此,DDPM 的每一步都可以根据网络预测的噪声来计算去噪后的均值,再加入适当的随机噪声,得到上一步的状态。6. 实验结果和贡献论文在 CIFAR-10、LSUN 等图像数据集上进行了实验。主要结果包括:在无条件 CIFAR-10 上取得 Inception Score 9.46;FID 达到 3.17;在256×256256\times256256×256的 LSUN 图像上,质量接近 ProgressiveGAN;生成效果超过此前扩散模型的已发表结果。这证明扩散模型不只是一个理论上可定义的生成过程,也可以在实际图像生成任务中取得领先表现。7. 论文对似然结果的看法论文也指出,DDPM 的样本质量虽然很高,但其对数似然并不一定优于其他基于似然的模型。作者发现,模型的大部分无损编码长度,实际上用于描述人眼几乎察觉不到的图像细节。这说明:高对数似然不一定意味着视觉质量最好;模型可能花费大量编码成本表示微小、不可见的像素差异;视觉生成质量和无损概率建模能力之间存在一定区别。8. 渐进式有损解压论文进一步从压缩角度分析反向采样过程。在生成的早期阶段,模型主要恢复:大体轮廓;物体布局;低频结构。在后期阶段,模型才逐步恢复:纹理;边缘;细节;人眼不容易注意到的信息。因此,扩散模型的采样过程可以被理解为一种渐进式解码:先恢复重要的粗粒度信息,再恢复不那么重要的细粒度信息。作者认为,这可以看作自回归解码的一种推广,因为它也在逐步增加信息,只是信息顺序不再局限于固定的像素扫描顺序。Introduction 的一句话总结这一章介绍了扩散模型“加噪—去噪”的基本思想,指出此前扩散模型虽然训练简单却缺乏高质量生成结果的证明;论文通过建立扩散模型与去噪 score matching、退火 Langevin dynamics 的联系,采用预测噪声的参数化,使 DDPM 在 CIFAR-10 和 LSUN 上实现了高质量图像生成,并揭示了其采样过程具有渐进式解码和压缩的意义。2. Background这一章介绍扩散概率模型的基本数学结构、正向加噪过程、反向生成过程,以及模型如何通过变分推断进行训练。1. 扩散模型是一种潜变量模型扩散模型把真实数据x0x_0x0​和一系列中间变量联系起来:x0,x1,…,xT x_0,x_1,\ldots,x_Tx0​,x1​,…,xT​其中:x0x_0x0​是真实图像;x1,…,xTx_1,\ldots,x_Tx1​,…,xT​是不同噪声程度下的中间状态;xTx_TxT​最终接近标准高斯噪声。模型的生成分布可以写成:pθ(x0)=∫pθ(x0:T) dx1:T p_\theta(x_0) = \int p_\theta(x_{0:T})\,dx_{1:T}pθ​(x0​)=∫pθ​(x0:T​)dx1:T​也就是说,最终图像的概率需要对所有中间噪声状态进行积分。2. 反向过程:从噪声生成图像模型的反向过程从标准高斯噪声开始:p(xT)=N(0,I) p(x_T)=\mathcal{N}(0,I)p(xT​)=N(0,I)然后使用一个马尔可夫链逐步生成:xT→xT−1→⋯→x1→x0 x_T\rightarrow x_{T-1}\rightarrow\cdots\rightarrow x_1\rightarrow x_0xT​→xT−1​→⋯→x1​→x0​每一步都由一个参数化的高斯分布表示:pθ(xt−1∣xt)=N(xt−1;μθ(xt,t),Σθ(xt,t)) p_\theta(x_{t-1}\mid x_t) = \mathcal{N} \left( x_{t-1}; \mu_\theta(x_t,t), \Sigma_\theta(x_t,t) \right)pθ​(xt−1​∣xt​)=N(xt−1​;μθ​(xt​,t),Σθ​(xt​,t))神经网络的任务就是根据当前的噪声图像xtx_txt​和时间步ttt,预测上一步xt−1x_{t-1}xt−1​的分布参数。3. 正向过程:逐步向图像加入噪声训练时,论文人为定义一个固定的正向扩散过程:q(x1:T∣x0)=∏t=1Tq(xt∣xt−1) q(x_{1:T}\mid x_0) = \prod_{t=1}^{T}q(x_t\mid x_{t-1})q(x1:T​∣x0​)=t=1∏T​q(xt​∣x
上一篇/下一篇内容由系统自动关联 返回资讯列表 →