Sihan Fu 只识弯弓射大雕

Analyzing and Improving the Training Dynamics of Diffusion Models(EDM 2)

作者提出了量级保持(Magnitude-Preserving, MP)的设计哲学:每一层操作都应使输出的二阶矩保持为 1。

1. 为什么我们要研究“训练动力学”?

在传统的扩散模型(如经典的 ADM 架构)训练过程中,模型内部的数值量级(Magnitudes)往往是失控的

核心魔法:量级保持(Magnitude-Preserving)

这是论文最核心的数学思想。作者提出:每一层神经网络都应该保证输入和输出的数值“规模”是一致的

权重规范化(Weight Normalization):为了防止数值爆炸,作者强制要求每一层的权重都在一个“超球面”上移动 去除偏置(No Biases):论文中取消了卷积层和线性层的加法偏置,仅保留乘法,以简化数值传导 改进的激活函数:对常用的 SiLU 激活函数进行了缩放,使其在统计期望上不改变信号的强弱

后验 EMA:省下“一千个 GPU 年”的创新

EMA(指数移动平均) 是训练生成模型时的标配,它通过平均过去一段时间的模型权重来获得更稳定的生成效果

以往的痛点:你必须在训练开始前就设定好平均的“跨度”(衰减率速率)。如果设错了,对不起,请重新训练,这极其昂贵 。

EDM2 的方案:作者发明了 Post-hoc EMA(后验 EMA) 。在训练时,只存下少量的“快照”。训练结束后,你可以像调节收音机旋钮一样,随意合成出任何衰减率的模型,而无需重新训练

Dropout 的妙用:对于小模型,Dropout 是有害的;但对于超大规模模型(如 XXL 级别),开启 10% 的 Dropout 能显著抑制过拟合,让模型进步得更久

引导(Guidance)的发现:研究显示,即便用非常小的无条件模型去引导巨大的条件模型,效果也一样好,这能省下近 50% 的推理开销 。

这篇论文的核心在于将扩散模型的训练过程从一种“黑盒实验”转变为一种“精密工程”。Config A 到 G 的演化过程,本质上是研究者不断发现并消除神经网络中数值不稳定性的过程。

在 Config G 下,模型所有层对 EMA 的长度达成了惊人的一致,这意味着模型进入了真正的“共振”状态,而不再是各个层在训练中互相对抗