论文

扩散模型中的双重下降和恶性过度拟合

Double Descent and Malign Overfitting in Diffusion Models

模型评测模型行为与机制分析

摘要

深度学习中的传统观点认为,过度参数化(参数 $p$ 多于训练样本 $n$)是良性的:较大的模型泛化能力更好,即使没有正则化,插值模型也能很好地泛化,测试误差遵循双下降曲线。人们可能会期望扩散模型也会出现同样的良性过度拟合,其训练简化为回归,即最小化二次分数匹配损失。然而,我们观察到了相反的情况:这里的过度拟合是灾难性的,会导致模型陷入记忆状态。我们通过将在 CelebA 上训练的 U-Net 实验与随机特征模型相结合来解决这个悖论,并为该模型推导出封闭式学习曲线。我们表明,每个训练样本的噪声实现数量固定为 $m$,确实会出现插值峰值,但在 $p\sim nm$ 处,而不是标准回归中的 $p\sim n$ 处。然而,测试损失的上升开始得更早,为 $p\sim n$,与 $m$ 无关。这种过度拟合是有害的,因为尽管训练的隐式正则化完全发挥作用,但它使模型趋向于记忆训练集的经验分数,而不是趋向真实分数。偏差-方差分解确定了机制:分数估计器的偏差在 $p\sim n$ 处开始增长;过了峰值,方差就会衰减,就像回归一样,而偏差则持续增长,并且都在一个很大的值处饱和。由于扩散模型是使用 $m\gg1$ 进行训练的,因此峰值被推至非常大的模型大小,因此位于其之前的上升分支上,其中恶性过度拟合已经在发挥作用。尽管如此,当与正则化结合使用时,过参数化仍然是有益的:在随机特征理论和 U-Net 实验中,最佳正则化大型模型(分别通过岭罚分或提前停止)优于任何非正则化模型。