论文

扩散模型的时间差异学习

Temporal Difference Learning for Diffusion Models

模型训练预训练

摘要

扩散模型通常以关注各个时间步(或相邻对)的局部去噪目标为目标进行训练,这不会强制沿着去噪轨迹的预测之间的一致性。缺乏跨时间一致性会降低性能,尤其是对于少步采样器。我们引入了时间差异(TD)目标,该目标可以惩罚模型沿去噪路径的多步骤进展的不一致。通过将扩散过程重新表述为马尔可夫奖励过程,并将去噪作为强化学习中的策略评估问题,我们得出了一种适用于离散时间和连续时间扩散公式的统一的 TD 方法。我们进一步提出了一种基于样本的重新加权方法,可以稳定训练。根据经验,我们表明使用 TD 训练可以显着提高 FID 测量的样本质量,当采样步骤数较小时具有更强的优势,突出了其在低计算预算场景下的实用性。我们提供消融研究来证明我们的设计选择的合理性,包括成对损失重新加权、正则化权重和单步跨步。总的来说,我们的 TD 方法可以是一种通用的替代方法,可以增强跨时间一致性并提高不同扩散生成模型的生成质量。