论文
Transformer 了解多词元 GMM 的最佳 DDPM 降噪器
Transformers Learn the Optimal DDPM Denoiser for Multi-Token GMMs
摘要
基于 Transformer 的扩散模型在生成高质量样本方面表现出了卓越的性能。然而,我们对这一成功原因的理论理解仍然有限。例如,现有模型通常通过最小化去噪目标来训练,这相当于拟合训练数据的得分函数。然而,我们不知道为什么基于 Transformer 的模型可以匹配去噪的得分函数,或者为什么基于梯度的方法尽管存在非凸损失景观但仍能收敛到最佳去噪模型。据我们所知,本文首次为训练基于 Transformer 的扩散模型提供了收敛分析。更具体地说,我们考虑遵循多标记高斯混合分布的去噪数据的总体去噪扩散概率模型(DDPM)目标。我们从理论上量化了每个数据点所需的标记数量和训练迭代,以实现全局收敛到去噪目标的贝叶斯最优风险,从而实现所需的分数匹配误差。更深入的研究表明,训练后的 Transformer 的自注意力模块实现了平均去噪机制,使训练后的模型能够逼近扩散步骤中注入噪声的预言机最小均方误差 (MMSE) 估计器。数值实验验证了这些发现。