论文

扩散模型仅观察梯度:分数匹配误差的几何视角

Diffusion Models Observe Only Gradients: A Geometric Perspective on Score Matching Errors

模型训练预训练

摘要

基于分数的扩散模型通常通过最小化 $L^2$ 分数匹配误差来训练,标准理论分析依赖于这个量来限制学习分布和目标分布之间的采样差异。我们证明 $L^2$ 得分误差不是边际分布质量的正确内在度量:学习的扩散模型在完美匹配目标分布的同时可能会产生任意大的 $L^2$ 得分误差。通过将分数误差分解为梯度和螺线管分量(亥姆霍兹-霍奇分解),我们确定了其背后的几何原因:只有梯度分量进入边缘福克-普朗克动力学,而螺线管分量在结构上是不可见的。我们通过三个结果来精确说明这一点。首先,在校正后的几何结构的基础上,我们证明了一个不可能的结果:$L^2$ 得分误差的单调函数不能统一降低学习分布和目标分布之间的任何分歧。其次,我们推导出 Kullback-Leibler 散度的上限,该上限仅取决于误差的可观察梯度分量,收紧通用评分网络的标准吉尔萨诺夫界限,并将其松散性识别为在路径空间而不是边际空间动态上运行的成本。第三,我们通过双 Sobolev 恒等式给出了梯度分量的易于处理的估计量,经验表明,与完整的 $L^2$ 误差相比,该估计量与样本质量的相关性要好得多。