论文

扩散教师的期望方差减少

Variance Reduction for Expectations with Diffusion Teachers

摘要

预训练的扩散模型充当冻结教师,为下游管道(例如文本转 3D、单步 蒸馏 和数据归因)提供支持。这些管道消耗的教师梯度是对噪声水平和高斯噪声样本的蒙特卡罗(MC)期望;他们的估计方差主导着计算成本,因为每次绘制都需要昂贵的上游工作(渲染、模拟、编码)。我们引入了 CARV,一种计算感知的方差会计框架,它激发了分层 MC 估计器:将昂贵的上游计算分摊到廉价的扩散噪声重采样上,并通过时间步重要性采样和分层逆 CDF 构造进行锐化。在我们的文本到 3D 蒸馏 和归因实验中,CARV 在不改变目标的情况下提供了 2-3 倍的有效计算乘数(大部分来自摊销重用;约 25% 的额外来自 IS+分层);在单步 蒸馏 中,相同的技术将梯度方差降低了一个数量级,但没有改善下游 FID,这标志着 MC 方差不再是瓶颈的状态。