论文

VASR:用于奖励引导扩散的方差感知系统重采样

VASR: Variance-Aware Systematic Resampling for Reward-Guided Diffusion

模型推理推理搜索与路径规划

摘要

用于奖励引导扩散模型的顺序蒙特卡罗 (SMC) 采样器经常遭受快速谱系崩溃的困扰:一些高奖励粒子在少数重采样步骤中主导了总体,破坏了多样性并降低了样本质量。我们提出了奖励引导扩散 SMC 的方差分解框架,它将连续方差 $V_t^{\mathrm{cont}}$ 与残差方差 $V_t^{\mathrm{res}}$ 分开,揭示了常用多项重采样下的高后代计数方差导致了这种崩溃。这激发了 \textsc{VASR} (方差感知系统重采样),它通过方差最优质量分配 $m_t \propto w_t e^{r_t}$ (最小化 $V_t^{\mathrm{cont}}$)和系统重采样(控制 $V_t^{\mathrm{res}}$)来解决方差项。对于由于随机延续而导致中间奖励有噪声的潜在扩散模型,我们提出 \textsc{VASR-Max},这是一种故意有偏差的高选择变体,用于方差敏感的奖励优化。两种方法都是 无需训练,完全可并行,并且仅增加线性开销。在 MNIST 和 CIFAR-10 上,VASR 的 FID 比之前的 SMC 方法高出 26%$,同时在匹配计算方面比基于 MCTS 的价值方法快 66 倍。在文本到图像生成方面,\textsc{VASR-Max} 在整个计算预算中始终优于最强的 SMC 基线,并在高预算下与基于 MCTS 的方法相匹配,奖励在 2.5--3% 内,同时速度大约快一倍。