论文
测试时扩散对齐的最佳 $N$ 指南
Best-of-$N$ Guidance for Test-time Diffusion Alignment
摘要
扩散模型实现了强大的生成性能,但通常难以将生成的样本与奖励模型测量的人类偏好保持一致。 测试时对齐的一种简单而有效的算法是 Best-of-$N$ (BoN) 采样,它绘制 $N$ i.i.d.。来自预先训练的扩散模型的样本并输出单个最高奖励样本。尽管在实证上取得了成功,但 BoN 对奖励信息的使用有限,因为它仅在最终选择阶段纳入,而不会影响采样期间的反向扩散轨迹。因此,BoN 采样不会改善生成样本的平均对齐情况,并且主要适用于单输出设置。我们提出了 Best-of-$N$ Guidance (BoNG),这是一种将 BoN 采样原理直接集成到反向扩散过程中的新颖方法。 BoNG 对去噪粒子执行在线 BoN 选择,并调整反向扩散过程,以在生成过程中引导粒子群走向更高奖励的区域。具体来说,通过在降噪粒子之间引入不对称引导相互作用,BoNG 使用当前的 BoN 粒子作为其余粒子群的引导信号。这种粒子级交互将采样过程重塑为更高奖励区域,使 BoNG 不仅能够改进最终的最佳样本(超越 Vanilla BoN 采样),而且还能提高生成样本的平均质量。在 36 次实证比较中,BoNG 在 29 个案例中取得了最佳性能,在与 SMC 和 Vanilla BoN 抽样的比较中以 80.56% 的比例排名第一。 BoNG还支持多输出功能,最新基于样本的引导方法的ImageReward得分为1.3$\times$,加速比为1.6$\times$。我们在 https://github.com/aailab-kaist/BoNG. 发布代码
