论文

测试时扩散对齐的最佳 $N$ 指南

Best-of-$N$ Guidance for Test-time Diffusion Alignment

模型推理解码与生成控制

摘要

扩散模型实现了强大的生成性能,但通常难以将生成的样本与奖励模型测量的人类偏好保持一致。 测试时对齐的一种简单而有效的算法是 Best-of-$N$ (BoN) 采样,它绘制 $N$ i.i.d.。来自预先训练的扩散模型的样本并输出单个最高奖励样本。尽管在实证上取得了成功,但 BoN 对奖励信息的使用有限,因为它仅在最终选择阶段纳入,而不会影响采样期间的反向扩散轨迹。因此,BoN 采样不会改善生成样本的平均对齐情况,并且主要适用于单输出设置。我们提出了 Best-of-$N$ Guidance (BoNG),这是一种将 BoN 采样原理直接集成到反向扩散过程中的新颖方法。 BoNG 对去噪粒子执行在线 BoN 选择,并调整反向扩散过程,以在生成过程中引导粒子群走向更高奖励的区域。具体来说,通过在降噪粒子之间引入不对称引导相互作用,BoNG 使用当前的 BoN 粒子作为其余粒子群的引导信号。这种粒子级交互将采样过程重塑为更高奖励区域,使 BoNG 不仅能够改进最终的最佳样本(超越 Vanilla BoN 采样),而且还能提高生成样本的平均质量。在 36 次实证比较中,BoNG 在 29 个案例中取得了最佳性能,在与 SMC 和 Vanilla BoN 抽样的比较中以 80.56% 的比例排名第一。 BoNG还支持多输出功能,最新基于样本的引导方法的ImageReward得分为1.3$\times$,加速比为1.6$\times$。我们在 https://github.com/aailab-kaist/BoNG. 发布代码

测试时扩散对齐的最佳 $N$ 指南的原论文方法或结果图
图 3:对 Vanilla、SMC 和 BoNG(SD v1.5 DDPM 100 步采样器)生成的样本进行定性比较。红色框表示每种方法的 Best-of-$N$ 样本。普通采样通常无法生成与特定提示(例如“花瓶下方”和“蓝色盆栽植物”)很好地吻合的图像。 SMC 生成更好对齐的图像,但重新采样会导致粒子过早崩溃。相比之下,BoNG 生成的样本与提示保持良好一致,同时保留不同的布局和外观。