论文
NoiseTilt:用于扩散奖励对齐的噪声倾斜反向内核
NoiseTilt: Noise-Tilted Reverse Kernels for Diffusion Reward Alignment
摘要
我们引入了噪声倾斜反向内核(NTRK),这是一种奖励引导的扩散采样器,它通过噪声项注入奖励梯度,使预训练的反向内核保持不变,并且每步只需要一个样本。推理时的奖励引导采样极大地扩展了预训练扩散模型的多功能性。然而现有的方法面临着权衡。基于梯度的引导改变了反向均值,引导生成,但将中间状态推到模型训练区域之外并降低了质量。基于搜索的方法可以保持质量,但不会获得梯度信号。现有方法还没有同时实现这两者。 NTRK 通过保持反向均值固定并将噪声项偏向高奖励来解决此问题。这是由白化算子实现的,白化算子是 NTRK 背后的核心机制,它将奖励梯度转换为与噪声兼容的扰动,而不会丢失其引导信号。在各种奖励调整任务中,NTRK 在不损失样本质量的情况下优于最近最先进的基线。值得注意的是,在美学生成方面,NTRK 仅使用 25 个 NFE,就超过了 500 个 NFE 的最佳基线奖励,计算量减少了 20 倍。