论文
不确定性引导扩散的样本自适应潜在奖励 后训练
Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training
摘要
潜在奖励模型可以监督视觉扩散模型,而无需将中间状态解码到像素空间。这使得与人类偏好的协调更加有效。然而,现有的潜在奖励模型仅输出标量分数。他们不估计每个预测的不确定性。因此,生成器无法确定哪个反馈是可靠的。这可能会将优化推向错误的方向并导致 奖励作弊。我们提出 \textsc{SURE},一个用于图像和视频扩散模型的统一潜在空间框架。它学习奖励分布并直接使用它们的可靠性来指导密集的 后训练。首先,我们提出样本自适应潜在奖励模型(\textsc{SURE-LRM})。它预测每个潜在噪声的高斯效用。它的平均值预测奖励分数。它的方差反映了在没有人工注释的情况下预测的不确定性。然后,学习到的分布通过不确定性引导的奖励反馈学习(\textsc{SURE-REFL})引导 后训练。该方法沿着去噪轨迹提供不确定性引导的密集反馈。在选定的转换处,\textsc{SURE-REFL} 查询冻结的\textsc{SURE-LRM}。它将分离方差转换为同一转变时样本的可靠性权重。每个加权奖励仅通过其局部转换进行反向传播。整个过程保留在潜在空间中,既不需要像素空间解码,也不需要完整的去噪图。实验表明,\textsc{SURE-LRM} 比强基线改进了偏好预测。 \textsc{SURE-REFL} 实现了各个指标之间的 sota 性能,并进一步提高了优化稳定性。在评估的方法中,它还获得了最高的 VBench 质量、语义和总分。