论文
用于扩散偏好调整的潜在奖励寄存器
Latent Reward Registers for Diffusion Preference Alignment
摘要
将扩散模型与人类偏好保持一致通常依赖于对最终生成的样本进行评估的稀疏终端奖励,这在去噪过程中产生了严重的时间信用分配问题。我们提出了潜在奖励寄存器,这是一种直接从中间带噪潜变量估计终端偏好的机制。可学习的、无位置的寄存器词元作为辅助读取路径附加到冻结的 Diffusion Transformer (DiT),提取偏好信号而不改变生成器的隐藏状态或速度场。由此产生的密集、可微的奖励场跨越完整的去噪轨迹,并支持两种对齐策略。对于训练,奖励梯度 同策略 蒸馏 (RG-OPD) 将此密集奖励字段转换为当前生成器访问的状态的每步目标,用直接 同策略 蒸馏 取代轨迹采样密集型策略梯度。为了进行推理,奖励引导采样(RGS)通过幅度匹配的奖励梯度校正来引导轨迹,并且没有参数更新。根据经验,在高噪声水平 (t=0.8) 下,寄存器在评估的潜在奖励模型中达到最高的成对精度。 RG-OPD 的性能优于在线强化学习基线,同时将 GPU 时间减少高达 33 倍。 RGS 与 无需训练 基线相比,通过良好的奖励质量平衡实现了显着的奖励改进。代码和权重可在 https://github.com/Guanys-dar/latent-reward-register 获取