论文
用于样本高效扩散 RLHF 的选择性时间步长加权和基于优势的重放
Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF
摘要
来自人类反馈的强化学习(RLHF)已成为使生成模型与人类偏好保持一致的强大范例。然而,将 RLHF 应用于扩散模型仍然是非常低效的反馈,因为现有方法通常需要大量的人工或奖励模型评估。这种限制降低了扩散 RLHF 在反馈是主要瓶颈的现实环境中的实用性。在本文中,我们提出了两种互补策略,可以显着提高扩散 RLHF 的反馈效率,同时保留对未见提示的泛化能力。我们的主要观察结果是,扩散轨迹中的奖励信息分布不均匀:并非所有去噪时间步长或轨迹都对从奖励信号中学习做出同样的贡献。通过在优化过程中强调信息丰富的时间步长和轨迹,我们获得了更有效的梯度更新。首先,我们引入了一种按时间步长的加权方案,该方案在策略优化期间重新加权去噪步骤。我们从理论上将这种权重与近端策略优化(PPO)的最优收敛特性联系起来,并根据经验近似结果的权重趋势。其次,我们引入了一种重播机制,该机制优先考虑信息丰富的轨迹,使模型能够重用过去的样本,而不是重复查询新的奖励。这些策略共同显着提高了扩散 RLHF 的反馈效率。在相同的超参数设置下,与广泛使用的扩散 RLHF 基线相比,我们的方法在样本效率方面实现了高达 6 倍的提高。