论文

ReCAST:跨时间步长的奖励信用分配,用于在线扩散强化

ReCAST: Reward Credit Assignment across Timesteps for Online Diffusion Reinforcement

模型训练强化学习

摘要

训练具有多种奖励的扩散模型需要区分用户偏好和奖励信息。用户偏好决定了每个奖励对总体目标的贡献程度;奖励信息量决定了其反馈在去噪过程中何时有用。一旦全局结构出现,一些奖励就可以对样本进行有意义的评估,但其他奖励只有在样本接近干净时才变得有用。为了共同解决这两个问题,我们提出了 ReCAST(跨时间步的奖励信用分配),据我们所知,这是第一种方法,用于扩散奖励微调中每个奖励、时间步相关的信用分配。 ReCAST 通过按时间步长的奖励权重矩阵 $W$ 将用户偏好与时间分配分开,该矩阵的行总和与用户指定的奖励预算 $λ$ 匹配,而其列总和相等,为每个去噪步骤分配相同的总权重。在这些边际约束下,ReCAST 根据每个奖励的信息量分配权重,并通过每一步的 Rényi 可辨别性增益进行量化。这些收益反映了奖励引发的积极政策与当前政策之间的总体可区分性,为时间信用分配提供了基础。我们通过在两个不同的四奖励设置下训练 SD3.5-Medium 来评估 ReCAST,每个设置跨越五个奖励预算 $λ$。 ReCAST 提高了一种环境中的训练奖励,并在另一种环境中进行匹配,提高了这两种环境中的每一位坚持不懈的法官,并且受到独立大语言模型作为法官的青睐。总之,这些结果表明,ReCAST 产生的改进可以推广到训练奖励之外,并支持其核心原则:在反馈信息最丰富的去噪时间步上为每个奖励分配更大的权重。