论文

Pave-GRPO:通过有原则的平均速度分解超越瞬时引导

Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition

模型训练强化学习

摘要

组相对策略优化(GRPO)已成为将基于流的生成模型与人类偏好保持一致的有效范例。然而,小组执行轨迹的高成本迫使现有方法使用很少的去噪步骤,导致稀疏的时间监督,并使大多数中间阶段没有直接的奖励指导。为了解决这个问题,我们提出了 Pave-GRPO,它通过有原则的平均速度分解重新制定了 GRPO 目标。我们不是生成昂贵的高步执行轨迹,而是保持高效的少步组采样,但将每个粗略过渡分解为跨越多个中间时间步的更精细子轨迹的等效集合,将奖励反馈传播到更密集的时间阶段集,以实现更全面的偏好对齐。至关重要的是,这不会产生额外的随机执行轨迹生成或奖励评估:分解的子轨迹是围绕观察到的转变分析构建的,在策略更新期间只需要少量额外的速度网络评估。这种设计有两个好处:(i)免部署范围扩展:通过直接重用少步组样本及其相关奖励,Pave-GRPO 显着拓宽了固定采样和奖励预算下的有效优化范围; (ii) 全面的时间监督:通过将瞬时速度目标等效地分解为多时间步长集合,它将奖励信号分布在去噪过程的更多中间阶段,从而实现更细粒度和更彻底的偏好优化。