论文
$λ$-受控 GRPO:将流量匹配比不稳定转化为预算资源
$λ$-Controlled GRPO: Turning Flow-Matching Ratio Instability into a Budgeted Resource
摘要
强化学习越来越多地用于将图像生成器与奖励信号对齐,Flow-GRPO 最近将这种范式扩展到流匹配模型,将去噪采样器视为可以根据奖励反馈进行优化的随机策略。这种设置中的训练在多步去噪方面是不稳定的:策略更新在去噪步骤中系统性地变化,重要性比漂移到低于 1,变得越来越分散,以不同的速率进行裁剪,并在训练后期留下更少的可用样本。先前的工作将这些影响视为单独的故障模式,并通过手动调整的稳定器来解决每个问题。相反,我们表明它们是由单个每步数量产生的,我们称之为路径方差。该数量由采样器的高斯转移核精确确定,并且可以在训练期间廉价地估计。这将不稳定重新定义为一种可以衡量和预算的资源,而不是需要修复的症状的集合。我们的方法 $\lambda$-Controlled GRPO 根据该预测定律而不是噪声经验统计来校准重要性比行为,并根据预测成本在去噪步骤之间分配梯度工作。管理更新的两个尺度由标准策略选择固定,而不是作为自由调整参数引入。在两种奖励设置下的文本到图像模型上,渲染通过光学字符识别评分的困难目标文本并匹配通过偏好模型评分的人类偏好,$\lambda$-Controlled GRPO 比最强的经验稳定器提高了文本准确性和偏好奖励。它还将后期路径方差保持在其预期预算内,正是基线系统性超调的地方。结果是 Flow-GRPO 更新通过其自身的转换定律进行校准,而不是在不稳定出现后稳定下来。