论文

探索流量匹配奖励反向传播的设计空间

Exploring the Design Space of Reward Backpropagation for Flow Matching

模型训练强化学习

摘要

通过直接奖励反向传播将文本到图像流匹配模型与人类偏好对齐是样本高效的,但受到两个众所周知的病态的阻碍:激活不能在现代模型规模的完整采样轨迹上存储,并且跨步骤的链式雅可比积会在返回到早期索引时夸大奖励梯度。基于连接器的方法(例如 LeapAlign)通过用短固定路径替换完整的向后轨迹来解决这些问题,突出了采样和优化之间的有用解耦。然而,生成的梯度的质量取决于这条短路径近似完整展开的准确程度,尤其是在长间隔内。我们提出了 FlowBP,一个统一的代理轨迹框架,将后向轨迹本身视为设计对象。 FlowBP 保留用于采样的无梯度缓存采样轨迹,然后根据缓存和选择性重新转发的速度构建轻量级后向代理。该视图分离了四个选择:奖励模型输入、活动集、积分权重和桥耦合,并将先前的直接梯度方法恢复为特定设置。在此框架内,我们实例化了三个变体:FlowBP-Sparse 使用稀疏欧拉重构,FlowBP-Bridge 添加了受控桥耦合,FlowBP-Lagrange 提高了跳跃求积的阶数。所有这三种都通过活动集大小绑定内存,并将梯度链接限制为最多一个雅可比因子。在 SD3.5-M、FLUX.1-dev 和 FLUX.2-Klein 中,基于偏好、质量和成分指标,这三个变体在大多数指标上都比直接梯度基线有所改进。