论文

Flash-GRPO:通过一步策略优化实现视频传播的高效对齐

Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization

模型训练强化学习

摘要

组相对策略优化已成为使视频扩散模型与人类偏好保持一致的关键,但面临着一个关键的计算瓶颈:训练 14B 参数化模型通常需要每次实验数百个 GPU 天。现有的效率方法通过滑动窗口子采样训练时间步来降低成本,但从根本上损害了优化,表现出严重的不稳定性并且无法达到完整的轨迹性能。我们提出了 Flash-GRPO,这是一种单步训练框架,它在低计算预算下的对齐质量方面优于全轨迹训练,同时显着提高了训练效率。 Flash-GRPO 解决了两个关键挑战:等时间分组通过强制即时时间一致性来消除时间步长混杂方差,将策略性能与时间步长困难解耦;时间梯度校正抵消了与时间相关的缩放因子,该缩放因子导致跨时间步长的梯度幅度极大不一致。 1.3B 至 14B 参数模型的实验验证了 Flash-GRPO 的有效性,证明了具有一致的稳定性和最先进的对齐质量的显着训练加速。