论文
CreFlow:稀疏奖励体现视频扩散 RL 的校正回流
CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL
摘要
在具有似然替代目标的异构数据上训练的视频生成模型可以产生视觉上合理的采样轨迹,这违反了具体操作中的物理限制。尽管强化学习 后训练 提供了适应 VGM 的自然途径,但现有的视频 RL 奖励通常会将每次采样轨迹降低为低级视觉指标,而操作视频评估需要基于逻辑的验证,以验证采样轨迹是否满足组合任务规范。为了填补这一空白,我们为 后训练 体现的视频生成模型引入了一种基于组合约束的奖励模型,该模型自动将任务要求制定为线性时序逻辑约束的组合,从而在生成的视频中提供忠实的奖励和局部错误信息。为了使用这些奖励信号实现高维视频生成的有效改进,我们进一步提出了 CreFlow,一种新颖的在线 RL 框架,具有两个关键设计:i)信用感知 NFT 损失,将 RL 更新限制在奖励相关区域,防止 后训练 期间对不相关区域的扰动; ii) 校正回流损失,利用组内正样本作为校正方向的明确估计,从而稳定和加速训练。实验表明,与现有方法相比,CreFlow 产生的奖励判断更符合人类和模拟器成功标签,并将八个双手操作任务的下游执行成功率提高了 23.8 个百分点。