论文

DEVIS-GRPO:在动态极端视图合成中释放 GRPO

DEVIS-GRPO: Unleashing GRPO on Dynamic Extreme View Synthesis

模型训练强化学习

摘要

轨迹控制视频生成已成为可控视频生成的关键。虽然当前的方法在小视图相机运动下表现良好,但在大视图运动下它们的性能会显着下降。现有的极端视图合成解决方案通常需要专用的视频对,需要大量的注释工作。为了解决这些限制,我们提出了动态极端视图合成-GRPO(DEVIS-GRPO),这是一种基于GRPO的轨迹控制视频生成框架,是第一个用于极端视图视频生成的在线策略梯度方法。我们方法的核心是一种新颖的采样策略:累积动态极端视图合成(ADEVIS),它通过逐步累积小视图增量来实现大视图相机运动。该方法具有两个关键优势:1)提高训练效率,因为它无需通过收集昂贵的配对大视图视频来热启动策略模型;2)通过灵活改变轨迹配置来提高采样多样性。最后,我们设计了多级一致性质量奖励函数来选择高质量样本进行模型优化。 Kubric-4D、iPhone 和 DL3DV 数据集上的实验证明了我们方法的优越性。在 Kubric-4D 上,与非遮挡区域的第二佳方法相比,我们在 PSNR 和 SSIM 方面实现了 21.57% 的相对改进。在 iPhone 上,LPIPS 降低了 18.56%。