论文

Geo-Align:通过公制几何奖励进行视频生成对齐

Geo-Align: Video Generation Alignment via Metric Geometry Reward

模型训练强化学习

摘要

近年来,摄像机控制的视频生成取得了显着的进步。然而,现有的视频到视频重新渲染方法主要依赖于使用合成数据集的监督 微调。目前,同步、多视图的真实世界视频数据极其缺乏。因此,在处理分布外的现实世界视频时,流行的范式通常表现出有限的泛化能力,模型很难准确地遵循物理尺度和摄像机轨迹。为了弥补这一差距,我们提出了 Geo-Align,这是第一个专门为摄像机控制的视频重新渲染而设计的强化学习框架。基于预训练模型,我们通过规模感知感知奖励机制优化模型。具体来说,我们引入了一个度量 3D 估计器,从生成的视频中提取精确的摄像机轨迹,明确惩罚旋转和平移的偏差。此外,我们根据现实世界的调节视频和从合成数据得出的目标相机轨迹精心设计了数据管道策略,消除了对配对数据的依赖。大量实验表明,Geo-Align 在精确的相机可控性和视觉保真度方面始终优于现有的监督学习基线,这表明了我们方法的有效性。