论文

VGGRPO:通过 4D 潜在奖励实现世界一致的视频生成

VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward

模型训练强化学习

摘要

大规模视频扩散模型实现了令人印象深刻的视觉质量,但往往无法保持几何一致性。先前的方法通过使用附加模块增强生成器或应用几何感知对齐来提高一致性。然而,架构修改可能会损害互联网规模预训练模型的泛化,而现有的对齐方法仅限于静态场景,并依赖于需要重复 VAE 解码的 RGB 空间奖励,从而产生大量的计算开销,并且无法泛化到高度动态的现实世界场景。为了保留预训练容量,同时提高几何一致性,我们提出了 VGGRPO(视觉几何 GRPO),这是一种用于几何感知视频 后训练 的潜在几何引导框架。 VGGRPO 引入了潜在几何模型 (LGM),它将视频扩散潜在模型缝合到几何基础模型,从而能够从潜在空间直接解码场景几何模型。通过从具有4D重建能力的几何模型构建LGM,VGGRPO自然地扩展到动态场景,克服了现有方法的静态场景限制。在此基础上,我们执行潜在空间组相对策略优化,并提供两种互补的奖励:惩罚抖动轨迹的相机运动平滑度奖励,以及强制跨视图几何一致性的几何重投影一致性奖励。静态和动态基准测试表明,VGGRPO 提高了相机稳定性、几何一致性和整体质量,同时消除了昂贵的 VAE 解码,使潜在空间几何引导增强成为一种高效、灵活的方法来生成世界一致的视频。