论文
LIFT:通过策略自蒸馏在大视点变化下生成未来布局视频
LIFT: Layout-In-Future Video Generation under Large Viewpoint Change via On-Policy Self-Distillation
摘要
我们推出了 LIFT,这是一个统一的图像到视频生成框架,它通过未来布局控制来补充相机控制,使用户能够指定未来视图中应该出现的内容以及应该出现的位置。这解决了可控视频生成的实际需求:给定初始图像,用户通常不仅关心摄像机如何移动,而且还关心未来关键时刻(尤其是最终帧)场景应该是什么样子。现有的相机控件指定视点轨迹,而文本提示仅提供粗略的语义指导;两者都无法准确地决定未来景观的内容和空间布局。这种限制在较大的视点变化下变得尤其明显,此时相机会显示第一帧中不可见的区域。因此,LIFT 使用最后一帧布局作为所需未来场景的显式控制信号。由于从这种稀疏布局指导中学习比在密集每帧布局上进行调节更具挑战性,因此我们引入了策略自蒸馏(OPSD),将密集布局教师的控制能力转移给最后一帧布局学生。我们进一步策划了 LIFT-Vista,这是一个数据集,具有相机的大视点变化和时间一致的布局注释。实验表明,与其他方法相比,LIFT 提高了视频质量、未来布局可控性和摄像机可控性。