论文

MirrorWorld:驯服视频扩散模型以生成镜面反射

MirrorWorld: Taming Video Diffusion Models for Mirror Reflection Generation

摘要

视频扩散模型 (VDM) 的最新进展使得高保真视频合成成为可能。然而,生成镜面反射仍然具有挑战性,因为镜子内的内容必须与周围场景保持一致。现有的 VDM 并不是专门为场景与镜子关系建模而设计的,这可能会导致反射内容不正确或空间排列不一致。我们观察到,镜像反射生成涉及两个互补的挑战:确定应反射哪些场景内容以及反射内容应如何在镜像区域内进行空间排列。受这一观察的启发,我们提出了 MirrorWorld,这是一种反射感知视频修复框架,可在生成过程中对场景与镜子的关系进行建模。具体来说,我们引入了语义关系 蒸馏 (SRD),它从冻结的视觉基础模型传输关系信息,以鼓励可见场景内容和镜像区域之间的语义关联。我们进一步提出几何变换对齐(GTA),它学习指导反射内容的空间排列的变换。这两个组件起着互补的作用,SRD 建模应该反映什么,GTA 建模应该如何安排。为了促进对该问题的研究,我们通过将四个现有视频镜像数据集重新用于统一的反射重建任务来构建视频镜像反射生成的基准。实验结果表明,与代表性的基于图像的反射生成方法和强大的视频修复基线相比,MirrorWorld 提高了反射重建质量。