论文
TARS:用于无 3D 视频重新拍摄的时间步感知数据缩放
TARS: Timestep-Aware Data Scaling for 3D-Free Video Re-Shooting
摘要
视频重拍旨在重新生成具有可控摄像机运动和视点的视频。现有方法依赖于显式 3D 先验,该先验受到重建质量的限制,并且在合成以前未见过的区域时通常表现不佳,或者依赖于具有不同相机轨迹的配对视频,其稀缺性阻碍了泛化。我们通过文本驱动的语义视点规范重新审视视频重新拍摄,从而能够控制镜头比例、视角和第一/第三人称视角。为此,我们提出了 TARS,一种无 3D 视频重拍范式。时间步长灵敏度分析表明,相机运动主要是在高噪声阶段建立的,在此阶段形成粗糙的时空结构。基于这一见解,我们引入了自我监督训练来学习相机动态和基本视觉表示,而无需配对重新拍摄数据或 3D 重建。通过数据缩放和联合文本相机调节,TARS 支持强大的相机和视点控制,在大相机运动下合理地合成源视图之外的区域,同时实现反向角度重新拍摄和视角切换。大量实验表明,与之前的方法相比,TARS 提供了更准确且时间一致的相机控制。项目页面:https://ymlinfeng.github.io/TARS.github.io/