论文
重新拍摄任何东西:野外视频重新拍摄的自我监督模型
Reshoot-Anything: A Self-Supervised Model for In-the-Wild Video Reshooting
摘要
由于非刚性场景的成对多视图数据严重缺乏,用于重新拍摄动态视频的精确相机控制受到瓶颈。我们通过高度可扩展的自我监督框架克服了这一限制,该框架能够利用互联网规模的单目视频。我们的核心贡献是生成伪多视图训练三元组,由源视频、几何锚点和目标视频组成。我们通过从单个输入视频中提取不同的平滑随机游走作物轨迹作为源视图和目标视图来实现这一点。锚点是通过使用密集跟踪场前向扭曲源的第一帧来综合生成的,这有效地模拟了推理时预期的扭曲点云输入。由于我们的独立裁剪策略引入了空间错位和人工遮挡,因此模型不能简单地从当前源帧复制信息。相反,它被迫通过主动路由和重新投影源视频中不同时间和视点缺失的高保真纹理来隐式学习 4D 时空结构,以重建目标。由此推断,我们的最小适应扩散 Transformer 利用 4D 点云衍生锚点来实现最先进的时间一致性、强大的相机控制以及复杂动态场景上的高保真新颖视图合成。