论文

生成式电影摄影师:以 3D 形式组合摄像机和物体运动

Generative Cinematographer: Composing Camera and Object Motion in 3D

应用与实践内容创作

摘要

当前的可控视频生成系统通常依赖于对象运动的 2D 运动轨迹或稀疏拖动信号。这些控制是不明确的,因为相同的 2D 轨迹可以对应于不同的 3D 运动,尤其是当相机和物体同时移动时。我们推出 Generative Cinematographer (GenCine),这是一个将单个图像提升到可编辑 3D 场景支架的系统,艺术家可以在其中共同创作相机和前景运动。艺术家指定相机路径并使用本地 3D 运动手柄移动选定的前景区域。多个手柄可以独立移动对象的不同部分,无需物理模拟器或特定类别的先验,即可为非刚性运动提供分段刚性近似。为了将这些控件传达给预训练的视频模型,我们将它们投影到引导地图中。这些贴图记录受控区域出现在每个帧中的位置,为每个手柄分配跨帧的固定颜色,并在与背景相同的世界坐标系中对其受控点的当前 3D 位置进行编码。这使我们能够描述对象相对于场景的运动,即使相机移动也是如此。对于训练,我们从真实视频中观察到的运动中恢复控制,并使用合成视频中的地面实况几何和轨迹。我们在预训练的 Wan 模型上训练轻量级引导分支和 LoRA 适配器,以遵循这些控制。我们的实验显示了一致的相机相对运动、视点变化下改进的几何一致性以及跨不同现实世界场景的强大可控性。