论文

ActCam:用于视频生成的零镜头联合相机和 3D 运动控制

ActCam: Zero-Shot Joint Camera and 3D Motion Control for Video Generation

应用与实践内容创作

摘要

对于艺术应用,视频生成需要对表演和摄影进行精细控制,即演员的动作和摄像机轨迹。我们提出了 ActCam,一种用于视频生成的零镜头方法,可将角色运动从驾驶视频联合传输到新场景,并实现内部和外部相机参数的每帧控制。 ActCam 建立在任何预先训练的图像到视频扩散模型的基础上,该模型接受场景深度和角色姿势的调节。给定具有移动角色和目标摄像机运动的源视频,ActCam 会生成跨帧保持几何一致的姿势和深度条件。然后,我们使用两阶段调节计划运行单个采样过程:早期去噪步骤以姿势和稀疏深度为条件,以强制场景结构,之后深度被丢弃,仅姿势指导细化高频细节,而不会过度约束生成。我们根据涵盖不同角色动作和具有挑战性的视角变化的多个基准来评估 ActCam。我们发现,与仅姿势控制和其他姿势和相机方法相比,ActCam 提高了相机依从性和运动保真度,并且在人类评估中更受青睐,尤其是在较大视点变化的情况下。我们的结果强调,仔细的相机一致调节和分阶段指导可以在无需训练的情况下实现强大的联合相机和运动控制。项目页面:https://elkhomar.github.io/actcam/。