论文
SemCam:用于视频生成的语义相机运动控制
SemCam: Semantic Camera Motion Control for Video Generation
摘要
在现有视频中相对于移动主体控制相机具有挑战性:保持正面视图等行为需要相机适应主体不断变化的位置和方向,从而难以提前指定所需的轨迹。现有的摄像机控制的视频到视频方法通常依赖于明确的轨迹或参考运动,它们不直接表达这些动态摄像机-主体关系。我们引入了语义相机运动控制,这是一种新颖的视频到视频任务,其中参考视频和目标运动标签指定所需的相对于主体的相机行为,而无需明确的目标轨迹。我们的方法 SemCam 学会在保留源内容的同时实现这种行为。它将共享基础低秩自适应与运动调节调制相结合,而背景一致性损失则提高了参考视频和目标视频中可见区域的保真度。我们构建了 661 个配对视频,涵盖八种语义相机行为,并使用主体相对运动指标、外观测量和用户研究在单独的 109 个场景基准上进行评估。 SemCam 的语义运动成功率为 68.6%,而 Vista4D(最强的评估基线)的成功率为 45.3%,同时保持了可比较的受试者身份保留。
