论文

SemCam:用于视频生成的语义相机运动控制

SemCam: Semantic Camera Motion Control for Video Generation

应用与实践内容创作

摘要

在现有视频中相对于移动主体控制相机具有挑战性:保持正面视图等行为需要相机适应主体不断变化的位置和方向,从而难以提前指定所需的轨迹。现有的摄像机控制的视频到视频方法通常依赖于明确的轨迹或参考运动,它们不直接表达这些动态摄像机-主体关系。我们引入了语义相机运动控制,这是一种新颖的视频到视频任务,其中参考视频和目标运动标签指定所需的相对于主体的相机行为,而无需明确的目标轨迹。我们的方法 SemCam 学会在保留源内容的同时实现这种行为。它将共享基础低秩自适应与运动调节调制相结合,而背景一致性损失则提高了参考视频和目标视频中可见区域的保真度。我们构建了 661 个配对视频,涵盖八种语义相机行为,并使用主体相对运动指标、外观测量和用户研究在单独的 109 个场景基准上进行评估。 SemCam 的语义运动成功率为 68.6%,而 Vista4D(最强的评估基线)的成功率为 45.3%,同时保持了可比较的受试者身份保留。

SemCam:用于视频生成的语义相机运动控制的原论文方法或结果图
图 2:SemCam 方法概述。参考视频token与噪声目标视频token $z_{t}$ 连接并由 DiT 处理。运动标签 $m$ 选择运动特定的 LoRA 因子 $A_{k}$,与共享基础 $B$ 以及预测调制残差 $(\Delta\gamma_{m},\Delta\beta_{m},\Delta g_{m})$ 的学习嵌入 $e_{m}$ 配对。这些残差被添加到时间步相关的调制参数中。火灾图标表示可训练组件;预训练的骨干模型保持冻结状态。