论文

TriMotion:用于视频生成的模态无关相机控制

TriMotion: Modality-Agnostic Camera Control for Video Generation

应用与实践内容创作

摘要

相机运动控制对于引导生成系统中的视点变化至关重要。然而,现有方法通常将生成过程限制在单个特定模态上,例如显式姿势轨迹或参考视频,限制了它们支持异构用户输入的能力。为了解决这个限制,我们提出了 TriMotion,这是一种用于相机控制视频生成的模态不可知框架,可映射视频、姿势和文本输入,将相同的相机轨迹描述到共享运动嵌入空间中。学习这样的空间需要跨模式的同步监督。因此,我们通过使用从摄像机外部导出的基于几何的运动描述扩展多摄像机视频数据集来构建运动三元组数据集。我们进一步引入了潜在运动一致性目标,该目标利用运动嵌入空间来鼓励生成的视频直接在潜在空间中遵循目标相机轨迹,从而避免像素空间解码的成本。大量实验表明,TriMotion 可以生成高质量视频,在所有三种模式下都能准确跟踪目标摄像机轨迹。除了标准生成之外,共享运动嵌入空间还支持灵活的应用,例如顺序运动合成和跨模态运动插值。