论文

UniMoCa:统一运动和摄像机控制作为视觉代理,以实现忠实的人类视频生成

UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation

应用与实践内容创作

摘要

控制人体运动和摄像机运动对于忠实地以人为本的视频生成至关重要,但在具有较大身体运动、遮挡和动态摄像机的多人场景中仍然具有挑战性。现有的管道通常依赖视觉运动序列(例如骨架图、姿势图或渲染的身体表示)进行运动控制,同时使用相机嵌入进行相机控制。这种异构控制接口迫使视频生成模型将像素对齐的视觉线索与非视觉几何嵌入相协调,使得运动相机归因变得困难并且对相机估计误差敏感。我们提出 \textbf{UniMoCa},一个表示驱动的框架,统一视觉空间中的运动和相机控制。 UniMoCa 的核心是 \textbf{Motion-Camera Visual Proxy} (\textbf{MCVP}),这是一种可相互共享的新颖表示形式,可将从驾驶视频中提取的 3D 人体运动和相机轨迹转换为身份中立的视觉代理。 MCVP 在恢复的相机轨迹下渲染时间对齐的人体几何形状,并使用明确的相机轨迹标记对其进行增强,用可区分的视觉提示取代异构视觉参数控制。由于两个控制因素都在同一视觉空间中表示,因此它们变得相互兼容而不是异构,从而在视频生成过程中实现一致的联合推理和编辑。我们进一步整理了一个 \textbf{MCVP-Video} 数据集,涵盖复杂的动作、多人交互和不同的相机轨迹。基于 Wan2.2 I2V 的实验表明,UniMoCa 在人体运动控制、摄像机控制、时间一致性和摄像机感知鲁棒性方面取得了显着的进步,同时附加的复杂性最小。更多详细信息请参见我们的项目页面:https://tanliming-daniel.github.io/UniMoCa/。