论文

E$^3$C:具有 3D 环境记忆和 Ego-Exo 人体姿势控制的视频生成

E$^3$C: Video Generation with 3D Environmental Memory and Ego-Exo Human Pose Control

应用与实践内容创作

摘要

可控且基于物理的以自我为中心的视频生成对于实体主体推理自己和他人的行为如何体现和改变世界至关重要。与一般的视频合成相比,以自我为中心的生成尤其具有挑战性:摄像机与演员紧密耦合,导致视点快速变化和频繁的自遮挡;潜在的行为是微妙的、明确的,而且通常只是部分可见;人物和场景状态都必须与指定的控制保持一致。我们提出了 E$^3$C,一个用于以自我为中心的生成的可控视频扩散框架,它构建了结构化和紧凑的条件,将持久的场景结构与人类驱动的动态分离。 E$^3$C 根据上下文帧构建基于半密集点云的 3D 内存,并使用来自视频 VAE 特征的外观描述符来增强每个点。将此内存渲染到目标视点会产生与目标帧对齐的条件。人体动力学是单独建模的。场景中被观察的人由骨骼渲染控制(自我人类控制),而相机佩戴者由他们的 3D 身体关节和 6DoF 手腕运动指定(自我人类控制)。为了在佩戴者的身体部位不可见时保持自我控制,我们引入了一种自我运动编码器,可以产生持久的交叉注意标记。 Nymeria 上的实验表明,E$^3$C 提高了视觉保真度、相机运动准确性、对象一致性以及对强基线的自我和外在人类控制,同时还实现了直观的场景编辑。