论文
迈向 3D 感知视频扩散模型:具有网格标记化的免渲染人体运动控制
Towards 3D-Aware Video Diffusion Models: Render-Free Human Motion Control with Mesh Tokenization
摘要
扩散模型在视频生成方面取得了显着的成功。然而,这些模型是否真正意识到视觉观察背后的 3D 结构,而不是简单地复制合理的 2D 投影,仍然是一个悬而未决的问题。在这项工作中,我们通过人体运动控制来研究这个问题,这项任务需要对 3D 人体几何、运动、相机视角和场景上下文进行精确建模。与依赖渲染 2D 运动引导视频的先前方法不同,我们提出了一种免渲染框架,可以直接在压缩的 3D 人体网格标记上调节视频生成。这种表示保留了完整的 3D 几何信息,同时启用基于词元的统一生成管道,在基于 DiT 的架构中联合处理视频词元和运动词元。此设计要求模型在视频生成过程中对外观、3D 结构和摄像机视点进行联合推理。实验结果表明,在人体运动控制基准测试中具有强大的性能,同时减少了编辑过程中因视图相关的 2D 引导和轨迹姿势不匹配而引起的伪影。这些发现表明,视频扩散模型在配备网格标记化后,可以更好地捕捉复杂的 3D 人体结构及其与周围环境的交互。