论文
HumANDiff:用于生成运动一致的人类视频的铰接式噪声扩散
HumANDiff: Articulated Noise Diffusion for Motion-Consistent Human Video Generation
摘要
尽管人类视频生成最近取得了巨大进展,但生成视频扩散模型仍然难以忠实地捕捉人类运动的动力学和物理特性。在本文中,我们提出了一种用于人体视频生成的新框架 HumANDiff,它通过三个关键设计增强了人体运动控制:1)铰接运动一致噪声采样,将潜在噪声的时空分布相关联,并用在统计人体模板的密集表面流形上采样的 3D 铰接噪声替换非结构化随机高斯噪声。它继承了身体拓扑先验,以实现空间和时间一致的噪声采样。 2)联合外观-运动学习,通过联合预测像素外观和来自关节噪声的相应物理运动,增强视频扩散模型的标准训练目标。它可以实现高保真人类视频合成,例如捕捉与运动相关的衣服皱纹。 3)几何运动一致性学习,通过在铰接噪声空间中定义的新颖的几何运动一致性损失来强制跨帧的物理运动一致性。 HumANDiff 通过具有铰接式噪声采样的 微调 视频扩散模型实现可扩展、可控的人类视频生成。因此,我们的方法与扩散模型设计无关,并且不需要对模型架构进行修改。在推理过程中,HumANDiff 能够在单个框架内生成图像到视频,从而实现内在运动控制,而无需额外的运动模块。大量的实验表明,我们的方法在渲染具有不同服装风格的运动一致、高保真人类方面实现了最先进的性能。项目页面:https://taohuumd.github.io/projects/HumANDiff/