论文
ReImagine:重新思考通过图像优先合成的可控高质量人类视频生成
ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis
摘要
由于在有限的多视图数据下联合建模人类外观、运动和摄像机视点的难度,人类视频生成仍然具有挑战性。现有方法通常单独解决这些因素,导致可控性有限或视觉质量降低。我们从图像优先的角度重新审视这个问题,通过图像生成学习高质量的人体外观,并将其用作视频合成的先验,将外观建模与时间一致性解耦。我们提出了一种姿势和视点可控的管道,它将预训练的图像主干与基于 SMPL-X 的运动指导相结合,以及基于预训练的视频扩散模型的 无需训练 时间细化阶段。我们的方法可以在不同的姿势和视角下生成高质量、时间一致的视频。我们还发布了一个规范的人体数据集和一个用于合成人体图像合成的辅助模型。代码和数据可在 https://github.com/Taited/ReImagine 上公开获取。