论文

通过语义表示对齐改进人类图像动画

Improving Human Image Animation via Semantic Representation Alignment

应用与实践内容创作

摘要

图像到视频生成领域已经取得了显着的进展。然而,人体肢体扭曲和面部扭曲等挑战仍然存在,特别是在生成长视频或建模密集运动时。现有的人类图像动画作品通过结合人类特定的语义表示(例如密集姿势或 ID 嵌入)作为附加条件来解决这些问题。然而,对这些表示的调节可能会降低生成的灵活性。此外,他们对 RGB 像素监督的依赖也缺乏对学习必要的 3D 几何关系和时间一致性的重视。相比之下,我们引入了一种名为 SemanticREPA 的新颖方法,该方法通过表示对齐利用这些语义表示作为监督信号。具体来说,我们首先训练一个结构对齐模块,该模块将从视频潜在特征获得的结构表示与视频深度估计特征对齐。然后,我们修复预训练模块,并利用它对扩散模型的结构表示提供额外的监督,实现结构校正以生成连贯且稳定的人体结构。同时,我们开发了一个 ID 对齐模块,将生成的视频的 ID 表示与人脸识别特征对齐。我们进一步建议使用预测的结构表示来完善相关区域的身份恢复。通过结构和 ID 对齐,我们的方法在扩展角色运动和增强的角色一致性方面展示了卓越的质量。