论文

FaithfulFaces:用于文本到视频生成的忠实面部身份保留

FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation

应用与实践内容创作

摘要

身份保留文本到视频生成 (IPT2V) 使用户能够制作具有一致的人脸身份的多样化且富有想象力的视频。尽管最近取得了进展,但现有方法在较大的面部姿势变化或面部遮挡下经常会遭受严重的身份扭曲。在本文中,我们提出了 \textit{FaithfulFaces},一种姿势忠实的面部身份保留学习框架,用于改进复杂动态场景中的 IPT2V。 FaithfulFaces 的关键是一个姿势共享身份对齐器,它通过姿势共享字典和姿势变化-身份不变性约束来细化和对齐不同视图中的面部姿势。通过将单视图输入映射到具有显式欧拉角嵌入的全局面部姿势表示,FaithfulFaces 提供了姿势忠实的面部先验,指导生成基础实现稳健的身份保留生成。特别是,我们开发了一个专门的管道来管理具有大量面部姿势多样性的高质量视频数据集。大量实验表明,FaithfulFaces 实现了最先进的性能,即使发生姿势变化和遮挡,也能保持卓越的身份一致性和结构清晰度。