论文
Diff-ID:通过扩散模型生成和变形身份一致的面部图像
Diff-ID: Identity Consistent Facial Image Generation and Morphing via Diffusion Models
摘要
生成扩散模型彻底改变了面部图像合成,但高分辨率输出中强大的身份保留仍然是一个严峻的挑战。这个问题对于安全系统、生物识别身份验证和隐私敏感应用程序尤其重要,在这些应用程序中,身份完整性的任何偏差都可能破坏信任和功能。我们引入了 Diff-ID,这是一种基于扩散的框架,可在提供逼真质量的同时增强身份一致性。我们方法的核心是由 CelebA-HQ、FFHQ 和 LAION-Face 合成的自定义 210K 图像数据集,并通过微调的 BLIP 模型添加图像描述,以增强训练期间的身份识别。 Diff-ID 通过微调的稳定扩散 UNet 中的双交叉注意适配器集成了 ArcFace 和 CLIP 嵌入。为了进一步增强身份保真度,我们提出了一种基于 ArcFace 余弦相似度和指数时间步长加权的伪鉴别器损失。对保留的和未见过的人脸进行的实验表明,Diff-ID 在原始 ArcFace 人脸相似度方面并未超过 InstantID,但在评估方法中实现了显着较低的 FID 和最强的基于 FIQ 的身份现实主义权衡。我们还提出了一个基于统一 DDIM 的变形管道,无需每个身份 微调 即可实现定性面部插值。我们进一步认为,身份保存和照片写实主义应该联合评估,而不是单独评估,因为仅高身份相似性并不能保证真实的输出。为了使这种权衡更加明确,我们将人脸图像质量(FIQ)报告为基于互补比率的分数,它结合了身份相似性和感知真实性,同时将 FS 和 FID 作为主要指标。