论文
用于人脸合成的身份条件潜在一致性 蒸馏
Identity-Conditioned Latent Consistency Distillation for Face Synthesis
摘要
扩散模型在高保真图像合成方面取得了很好的成果,但其迭代采样过程使得大规模生成的计算成本很高。当生成用于人脸识别的合成人脸数据集时,这种限制尤其重要,因为需要大量受试者以及不同姿势、表情、年龄等的许多样本。在这项工作中,我们表明,可以通过潜在一致性模型以极低的计算成本执行身份条件人脸合成,只需很少的迭代,而不会影响图像质量。为了进行训练,我们从基础扩散模型 Arc2Face(教师)中提取知识,将其原始文本到图像管道调整为嵌入到面部设置,用 ArcFace 身份嵌入替换文本提示。我们的蒸馏模型(学生)生成身份条件人脸图像,每张图像的平均推理时间为 0.4819 秒,而 Arc2Face 的推理时间为 2.102 秒,从而实现了 4.36$\times$ 的加速。基于 FID 分数的定量结果表明,在所有评估协议中,蒸馏模型与 Arc2Face 相比仍然具有竞争力。在 100k 生成的图像上,它在 CelebA 上几乎达到了同等水平(13.921 vs. 12.928),并且在 WebFace42M 上的表现优于教师(9.317 vs. 9.802)。对 Synth-500 和 AgeDB 的进一步评估显示,前者的性能差距不大,但后者的结果相当。这些结果表明,Arc2Face 可以通过特定于任务的潜在一致性 蒸馏 进行加速,同时保持大规模合成人脸生成的高图像质量。我们的提案已公开发布于 https://github.com/UFPR-IPASP-PR/FaceRec-IdentityConsistency。