论文

文本到图像个性化模型中的潜在身份调整

Latent-Identity Tuning in Text-to-Image Personalization Models

应用与实践内容创作

摘要

生成和编辑人脸需要高精度,因为即使很小的修改也会显着改变对象的感知身份。然而,当前基于通用文本到图像模型构建的个性化和编辑方法通常缺乏细粒度面部编辑所需的精度。我们提出了一种在文本到图像个性化模型中进行细粒度身份调整的方法。与对给定图像进行操作的标准图像编辑不同,身份调整修改特定身份的潜在表示,从而能够生成一致地描绘相同编辑身份的不同图像。为了实现细粒度的潜在身份调整,我们探索了用于文本到图像个性化的预训练、冻结编码器的潜在空间。我们的方法不需要额外的训练。相反,它利用冻结编码器的现有架构来发现潜在的语义方向。该空间由一组潜在标记组成,这些标记在捕获身份的不同方面发挥着不同的作用,并且通常对应于特定的空间或语义面部区域。我们表明,可以在该空间内以及由所选标记定义的子空间内识别有意义的方向,从而实现本地化、细粒度和语义连贯的编辑。我们通过定性和定量实验验证了我们的方法,这些实验展示了多样化的局部面部编辑,同时保持了跨图像身份的一致性。项目页面:https://garibida.github.io/IdentityTuning/