论文

生成图像模型中的持久身份保存:基准和评估系统

Persistent Identity Preservation in Generative Image Models: A Benchmark and Evaluation System

模型评测基准与评测资源

摘要

生成图像模型现在可以生成高质量的图像,遵循复杂的指令并支持精确的编辑,但它们仍然难以保留所描绘的人物或事物。当生成或编辑特定主题的图像时,身份可能会随着姿势、表情、外观、视点或周围场景的变化而变化。现有的主题驱动方法对身份的表示位置做出了根本不同的选择:通过输入上下文(GPT-Image-2,NB2),作为可训练的特定于主题的模型参数(LoRA),或作为可跨代和编辑重复使用的持久身份层(PHOTA IDENTITY)。我们在主题驱动的生成、编辑、修复和多主题设置中系统地对这些范例进行基准测试,并设计越来越强调身份保存的任务。我们的结果表明,身份保留仍然是当前生成基础模型的一个明显局限性:强大的图像质量和指令遵循并不一定意味着强大的身份保真度,并且在迭代编辑、小主题规模、严重的图像退化和多主题合成下,身份退化变得更加明显。持久身份大大减少了生成、编辑和恢复过程中的这种退化,在应用于不同的基础模型时持续改进身份保留,同时保持可比的指令依从性和感知图像质量。这些结果表明,身份并不是简单地从能力越来越强的生成模型中产生,而是可以表示为与底层生成模型独立组成的持久的学科知识。