论文

用于身份保护视频生成的表达多样化参考

Expression-Diverse References for Identity-Preserving Video Generation

应用与实践模型评测评测方法与指标内容创作

摘要

身份保留视频生成旨在在合成真实视频的同时保持主体的身份。然而,一张参考肖像仅捕捉了拍摄对象在一种面部配置下的外观。随着表情的变化,面部外观可能会以高度特定于身份的方式发生变化,使得受试者在看不见的表情下的外观无法仅由参考来确定。这种依赖于表情的变化也使评估变得复杂:即使对于同一个人的真实图像,在强烈的表情下,与中性参考的相似性也可能会降低。我们从生成和评估的角度研究了这一局限性。首先,我们使用受控照片和 MEAD 视频来量化面部识别相似性如何随表情强度变化。然后,我们构建一个紧凑但富有表现力的参考图库,捕捉不同的依赖于表情的面部配置。与该图库的匹配提供了表达运动下身份相似性的更可靠的测量。为了进一步揭示表达强度导致的性能下降,我们 分别报告轻度、强烈和极端表达的身份相似性。对于生成,我们扩展了 Stand-In 来以表情多样化的参考集为条件,并开发了一个数据管理管道,从训练视频中提取一致但多样化的面部裁剪。在只有单个肖像可用的实际设置中,我们通过使用预先训练的面部重现模型合成附加表情来构建参考集。在我们的受控基准上,真实参考集和合成参考集在所有三种表达强度方案中的身份相似性均优于评估的基线,其中极端表达的改进最大。