论文

ID-V2V:保留身份的视频重新风格化

ID-V2V: Identity-Preserving Video Restylization

应用与实践内容创作

摘要

在视觉叙事中,人类表演是创作意图和叙事意义的核心。然而,对于生成视频模型来说,在实现灵活的视觉编辑的同时保留人类身份和性能仍然具有挑战性。我们将这一挑战形式化为保留身份的视频重新风格化,它在源视频中传播由编辑后的关键帧指定的场景、灯光和风格变化,同时保留面部相似度和性能,包括表情、眼神和唇形同步。一个关键障碍是缺乏配对训练数据,因为在现实环境中保留身份的重新风格化视频对很少见。为了解决这个问题,我们提出了基于源的身份保存和编辑驱动的视频合成的解耦。我们的主要见解是面部外观和表情应保持不变,照明是主要允许的变化。因此,我们将身份保存视为视频重新照明问题,同时将视觉编辑传播建模为由编辑的关键帧引导的受控视频合成。在此基础上,我们引入了 ID-V2V,这是一种集成互补控制信号的视频到视频生成框架:重新点亮的面部区域和面部法线贴图严格限制面部相似度和性能,而编辑的关键帧和深度序列则实现灵活且时间连贯的生成。这种设计可以从单个视频构建训练对,从而消除了对稀缺配对数据的需求。大量实验表明,ID-V2V 在保留面部相似度和细粒度面部表现方面显着优于现有方法,支持单主体和多主体场景,并提供高视觉质量,凸显了其作为以人为中心的现实世界内容制作工具的潜力。该代码位于:https://github.com/Eyeline-Labs/ID-V2V。