论文
DiffMagicFace:真实视频的身份一致面部编辑
DiffMagicFace: Identity Consistent Facial Editing of Real Videos
摘要
文本条件图像编辑极大地受益于图像扩散模型的进步。然而,将这些技术扩展到面部视频编辑会带来挑战,即在整个源视频中保留面部身份并确保编辑后的主题在帧之间的一致性。在本文中,我们介绍了 DiffMagicFace,这是一种独特的视频编辑框架,集成了两个用于文本和图像控制的微调模型。这些模型在推理过程中同时运行,生成保持身份特征的视频帧,同时与编辑语义无缝对齐。为了确保编辑视频的一致性,我们开发了一个数据集,其中包含显示每个编辑对象的各种面部视角的图像。数据集的创建是通过渲染技术和随后的优化算法的应用来实现的。值得注意的是,我们的方法不依赖于视频数据集,但仍然在一致性和内容方面提供高质量的结果。即使对于复杂的任务(例如头部说话视频和区分密切相关的类别),也能获得出色的效果。使用我们的框架编辑的视频与使用传统渲染软件制作的视频具有同等效果。通过与当前最先进的方法进行比较分析,我们的框架在视觉吸引力和定量指标方面都表现出了卓越的性能。