论文

IP 适配器就是您所需要的:实现 微调-Free Diffusion-Based Talking Face 生成

IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation

应用与实践内容创作

摘要

随着扩散模型的快速进步,说话人脸生成取得了显着的进展。然而,现有的基于扩散的方法仍然需要特定于任务的 微调 和大规模视听数据集,导致计算成本高昂,阻碍了整个研究界基于扩散的方法的可扩展性和可访问性。为了解决这个问题,我们提出了一种无需微调的范例,它使用稳定扩散和 IP 适配器的预训练权重直接执行说话人脸生成。该主干网利用 IP-Adapter 的视觉嵌入功能从预训练的稳定扩散中挖掘与嘴唇相关的语义。为了解决身份漂移、同步错误和时间不稳定的挑战,我们还设计了三个可训练的无参数组件:(1)结构主义者,它明确地解开并重新组装嘴唇和外观特征,以减轻身份漂移和外观扭曲; (2)结构控制器,根据准单调运动趋势自适应地细化嵌入,以实现精确的唇形同步; (3) 噪声传感器,引入高斯先验来检测和抑制闪烁和抖动伪影并增强时间一致性。实验结果表明,我们的方法在口型同步精度(PCLD 中至少提高 0.16)和视觉保真度(FID 中至少提高 0.7)方面均优于现有的 SOTA 方法,建立了一种用于说话人脸生成的新型 微调-free 扩散框架。