论文
FADRA:具有残差适应的频率感知扩散,用于视频人脸恢复
FADRA: Frequency-Aware Diffusion with Residual Adaptation for Video Face Restoration
摘要
视频人脸恢复(VFR)旨在从严重退化的视频序列中恢复高质量且时间一致的面部细节;然而,现有方法仍然难以在复杂退化下平衡空间保真度和时间一致性。为了解决这个问题,我们提出了 FADRA,这是一种频率感知扩散框架,具有迭代残差适应功能,专为稳健的 VFR 量身定制。我们首先利用预训练的文本到视频扩散模型的强时间一致性,并引入轻量级 LoRA 适配器和低质量 (LQ) 像素对齐特征融合模块,以在 VFR 任务之前有效地适应冻结的生成。为了进一步使冻结扩散主干适应基于 LoRA 的适应之外的下游 VFR 任务,我们引入了重复残差适应头(RRAH),用于在扩散主干之后进行逐步残差细化。为了使这种细化由退化的观察结果明确指导,RRAH 进一步将 LQ 潜在值与当前速度预测一起作为输入,允许模型重复地重新访问 LQ 线索并预测每个流匹配步骤的残差更新。这种 LQ 引导的重复残差适应有助于恢复精细的面部细节,同时保留预训练模型的固有时间先验。此外,为了确保感知重要细节的结构完整性,我们引入了频率感知损失,它可以跨多个频段提供明确的监督,强调对感知质量至关重要且容易出现时间抖动的视觉敏感频率分量。大量实验表明,与最先进的方法相比,FADRA 可以恢复更好的面部结构,并生成时间上更一致的视频,从而在定量指标和视觉感知方面取得明显的进步。