论文

DTI:生成人脸视频超分辨率的动态轨迹初始化

DTI: Dynamic Trajectory Initialization for Generative Face Video Super-Resolution

应用与实践内容创作

摘要

作为感知上最强大的人脸视频超分辨率(FVSR)方法,生成式 FVSR(GFVSR)的现有工作主要利用预训练扩散模型的生成先验。然而,从完整生成的角度来看,如果没有大规模的辅助训练,它们就会遭受固定采样和昂贵的推理成本的困扰。此外,过度追求通用感知指标通常会导致保真度低。为了解决这些问题,我们提出了 GFVSR 的动态轨迹初始化(DTI)范例,它将 GFVSR 重新表述为输入驱动的定向恢复。通过针对预训练 DiT 主干的新型增强和注入调节机制,我们模型的保真度得到了显着提高,同时又不影响感知质量。为了动态设置起始采样点,我们提出了一种通过客观信噪比(SNR)对齐进行训练的判别指南(DG)。仅通过较小的模型调整和 微调,我们的方法就在不同的指标和基准上实现了 SOTA 整体性能。还对实际综合质量和通用指标之间的关系进行了分析,这证明了感知与扭曲的权衡,并且 LPIPS 是我们案例中最有说服力的指标。