论文
DiffCVE:基于扩散的压缩视频增强
DiffCVE: Diffusion-based Compressed Video Enhancement
摘要
由于复杂的伪影模式和大量信息丢失,严重压缩视频的感知质量增强仍然具有挑战性。最近的扩散模型已经表现出强大的视觉恢复生成能力,但直接将其应用于压缩视频通常会忽略压缩退化特性,并可能引入结构不一致的幻觉。为了解决这个问题,本文提出了一种基于扩散的压缩视频增强方法,称为DiffCVE。编码先验增强双调节(CPDC)分支旨在联合建模压缩视频和编码先验条件,其中包括残差和运动向量的编码先验在扩散去噪过程中提供补充的结构和运动指导。为了使扩散过程了解压缩严重性,引入了压缩降级语义提示 (CDSP) 机制,以利用 QP 条件文本提示和 LoRA 微调。此外,VAE 解码器中还集成了编码先验引导加权融合 (CPWF) 模块,以融合 VAE 编码器和编码先验编码器特征与 QP 预测权重。大量的实验证明了所提出的方法在提高感知质量方面的有效性,特别是在严重的压缩设置下。带有增强视频演示的项目页面位于 https://wqmaker.github.io/projects/DiffCVE/。