论文
基于分层引用的生成视频压缩
Generative Video Compression Based on Hierarchical Referencing
摘要
基于扩散的生成视频压缩已成为提高感知质量的有前途的范例,其中需要对潜在帧进行有效编码,同时充当去噪条件。然而,现有方法既没有在潜在编码期间仔细设计参考和质量结构,也没有考虑帧级质量变化对去噪过程的影响,这限制了编码效率并加剧了生成重建期间的伪影传播。在本文中,我们提出了 GVCHR,基于分层引用的生成视频压缩。关键思想是分层组织潜在帧,其中所选的高质量参考有利于潜在编码和生成重建。在潜在编码中,GVCHR 将分层参考结构与分层质量结构结合起来,为较低层帧分配更多位,以便更频繁地重用作为参考。在此设计的基础上,我们引入了分层时间上下文挖掘,以利用互补的短期和长期时间上下文来进行有效的潜在编码。在生成重建中,编码侧层次结构被合并到附加到视频扩散Transformer的层次结构注意适配器中。该适配器使用分层注意力来限制每个潜在帧仅关注相同或较低层的参考,从而减少去噪期间的伪影传播。实验在多个基准上验证了 GVCHR。与之前最先进的方法相比,GVCHR 在 LPIPS 和 DISTS 方面分别实现了 50.5% 和 54.0% 的 BD 速率增益,同时还提供了明显改善的视觉质量。