论文
RefDecoder:通过条件视频解码增强视觉生成
RefDecoder: Enhancing Visual Generation with Conditional Video Decoding
摘要
视频生成为大量下游应用提供动力。然而,虽然事实上的标准,即潜在扩散模型,通常采用严格条件的去噪网络,但它们的解码器通常保持无条件。我们观察到,这种结构不对称会导致细节的严重丢失以及相对于输入图像的不一致。为了解决这个问题,我们认为解码器需要同等的条件来保持结构完整性。我们引入了 RefDecoder,这是一种参考条件视频 VAE 解码器,通过参考注意将高保真参考图像信号直接注入解码过程。具体来说,轻量级图像编码器将参考帧映射到细节丰富的高维词元,这些词元在每个解码器上采样阶段与去噪视频潜在词元共同处理。我们展示了跨多个不同解码器主干(例如,Wan 2.1 和 VideoVAE+)的一致改进,在 Inter4K、WebVid 和 Large Motion 重建基准上的无条件基线上实现了高达 +2.1dB PSNR。值得注意的是,RefDecoder 可以直接交换到现有的视频生成系统中,无需额外的 微调,并且我们报告了 VBench I2V 基准测试中主题一致性、背景一致性和整体质量得分的全面改进。除了 I2V 之外,RefDecoder 还可以很好地推广到各种视觉生成任务,例如风格转移和视频编辑细化。