论文
EchoCache:用于高效音频驱动视频生成的能量引导跨模式缓存
EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation
摘要
音频驱动的视频生成(A2V)在合成时间相干和视听对齐的视频方面取得了有希望的进展,但由于扩散模型的迭代去噪过程,其推理仍然昂贵。现有的缓存方法主要利用视觉特征中的时间冗余,而忽略了 A2V 的跨模态对齐,其中音频驱动具有高度不均匀时间重要性的视觉生成。在本文中,我们确定了现有 A2V 缓存方法中两个级别的错位:时间语义错位和计算存储错位。为了解决这些问题,我们提出了 EchoCache,一种用于高效 A2V 生成的能量引导跨模式缓存框架。 EchoCache利用音频时频能量作为显着性锚点来指导潜在级缓存更新,并进一步引入了具有量化缓存管理的动态时间步潜在缓存机制,以实现联合效率和内存优化。对主流 A2V 模型的大量实验表明,EchoCache 持续改善延迟质量权衡,同时保持生成质量和视听一致性。特别是,在 EMTD 基准测试的 Wan2.2-S2V 上,EchoCache 实现了 2.46 倍的加速,整体性能最佳。代码可在 https://github.com/IF-LAB-PKU/EchoCache 获取。