论文

通过同步感知跨模态稀疏注意力高效生成视听

Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention

模型优化稀疏化

摘要

最近的视听生成模型可以在统一的扩散过程中合成同步的视频和声音,但它们的推理成本仍然很高,因为长视频标记序列需要在去噪步骤中重复进行注意计算。人们已经为视频生成模型开发了多种加速技术,包括低比特量化、注意力稀疏化和特征缓存。然而,由于这些方法最初是为视频生成而设计的,直接将它们应用于视听模型会忽略音频和视频分支之间的交互,因此可能会破坏音视频同步。我们提出了一个同步感知加速框架,用于高效的视听生成。我们的主要观察结果是,双向音视频交叉注意力揭示了两个分支之间的结构化交互,高响应通常集中在一些与声音相关的视觉和时间区域。在这种交互模式的指导下,我们引入了一种受保护的稀疏注意力策略,该策略保留同步关键词元的高保真计算,同时稀疏冗余注意力交互。通过明确考虑加速过程中的跨模式依赖性,我们的方法提高了推理效率,同时保持视频质量、音频质量和音视频同步。