论文

Prism:原生 2K 联合视音频生成模型训练的动态稀疏注意力

Prism: Dynamic Sparse Attention for Native 2K Joint Video-Audio Generation Model Training

模型架构Transformer

摘要

更高分辨率的原生训练联合视频音频生成模型使他们能够学习更丰富的视觉细节和更清晰的运动动态。然而,充分的注意力会产生二次成本,并且随着分辨率的提高,注意力会分散到越来越冗余的token上,从而稀释信息内容的学习信号并破坏预先训练的先验。现有的稀疏注意力方法要么以无需训练加速为目标,要么忽视联合视频音频数据的独特结构,其中跨模态交互本质上集中在发声区域周围。为了解决这个问题,我们提出了 Prism,一种动态稀疏注意力框架,用于 2K 的原生训练联合视频音频生成模型。特别是,Prism 将token序列组织成时空宏观区域,使注意力结构能够适应局部内容。对于每个区域,它通过沿通道的视频特征方差和音频到视频交叉注意力的特征规范来估计局部信息结构,共同捕获视觉内容如何方向变化以及音频对每个视觉区域的影响程度。基于这些信号,Prism 动态地为每个区域分配定制的块形状,沿着快速视觉内容变化和强视听耦合的轴应用更精细的分区。这鼓励每个块内的token保持语义一致,从而允许块级功能捕获视觉内容和联合视频音频交互模式。 Prism进一步采用混合块选择策略来动态确定每个查询的稀疏性。实验表明,与完全注意力相比,Prism 实现了 2.5$\times$ 训练的加速,同时在生成质量上超越了它。

Prism:原生 2K 联合视音频生成模型训练的动态稀疏注意力的原论文方法或结果图
图 3:与之前的开源方法的定性比较。音频请参阅演示视频。更多结果位于 Appx 中。 A.7.