论文
AVTok:用于整体音频-视频生成的一维统一标记化
AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation
摘要
音视频生成最近获得了前所未有的研究关注,旨在通过听觉和视觉组件之间的细粒度同步和语义对齐来合成高质量的声音视频内容。前述方法主要采用双分支设计,每种模态具有单独的标记化和生成模块,忽略了表示间隙,同时需要密集的计算资源来进行适当的训练。受到一维视觉标记化最新进展的启发,我们提出了 \textbf{AVTok},一种新颖的统一标记器,专门用于整体音频视频生成。 AVTok 采用基于双流 Transformer 的架构,具有共享编码器-解码器和特定于模态的可学习查询,可高效地将音频-视频对编码为具有统一码本的紧凑一维潜在表示。为了应对阻碍 AVTok 利用对齐视听信息的异构信息不平衡问题,我们设计了一种分层训练策略来逐步实现每种模态的重建能力。大量实验表明,AVTok 在音频视频重建以及集成到音频到视频、视频到音频和类条件联合音频视频生成的下游管道中都表现出色。 AVTok 为联合音视频标记化的挑战铺平了道路,并为构建音视频生成的统一大型多模态模型提供了潜在方向。