论文

为什么您的分词器在信息融合中失败:用于视频增强音频分词的定时感知预量化融合

Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization

模型架构新型架构

摘要

音频标记化已成为端到端音频语言模型的关键组成部分,为音频理解和生成任务提供高效的离散表示学习。然而,由于单一模态的限制,现有的音频分词器在理解任务方面面临着根本性的限制,特别是当音频信号包含不明确或不完整的信息时。虽然合并额外的模态信息可以显着增强音频理解,但当前的多模态融合方法总是会降低重建质量。对于需要高保真音频生成功能的端到端音频系统来说,这种降级是不可接受的。在这项工作中,我们研究了视频增强音频标记化中重建质量下降的根本原因,并提出了三个关键发现。首先,分词器架构中融合的位置对于保持重建质量至关重要。其次,我们表明对比学习虽然在连续表示融合中有效,但不适合离散分词器,因为它无法增强下游任务性能。第三,虽然特征维度融合方法取得了一定的成功,但我们发现沿时间轴的融合——在独特特征概念的指导下——产生了明显更好的结果。基于这些见解,我们引入了用于视频增强音频标记化的定时感知预量化融合,这是第一种成功地将视觉信息集成到音频标记化器架构中同时保持重建保真度的方法。与纯音频标记器和建立的多模态融合基线相比,我们的方法不仅保持了高保真重建,而且在下游理解任务上实现了卓越的性能。