论文
CoSTALA:通过多粒度分层对比学习进行组合时空音频语言对齐
CoSTALA: Compositional Spatio-Temporal Audio-Language Alignment via Multi-Grain Hierarchical Contrastive Learning
摘要
传统的音频语言模型(ALM)在实现听觉和文本表示之间的一致性方面取得了重大进展,包括最近对空间音频的探索。然而,在日常空间场景中,它们仍然无法有效处理多事件音频序列。当前的方法主要依赖于具有全局听觉和文本特征的粗粒度对比学习,缺乏区分多个连续事件的分辨率。为了克服这些限制,我们提出了 CoSTALA——一种新颖的训练范式,从纯粹的全局对齐过渡到细粒度的时空推理。通过构建多粒度分层损失函数系统,我们实现了时间依赖性的显式建模,并成功锚定单个声学事件以保持其语义纯度。大量实验表明,CoSTALA 显着建立了一个强大的时空音频理解新框架。