论文

COMET:音频文本多模态对比嵌入中模态差距的概念空间剖析

COMET: Concept Space Dissection of the Modality Gap in Audio-Text Multimodal Contrastive Embeddings

模型评测模型行为与机制分析

摘要

对比语言音频预训练 (CLAP) 模型广泛用于音频理解,并在许多零样本应用中支持模态不可知的条件交换。然而,它们的性能很大程度上受到音频和文本嵌入之间的模态差距的影响。现有的解释主要将这种差距归因于锥体效应,将其视为平均嵌入之间的转变,但单独校正均值只能产生有限的改进。还提出了其他假设,例如信息不平衡和维度崩溃,但它们仍未得到充分验证,并且尚未在音频领域得到彻底研究。与此同时,一些工作试图将多模态对比嵌入分解为可解释的概念,但没有从概念分解的角度明确分析模态差距。在这项工作中,我们介绍了 COMET(概念空间组织和模态间隙解释与 PLS-SVD 变换),这是一种新颖的 CLAP 偏最小二乘奇异值分解 (PLS-SVD) 框架,它揭示了模态间隙的更广泛视角。我们的框架表明,只有一个小的、可解释的轴子集(捕获共享概念)对相似性计算有很大贡献,并且平均分量仅代表部分模态差距。基于这一见解,我们提出了一种简单的谱截断方法,以 无需训练 方式减轻模态间隙。该方法能够通过条件交换实现零样本音频字幕,以接近完全监督的性能,而不需要大型辅助存储库或昂贵的计算。同时,它实现了嵌入维数的大幅降低,同时保持了检索和音频字幕任务的强大性能。