论文

MixProLAP:概率语言音频预训练的混合引起的不确定性建模

MixProLAP: Mixture-Induced Uncertainty Modeling for Probabilistic Language-Audio Pretraining

模型训练预训练

摘要

声学环境通常包含多个重叠的声音事件,并且可以使用不同的文本表达来描述相同的声学场景,使得音频文本对齐本质上不明确。本文提出了一种概率音频语言预训练框架来模拟音频文本对齐中的多对多对应歧义。与学习确定性点嵌入的传统对比方法不同,我们的方法将每种模态表示为分布,并学习不确定性感知的跨模态对齐。我们不依赖基于掩蔽的不确定性模拟,而是混合音频文本对来创建重叠的声音,更好地反映真实的声学混合物并捕获声音事件之间的语义包含关系。我们进一步引入多级包含损失来强制表示与这些关系一致。音频文本检索基准的实验表明,所提出的方法优于确定性基线。