论文
音频表示可以相加合成吗?
Do Audio Representations Compose Additively?
摘要
组合性是将复杂声学场景表示为更简单声源的组合的能力,是听觉感知和经典加性信号模型的核心。尽管如此,目前尚不清楚现代预先训练的音频表示是否在没有合成监督的情况下内化了附加结构。现有的音频合成推理评估框架主要集中在跨模式音频文本对齐上,而音频表示本身是否表现出独立于文本基础的加性合成结构(类似于单词表示中的向量算术)尚不明确。为了研究这个问题,我们对冻结的音频表示采用两步诊断。首先,我们使用规范相关分析来量化表示和声源标签之间的线性对齐。其次,我们通过留一组合重构来测试加性合成泛化,根据精确的源标签集对剪辑进行分组,对它们的表示进行平均,并根据仅适合训练组合的每个源贡献来预测保留的平均值。对于较大的组合保留,CLAP 优于 FSD50K 上的排列基线和标签重叠基线,而语音模型则不优于标签重叠基线。我们检查 Wav2Vec2、HuBERT 和 CLAP 在 FSD50K 和 CHiME-Home 数据集上生成的表示。所有三个模型均表现出比排列基线更高的线性相关性和更准确的留一组合重建。然而,只有 CLAP 显示出较大的余弦相似度增益,这可能与其对多种音频和文本的训练有关。最后,我们注意到所有三个模型都表现出重建残差,揭示了加性合成性的限制,例如非线性或非合成音频结构。