论文
NABEATs:噪声感知音频表示学习
NABEATs: Noise-Aware Audio Representation Learning
摘要
我们提出了噪声感知音频自监督学习(SSL)的概念,其目标是对音频混合进行编码,同时抑制不需要的噪声,并提出噪声感知 BEAT(NABEAT)作为该框架的基于 BEAT 的实现。音频 SSL 模型旨在处理各种音频信号。因此,在嘈杂的条件下,它们无法有效地专注于与下游任务相关的目标声音,从而导致性能下降。为了解决这个问题,NABEATs 经过训练,可以通过辅助参考噪声输入从噪声音频信号中估计干净的 BEATs 表示。该参考噪声使模型能够在推理时考虑特定的噪声特征,从而在操作环境中实现更好的泛化。我们的实验评估表明,NABEAT 显着提高了噪声条件下各种下游任务的性能,并且还可以很好地推广到不可见的噪声类型。