论文
轴承:来自一阶高保真度立体声响复制的自监督声场嵌入
Bearings: Self-Supervised Soundfield Embeddings from First-Order Ambisonics
摘要
最近提出的自监督音频编码器可以学习声音场景的强大通用表示,但它们是空间盲的。为了提供声音场景缺失的空间表示,我们引入了轴承。 Bearings 是一个自监督框架,可以从未标记的一阶 Ambisonics 中学习声场嵌入。我们预训练一个掩码自动编码器,与一个解码器配对,该解码器以来自现成的单通道音频编码器的冻结声学嵌入为条件。我们的结果表明,产生的声场嵌入形成可重复使用的流,可以通过轻量级可训练融合头连接到冻结声学编码器。在声音事件定位和检测方面,将我们的声场嵌入与声学表示连接起来,提供了缺失的空间信息,并实现联合检测和定位,将 TAU-NIGENS 2021 上的位置相关 F 分数从 4 以下提高到 50,在 STARSS23 上提高到 39。据我们所知,Bearings 是第一个自监督声场编码器,其嵌入插入到冻结的声学编码器中,而无需重新训练任何一个模型。