论文
探索预训练音频表示中的空间结构
Probing Spatial Structure in Pretrained Audio Representations
摘要
预训练的空间音频编码器越来越多地用作感知任务的通用表示,但它们的空间编码功能仍然知之甚少。我们引入了空间音频表示学习(SARL)基准,这是一个用于评估预训练音频模型中的空间信息的受控框架。 SARL 探测源级因素(方位角、仰角、距离、类别)和房间级因素(RT60、体积、形状)。跨不同编码器的实验揭示了三种模式:输入配置和训练范式形状空间编码;源因素始终比房间因素更容易解码;受控扰动下的敏感性分析显示了对源和房间变化的异质响应。这些结果揭示了当前预训练音频表示中的系统偏差。 SARL 作为开源基准发布,用于空间音频表示的可重复评估。