论文

从通用音频标记到空间定位声音事件定位和检测

From General-Purpose Audio Tagging to Spatially Grounded Sound Event Localization and Detection

应用与实践视觉感知与空间理解

摘要

本报告研究了预训练通用音频标记 (GP-AT) 模型向空间定位声音事件定位和检测 (SELD) 的扩展。所提出的 AT2SELD 框架将预训练的 AT 主干与紧凑的一阶高保真度立体声响复制 (FOA) 空间处理、轨道式 SED 和笛卡尔 DOA 估计、排列感知监督和校准相结合。它描述了语义音频先验如何在数据、计算和部署约束下支持本地化感知场景分析。该框架是通过知情的多阶段神经架构搜索(NAS)开发的。第一阶段表明,基于幅度、相位和强度向量 (IV) 的频谱 FOA 描述符为语义到空间传输提供了最可靠的接口。第 2 阶段将早期残差空间编码确定为主要的容量敏感组件,而后期逐轨抽象和循环平滑主要充当细化阶段。第三阶段表明,后期的十字绣耦合改善了语义空间交互,而早期的融合成本更高且效率较低。诊断评估根据类别平衡、焦点损失、活动条件 DOA 监督、阈值校准以及跨 STARSS23、TAU2019、TAU-NIGENS2020 和 TAU-NIGENS2021 的传输来分析所选架构。焦点损失改善了活动点,仅活动 DOA 监督减轻了非活动目标优势,验证选择的阈值恢复校准而不取代空间学习。跨数据集和预言机活动分析表明,TAU2019 上有很强的固定源本地化,TAU NIGENS2021 上的可转移表示,以及 STARSS23 上有意义但不确定的行为。总体而言,当嵌入空间感知架构并通过集成校准和面向部署的策略进行优化时,GP-AT 先验对于 SELD 设计似乎很有前景。