论文

具有条件混合和嵌入级对比损失的半监督声音事件检测

Semi-Supervised Sound Event Detection with Conditional Mixup and Embedding-Level Contrastive Loss

模型训练监督微调与指令调优

摘要

声音事件检测(SED)是声环境分析的核心模块,但其性能往往受到稀缺标记数据的限制。最近的系统利用大型预训练音频基础模型,但有效的 微调 仍然具有挑战性,因为标记数据有限,而未标记数据丰富。之前的工作 ATST-SED 使用基于伪标签的半监督 微调 框架解决了这个问题。在这项工作中,我们通过采用受 ATST-Frame 预训练启发的嵌入级自监督对比损失来进一步改进框架。这个对比目标更好地利用 微调 期间未标记的数据。一个挑战是混合在两个目标中发挥不同的作用:伪标签学习使用组合混合,而对比学习将混合视为一种扰动。为了解决这种不匹配问题,我们提出了条件混合,它将合成混合和扰动混合结合在一个半监督框架中,并定义相应的嵌入级对比损失。所得模型在 DESED 验证集上达到 0.645 PSDS1 和 0.822 PSDS2,建立了新的技术水平。