论文
异构音频分类的多分支层次结构感知框架
A Multi-Branch Hierarchy-Aware Framework for Heterogeneous Audio Classification
摘要
本技术报告描述了我们用于 DCASE 2026 挑战赛任务 1 的系统,该系统旨在根据广泛声音分类法 (BST) 对异构音频录音进行分类。该任务既需要准确的二级预测,又需要与顶级分类法保持一致。我们的系统建立在基于 CLAP 的音频文本表示之上,并沿着三种策略进行改进:使用 BSD35k 的过滤子集扩展训练集,使用特定特征的分支增强声学建模,以及使用层次感知分类器和基于 KNN 的后处理完善预测。在考虑的声学特征中,log-STFT 分支提供了最强的单模型性能。通过基于 KNN 的后处理,我们最好的单一系统在与基线相同的评估协议下,在 BSD10k-v1.2 集上实现了 80.84% 的分层 F1 分数 (Hier. F1)。我们通过将具有互补声学特征的模型和分类头相结合来进一步构建集成系统,从而实现 Hier。 F1得分分别为81.25%和81.18%。