论文

数据有限的屏蔽自动编码器:它有效吗?细粒度生物声学案例研究

Masked Autoencoders with Limited Data: Does It Work? A Fine-Grained Bioacoustics Case Study

模型训练预训练

摘要

生物声学识别需要细粒度的声学理解来区分发音相似的物种。然而,许多大型数据存储库(例如 iNaturalist)的注释很弱,每个记录通常只有一个正物种标签,这使得监督学习特别具有挑战性。受计算机视觉进步的启发,最近的方法已经转向自我监督学习,以捕获音频的底层结构,而不依赖于详尽的注释。特别是,掩蔽自动编码器(MAE)在海量音频语料库上表现出了强大的可移植性,但它们在更温和的生物声学环境中的有效性仍未得到充分探索。在这项工作中,我们对 iNatSounds 上物种分类的 MAE 预训练进行了系统研究,分析了预训练数据规模、领域特异性、数据管理和传输策略的影响。与之前的工作一致,我们发现在各种通用音频数据上预训练的模型在 iNatSounds 上实现了最佳传输性能。与大规模音频基准的观察结果相反,我们发现(1)对特定领域数据进行额外的屏蔽重建预训练带来的好处有限,甚至可能会降低相对于现成模型的性能;(2)当整体数据规模有限时,选择性数据过滤提供的优势可以忽略不计。我们的结果表明,在中等规模的细粒度生物声学环境中,预训练规模主导目标设计。这些发现进一步阐明了基于 MAE 的预训练何时有效,并为有限监督下的模型选择提供了实用指导。