音频基础模型捕获的海洋哺乳动物和鸟类发声的系统发育信号:特定领域预训练的有限优势
Phylogenetic signal in marine mammal and bird vocalizations captured by audio foundation models: the limited benefit of domain-specific pretraining
摘要
学习到的音频嵌入是否会编码没有人告诉他们编码的结构?我们探索了四个大型预训练音频模型(AST、CLAP、BEATs-bio 和 BirdNET),以及它们在训练过程中没有见过的下游任务:恢复物种发声的系统发育距离。如果嵌入空间的几何形状跟踪生命之树,则表示会拾取比模型优化的标签更深的东西。我们对两个独立的辐射进行曼特尔测试。在 32 种海洋哺乳动物(来自沃特金斯海洋哺乳动物声音数据库的 1,754 条记录)中,基础模型在 26 种鲸目动物中恢复了强烈的系统发育信号(CLAP r=0.82、BEATs-bio r=0.82、AST r=0.74;所有 p<0.001),是所有分类单元报告的最高的声学系统发育相关性之一。手工制作的 MFCC 特征 (105d) 没有发现任何结果 (r=0.040,p=0.338)。在 PCA 将每个嵌入投影到 105 维后,该差距仍然存在,因此它不是表示大小的人为因素。它还通过了控制主频率的部分 Mantel 测试(部分 Mantel r=0.404,保留了 97% 的方差解释),因此它不仅仅是变相的音高。我们使用 Jetz 等人对 20 种鸟类进行了重复分析。 (2012) 系统发育,这次添加了 BirdNET,这是一个对大约 6,000 种鸟类进行端到端训练的分类器。通用基础模型再次恢复信号(AST r=0.55,CLAP r=0.52)。出乎意料的结果是 BirdNET 和生物声学 BEATs-bio 都没有击败他们(r 约为 0.32 至 0.36)。将训练域与目标分类单元相匹配本身并没有帮助。预训练的音频嵌入在两个独立的辐射中携带进化信息,并且不需要特定领域的预训练来使其出现。