论文
词元表示能否竞争?BirdCLEF+ 2026音频检测的模型对照
Can Tokens Compete? Token Representations against Supervised CNN Backbones for BirdCLEF+ 2026
摘要
本文详细介绍了 DS@GT ARC 团队的 BirdCLEF+ 2026 方法,即潘塔纳尔湿地声景中动物发声的多标签检测。 2026 年版本增加了大约一小时的标记音景,将任务转向适合标记集的监督管道。首先,我们建立了一个竞争性监督基线,集成了一个冻结的 Perch v2 主干网络、一个训练有素的 HGNetV2-B0 声音事件检测网络和一个非鸟类原型头部,在 90 分钟的 CPU 预算内达到了 0.936 的私人排行榜分数,排名 1894。其次,我们询问基于标记的表示是否可以竞争,将神经音频编解码器的编解码器表示与基础嵌入的语义表示进行对比。我们将两个生物声学专家模型与在 AudioSet 上训练的四个基于词元的编码器进行比较。这项工作的存储库可以在 https://github.com/dsgt-arc/birdclef-2026 找到。