论文

BEANS-Next 和 ROOTS:拓宽生物声学的音频语言功能

BEANS-Next and ROOTS: Broadening Audio-Language Capabilities for Bioacoustics

模型评测模型训练应用与实践合成数据基准与评测资源行业应用

摘要

生物声学和动物行为学涵盖了广泛的音频理解任务,其中许多任务都受益于大型音频语言模型的最新进展。然而,迄今为止,该领域的进展是在一组狭窄的任务上进行评估的,主要集中在以标签为中心的生物类别识别上,例如物种和鸣叫类型分类。在这项工作中,我们介绍了 BEANS-Next,这是一个基于生物声学任务分类的基准,涵盖声学感知、生物类别识别、场景理解和上下文学习。使用 BEANS-Next,我们表明现有模型在既有评测重点任务族之外表现有限,限制了它们在更广泛的生物声学应用中的有用性。为了支持在这个更广泛的任务领域取得进展,我们还引入了 ROOTS,这是一种大规模训练资源,由扩展的精选现实世界数据和以前未充分利用的行为和声学元数据构建,并辅以音频衍生信息和可扩展的合成生成(其中标签不足)。我们展示 该数据集的训练在 BEANS-Next 的所有任务组中都取得了实质性进展,使音频语言模型更接近其作为生物声学和行为学通用助手的潜力。为了加速该领域的进展,我们开源了我们的基准、数据集和数据管道。