论文

BioVITA:视觉-文本-声学对齐的生物数据集、模型和基准

BioVITA: Biological Dataset, Model, and Benchmark for Visual-Textual-Acoustic Alignment

模型训练预训练

摘要

从多模式数据中了解动物物种对计算机视觉和生态学的交叉提出了新的挑战。虽然最近的生物模型(例如 BioCLIP)已经证明了用于物种识别的图像和文本分类信息之间的强大一致性,但音频模式的集成仍然是一个悬而未决的问题。我们提出了 BioVITA,一种用于生物应用的新型视觉-文本-声学对齐框架。 BioVITA 涉及 (i) 训练数据集、(ii) 表示模型和 (iii) 检索基准。首先,我们构建了一个大规模训练数据集,包含 130 万个音频片段和 230 万张图像,涵盖 14,133 个物种,并标注了 34 个生态特征标签。其次,在 BioCLIP2 的基础上,我们引入了一个两阶段训练框架,以有效地将音频表示与视觉和文本表示对齐。第三,我们开发了一个跨模态检索基准,涵盖三种模态(即图像到音频、音频到文本、文本到图像及其相反方向)的所有可能的定向检索,具有三个分类级别:科、属和物种。大量的实验表明,我们的模型学习了一个统一的表示空间,可以捕获分类学之外的物种级语义,从而促进多模式生物多样性的理解。该项目页面位于:https://dahlian00.github.io/BioVITA_Page/