论文
ACAVCaps:实现细粒度和多样化音频理解的大规模训练
ACAVCaps: Enabling large-scale training for fine-grained and diverse audio understanding
摘要
一般音频理解是大型音频语言模型的基本目标,而音频字幕是其开发的基石任务。然而,该领域的进展受到现有数据集的阻碍,这些数据集缺乏训练真正通用模型所需的规模和描述粒度。为了解决这一差距,我们引入了 ACAVCaps,这是一个新的大规模、细粒度、多方面的音频字幕数据集。 ACAVCaps 源自 ACAV100M 系列,使用多专家管道构建,该管道从不同角度(包括语音、音乐和声学属性)分析音频,然后由 大语言模型 将其合成为丰富、详细的描述。实验结果表明,与在其他领先字幕数据集上训练的模型相比,在 ACAVCaps 上预训练的模型在各种下游任务上表现出更强的泛化能力。该数据集可在 https://github.com/xiaomi-research/acavcaps 获取。