论文

FineLAP:联合片段级与帧级监督进行语言—音频预训练

FineLAP: Taming Heterogeneous Supervision for Fine-grained Language-Audio Pretraining

模型训练预训练

摘要

通过对比学习预训练的音频—语言模型(如CLAP)擅长片段级理解,但在帧级任务上较弱。实际音频文本数据中,大量片段级描述与少量帧级标注并存,既有扩展未能充分利用这些不同粒度的监督。本文提出FineLAP细粒度语言—音频预训练,用异构数据同时改善片段级和帧级对齐。方法结合双流sigmoid损失和聚类采样,联合学习两类监督;在自监督编码器上加入解耦音频投影器,以兼顾整体语义和局部细节。为缓解时间标注数据不足,研究提供FineLAP-100k,使用可扩展数据整理流程构建的10万条合成声音事件检测数据。所测音频检索、分类、声音事件检测和文本音频定位任务中取得先进表现。消融表明粗粒度和细粒度对齐可相互促进。