论文

SonicCaps:大规模多样化和细粒度的字幕,以改进音频检索

SonicCaps: Large-Scale Diverse and Fine-Grained Captioning for Improved Audio-Retrieval

模型训练合成数据

摘要

音频语言建模的最新进展是由大规模音频字幕数据集推动的。然而,现有数据集仍然受到语义多样性低、缺乏声学细节的通用描述以及不能很好地反映听觉感知固有模糊性的一对一音频字幕映射的限制。我们介绍了 SonicCaps,这是一个大型音频字幕数据集,包含约 1500 万个字幕和约 70 万个音频剪辑,使用以音频和文本为条件的多模态 大语言模型 (Qwen3-Omni) 生成。为了明确促进多样性,我们通过结构化提示工程和少镜头生成为每个音频生成大约 24 个字幕,涵盖主要描述、改写变体(冗长、风格)和语义标签。人工评估表明,SonicCaps 的评分明显高于现有字幕数据集,细粒度分析表明我们的字幕被认为更具描述性和精确性,这与质量判断密切相关。最后,使用多字幕采样策略在 SonicCaps 上训练 CLAP 模型可以持续改进音频检索和零样本分类,并在公共和商业基准上具有更强的泛化能力。我们发布了 SonicCaps 和两个专门针对拥抱脸部的 CLAP 模型:https://huggingface.co/datasets/Zineb/SonicCaps。