论文
UniVerse:在文化包容性低资源音乐理解方面对 LALM 进行基准测试和增强
UniVerse: Benchmarking and Enhancing LALMs on Culturally Inclusive Low-Resource Music Understanding
摘要
大型音频语言模型 (LALM) 的最新进展显着提高了音乐字幕、流派分类和声音事件检测等任务的性能。然而,人们对提高其对不同音乐传统的适应性的关注有限,特别是植根于不同文化背景的民间音乐。民间音乐传统通常资源匮乏,各地区的代表性不均衡,而且记录很少。即使此类样本出现在大规模的 预训练 中,LALM 也常常无法捕获其结构和风格特征,部分原因是缺乏专用的评估协议和训练解决方案。为了解决这些限制,我们引入了 UniVerse,这是一种用于低资源音乐理解的可重复解决方案。具体来说,我们提出了 UniVerseBench,这是一个涵盖超过 38 个文化和语言实体的 5,042 个问答对的基准,通过专家指导且高度自动化的管道构建。同时,我们构建了一个完全自动化的、模型生成的多轮对话训练数据集 UniVerseSet。通过在 UniVerseSet 上训练 LALM,我们系统地调整和研究了跨密集架构和专家混合 (MoE) 架构的代表性多模态不平衡学习策略。实验结果表明,完全自动化的数据管理与不平衡感知训练相结合产生了不小的改进,但模型仍然难以捕获细粒度的声学特征,这表明表面水平对齐和深层音乐理解之间存在差距。