论文
GaMMA:在大型多模态模型中实现联合全局时态音乐理解
GaMMA: Towards Joint Global-Temporal Music Understanding in Large Multimodal Models
摘要
在本文中,我们提出了 GaMMA,这是一种最先进的 (SoTA) 大型多模态模型 (LMM),旨在实现全面的音乐内容理解。 GaMMA继承了LLaVA的简化编码器-解码器设计,实现了音乐和语言之间的有效跨模态学习。通过以专家混合的方式合并音频编码器,GaMMA 有效地将时间序列和非时间序列音乐理解任务统一在一组参数内。我们的方法将精心策划的大规模数据集与渐进式训练管道相结合,通过预训练、监督 微调 (SFT) 和强化学习 (RL) 有效地突破音乐理解的界限。为了全面评估音乐 LMM 的时间和非时间能力,我们引入了 MusicBench,这是最大的音乐导向基准,包含 3,739 个人工策划的多项选择题,涵盖音乐理解的各个方面。大量实验表明,GaMMA 在音乐领域建立了新的 SoTA,在 MuchoMusic 上实现了 79.1% 的准确率,在 MusicBench-Temporal 上实现了 79.3%,在 MusicBench-Global 上实现了 81.3%,始终优于之前的方法。