论文
统一分数和性能以实现音频语言模型中的细粒度音乐理解
Unifying Score and Performance for Fine-Grained Music Understanding in Audio-Language Models
摘要
大型音频语言模型 (LALM) 在标记、检索和字幕等广泛的音乐理解任务中显示出了可喜的进展。然而,音乐理解仍处于早期阶段,需要更好地聆听内容以及如何通过动态、乐句、清晰度、时间和其他表演技巧在表演中实现它。现有的音频语言模型 (ALM) 训练流程通常依赖于粗略、基础薄弱的字幕,因此对学习音乐中这些微妙的细微差别几乎不提供支持,从而限制了它们在教育或艺术实践中服务于现实世界应用的能力。因此,我们引入了 MuNo-SP(统一乐谱和演奏的音乐符号),这是一种基于文本的表示,联合编码乐谱内容和演奏信息。在 MuNo-SP 的基础上,我们开发了一个自动训练数据生成管道,该管道使用对齐的乐谱和表演来生成长篇听觉分析和音乐知识问答对。我们使用此管道构建 MAESTROCaps,这是一个古典钢琴数据集,包含 148 个长格式演奏分析和从 148 个对齐的乐谱演奏对派生的 31,080 个问答对。在人类评估中,对于九个摘录中的八个,MuNo-SP 分析以多数票优于仅 MIDI 分析。 MuNo-SP 在乐谱-演奏理解基准上也表现强劲,这表明集成乐谱和演奏信息可以实现比仅 MIDI 基线更可靠且音乐信息丰富的 LALM 监督。