论文

STEMMA:大型音频语言模型的歌曲到词干多音频推理

STEMMA: Song-to-Stem Multi-Audio Reasoning for Large Audio Language Models

模型训练模型评测合成数据基准与评测资源

摘要

音乐理解通常需要比较摘录并推理歌曲、部分和主干之间的关系。然而,现有的大型音频语言模型(LALM)和音乐问答数据集通常在单个录音上运行,或者比较没有已知制作关系的独立采样曲目。我们介绍 STEMMA,一个围绕制作来源构建的多音频音乐问答框架:摘录是否源自同一曲目或部分,以及哪些词干属于哪些混合物。由于这种关系在传统的音频优先采样下是稀疏的,因此STEMMA采用了关系优先的构造策略:它首先指定一个目标关系,然后在目录中查询满足它的摘录和不满足它的硬负例。标签是直接根据目录来源确定的,而不是通过元数据的语言模型生成的。我们构建了用于评估的 STEMMA-Bench 和轨道不相交的训练集 STEMMA-Instruct。在 STEMMA-Instruct 上微调两个 LALM 可以改善多音频推理,最大收益是 结构关系直接由目录确定,同时保留单音频音乐理解。