论文

Jamendo-MT-QA:多轨比较音乐问答的基准

Jamendo-MT-QA: A Benchmark for Multi-Track Comparative Music Question Answering

模型评测基准与评测资源

摘要

最近关于音乐问答(Music-QA)的工作主要集中在单轨理解上,其中模型使用其标签、音频描述或元数据回答有关单个音频剪辑的问题。然而,听众经常用比较的方式来描述音乐,而现有的基准并没有系统地评估多个曲目的推理。在 Jamendo-QA 数据集的基础上,我们引入了 Jamendo-MT-QA,这是一个用于多轨比较问答的数据集和基准。根据 Jamendo 上知识共享许可的轨道,我们在 12,173 个轨道对上构建了 36,519 个比较 QA 项目,每对产生三种问题类型:是/否、简答题和句子级问题。我们描述了用于生成和过滤比较问题的 LLM 辅助管道,并使用自动指标和 LLM 作为法官评估来对代表性音频语言模型进行基准测试。