论文
HumMusQA:人类编写的音乐理解 QA 基准数据集
HumMusQA: A Human-written Music Understanding QA Benchmark Dataset
摘要
大型音频语言模型(LALM)中音乐理解的评估需要严格定义的基准来真正测试模型是否能够感知和解释音乐,而当前的数据方法经常无法满足这一标准。本文介绍了一种精心结构化的音乐评估方法,提出了由受过音乐训练的专家策划和验证的 320 个手写问题的新数据集,认为这种集中的手动策划对于探索复杂的音频理解来说是优越的。为了演示数据集的使用,我们对六个最先进的 LALM 进行了基准测试,并另外测试了它们对单模态快捷方式的鲁棒性。