论文

我关心的音乐:LLM 对(几乎)任何音乐的音乐感知技能的自动多模态基准测试

Music I Care About: Automated Multimodal Benchmarking of LLM Music Perception Skills on (Almost) Any Music

模型评测基准与评测资源

摘要

音乐代表了人类文化的基石,以多种形式以数字方式存在,包括音频、符号编码(例如 MIDI、MusicXML)和乐谱。尽管多模式 大语言模型 (MLLM) 取得了进步,但当前的音乐基准面临三个主要限制。首先,大型静态基准测试需要大量资源来评估,而且目前还不清楚它们的结果如何转移到基准测试中包含的各种音乐之外。其次,声称衡量“音乐理解”的基准往往不要求音乐感知。第三,他们不支持跨音乐形式的系统性能比较。为了克服这些问题,我们引入了 Music I Care About Meta-Benchmark (MusICA-MetaBench),这是一个直接从用户提供的数据自动导出点播基准的框架。通过利用结构化符号表示(例如 MusicXML)和我们预定义的问题模板,我们构建了多项选择问答对,以探索音乐感知能力,并与音乐教学法、音频、乐谱图像和符号文件保持一致。我们使用 ChoraleBricks 数据集演示我们的框架,并通过实验确定基准大小,以确保此设置的模型比较在统计上可靠。通过与纯文本和白噪声基线进行比较,我们表明我们的问题确实可以衡量音乐感知。最终,MusICA-MetaBench 代表了 MLLM 音乐感知跨模式评估的重大进步。通过提出特定于数据集的基准测试范式,它可以对音乐感知能力进行高效的按需评估。