论文
LLM能听懂LilyPond吗?象征音乐生成和理解的基准
Can LLMs understand LilyPond? A benchmark for symbolic music generation and understanding
摘要
大语言模型 的象征性音乐评估在表示、数据集和指标方面仍然支离破碎。我们推出了 LilyBench,这是一个基于 LilyPond 的基准测试,可在同一系列开放权重 LLM 上联合评估符号音乐生成和音乐理解。该基准包括 200 个提示生成套件和 10 个改编自 ABC-Eval 的理解任务,涵盖语法、元数据预测、结构排序和音乐识别。使用编译率、基于 Jensen-Shannon 相似性的 MusPy 描述符分布以及基于 LilyBERT 的 Fréchet 音乐距离 (FMD) 来评估生成质量。对四个开放权重模型的实验表明,可执行的 LilyPond 生成在零样本设置下是可以实现的,尽管在作曲家和流派识别方面表现出色,但结构理解任务仍然具有挑战性。我们的实验还揭示了基于描述符的指标和基于嵌入的指标之间的系统性分歧,表明符号音乐评估受益于指标三角测量而不是单分排名。我们在 https://github.com/CSCPadova/lilybench 发布了基准、提示库和评估代码,以支持符号音乐生成和理解的未来研究