论文
探索 LLM 南亚音乐的理解和生成
Exploring LLMs for South Asian Music Understanding and Generation
摘要
大语言模型 (LLM) 的最新进展在音乐理解和生成任务中显示出了有希望的结果。然而,现有的作品仍然局限于西方音调传统,对于当前的 LLM 是否可以处理结构上不同的低资源音乐传统几乎没有提供任何见解。我们对南亚古典音乐中的 LLM 能力进行了首次系统评估,南亚古典音乐是一种受拉格(raga)和基于塔拉(tala)的旋律约束支配的传统,其结构原则与西方和声驱动的音乐有着根本不同的结构原则。我们的评估基于印度斯坦古典理论和孟加拉古典形式,包括拉宾德拉和纳兹鲁尔桑吉特——南亚古典音乐中具有代表性的低资源传统。对于音乐理解评估,我们引入了涵盖拉格语法、文化知识和符号符号推理的 504 个问题答案基准,评估了 33 个 LLM,其中 Gemini 2.5 Pro 等前沿模型的准确率达到 85-90%,而大多数开源模型仍保持在 23-40% 的范围内。对于音乐生成,我们设计了一个五级控制提示框架,发现即使是最强的模型也只有 40% 的时间能够产生风格上忠实的输出。这些结果表明,音乐生成中的结构有效性和风格 忠实性 是不同的目标,并凸显了基于文化的音乐建模的公开挑战。