论文
MusTBench:基准测试和推进音乐的时间基础 LLM
MusTBench: Benchmarking and Advancing Temporal Grounding in Music LLMs
摘要
最近的大型音频语言模型(LALM)在理解音乐内容方面表现出了良好的能力。然而,他们的反应是否基于音频的正确时间区域仍有待探索。这种限制对于音乐理解尤其重要,其中关键信息通常作为时间局部事件出现,例如乐器输入和节奏过渡。为了解决这一差距,我们引入了 MusTBench,这是一个经过音乐专家验证的基准测试,旨在通过五个时间定位问答任务来评估 LALM 中的时间定位。为了进一步改善现有模型的时间基础,我们提出了 MusT,一种新颖的四阶段时间优化方法,涵盖音乐编码器适应、LLM 适应、LLM 监督 微调 和基于 RL 的优化。 MusTBench 上的实验表明,现有的 LALM 难以实现精确的时间定位,而 MusT 则在强基线的基础上带来了显着的改进。这些结果将时间定位确定为当前 LALM 中缺少的一个关键功能,并将 MusTBench 定位为未来时间定位音乐理解研究的具有挑战性的基准。