论文

你在听什么?音频转文本的时态音乐基础 大语言模型

What Are You Listening to? Temporal Music Grounding for Audio-to-Text Large Language Models

模型评测基准与评测资源

摘要

大型音频语言模型可以产生流畅且音乐上可信的响应,但通常仍不清楚这些响应是否基于音频输入。我们引入了时间音乐基础,这是一项模型返回与查询的音符、事件或模式相对应的一个或多个时间跨度的任务。为了评估此功能,我们推出了 MusicGroundingBench,这是一个受控基准测试套件,通过将算法生成的钢琴 MIDI 渲染为音频而构建,从而产生精确的符号到音频对齐。该套件包含两个子集:MGBench-3N,用于评估最多包含三个音符的剪辑中的音符级基础;MGBench-2B,用于评估两小节摘录中的结构化基础和短格式音乐理解。实验表明,时间音乐基础对于当前的音频语言模型仍然具有挑战性,而特定任务的训练却能带来巨大的收益。我们进一步报告了关于基础监督和音乐理解之间关系的探索性证据。这些结果将 MusicGroundingBench 确立为一个受控测试平台,用于评估音频语言模型是否将其响应基于时间本地化的音乐证据。