论文

TinyMU:用于音乐理解的紧凑音频语言模型

TinyMU: A Compact Audio-Language Model for Music Understanding

模型优化小模型/轻量模型

摘要

音乐理解和推理是音乐信息研究领域的核心挑战,其应用范围从检索和推荐到音乐代理和虚拟助理。最近的大型音频语言模型(LALM)在通过遵循用户指令回答音乐相关问题方面取得了显着的进步。然而,它们的规模庞大,通常有数十亿个参数,导致训练成本高昂、推理速度缓慢,并且在边缘设备上的部署能力有限。在这项工作中,我们提出了 TinyMU,一种轻量级 (229M) 音乐语言模型 (MLM),其性能可与更大的 LALM 相媲美,同时保持高效和紧凑。为了训练 TinyMU,我们引入了 MusicSkills-3.5M,这是一个精心策划的、以音乐为基础的问答数据集,包含 350 万个样本。该数据集涵盖多项选择、二进制和开放式格式,提供跨不同音乐概念的细粒度监督。对于其架构,TinyMU 利用 MATPAC++(SOTA 自监督音频编码器)进行细粒度特征提取。与轻量级线性投影仪配合使用,它可以有效地将音频嵌入与语言模型保持一致。通过广泛的评估,我们表明 TinyMU 在基本音乐理解和复杂推理方面都表现出色。值得注意的是,在 MuChoMusic 基准测试中,尽管尺寸缩小了 35 倍,但它的性能却达到了 SOTA LALM 的 82%,这突显了小型 MLM 在计算预算有限的情况下的潜力。