论文

SkillFormer:音频语言模型的技能分解适配

SkillFormer: Skill-Decomposed Adaptation for Audio Language Models

模型训练参数高效训练

摘要

音频语言模型必须处理数十种不同的技能,从音高比较和说话者计数到音乐节奏估计和情感识别。同时联合所有技能上的训练会造成干扰:一项技能的增益通常是以牺牲另一项技能为代价的。我们提出 SkillFormer,它将音频理解分解为特定于技能的低秩适配器,并通过学习的路由器在推理时组合它们。路由器检查问题来决定激活哪些适配器以及每个适配器应承载多少权重,以便音调查询使用与流派分类查询不同的参数。交替的训练计划会在联合校准路由器之前更新其自己的技能集群上的每个适配器,从而防止标准多任务优化中出现的梯度冲突。 SkillFormer 添加了不到 4\% 的基本模型参数,并且无需更改音频编码器或语言 骨干模型。在 MMSU、MMAU-Pro 和 MMAR 三个架构不同的模型上进行评估,它将平均准确度提高了 2.5 到 4.1 个点,并且在感知、推理和语义子类别之间取得了平衡的收益。