论文
HeadRouter:动态头重路由,用于大型音频语言模型中的任务自适应音频词元修剪
HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models
摘要
最近的大型音频语言模型(LALM)在处理扩展的多模态序列方面表现出卓越的能力,但会产生高昂的推理成本。词元压缩是一种直接减少序列中冗余词元的有效方法。现有的压缩方法通常假设 LALM 中的所有注意力头对各种音频任务的贡献相同,并通过对所有头的平均分数来计算词元重要性。然而,我们的分析表明,注意力头在不同的音频领域表现出不同的行为。我们进一步揭示,只有一小部分注意力头会主动响应音频,在处理语义和声学任务时具有完全不同的性能。根据这一观察,我们提出了 HeadRouter,这是一种头部重要性感知的标记修剪方法,可以感知不同音频任务中注意头的不同重要性,以最大限度地保留关键标记。 HeadRouter为无需训练,可应用于各种LALM。 AudioMarathon 和 MMAU-Pro 基准测试的大量实验表明,HeadRouter 实现了最先进的压缩性能,即使在保留 70% 的音频词元的情况下也超过了基准模型,并且在 Qwen2.5-Omni-3B 和 Qwen2.5-Omni-7B 上分别实现了普通平均值的 101.8% 和 103.0%。