论文
直接还是中介?大型音频语言模型中任务相关的音频信息路由
Direct or Mediated? Task-Dependent Audio Information Routing in Large Audio Language Models
摘要
大型音频语言模型 (LALM) 在广泛的音频理解任务中表现出了强大的性能。然而,它们通常是在单个连贯的音频片段上进行评估,从而导致它们在不太熟悉的输入配置下的行为尚未得到充分探索。我们通过受控设置来研究这个问题,其中两个音频片段连接成单个输入。在多个 LALM 中,我们观察到一个显着的任务依赖性鲁棒性差距:自动语音识别(ASR)保持相对稳定,而音频问答(AQA)则大幅下降。为了研究这种差异背后的机制,我们分析了如何使用分层注意力剔除技术通过 LALM 解码器路由音频信息。结果揭示了不同的任务依赖性途径。 ASR 主要依赖于通过答案标记从音频标记中直接检索,而 AQA 更依赖于中介路径,其中音频信息首先集成到提示标记中,然后在生成过程中进行访问。我们进一步探究音频串联下的提示词元表示,发现即使 AQA 性能急剧恶化,任务相关的音频属性仍然易于解码,特别是在中间和后面的解码器层。这种分离表明失败不能用解码器状态中音频信息的完全丢失来解释,而是与在答案生成期间检索或利用提示介导信息的下游瓶颈一致。总之,我们的研究结果揭示了 LALM 中任务相关的音频信息路由,并强调信息利用是其泛化的潜在限制。