论文
谁赢得了冲突?音频中文本偏差的机械解释性 LLM
Who Wins the Conflict? Mechanistic Interpretability of Text Bias in Audio LLMs
摘要
虽然 Audio 大语言模型 (Audio LLM) 擅长多模态理解,但它们受到文本主导的影响,这是一种模型偏爱文本而不是声学证据的偏见,可能导致幻觉响应。然而,当音频和文本输入相互矛盾时,这些模型如何表现的内部机制仍未被探索。在这项工作中,我们通过追踪内部表征跨层的传播,首次对这种现象进行了机制分析。我们的调查揭示了三个关键发现:(i)跨模型一致观察到文本主导; (ii) 虽然文本和音频依赖于功能上不同的路径,但它们最终会在后面的层中汇聚成共享的语义空间; (iii) 文本路径不会删除音频信息,而是主动抑制完整的音频表示。基于这些见解,我们利用反向修补,这是一种 无需训练 干预措施,可将后期层音频激活路由回早期层。这放大了音频表示,使它们能够克服文本抑制。我们的评估表明,反向修补持续减少了文本主导地位,展示了在冲突下减轻文本主导地位的机械途径。