论文
音频-视觉大语言模型真的能看又能听吗?
Do Audio-Visual Large Language Models Really See and Hear?
摘要
音频-视觉大语言模型(AVLLMs)正在成为多模态感知的统一接口。我们提出了首个针对AVLLMs的机制可解释性研究,分析音频与视觉特征如何在AVLLM的不同层中演化与融合并最终生成文本输出。我们发现,尽管AVLLMs在中间层编码了丰富的音频语义,但当音频与视觉冲突时,这些能力大多未能在最终文本生成中显现。探测分析表明,有用的潜在音频信息确实存在,但更深的融合层不成比例地偏向视觉表示,而这些表示往往会抑制音频线索。我们进一步将这种不平衡追溯到训练:AVLLM的音频行为与其视觉-语言基座模型高度一致,表明其对音频监督的额外对齐有限。我们的发现揭示了AVLLMs中一种根本性的模态偏置,并为多模态大语言模型如何整合音频与视觉提供了新的机制性洞见。
