论文

音频-视觉大语言模型真的能看又能听吗?

Do Audio-Visual Large Language Models Really See and Hear?

模型评测模型行为与机制分析

摘要

音频-视觉大语言模型(AVLLMs)正在成为多模态感知的统一接口。我们提出了首个针对AVLLMs的机制可解释性研究,分析音频与视觉特征如何在AVLLM的不同层中演化与融合并最终生成文本输出。我们发现,尽管AVLLMs在中间层编码了丰富的音频语义,但当音频与视觉冲突时,这些能力大多未能在最终文本生成中显现。探测分析表明,有用的潜在音频信息确实存在,但更深的融合层不成比例地偏向视觉表示,而这些表示往往会抑制音频线索。我们进一步将这种不平衡追溯到训练:AVLLM的音频行为与其视觉-语言基座模型高度一致,表明其对音频监督的额外对齐有限。我们的发现揭示了AVLLMs中一种根本性的模态偏置,并为多模态大语言模型如何整合音频与视觉提供了新的机制性洞见。

音频-视觉大语言模型真的能看又能听吗?:论文配图
图 1:视觉偏差图示。 AVLLM 表现出关键的模态偏差,通常优先考虑视觉提示而不是重要的音频提示。该图展示了一个反事实场景,可见物体(一辆蓝色汽车和一个遛狗的女人)是安静的,唯一可听见的声音是视野外的救护车警报声。当被提示描述场景时,AVLLM 会产生幻觉音频事件(汽车引擎、狗叫)并错过实际的警报声。