论文

通过部分信息分解理解多模态语言模型中的模态交互

Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition

模型评测模型行为与机制分析

摘要

了解多模态大语言模型 (MLLM) 中的模态交互对于可靠部署至关重要。我们引入部分信息分解(PID)作为决策级框架,该框架将感官和语言输入的独特、冗余和协同贡献分开,超越表示对齐和基于结果的评估。在视觉-语言基准中,PID揭示了重复出现的模态使用概况:推理和基础导向的任务往往表现出高度的协同作用,而专家和知识导向的任务则表现出更强的语言独特依赖性。这些概况概括了模型家族并预测对模式水平干预的敏感性。我们进一步将PID扩展到具有Sensory PID的三模态系统,将语言作为控制变量来分解视频-音频信息增益。应用于全模态模型时,感官 PID 揭示了视觉信息主导的感官协同瓶颈,即使在视听融合任务中也是如此。最后,PID 引导的重新加权为改善多模态推理和基础性能提供了初步证据。

通过部分信息分解理解多模态语言模型中的模态交互
图 1:传感 PID 框架。 (左)通过将文本提示视为控制视频音频集成的门来分析全模态模型。 (右)在共享token空间中应用 BATCH 估计器将决策级信息分解为独特( U vis U_{\text{vis}} 、 U aud U_{\text{aud}} )、冗余( R sens R_{\text{sens}} )和协同( S av S_{\text{av}} )组件,揭示了多模态推理机制。