论文
通过部分信息分解理解多模态语言模型中的模态交互
Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition
摘要
了解多模态大语言模型 (MLLM) 中的模态交互对于可靠部署至关重要。我们引入部分信息分解(PID)作为决策级框架,该框架将感官和语言输入的独特、冗余和协同贡献分开,超越表示对齐和基于结果的评估。在视觉-语言基准中,PID揭示了重复出现的模态使用概况:推理和基础导向的任务往往表现出高度的协同作用,而专家和知识导向的任务则表现出更强的语言独特依赖性。这些概况概括了模型家族并预测对模式水平干预的敏感性。我们进一步将PID扩展到具有Sensory PID的三模态系统,将语言作为控制变量来分解视频-音频信息增益。应用于全模态模型时,感官 PID 揭示了视觉信息主导的感官协同瓶颈,即使在视听融合任务中也是如此。最后,PID 引导的重新加权为改善多模态推理和基础性能提供了初步证据。
