论文
大视觉语言模型的综合信息分解分析
A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models
摘要
大型视觉语言模型(LVLM)取得了令人印象深刻的性能,但其内部决策过程仍然不透明,因此很难确定成功是源于真正的多模态融合还是源于对单模态先验的依赖。为了解决这种归因差距,我们引入了一种新颖的框架,使用部分信息分解(PID)来定量测量 LVLM 的“信息谱”——将模型的决策相关信息分解为冗余、独特和协同的组件。通过使可扩展的估计器适应现代 LVLM 输出,我们的模型无关管道在三个维度上的四个数据集上分析了 26 个 LVLM:广度(跨模型和跨任务)、深度(逐层信息动态)和时间(跨训练的学习动态)。我们的分析揭示了两个关键结果:(i)两种任务机制(协同驱动与知识驱动)和(ii)两种稳定的、对比鲜明的家庭层面策略(以融合为中心与以语言为中心)。我们还发现了分层处理中一致的三相模式,并将视觉指令调整确定为学习融合的关键阶段。总之,这些贡献提供了超越仅准确度评估的定量视角,并为分析和设计下一代 LVLM 提供了见解。代码和数据可在 https://github.com/RiiShin/pid-lvlm-analysis 获取。