论文
视觉如何变为语言:多模态推理的逐层信息论分析
How Vision Becomes Language: A Layer-wise Information-Theoretic Analysis of Multimodal Reasoning
摘要
当多模态 Transformer 回答视觉问题时,预测由视觉证据、语言推理还是真正融合的跨模态计算驱动——这一结构如何随层演变?我们用基于部分信息分解(PID)的逐层框架回答这一问题,把 Transformer 每层的预测信息分解为冗余、视觉独有、语言独有和协同分量。为使 PID 可用于高维神经表征,我们提出 PID Flow,一个结合降维、归一化流高斯化和闭式高斯 PID 估计的流水线。将该框架应用于 LLaVA-1.5-7B 和 LLaVA-1.6-7B 在六个 GQA 推理任务上,我们发现一致的模态转导模式:视觉独有信息在早期达到峰值并随深度衰减,语言独有信息在后期激增、约占最终预测的 82%,跨模态协同始终低于 2%。这一轨迹在不同模型变体间高度稳定(逐层相关性大于 0.96),但对任务强烈依赖,语义冗余决定细节信息指纹。为确立因果性,我们进行有针对性的图像到问题注意力敲除,表明破坏主要转导通路会引起被困视觉独有信息、补偿性协同和总信息成本的可预测增加——这些效应在依赖视觉的任务中最强,在高冗余任务中最弱。综合起来,这些结果为多模态 Transformer 中视觉如何变为语言提供了信息论与因果解释,并为识别模态特定信息丢失的架构瓶颈提供定量指导。
