论文

MLLM-显微镜:解锁多模态中的隐藏结构 大语言模型

MLLM-Microscope: Unlocking Hidden Structure Within Multimodal Large Language Models

模型评测模型行为与机制分析

摘要

这项工作提出了 MLLM-Microscope,这是一种新颖的系统,旨在分析多模态 大语言模型 (MLLM) 中的隐藏表示。我们的系统评估 Transformer 层中多模态词元嵌入的线性度、内在维度和各向异性。利用 ScienceQA 数据集,我们评估了两种最先进的 MLLM:LLaVA-NeXT 和 OmniFusion。我们发现两种模式的词元的主要流和残余流在 Transformer 层中都表现出高度线性的行为。然而,LLaVA-NeXT 的图像标记显示线性度略有下降,而 OmniFusion 的图像标记保持一致。与 LLaVA-NeXT 相比,OmniFusion 中的图像词元尺寸在各层中始终保持较高。此外,观察到 OmniFusion 的各向异性在整个层中始终保持较低水平。这些发现表明,MLLM 的内部工作原理高度依赖于将词元序列传递到 LLM 之前执行的模态融合的性质。从我们的系统中获得的这一点和其他新的潜在见解肯定能够增强我们对 MLLM 内部工作原理的理解,为未来的模型设计和优化提供信息。