论文
多模态大语言模型中的对齐错觉
The Alignment Illusion in Multimodal Large Language Models
摘要
多模态大语言模型(MLLM)中逐层视觉文本相似性被广泛解释为语言模型逐步将视觉内容集成到共享表示空间中的证据。该解读基于这样的假设:标量对齐分数反映内容级别的跨模式交互。为了测试这个假设,我们对视觉流应用受控干预。在跨越 0.5B 至 72B 参数的 5 个系列的 13 个 MLLM 中,用高斯噪声替换投影仪输出视觉标记会大幅降低任务准确性,但四种标准标量测量(CKA、SVCCA、MIR 和主角余弦)无法始终如一地将损坏的流与原始流分开。我们将这种失败称为对齐错觉,并将其追溯到共享语言模型路径:各向异性 MLP 下投影将视觉和文本标记拉向共同的输出方向,从而产生权重引起的对齐。由于该分量本质上是一维的,因此我们引入了主角间隙(PA 间隙),定义为顶部两个主角余弦之间的差,它将权重引起的相似性与多方向视觉结构分开。在分级视觉损坏下,PA 差距比我们考虑的标量分数更一致地跟踪任务准确性;在结构化但不相关的图像下,它进一步暴露了内部几何和任务准确性分离的情况。因此,MLLM 中的内部视觉文本对齐最好理解为语言模型内部视觉流的几何诊断,而不是内容级跨模式交互的直接代理,并且在通过受控任务证据进行校准时提供的信息最多。