论文

为什么 MLLM 难以确定对象方向

Why MLLMs Struggle to Determine Object Orientations

模型评测模型行为与机制分析

摘要

多模态 大语言模型 (MLLM) 很难完成需要推理图像中 2D 对象方向的任务,如先前工作中所述。童等人。和尼科尔斯等人。假设这些故障源于视觉编码器,因为常用的编码器(例如 CLIP 和 SigLIP)是针对图像文本语义对齐而不是几何推理进行训练的。我们设计了一个受控的经验协议,通过测量是否可以从编码器表示中恢复旋转来测试这一说法。特别是,我们使用完整图像分别检查 LLaVA OneVision 和 Qwen2.5-VL-7B-Instruct 模型中的 SigLIP 和 ViT 特征,并使用针对自然背景图像的旋转前景补丁检查 LLaVA 1.5 和 1.6 中的 CLIP 表示。我们的零假设是方向信息不会保留在编码器嵌入中,我们通过训练线性回归器来根据编码特征预测对象方向来测试这一点。与假设相反,我们发现方向信息可以从编码器表示中恢复:简单的​​线性模型可以根据嵌入准确预测对象方向。这与 MLLM 方向故障源自视觉编码器的假设相矛盾。尽管拒绝了 MLLM 由于视觉编码器的限制而难以完成 2D 定向任务的假设,但我们仍然不知道它们失败的原因。尽管完整的解释超出了本文的范围,但我们表明,尽管存在方向信息,但方向信息广泛分布在数万个特征中。当 MLLM 无法利用可用的方向信息时,这可能会也可能不会。