论文
多模态空间词汇偏差的机械诊断 大语言模型 空间推理
Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning
摘要
多模态 大语言模型 (MLLM) 在空间多项选择问题上仍然不可靠,它们的失败通常归因于视觉信息关注不足。我们确定了一种互补的失败模式,即空间词汇偏差:添加到答案选项中的空间关系词可以充当词汇语义干扰因素,将模型的决策引向该选项。使用九个开放权重 MLLM,我们表明这种现象很普遍。然后,我们隔离诊断案例,其中模型正确回答二元空间问题,但始终选择新添加的第三空间选项,我们将其称为二元稳定但三元脆弱的情况。在这些案例中利用机械可解释性工具,我们发现失败出现在语言方面而不是视觉方面:视觉注意分析和残余流探针显示正确的空间关系在内部仍然可用,而不相关选项控制、激活修补和稀疏组件干预则将偏差追溯到特定的 LLM 侧通道和神经元。因此,我们表明,对微小的单对象对合成数据进行轻量级的仅 LLM DPO 更新可以减轻偏差,将合成数据的四向鲁棒精度提高多达 100 点,并将更广泛的评估数据集 WhatsUp、SpatialMQA-Direct 和 VSR 提高 68.0、32.6 和 20.1 点。