论文
超越所见:揭示多模态大语言模型的情境错觉
Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models
摘要
现实世界的情境外观可能偏离其底层物理状态,这挑战了多模态大语言模型(MLLM)在实际应用中的可靠性。在本文中,我们将这一现象命名为情境错觉(situational illusions),并研究:(1)MLLM在这种错觉下的表现如何,(2)如何缓解这些局限。我们首先开发了一个全面的where-what-how分类体系,刻画情境错觉发生在哪里、指向什么目标以及如何产生。在该分类体系基础上,我们提出MSIBench,一个评估MLLM在情境错觉下辨别、理解和推理能力的基准。对27个模型配置的评估显示,当前MLLM极易受这些错觉影响,并表现出与视觉观察、接地和推理相关的6种典型失败模式。为缓解这些局限,我们基于系统地检查和推理视觉证据以实现情境理解这一核心思想,分别为闭源模型开发提示方法、为开源模型开发监督微调。这两种简单而有效的方法最多可将模型性能提高20%,为在复杂现实环境中实现更可靠的多模态感知与推理提供了实用路径。
