论文
通过自我场景增强增强多模态 大语言模型 中的自我中心空间感知
Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation
摘要
第一人称的视觉问答(VQA)作为使多模态 大语言模型(MLLM)与现实世界交互的一项重要任务而引起了广泛的关注。然而,由于空间感知能力有限,现有的 MLLM 很难在复杂的第一人称的场景中执行有效的空间推理。为此,我们引入了自我场景增强(ESA),这是一种第一人称的空间感知框架,它在所提出的自我元素图的支持下,从自我中心的角度积极增强空间感知能力。我们的核心见解是利用自我元素图作为中介表示,通过视觉基础模型增强 MLLM 的自我中心空间感知。具体来说,我们1)构建自我元素图,它封装并集成了由视觉基础模型支持的第一人称的空间特征; 2)通过自我视角场景的自我元素图增强MLLM的空间感知能力。我们提出的 ESA 框架在 EgoTextVQA 基准测试上呈现出显着的性能改进。我们在室内设置上实现了 8.14% 的增益,在室外设置上实现了 8.72% 的增益。此外,我们的 ESA 在室内环境的购物子集中显示出最令人印象深刻的性能改进。项目代码是公开的。