论文

DM-KG:一种增强街景图像中视觉语言模型空间认知的新方法

DM-KG: A Novel Method for Boosting Spatial Cognition of Vision-Language Models in Street View Imagery

上下文与知识知识图谱

摘要

随着视觉语言模型(VLM)越来越多地应用于地理空间问答和视觉场景理解中,提高其对街景图像的空间认知能力以进行复杂的逻辑推理已成为一个关键的研究重点。然而,现有的 VLM 在感知现实街景场景中的物体位置、距离和方向时经常会出现“空间语义幻觉”。此外,此类错误通常难以追踪和校准,成为其在地理空间任务中实际部署的关键瓶颈。为了应对这一紧迫的挑战,本研究提出了 DM-KG(方向度量知识图),这是一种基于结构的街景图像空间表示框架。通过从单个 2D 图像中显式提取实体之间的方向和度量关系,该框架通过结构化知识图提高了 VLM 的空间推理准确性。具体来说,我们将全景分割与度量深度估计相结合,以稳健地计算实体级 3D 空间坐标。随后,我们将实体对的时钟方位角和欧几里得距离编码为 JSON 格式的知识图,将其作为显式几何先验注入到 VLM 中以指导空间推理。公共空间问答(QA)基准的实验结果表明,DM-KG 将距离估计的平均绝对误差(MAE)降低了 31.1%,将方向判断的平均角度误差降低了 65.8%,同时保持了较高的 QA 成功率。通过建立完整的增强推理管道,该研究显着提高了VLM在街景场景中的空间认知能力,从而为开放环境中的地理视觉问答(GeoVQA)提供了灵活的、通用的、可解释的框架。