论文
AlloEgo-VLM:消除视觉语言模型中的异中心和自我中心参考系的歧义
AlloEgo-VLM: Disambiguating Allocentric and Egocentric Reference Frames in Vision-Language Models
摘要
本研究调查了视觉语言模型(VLM)在理解空间语义时所面临的歧义挑战。空间认知由认知心理学、空间科学和文化背景塑造,通常为物体赋予方向性。然而,空间关系的自然语言描述经常省略明确的参考框架,导致语义模糊,并给实体人工智能机器人带来潜在的严重错误。现有的 VLM 由于对参考系和物体方向的训练不足,常常会产生不一致的响应。为了解决这个问题,我们构建了一个新的数据集 AlloEgo-View,其中包含(图像、查询、特定于视图的答案)三元组,它们从非中心和自我中心的角度捕获关键对象关系。视图特定的描述遵循结构化的空间表示,该表示注释详细的场景描述、参考和目标对象、它们的方向、参考系和视图类型。在 AlloEgo-View 的基础上,我们开发了 AlloEgo-VLM,这是一个框架,即使在不明确的查询下也能消除异中心和自我中心参考系的歧义,并通过受监督的 微调 轻松集成到现有的 VLM 中。此外,我们将我们的框架部署到 NVIDIA Isaac Sim 内的具体机器人平台上,以验证其在开放式对象搜索任务中的现实可行性。实验凸显了当前 VLM 在处理特定于视图的查询方面的局限性,并证明了 AlloEgo-VLM 强大的消歧能力。