论文

GIST:基于智能语义拓扑的多模态知识提取与空间定位

GIST: Multimodal Knowledge Extraction and Spatial Grounding via Intelligent Semantic Topology

摘要

在零售店、仓库和医院等复杂、密集的环境中导航,对人类与具身AI都是重大的空间接地(spatial grounding)挑战。在这些空间中,由于物品的准静态特性,密集的视觉特征很快就会过时,长尾语义分布也挑战着传统计算机视觉。尽管视觉-语言模型(VLM)能帮助辅助系统在语义丰富的空间中导航,它们在杂乱环境中的空间接地仍然吃力。我们提出 GIST(Grounded Intelligent Semantic Topology),一个将消费级移动设备点云转换为语义标注导航拓扑的多模态知识提取流水线。该架构将场景提炼为 2D 占据地图,提取其拓扑布局,并通过智能关键帧与语义选择叠加一个轻量语义层。我们通过关键的人机交互下游任务展示这种结构化空间知识的多样性:(1)意图驱动的 Semantic Search 引擎,在精确匹配失败时主动推断类别替代品与区域;(2)单样本 Semantic Localizer,实现 1.04 米的 top-5 平均平移误差;(3)Zone Classification 模块,将可行走的平面图分割为高层语义区域;(4)Visually-Grounded Instruction Generator,将最优路径合成为以自我为中心、富含地标的自然语言路线。在多标准 LLM 评估中,GIST 优于基于序列的指令生成基线。最后,一项现场形成性评估(N=5)取得了仅依靠口头提示 80% 的导航成功率,验证了系统的通用设计能力。

GIST:基于智能语义拓扑的多模态知识提取与空间接地:论文配图
图 1. GIST 多模态知识提取架构。原始多模态输入(RGB-D 和移动里程计)通过智能关键帧选择、代表性对象选择和 VLM 标记提炼为结构化空间知识。这种共享表示可实现强大的下游人机交互和自主系统任务,包括意图感知语义搜索、全局姿态定位和空间基础自然语言路由。框图显示了通过对象提取和视觉语言模型处理的移动 RGB-D 数据,以创建语义拓扑图,随后为意图感知搜索、语义定位和自然语言路由提供支持。