论文

CitySTAR:面向城市开放词汇三维定位的结构与拓扑推理

CitySTAR: Structured and Topology-Aware Reasoning for Open-Vocabulary Urban 3D Grounding

上下文与知识知识图谱

摘要

3D 定位旨在从自然语言中定位复杂场景中的目标实体,并在具身感知和空间推理中发挥基础作用。然而,现有的方法大多依赖于特征相似性或直接匹配,使得很难将自然语言意图与隐藏在数十亿规模的城市点云中的隐式语义和几何结构联系起来。我们将城市规模的 3D 基础重新表述为结构化约束推理,其中描述语义被组织成开放词汇 3D 实体、属性和空间关系上的可计算跨模态约束。我们推出了 CitySTAR,这是一个用于推理驱动的城市 3D 基础的免训练框架。 CitySTAR 将原始的数十亿级城市点云提升为开放词汇 3D 实例的可查询场景图,并使用 CodeLLM 驱动的工具为节点属性和 3D 空间关系提供多模态证据。然后,它使用成对的超图对目标上下文拓扑进行建模,并执行双向拓扑验证以消除结构歧义。最后,反射式跨模态定位模块集成了拓扑一致性和以候选者为中心的 2D 视觉证据,以根据度量感知的 3D 上下文图做出决策。为了进一步支持此设置,我们引入了 CitySTAR-3D,这是一种增强的基准测试,可提高城市规模 3D 基础中的语义覆盖范围、实例完整性、边界框保真度和空间关系复杂性。大量实验表明,CitySTAR 持续改进开放世界城市 3D 基础,同时保持强大的可解释性和泛化性。