论文

边绘图边思考:用于增量 3D 场景图的异步视觉语言代理

Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs

应用与实践视觉感知与空间理解

摘要

开放词汇 3D 场景图方法通常分两个阶段运行:首先重建,然后用视觉语言模型丰富,使图在探索过程中不可查询。我们认为这种顺序耦合是不必要的,并提出了一种异步架构,其中轻量级在线映射与重量级语义细化同时运行。基于概率体素的骨干网逐步维持稳定的对象身份,而背景 VLM 代理则逐步丰富图形。该框架通过语义闭环解决重复的对象轨迹,附加细粒度的视觉属性并导出对象之间的空间关系。多目标帧调度器通过选择一小组共同覆盖多个目标的信息帧来摊销 VLM 成本。生成的场景图在探索过程中是可查询的,并且语义随着时间的推移而丰富。我们的方法在语义分割方面匹配或优于现有的开放词汇 3D 场景图方法(ScanNet、Replica),并在三个视觉定位基准(Sr3D+、Nr3D、ScanRefer)上超越现有技术水平 15.3 至 18.8 A@0.25。项目页面:https://denizbickici.github.io/thinkgraphs/