论文
Scene-Q:通过选择性 VLM 推理对 3D 场景进行置信感知的粗到精查询
Scene-Q: Confidence-Aware Coarse-to-Fine Querying of 3D Scenes with Selective VLM Reasoning
摘要
室内移动机器人需要开放词汇场景理解,在一致的 3D 地图中进行自然语言查询。许多现有系统最终依赖于对比图像文本编码器的余弦相似性检索,这种方法虽然高效,但当标签接近同义或出现多个相似实例时很脆弱。我们提出了 Scene-Q,一种置信度感知的从粗到精的查询框架,它通过温度缩放标准化编码器分数,并仅针对低置信度情况有选择地调用推理 VLM。高置信度查询通过快速检索得到回答,而模糊查询则使用原始多视图图像和实例边界框在小型 top-K 候选集中重新排名,从而以低成本实现上下文感知消歧。 Scene-Q 改进了 ScanNet200 上的开放词汇 3D 实例分割以及现实世界重建中的自然语言 3D 实例检索,在空间和关系查询方面获得最大收益,同时将大部分查询保持在快速路径上。