论文
3D 场景图中语义不确定性的分层聚合
Hierarchical Aggregation of Semantic Uncertainty in 3D Scene Graphs
摘要
开放词汇 3D 场景图 (3DSG) 将每个对象节点置于视觉语言嵌入中,但它们将每个条目记录为同样确定,因此查询地图的机器人无法判断哪些条目不可靠。语义不确定性的估计器可以提供这种区别,但它们需要对模型、训练或保留标签进行重复采样,而这些在查询时都不适用于已部署的系统。我们提出了一个框架,该框架利用检测器置信度和 3DSG 已存储的嵌入,将它们转换为条目正确的概率,并通过包含层次结构将该概率传播为房间包含查询类的信念。四个信号,每个信号与其指示的对象级误差配对,被转换为由视觉语言模型学习的 Logit 尺度的概率,并以封闭形式组合,无需额外的感知或训练。共享检测器和词汇表的对象一起失败,因此框架将它们聚合在完全相关的限制中,其中独立下的聚合会将一个重复的错误视为重复的证据。该框架在 HM3DSem 上针对最先进的 3DSG 系统进行了评估,改进了对象检索并降低了其读取的图形的房间级断言的错误。