论文
基于 VLM 的目标搜索中的空间语义不确定性:平衡探索和识别
Spatial-Semantic Uncertainty in VLM-Based Target Search: Balancing Exploration and Identification
摘要
从自然语言描述中搜索目标的机器人不仅必须确定搜索位置,还必须确定哪个观察到的候选者是所需的目标。这些决策反映了两个不同的不确定性来源——候选位置的空间不确定性和目标身份的语义不确定性——这在基于 VLM 的搜索系统中经常被混为一谈。我们引入了一种空间语义不确定性公式,该公式对每个组件保持单独的信念,并将概率 VLM 证据集成到全局目标身份后验中,包括未发现目标的概率质量。这种分解允许信息论规划者通过空间和语义预期信息增益(EIG)独立地评估候选发现和目标消歧,从而提供了一种明确的机制,用于交换更广泛的探索和早期识别。我们评估了 500 个合成目标上的 6 个 VLM 不确定性引发接口,结果表明相似的识别精度可以掩盖校准和错误置信度方面的实质性差异。在降级观察搜索和识别实验中,基于 EIG 的规划器在 75.0%-92.5% 的试验中做出了有信心的决策,而随机搜索的这一比例为 20.0%,而一旦获得置信度,不同的空间语义权重就可以实现相当的识别精度。增加语义重点可以减少不必要的探索和 VLM 查询,这表明对语义不确定性进行显式规划可以加速目标解析,而不会牺牲决策质量。这些结果强调了不确定性表示和不确定性驱动规划在具体 VLM 系统中的独特作用。