论文

探测器置信度表明杂乱操作中存在而不是遮挡

Detector Confidence Signals Presence Rather Than Occlusion in Cluttered Manipulation

模型评测模型行为与机制分析

摘要

遮挡一个命名对象,直到其大约八分之一仍然可见,并且开放词汇检测器对该对象存在的置信度几乎没有变化;随着周围杂乱的增加,信心甚至会上升。在真实视频中,检测器仍然报告同一类别的另一个实例中 99% 的被遮挡帧中存在的对象。这很重要,因为这种置信度被广泛解读为可见性信号,用于阈值检测、评估开放词汇检测器、将语言指代定位到视觉对象、检索实例和门控主动感知。我们通过将每个视图与几何分割预言机配对来审核它是否反映了遮挡,该几何分段预言机提供了无需检测器的 真值 可见性。随着真实可见度从每个场景下降到八分之一,置信度几乎保持不变,并且与可见度无关,并且检测器报告目标存在于十个场景中的大约九个中,并触发相同类别的干扰物:它表明该类别存在于某处,而不是特定目标可见。该故障涉及三个探测器(Grounding DINO、OWLv2 和 Segment Anything Model 3)、九个对象类别、两个具有不同渲染器和对象集的模拟器、内置遮挡和自然遮挡以及真实视频。两个后果如下:基于置信度的指标低估了解决遮挡的价值大约十倍(在我们的主动感知设置中为 8 点,而在我们的主动感知设置中为 88 点),并且基于置信度的门在对象被隐藏时准确触发。我们尝试过的单视图信号(包括可实现的定位检查)都没有标记遮挡,因为遮挡物位于目标所在的位置。我们将影响与探测器校准错误和物体幻觉联系起来,发布受控基准,并推荐基于目标视觉定位的信号进行选通和评估。