论文

开放词汇检测中的置信度分数是量表和语义的有偏差的混合体

Confidence Scores in Open-Vocabulary Detection Are a Biased Mixture of Scale and Semantics

模型评测模型行为与机制分析

摘要

CLIP 等基础模型已经启用了开放词汇对象检测器,可以通过视觉语言相似性泛化到新类别。然而,这些检测器产生的置信度分数并不是可靠的定位概率估计:它们将视觉尺度和语义查询特异性与真实的检测信号混为一谈。通过在三个基于基础模型的检测器(GroundingDINO、OWL-ViT、YOLO-World)上对 COCO 进行受控实验,使用 GroundingDINO 在 LVIS(1,203 个类别)上进一步复制尺度偏差发现,我们表明 s=cos(v,t) 是两种效应的偏差混合。尺度偏差(alpha = +0.064,r = 0.579,p = 1.29 x 10^-58)系统性地夸大大型对象的分数。语义偏差(beta = -0.705,p = 5.23 x 10^-41)抑制通用查询的分数。这两种偏差在结构上都是 CLIP 图像级预训练不可避免的。阈值调整无法消除它们:oracle 按尺度阈值处理对于小对象产生 Delta F1 = +0.001,而对于大对象则产生 Delta F1 = +0.102。无参数温度缩放校正将小目标 Recall@10 提高了 19.6% (p < 0.01),无需重新训练。这是以适度的、可测量的池排名精度成本为代价的,因此偏差在推理时是部分可逆的,而不是自由可逆的。这些发现揭示了将图像级基础模型应用于区域级检测任务的根本局限性。