论文

定位精度在IoU曲线上的分布:无需标签的推理阶段边界细化

Where Grounding Accuracy Lives on the IoU Curve: Label-Free Inference-Time Boundary Refinement

模型推理推理验证与自校正

摘要

视觉语言模型可以识别正确的指示对象,同时返回不精确的边界框。我们研究冻结的直接答案模型是否可以使用自己的预测来分配一个额外的局部观察,而无需在推理时访问目标注释。无标签精度细化(LFPR)将预测的小区域路由到更高分辨率的通道,重新定位上下文裁剪内的表达式,仅在固定的几何防护下接纳候选者,并返回固定的坐标中点。我们报告三个证据层的结果。在 31,921 个回顾性 Ref-L4 表达式上,LFPR 将 mAcc$_{0.5:0.95}$ 从 72.947\% 提高到 76.013\%(Acc@0.5 88.531\%$\to$89.725\%,Acc@0.9 55.788\%$\to$61.142\%)。冻结传输到 30,969 个 RefCOCO/RefCOCO+/RefCOCOg 表达式改善了 Acc@0.5、mAcc 和平均 IoU 处的每个数据集(合并 mAcc $+0.645$、Acc@0.5 $+0.817$),而 Acc@0.9 总体没有变化:单独的路由在那里获得 $+1.162$ 点,但裁剪、防护和融合返回 $-1.192$,抵消而不是不显示严格的 IoU 效应。前瞻性、图像不相交的 Flickr30K 实体评估改善了每个端点(mAcc $+0.973$、Acc@0.9 $+1.022$),在单框变体(mAcc $+2.575$、Acc@0.9 $+3.689$)下效果更佳。应用于两个已发布的视觉定位专家的同一算子以大约两倍的延迟改善了每个端点(EGM-4B/8B 的 Acc@0.9 $+1.569$/$+6.716$),与专家训练相结合而不是替换它。真正的无保护控制(从相同候选人中删除保护)在每个指标上都低于现有控制,表明保护是承重的。总之,这些结果表明,参照物选择和边界精度是部分可分离的,不同的组件移动 IoU 曲线的相反区域——单个阈值无法揭示的行为。