论文
HKVLM:忠实查询——冻结探测器视觉定位的区域绑定
HKVLM: Faithful Query--Region Binding for Frozen-Detector Visual Grounding
摘要
即使目标对象存在于提案池中,视觉定位通常也会失败,因为语言侧所指对象绑定到了错误的区域。我们研究了冻结感知下的这种绑定失败,并询问显式查询区域对齐钩子与基于感知的弃权机制是否可以改善忠实定位,而无需重新训练检测器或视觉语言骨干。 HKVLM 冻结了用于本地化的语言对齐开放词汇检测器,并学习了一个轻量级钩子,该钩子将参考查询嵌入映射到共享空间中的检测器建议;当没有区域充分支持查询时,验证者将弃权。我们证明了精确的提案级诊断分解 $(1-\mathrm{SeeErr})(1-\mathrm{SayErr})$,将提案覆盖失败与条件绑定失败分开,以及表征 忠实性(由弃权引起的召回权衡)的单调性结果。在 RefCOCO、RefCOCO+、RefCOCOg 和 POPE 中,HKVLM 改进了未经训练和训练的匹配感知绑定控制,并通过弃权大大减少了幻觉。强大的坐标解码和端到端微调基线在原始定位精度方面仍然要高得多,并且推理压力集将绑定暴露为当前的主要瓶颈。因此,我们将 HKVLM 作为冻结感知下查询区域绑定的诊断和机制级研究,而不是绝对的本地化领导者。