论文
LVLM 中的自改进小物体定位
Self-Improving Small Object Grounding in LVLMs
摘要
大视觉语言模型 (LVLM) 中的内部注意力模式能否在没有 微调 的情况下识别可靠的小物体框?在这项工作中,我们给出了肯定的答案。 LVLM 中的注意力结构编码了定位质量——仅在注意力图上训练的轻量级 IoU 回归器实现了强大的 IoU 预测 (Pearson r > 0.67)。该回归器为基于注意力的候选选择 (ACS) 框架的基于回归器的变体(称为 ACS-Learned)提供支持,该框架从多个采样候选者中选择最佳框以改善对象定位。通过分析回归器学到的内容,我们揭示了哪些 Transformer 层和头是最关键的,并推导出 ACS-Free:一个 无需训练 选择器,通过这些判别头上的注意力熵对候选者进行排名,推理时没有学习组件。 COCO 和 Objects365 上的实验表明,小对象定位的自我改进高达 19%,其中 ACS-Free 在所有 无需训练 方法中排名最高,表明有用的注意力结构提高了 LVLM 中的定位可靠性和可解释性。