论文
PinPoint:用信息丰富的内部点进行提示
PinPoint: Prompting with Informative Interior Points
摘要
现代参考图像分割管道将视觉语言模型 (VLM) 与快速分割器结合起来,例如用于生成掩模的分段任意模型 (SAM)。此配方的先前 无需训练 实例始终落后于经过微调和强化学习 (RL) 调整的专家,并且尚不清楚差距是否来自 VLM 的定位、SAM 的能力或提示。我们表明,间隙主要是由提示模糊性决定的:VLM 提出的边界框 (bbox) 让 SAM 猜测 bbox 内的哪些像素属于表达式所表示的对象。内点是自然的消歧器,但它们落在哪里很重要。之前的工作依赖于天真的采样点,这些采样点落在边界、干扰因素和背景杂乱上,与单独的 bbox 相比,甚至会损害性能。监督和强化学习调整方法通过训练 VLM 来预测更好的点来缩小这一差距;我们表明这种训练是不必要的。在五个内部点的匹配预算下,用稳定、信息丰富的点选择替换朴素采样,可以将 RefCOCO/+/g 上的累积交集 (cIoU) 提高 12-18 个点,并且每个模型都是固定的。我们将这一观察结果转化为 PinPoint,这是一个确定性的 无需训练 点选择器,它将四个视觉线索融合成共识图,选择远离边界的紧凑的、空间多样化的点,并使用冻结的 VLM 来标记每个点。无需任何特定于任务的训练,PinPoint 在同一堆栈上匹配受监督和 RL 调整的专家,同时每个查询仅发出两次 VLM 调用。