论文
视觉语言基础的提示敏感性:措辞的微小变化如何影响物体检测
Prompt Sensitivity in Vision-Language Grounding: How Small Changes in Wording Affect Object Detection
摘要
视觉语言模型在语义等效描述产生一致输出的隐含假设下,通过自然语言查询实现开放词汇对象基础。我们使用受控管道来检验这一假设,该管道将用于对象提议的 DETR 与用于对 263 个 COCO val2017 图像进行语言条件选择的 CLIP 相结合。我们发现,诸如“一个人”、“一个人类”和“一个行人”等重叠提示经常选择不同的实例,六个提示中的平均不稳定性为 2.11 个不同的选择。主成分分析 (PCA) 分析表明,这种变异性是结构化的、有方向性的,而不是随机的。即时集成不会提高质量,并且常常会将选择转向通用区域。我们进一步表明,文本嵌入邻近性仅解释了 34% 的基础不一致 (r = -0.58),证实了不稳定是由 argmax 选择机制引起的,而不仅仅是文本级距离。