论文
不要只是看,还要干预:VQA 图像的基于扰动的区域标记
Don't Just Look, Intervene: Perturbation Based Region Labeling for VQA Images
摘要
视觉语言模型 (VLM) 应依赖于直接确定正确答案的视觉证据,但手动获取或与数据集特定的注释原语绑定的基础视觉推理的监督通常成本高昂。相反,我们引入模型因果视觉证据作为注释目标,定义为一组图像区域,其反事实干预改变了给定图像-问题对的模型答案分布。基于这一原则,我们引入了定位区域的反事实搜索(CSGR)。 CSGR 是一个可扩展的管道,它提出候选区域,扰乱它们,测量它们对答案敏感性的影响,并在多个评判模型之间聚合这些证据以近似 VQA 数据中的答案关键区域。为了评估 CSGR 注释是否包含有用的监督信号,我们将它们插入三个现有的视觉定位感知训练例程:注意力引导、视觉协同微调和潜在视觉推理。这些实验测试所提出的注释方案是否可以在多种使用区域标签的方式中提供有用的监督信号,而不是引入使用它们的新方式。在竞争的自动区域标记机制中,CSGR 注释在域内和域外评估中提供了比仅交叉熵微调更一致的增益,这表明所提出的标记方案捕获了有用的区域级信息。