论文
原子视觉蕴涵:通过原子事实分解和学习选择增强零样本视觉语言推理
Atomic Visual Entailment: Enhancing Zero-Shot Vision-Language Reasoning through Atomic Fact Decomposition and Learned Selection
摘要
视觉蕴含(VE)询问图像是否支持、矛盾或未确定文本假设。 微调大型视觉语言模型在标记数据上取得了强劲的结果,而零样本和混合方法仍然远远落后。 VE 假设经常捆绑多个视觉主张,但现有的零样本方法将其作为一个单元进行推理。我们提出了原子视觉蕴涵(AVE),它将假设分解为原子事实,使用冻结的视觉语言模型根据完整的假设及其事实生成候选预测,并使用仅根据这些候选行为进行训练的轻量级分类器来预测最终标签。我们发现,只有在保留假设背景的情况下,分解才有用:孤立地判断事实比根本不分解更糟糕。完整假设和原子预测会产生互补错误,而学习信任哪个可以比多数投票恢复更多的互补性,在没有微调任何视觉语言模型的 SNLI-VE 上达到 0.803 的测试精度。 AVE 还可以在没有区域级监督的情况下本地化其预测背后的视觉证据。这些结果表明,学习信任哪个候选预测可以缩小与微调系统的很大差距,提供一种实用的替代方案,其中微调视觉语言模型直接需要比可用的更多标记数据或计算。
