论文
CS-CLIP:用于稳健组合推理的组合场景图引导 CLIP
CS-CLIP: Compositional Scene Graph-guided CLIP for Robust Compositional Reasoning
摘要
视觉语言模型 (VLM) 在组合推理基准中表现出强大的性能,这需要对对象、属性、关系及其交互的语义扰动进行推理。然而,我们的受控分析表明,现有的组合性感知 VLM 表现出特定于元素的偏差,通常在某些组合元素上表现不佳。为了解决这个问题,我们提出了合成场景图引导 CLIP (CS-CLIP),它使用场景图来识别合成元素并通过选择性掩蔽构建结构化底片。我们进一步保留与原始标题最矛盾的负片,迫使模型依赖于成分结构而不是表面线索。 CS-CLIP 通过跨组合元素的强大性能实现了最先进的组合推理。它还保留了一般的视觉语言功能,例如跨模式检索和下游视觉推理,同时比以前的方法需要更少的训练样本。