论文

重新审视双编码器视觉语言模型中的组合性:推理的作用

Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference

模型评测模型行为与机制分析

摘要

双编码器视觉语言模型(VLM)(例如 CLIP)由于在组合基准上表现不佳,通常被描述为词袋系统。我们认为,这种限制可能更多地源于基于全局余弦相似性的标准推理协议,而不是表示的缺陷。首先,通过受控的诊断实验,我们表明,在推理时明确执行细粒度的区域片段对齐可以显着提高组合性能,而无需更新预训练的编码器。然后,我们引入一个轻量级的 Transformer,它直接从冻结补丁和词元嵌入中学习此类对齐。与完整的 微调 和之前的端到端组合训练方法相比,我们发现虽然这些方法改进了域内检索,但它们的增益在分布转移下并不能一致地转移。相比之下,学习冻结表示上的局部对齐与域内检索上的完整 微调 相匹配,同时在受控域外组合基准上产生实质性改进。这些结果表明全局嵌入匹配是双编码器 VLM 的关键瓶颈,并强调了对齐机制对于鲁棒组合泛化的重要性。