论文
相似性不是逻辑:双编码器视觉语言模型的分解推理
Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models
摘要
双编码器视觉语言模型 (VLM) 公开了一个相似性接口,可以实现零样本检索,但无法满足组合约束:像“雨伞和无人”这样的查询会检索包含两者的图像,即使概念检测是可靠的。我们将其追溯到界面级概念袋效应,其中相似性得分近似于概念证据的平均池化,而与操作员无关。尽管文本嵌入中存在依赖于运算符的信号,但它们太弱或未对齐,无法影响排名。 微调 无法可靠地解决此故障,因为主要瓶颈是相似性如何聚合证据,而不是编码器代表什么。我们提出因子推理,将证据提取与约束执行分开,并引入 LCSE(逻辑约束分数编辑),这是一种 无需训练 方法,它使用来自冻结编码器的概念分数在外部执行约束。我们还引入了 FACTOR-Bench,其中 LCSE 的准确度为 85.5%,而最佳微调基线为 73.2%,应用于 SigLIP 2 时为 90.7%,并将 NegBench COCO MCQ 准确度从 27.2% 提高到 65.2%,同时保持检索性能。