论文
PatchGate:通过冻结视觉语言模型中的内在对象清单缩小语言化差距
PatchGate: Narrowing the Verbalization Gap with Intrinsic Object Inventories in Frozen Vision-Language Models
摘要
视觉语言模型 (VLM) 中可靠的图像字幕要求字幕准确且完整,避免在覆盖可见对象的同时提及不受支持的对象。现有的 无需训练 方法主要解决前一个要求,通过在生成过程中干预模型预测的提及来抑制不支持的对象词。由于它们仅对模型已经可能提及的对象进行操作,因此输出中遗漏的可见对象仍然难以恢复。我们提出了 PatchGate,一个 无需训练 框架,它在生成之前提取冻结 VLM 固有的无提示对象证据,并使用它来缩小内在对象集和最终对象提及之间的差距。在第一阶段,视觉证据提取(VEX)从LM解码器层的后半部分读取补丁级词汇证据,并在没有任何任务提示的情况下构建图像条件对象集。在第二阶段,视觉证据包含-排除解码(VIED)使用该对象证据来校准解码logits,促进证据支持但语言化不足的对象并抑制弱支持但过度语言化的对象。在 AMBER 上,PatchGate 提高了物体级可靠性的两方面,将可见物体覆盖范围从 49.4 提高到 56.0 (+13.4%),并通过将 CHAIR 从 7.5 降低到 6.6 (-12.0%) 来减少物体幻觉,无需外部探测器或 微调,并需要一次额外的前向传递。