论文
依赖于查询使用生成的描述来实现可靠的视觉问答
Query-Dependent Use of Generated Descriptions for Reliable Visual Question Answering
摘要
视觉语言模型 (VLM) 会产生不存在的物体的幻觉,越来越多的工作试图通过向模型提供自己生成的标题作为辅助证据来遏制这种情况——假设标题一旦可用,就可以使用。我们证明这是失败的:天真地附加标题会降低准确性而不是提高准确性,使 HallusionBench 上的 Qwen2.5-VL-3B† 下降了近十个点。为了理解原因,我们构建了 GD-Probe,这是一个诊断集,将同一图像上的全局问题和细节问题配对,以便字幕效果的任何差异都可单独归因于问题。标题效用被证明是每个查询的属性:相同的标题通过单一机制帮助全局问题并损害细节问题——嵌入的标题与图像竞争注意力并将模型的证据拉到自己的文本上——其符号由标题是否覆盖查询的内容来设置。至关重要的是,这种机制可以从解码器已经发出的数量中读取,无需访问注意力或执行视觉定位。我们将其转化为 GEASS(门控证据自适应选择性字幕信任),这是一个 无需训练、logits 级模块,用于决定每个查询信任多少字幕,通过干净路径的置信度对其进行门控,通过其引起的熵减少对其进行加权,并在两条路径不一致时提高证据栏。在四个 VLM 和两个基准测试(POPE 和 HallusionBench)中,GEASS 在单一固定设置下改进了普通推理和对比解码,仅添加了两个前向传递且不添加任何参数。