论文

用于基础视觉语言推理的指令证据对比双流解码

Instruction-Evidence Contrastive Dual-Stream Decoding for Grounded Vision-Language Reasoning

模型推理解码与生成控制

摘要

视觉语言模型(VLM)在指令遵循和开放式视觉语言推理方面表现出强大的性能,但它们经常生成缺乏视觉证据的流畅输出。先前的研究表明,指令提示会放大语言先验,从而进一步恶化这个问题,特别是当视觉信号不确定或不明确时。为了应对这一挑战,我们提出了一个解码框架,在生成过程中明确平衡语言信息量和视觉 忠实性。我们的方法,指令证据对比双流解码(IECD$^2$),在每个解码步骤中维护两个并行的词元概率分布:一个促进表达和信息响应的指令驱动流,以及一个要求严格依据图像证据的证据驱动流。这两个流使用基于 KL 的对称对比门进行自适应融合,该门抑制语言先验青睐但不受视觉证据支持的标记,同时在两个分布一致时保留它们。我们在涵盖各种生成视觉语言推理任务的多个数据集上评估 IECD$^2$,例如在 POPE、MME、VQAv2、AMBER 和 MSCOCO 等多个数据集上的字幕和视觉问答。 IECD$^2$ 展示了任务准确性和推理性能的持续改进,与最先进的解码方法相比,幻觉显着减少。