论文

熵梯度基础:视觉语言模型中的 无需训练 证据检索

Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models

模型推理推理策略与问题分解

摘要

尽管进展迅速,但当答案依赖于微小的视觉细节或依赖于分布在多个区域的线索(如文档和组合查询)时,预训练的视觉语言模型仍然举步维艰。我们通过将基础框架构建为测试时证据检索来解决这个问题:给定一个查询,模型应该主动识别下一步要寻找的位置以解决歧义。为此,我们提出了一种 无需训练,即使用不确定性作为监督的模型内在基础方法。具体来说,我们计算模型的下一个词元分布的熵,并将其反向传播到视觉词元嵌入,以获得熵梯度相关图,而无需辅助检测器或注意力图启发式。然后,我们提取多个相干区域并对其进行排序以支持多证据查询,并引入具有空间熵停止规则的迭代缩放和重新研磨过程以避免过度细化。对四种 VLM 架构的七个基准进行的实验表明,与现有方法相比,方法得到了一致的改进,在细节关键和高分辨率设置上获得了最大的收益,同时还产生了更多可解释的证据本地化。