论文

倾听让 VLM 的视野更加清晰

Listening makes Vision Clear for VLMs

模型评测评测方法与指标

摘要

最近的工作通常使用答案端标记的注意力分布来评估视觉-语言一致性。然而,我们观察到注意力最高区域并不总是与预期的语义标记一致。这可能源于解码漂移,即先前生成的答案标记的语言先验累积并与视觉注意力不匹配。除了先前答案标记的先验之外,我们发现结构标记(例如模态边界标记)可能涵盖整个上下文并对与目标无关的区域产生高度关注。为了避免这些扭曲并为大型 VLM 提供一致性评估,我们采用提示端语义并提出 Prompt-Vision 词元激活映射(PV-TAM)。 PV-TAM 进一步结合了一个过滤器来消除由模态边界标记引起的系统偏差。与仅通过掩模评估重叠而忽略激活强度的传统方法不同,我们的指标利用注意力的峰值分布来测量提示和视觉区域之间的对齐情况。在实验中,PV-TAM 在各种数据集的答案端基线上不断改进基于注意力和 IoU 式的定位指标。