论文
GeoPID:分解并增强 VLM 的视觉信息
GeoPID: Decomposing and Steering Visual Information in Vision-Language Models
摘要
虽然最近的视觉语言模型(VLM)在不同的应用程序中表现出了出色的性能,但它们往往未充分利用视觉信息并过度依赖文本上下文。在这项工作中,我们提出了 \textsc{GeoPID},一个 无需训练框架,它从几何角度分析 VLM 内的多模态信息。 \textsc{GeoPID} 通过视觉和文本表示子空间之间的几何关系将信息分解为冗余、唯一模态和协同组件。通过对 22 个 VLM 和 14 个基准的广泛分析,我们确认,当问题强烈需要视觉基础时,正确的预测会表现出更强的视觉独特成分。在此几何分析的基础上,我们引入了一种有针对性的干预技术,该技术可以在推理过程中选择性地沿着视觉独特的子空间放大视觉表示。因此,视觉接地能力得到了增强,而无需任何额外的模型参数更新,实现了 7.63% 的平均相对准确度增益。
