论文

GeoPID:分解并增强 VLM 的视觉信息

GeoPID: Decomposing and Steering Visual Information in Vision-Language Models

模型评测模型行为与机制分析

摘要

虽然最近的视觉语言模型(VLM)在不同的应用程序中表现出了出色的性能,但它们往往未充分利用视觉信息并过度依赖文本上下文。在这项工作中,我们提出了 \textsc{GeoPID},一个 无需训练框架,它从几何角度分析 VLM 内的多模态信息。 \textsc{GeoPID} 通过视觉和文本表示子空间之间的几何关系将信息分解为冗余、唯一模态和协同组件。通过对 22 个 VLM 和 14 个基准的广泛分析,我们确认,当问题强烈需要视觉基础时,正确的预测会表现出更强的视觉独特成分。在此几何分析的基础上,我们引入了一种有针对性的干预技术,该技术可以在推理过程中选择性地沿着视觉独特的子空间放大视觉表示。因此,视觉接地能力得到了增强,而无需任何额外的模型参数更新,实现了 7.63% 的平均相对准确度增益。

GeoPID:分解并增强 VLM 的视觉信息:论文原图
图 1:在此图中,我们采用视觉和文本输入并将它们投影到各自的表示空间 (a-b) 中,其中向量表示可以从每种输入模态中提取的特征。 (c):融合的表示空间揭示了几何关系和对比模态特定的内容:文本独特的特征(橙色)赞扬房间的整洁,而视觉独特的特征(蓝色)描绘了混乱。绿色方向表示评估协同作用的互补几何形状。 (d):我们的方法沿着视觉独特的子空间选择性地放大,同时保留其正交补集。