先看再回答:无需训练 视觉语言模型的视觉层分析
Seeing Before Answering: Training-Free Visual Layer Profiling for Vision-Language Models
摘要
LLaVA 式视觉语言模型 (VLM) 将视觉标记从视觉主干的固定后层(通常是倒数第二层)传递到语言模型。我们首先证明这种隐藏约定是脆弱的:在 2 个 VLM 和 7 个图像和视频基准测试中,默认层在 14 个模型任务对中的 13 个中不是最优的,并且最佳层随任务和视觉主干发生变化。通过详尽的逐层推理找到该层的成本极其昂贵,并且不存在更好的固定默认值。因此,我们询问是否可以从表示几何中预测图层的有用性。我们研究基于矩阵的熵,引入单峰层分析,我们将样本级视觉嵌入计算为视觉数据集熵(VDE);和 Gromov-Wasserstein (GW) 距离,引入用于编码器级 VLM 模型选择,我们将其重新用作分层视觉语言对齐信号。将这些转移到基于 LLaVA 的模型并不是显而易见的先验:在训练多模态投影仪时视觉塔被冻结,因此我们对投影仪的两侧进行轮廓分析。我们发现VDE传输,而GW没有。预投影仪 VDE 根据 100 个未标记的任务样本进行计算,无需下游推理,可跟踪分层准确性,其排名靠前的层覆盖基于 SigLIP 的 LLaVA-Video 的每个任务的最佳层,同时为基于 CLIP 的 Video-LLaVA 提供区域级指导。投影仪后配置文件显示投影仪重塑了视觉几何形状,但并未消除与性能相关的趋势,从而使 $\mathrm{VDE}_{\mathrm{pre}}$ 信号更强。相反,GW 在投影后会变平,最好将其解读为对齐诊断而不是选择器。因此,VDE 提供了可解释的 无需训练 策略,将视觉层搜索范围缩小到少数候选者,以进行有限的下游验证。