论文

透过LENS:视觉语言模型表征的局部几何分解

Through the LENS: Local Geometric Decomposition of Vision-Language Model Representations

模型评测模型行为与机制分析

摘要

视觉-语言模型(VLMs)处理图像块和文本标记在一个共享的残差流中,但两个模态通过其交互的局部几何结构仍不清楚。大多数可解释性方法识别全局的线性方向,这可能遗漏全局高维但局部低维的表示。我们引入LENS(Local Explanation of Neighborhood Subspaces),一种使用混合因子分析器分解VLM激活为局部低秩高斯邻域的方法。应用于LLaVA-1.5-7B和Qwen3-VL-8B,LENS揭示了与每个模型融合机制一致的深度依赖融合轨迹:LLaVA在后期层逐步混合模态,而Qwen3-VL在早期层混合它们,部分重新分组它们,并在输出附近重新组合它们。自动多模态标注管道为这些邻域分配了简洁的语义描述。将激活向邻域中心点平滑化导致在模态之间和模态内的生成因果性改进,并在大多数评估条件下优于差值-均值和VL-SAE;在一种LLaVA的视觉-视觉设置中,MFA达到与VL-SAE相同的5.7倍分数。人类评估发现MFA与提示竞争,并且比其他干预基准线更强。最后,MFA系数空间在评估层的最深层提高了Qwen3-VL的图像到生成文本检索,从14.9%提高到48.6%的R@1。消融试验表明,报告的融合轨迹在组件数量、局部秩和模态纯度阈值上是稳定的。这些结果支持局部几何邻域作为分析评估中的VLM交叉模态表示的有用可解释和因果单元。

透过LENS:视觉语言模型表征的局部几何分解:论文配图
图 1:激活提取和标记流程。 (1) 图像标题对由 VLM 处理,以提取和存储中间多模态激活。 (2) 在采样的激活空间上训练混合因子分析器 (MFA)。 (3) 学习到的组件由 VLM Judge 进行解释,VLM Judge 会分析组件的顶级激活图像块和文本片段,并生成简洁的、人类可读的语义描述。