论文

所有单层都有帮助吗?视觉—语言模型中任务干扰层的实证研究

Do All Individual Layers Help? An Empirical Study of Task-Interfering Layers in Vision-Language Models

模型评测模型行为与机制分析

摘要

当前 VLM 已在广泛的多模态任务上展现能力。通常,在预训练 VLM 中,所有层默认参与下游任务的预测。我们发现,对单个层进行干预(例如将其参数置零)可以提升某些任务的表现,表明有些层阻碍而非帮助下游任务。我们通过层干预系统考察单个层如何影响不同任务。具体而言,我们测量干预每一层后相对基础模型的性能变化,并观察到绕过特定层带来的改进。这种改进可在不同模型与数据集间泛化,表明存在损害下游任务性能的任务干扰层。我们提出任务—层交互向量,量化在给定任务下干预 VLM 每一层的效果。这些任务干扰层展现出任务特异的敏感性模式:需要相似能力的任务在层干预下呈现一致的响应趋势,其任务—层交互向量的高度相似即可为证。受这些发现启发,我们提出 TaLo(Task-Adaptive Layer Knockout),一种免训练的测试时自适应方法,为给定任务动态识别并绕过干扰最强的层。无需参数更新,TaLo 在多种模型与数据集上提升性能,包括将 Qwen-VL 在 ScienceQA Maps 任务上的准确率最多提升16.6%。我们的工作揭示了预训练 VLM 中一种意想不到的模块化形式,并提供了一种即插即用、免训练的机制,在推理时释放隐藏能力。源代码将公开。

所有单层都有帮助吗?视觉—语言模型中任务干扰层的实证研究
图3:TaLo 框架。TaLo 首先为特定任务动态选择 Task-Interfering 层,并在最终评估流程中将该层剔除(knock out)。