论文

从头部到神经元:多任务视觉语言模型中的因果归因和引导

From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models

模型评测模型行为与机制分析

摘要

最近的工作越来越多地探索视觉语言模型(VLM)中的神经元级解释,以识别对最终预测至关重要的神经元。然而,现有的神经元分析通常集中于单个任务,限制了任务之间神经元重要性的可比性。此外,排序策略倾向于对神经元进行孤立评分,忽略了任务依赖信息通路如何塑造前馈网络(FFN)神经元的写入效应。这种疏忽会加剧多任务环境中神经元的多语义性,从而在任务关键型神经元的识别和干预中引入噪声。在这项研究中,我们提出了 HONES(面向头部的神经元解释和转向),这是一种用于多任务 VLM 中任务感知神经元归因和转向的无梯度框架。 HONES 根据任务相关注意力头的因果写入贡献对 FFN 神经元进行排名,并通过轻量级缩放进一步调节显着神经元。对四种不同的多模态任务和两种流行的 VLM 的实验表明,HONES 在识别任务关键型神经元方面优于现有方法,并提高了转向后的模型性能。我们的源代码发布于:https://github.com/petergit1/HONES。