论文

通过稀疏自编码器提取和分析视觉语言模型中的多模态概念

Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders

模型评测模型行为与机制分析

摘要

视觉语言模型(VLM)在需要共同理解图像和文本的任务中表现出了令人印象深刻的性能,例如图像字幕和视觉问答(VQA),但我们对其内部过程的理解仍然有限。最近,稀疏自动编码器 (SAE) 已成为支持 VLM 中编码概念解释的有前途的工具。然而,大多数基于 SAE 的方法仅分别关注文本或视觉概念,而忽略了多模态概念。这种限制阻碍了对 VLM 的全面理解,因为整合这两种模式的概念可能会被错误分类。此外,以前的视觉方法经常产生模糊或不完整的低质量视觉概念描述,限制了它们对于理解模型推理的有用性。我们提出了一个基于 SAE 的框架,用于从 VLM 中提取和分析视觉、文本和多模式概念。对于每个神经元,我们提出一个候选的人类可解释的概念,并使用余弦相似度分数计算概念与数据集样本之间的对齐情况。 VQA 数据集 (LLaVA-NeXT) 上的实验表明,与现有的基于 SAE 的方法相比,我们的框架将视觉概念质量提高了 45%,同时保持了较高的文本概念质量并实现了多模态概念的系统识别。这项工作为 VLM 的概念空间提供了新的见解,提供了一种区分视觉、文本和多模态概念的结构化方法。代码可在 https://github.com/PHDLanza/Multidata_SAE 获取