论文
当结构化稀疏自动编码器跨模态学习一致的概念时
When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities
摘要
稀疏自动编码器(SAE)已成为一种有前途的机械可解释性技术,它通过学习大型模型中的一组稀疏潜在特征(每个特征编码一个不同的概念)来实现。然而,在视觉语言模型 (VLM) 中,普通的 SAE 很难学习模态一致的概念,这些概念通常在视觉模态中表现出碎片化的覆盖范围(即不相交的区域)。为了应对这一挑战,我们提出了一种结构化稀疏自动编码器($S^2AE$),它从视觉模态的语义和空间角度强制概念一致性。具体来说,我们根据 Transformer 注意力相似性和空间邻近性对图像块进行分组,并在训练普通 SAE 时引入结构化稀疏正则化。正则化包括用于组间概念解缠的排他性稀疏性和用于组内概念一致性的组稀疏性,这驱动 SAE 的潜在神经元专门研究不同的、基于语义的概念。在 \texttt{Qwen2.5-VL-7B-Instruct} 模型上进行评估,该方法在语义对齐(mIoU)方面实现了 6.06% 的平均改进,在表示效率(低于 l0 范数)方面实现了 60.81 的平均改进,同时保持了近乎完美的重建保真度,解释方差高于 99%。跨模态分析进一步表明,$S^2AE$ 通过这种视觉结构先验增强了神经元单语义性,实现了多模态特征的两种模态的语义一致性平均增益 3.08% 和单语义得分平均增益 2.37%,从而促进更连贯和解缠结的表示。