论文
级联稀疏自动编码器在多模态中学习多层次视觉概念 LLM
Cascaded Sparse Autoencoders Learn Multi-Level Visual Concepts in Multimodal LLMs
摘要
多模态 大语言模型 (MLLM) 在视觉语言任务上表现出强大的性能,但其内部视觉表示仍然难以解释。稀疏自动编码器 (SAE) 提供了一种可扩展的方法,将密集模型激活分解为稀疏、可解释的特征。然而,现有的SAE架构主要恢复平面特征字典,不太适合显式的多级概念组织。在本文中,我们引入级联稀疏自动编码器(CSAE)来学习 MLLM 中的分层视觉概念。 CSAE 不是嵌套或堆叠 SAE 稀疏激活码,而是直接在第一级 SAE 的解码器权重上训练第二级 SAE,将学习的底层特征方向视为高级抽象的输入。这种设计使 CSAE 能够学习“概念的概念”,同时避免嵌套共享前缀耦合、俄罗斯套娃式层次结构以及简单堆叠的 SAE 瓶颈带来的缺点。在多个视觉数据集上进行的 Qwen3-VL、Gemma-3 和 LLaVA 实验表明,CSAE 比最先进的 SAE 基线提高了分层概念一致性方面的可解释性。概念指导的结果进一步表明,学习到的概念组支持对 MLLM 输出进行有效的组级干预。