论文
概念化嵌入:视觉语言模型的稀疏解缠
Conceptualizing Embeddings: Sparse Disentanglement for Vision-Language Models
摘要
视觉语言模型学习强大的多模态嵌入,但其内部语义仍然不透明。虽然稀疏自动编码器(SAE)可以提取可解释的特征,但它们依赖于扩展表示维度,这会损害原始几何形状并引入冗余。我们引入了 CEDAR(通过自适应旋转的概念嵌入解缠),这是一种事后方法,可以在不增加维度的情况下揭示预训练嵌入的组成结构。通过学习具有 top-$k$ 稀疏性瓶颈的可逆变换,CEDAR 将语义信息集中到轴对齐的解缠结坐标中。在类似 CLIP 的架构中,单个坐标可以用文本概念来解释,而对于 BLIP 等生成模型,它们可以被解码为自然语言描述。实验表明,CEDAR 实现了有竞争力的重建与稀疏性权衡,同时产生了更可解释且更符合人类感知的解释。我们的结果表明,视觉语言表示中明显的纠缠可以通过适当改变基础来解决,从而消除过度扩展的需要。