论文
通过稀疏自动编码器从语言到视觉的可解释性迁移
Interpretability Transfer from Language to Vision via Sparse Autoencoders
摘要
使用稀疏自动编码器(SAE)的语言模型可解释性的最新进展尚未有效地转化到视觉领域,这主要是由于标记视觉概念的困难和模糊性。在本文中,我们介绍了通过 SAE 传输对齐 (VISTA) 实现的视觉可解释性,这是一个框架,通过约束视觉投影仪将视觉标记映射到 LLM 预先存在的标记文本 SAE 空间,在 LLaVA 风格的视觉语言模型中将可解释性从语言转移到视觉。这种方法无需训练专门的视觉 SAE 即可实现视觉解释。通过使用 LLM 的 SAE 重建损失对投影仪进行正则化,VISTA 的匹配率提高了三倍,该匹配率可衡量 SAE 空间中最活跃的文本概念与图像中的语义元素相对应的准确程度。使用该框架,我们进一步分析了不同视觉编码器的空间定位特性,并表明 DINOv2 特征比其他编码器具有更强的定位能力。利用这种精度,我们通过细粒度、本地化的概念干预来验证 VISTA 的跨模式对齐,其中在模型的感知中删除或替换特定对象,同时保留周围场景。与仅视觉基线相比,这使得对象删除任务提高了 35%,对象替换任务提高了 47%,从而提供了视觉标记存在于文本 SAE 流形中的因果证据。这些贡献在多个 LLM 架构中得到了验证。