论文

通过潜在激活相干性测量稀疏自动编码器中的单义性

Measuring Monosemanticity in Sparse Autoencoders via Latent Activation Coherence

模型评测评测方法与指标

摘要

在可解释人工智能中,机械可解释性使用稀疏自动编码器(SAE)从神经表示中提取更多可解释的特征。然而,评估它们的单义性以及解释质量仍然具有挑战性。现有指标需要外部概念标签或依赖于预训练的嵌入模型,这使得它们对编码器的几何形状敏感。我们引入了 Tversky 单义得分 (TMS),这是一种无标签度量,可将单义性操作为二值化 SAE 潜伏的激活集一致性,并且不需要外部嵌入编码器。我们评估基于预训练视觉和视觉语言模型(DINOv3、CLIP、BLIP2)、两种常见 SAE 机制(TopK、BatchTopK)、多个稀疏级别和扩展因子的特征训练的 SAE 上的 TMS。我们的结果表明,与基于嵌入的替代方案相比,TMS 受编码器各向异性的影响更小,同时与已建立的单语义指标保持一致。 TMS 还揭示了跨基础模型的独特 SAE 训练动态。此外,在编码器各向异性下,TMS 提供了基于探针的概念删除有效性的更强指示,同时在其他方面具有竞争力。